Машинне навчання без нагляду: Algorithms, Типи та приклади

⚡ Розумний підсумок

Неконтрольоване навчання – це метод машинного навчання, який працює з немаркованими даними, дозволяючи моделі самостійно виявляти структуру за допомогою кластеризації, правил асоціації та зменшення розмірності, а не на основі заздалегідь наданих відповідей.

  • 🔘 Не потрібні мітки: Алгоритм шукає структуру замість зіставлення відомих відповідей.
  • ☑️ Три сімейства завдань: Clusterінг, видобуток правил асоціації та зменшення розмірності.
  • Чотири стилі кластеризації: Ексклюзивний, агломеративний, перекриттяping та ймовірнісні.
  • 🧪 Іменовані алгоритми: K-середні, ієрархічна кластеризація, нечіткі C-середні, PCA, SVD та ICA.
  • 🛠️ Де воно заробляє собі на життя: Сегментація клієнтів, виявлення шахрайства та аномалій, аналіз ринкового кошика, попередня обробка даних.
  • Компроміс: Відсутність фундаментальної інформації означає, що результати має інтерпретувати, перевіряти та називати людина.

Машинне навчання без учителя: алгоритми, типи з прикладом

Що таке неконтрольоване навчання?

Навчання без учителя – це метод машинного навчання, в якому користувачеві не потрібно контролювати модель. Натомість, він дозволяє моделі працювати самостійно, щоб виявляти закономірності та інформацію, які раніше не були виявлені. Він в основному має справу з немаркованими даними.

Навчання без нагляду Algorithms

Навчання без нагляду Algorithms дозволяють користувачам виконувати складніші завдання обробки порівняно з контрольоване навчанняОднак навчання без учителя може бути більш непередбачуваним, ніж методи, що навчаються на відомих відповідях. Алгоритми навчання без учителя включають кластеризацію, виявлення аномалій, зменшення розмірності та самоорганізовані нейронні мережі.

Приклад неконтрольованого машинного навчання

Розглянемо приклад самостійного навчання дитини та її собаки. На першому зображенні показано домашнього улюбленця, якого дитина вже впізнає.

Дитина з її сімейним собакою, твариною, яку вона вже впізнає

Вона знає та впізнає цього собаку. Через кілька тижнів друг сім'ї приводить собаку та намагається погратися з малюком. Той другий, незнайомий собака зображений нижче.

Незнайомий собака, якого малюк ніколи раніше не бачив

Малюк раніше не бачила цього собаку. Але вона розпізнає, що багато рис (2 вуха, очі, ходьба на 4 лапах) схожі на її собаку. Вона ідентифікує нову тварину як собаку. Це навчання без учителя, коли вас не навчають, а ви вчитеся з даних (у цьому випадку даних про собаку). Якби це було навчання без учителя, друг сім'ї сказав би дитині, що це собака, як показано у наведеному вище прикладі навчання без учителя.

Чому навчання без нагляду?

Ось основні причини використання самостійного навчання в машинне навчання:

  • Самонавчальне машинне навчання знаходить усілякі невідомі закономірності в даних.
  • Неконтрольовані методи допомагають вам знайти функції, які можуть бути корисними для категоризації.
  • Він може працювати з даними в міру їх надходження, тому вхідні записи аналізуються та групуються, не чекаючи, поки людина спочатку їх позначить.
  • Нерозмічені дані легше отримати з комп’ютера, ніж розмічені дані, які потребують ручного втручання.

Clusterтипи неконтрольованого навчання Algorithms

Проблеми навчання без учителя додатково групуються на проблеми кластеризації, асоціації та зменшення розмірності. ClusterГрупування схожих записів, асоціація знаходить елементи, які з'являються разом, а зменшення розмірності стискає багато ознак до кількох.

ClusterІНГ

Clustering є важливою концепцією, коли йдеться про навчання без нагляду. В основному це стосується пошуку структури або шаблону в колекції некатегоризованих даних. Навчання без контролю ClusterАлгоритми обробки оброблятимуть ваші дані та знаходитимуть природні кластери (групи), якщо вони існують у даних. Ви також можете змінити, скільки кластерів повинні ідентифікувати ваші алгоритми. Це дозволяє налаштувати ступінь деталізації цих груп. На діаграмі нижче показано розсіяні записи, розділені на окремі групи.

Clusterдіаграма, що показує немарковані точки даних, згруповані в окремі кластери

Існують різні типи кластеризації, які можна використовувати:

Ексклюзив (перегородка)

У цьому методі кластеризації дані групуються таким чином, що один запис може належати лише до одного кластера.

приклад: K-означає

Агломеративна

У цій техніці кластеризації кожен запис починається як окремий кластер. Ітеративні об'єднання між двома найближчими кластерами зменшують кількість кластерів.

Приклад: ієрархічна кластеризація

перекриватисяping

У цій техніці, нечіткі множини використовуються для кластеризації даних. Кожна точка може належати до двох або більше кластерів з окремими ступенями належності.

Тут дані будуть пов’язані з відповідним значенням членства. Приклад: нечіткі C-середні

Імовірнісний

Цей метод використовує розподіл ймовірностей для створення кластерів.

Приклад: Наступні ключові слова

  • «чоловіче взуття».
  • «Жіноче взуття».
  • «жіноча рукавичка».
  • «чоловіча рукавичка».

можна розділити на дві категорії: «взуття» та «рукавичка» або «чоловік» та «жінка».

Clusterтипи

Нижче наведено алгоритми, які найчастіше зустрічаються в машинному навчанні без учителя. Перші два групують записи, останні три зменшують розмірності, а не формують кластери, а K-NN перераховано, оскільки його часто плутають з K-середніми.

  • Ієрархічна кластеризація — кластеризація
  • K-означає кластеризацію — кластеризація
  • K-NN (k найближчих сусідів) — класифікатор з учителем, а не метод кластеризації
  • Аналіз головних компонент — зменшення розмірності
  • Розкладання сингулярних значень — зменшення розмірності
  • Аналіз незалежних компонентів — зменшення розмірності

Ієрархічна ClusterІНГ

Ієрархічна кластеризація – це алгоритм, який будує ієрархію кластерів. Вона починається з того, що всі дані призначаються окремому кластеру. Тут два близьких кластери об'єднуються в один кластер. Цей алгоритм завершується, коли залишається лише один кластер. Він визначає дві ідеї, які варто назвати окремо.

Агломеративна кластеризація

Ця висхідна форма ієрархічної кластеризації не вимагає кількості кластерів K як вхідних даних. Процес агломерації починається з формування кожного запису як окремого кластера.

Цей метод використовує певну міру відстані та зменшує кількість кластерів (по одному в кожній ітерації) шляхом процесу об'єднання. Зрештою, у нас є один великий кластер, що містить усі об'єкти, і аналітик обрізає дерево на висоті, яка дає розумну кількість груп.

Дендрограма

У методі кластеризації дендрограми кожен рівень представлятиме можливий кластер. Висота дендрограми показує рівень подібності між двома об'єднаними кластерами. Чим ближче до нижньої частини процесу вони розташовані, тим більше схожі кластери; вибір розрізу, який визначає кінцеві групи, не є автоматичним і здебільшого суб'єктивним.

K-означає ClusterІНГ

K-середніх – це ітеративний алгоритм кластеризації, який уточнює групуping на кожній ітерації. Спочатку вибирається потрібна кількість кластерів. У цьому методі кластеризації потрібно кластеризувати точки даних у k груп. Більше k означає менші групи з більшою деталізацією; менше k означає більші групи з меншою деталізацією.

Виходом алгоритму є група «міток». Він призначає кожну точку даних одній з k груп. У кластеризації k-середніх кожна група визначається шляхом створення центроїда для цієї групи. Центроїди є подібними до серця кластера, яке фіксує точки, найближчі до них, і додає їх до кластера.

К- Найближчі сусіди

K-найближчий сусід – це найпростіший з усіх класифікаторів машинного навчання. Він відрізняється від інших методів машинного навчання тим, що не створює модель. Це простий алгоритм, який зберігає всі доступні випадки та класифікує нові екземпляри на основі міри подібності. Оскільки для класифікації потрібні позначені випадки, K-NN є методом з контрольованим керуванням; він з'являється тут лише тому, що його логіка на основі відстані нагадує кластеризацію.

Це працює дуже добре, коли між прикладами є значуща відстань. Швидкість навчання повільна, коли навчальний набір великий, а розрахунок відстані нетривіальний.

Аналіз основних компонентів

Аналіз головних компонентів приймає багатовимірний простір і вибирає новий базис, зберігаючиping лише його найважливіші бали. Кожен напрямок у цьому базисі відомий як головна компонента. Підмножина, яку ви зберігаєте, утворює новий простір, який має менший розмір порівняно з початковим простором. Він зберігає якомога більшу складність даних.

Асоціація

Правила асоціації дозволяють встановлювати асоціації між об'єктами даних у великих базах даних. Цей метод без нагляду полягає у виявленні цікавих зв'язків між змінними у великих базах даних і є основним елементом... видобуток данихНаприклад, люди, які купують новий будинок, найімовірніше, купуватимуть нові меблі.

Інші приклади:

  • Підгрупа онкологічних пацієнтів, згрупованих за показниками експресії генів
  • Групи покупців на основі історії переглядів та покупок
  • Фільми, згруповані за оцінками глядачів

Контрольоване та неконтрольоване машинне навчання

Ось головна відмінність між Навчання під контролем проти неконтрольованого:

Параметри Керована техніка машинного навчання Техніка машинного навчання без нагляду
Вхідні дані Algorithms навчаються з використанням позначених даних. Algorithms використовуються проти даних, які не позначені
Обчислювальна складність Навчання під наглядом є простішим методом. Навчання без контролю є обчислювально складним
Точність Точність можна виміряти безпосередньо за відомими мітками. Точність неможливо виміряти безпосередньо; результати потребують інтерпретації
Типовий вихід Прогноз для кожного нового запису Групи, правила або стиснуті функції

Застосування неконтрольованого машинного навчання

Деякі застосування методів навчання без учителя:

  • Clustering автоматично розділяє набір даних на групи на основі їхньої схожості
  • Виявлення аномалій може виявити незвичайні точки даних у вашому наборі даних. Це корисно для пошуку шахрайських операцій
  • Інтелектуальний аналіз асоціацій визначає набори елементів, які часто зустрічаються разом у вашому наборі даних
  • Моделі латентних змінних широко використовуються для попередньої обробки даних, наприклад, для зменшення кількості ознак у наборі даних або розкладання набору даних на кілька компонентів.

Недоліки неконтрольованого навчання

  • Ви не можете отримати точну інформацію щодо сортування даних, оскільки дані, що використовуються в самостійному навчанні, не мають маркування, а їх справжня група...ping невідомо
  • Less точність результатів, оскільки вхідні дані невідомі та не позначені людьми заздалегідь. Це означає, що машина повинна робити це сама.
  • Спектральні класи не завжди відповідають інформаційним класам.
  • Користувачеві потрібно витратити час на інтерпретацію та маркування класів, що випливають з класифікації.
  • Спектральні властивості класів також можуть змінюватися з часом, тому неможливо зберегти ту саму інформацію про клас під час переходу від одного зображення до іншого.

Поширені запитання

Метод ліктя будує графік залежності внутрішньокластерної похибки від k та шукає вигин. Оцінка силуету, яка коливається від -1 до 1, оцінює, наскільки добре кожна точка відповідає своєму кластеру. Зчитуйте обидва показники разом.

Алгоритми на основі відстані однаково обробляють кожну одиницю, тому стовпець із зарплатою в тисячах домінуватиме над стовпцем віку в роках. Стандартизація кожної ознаки спочатку дає кожній змінній справедливе право голосу щодо відстані.

Apriori — це класичний інструмент для аналізу ринкових кошиків, що базується на правилах асоціацій. Він знаходить часті набори товарів, а потім перетворює їх на правила, ранжовані за підтримкою, впевненістю та зростанням. FP-growth та Eclat роблять те саме швидше.

Напівнавчання з учителем використовує невеликий маркований набір поряд з великим немаркованим. Структура, знайдена в немаркованих даних, керує моделлю, тому точність наближається до результату з учителем за значно менших витрат на маркування.

PCA – це лінійне перетворення, яке зберігає глобальну дисперсію та застосовується до нових записів. t-SNE є нелінійним та побудованим для візуалізації локальних околиць у двох вимірах; відстані між розділеними групами не слід читати буквально.

Звичайними варіантами є Ізоляційний ліс, Однокласова SVM, DBSCAN та помилка реконструкції автоенкодером. Кожен з них оцінює, наскільки далеко запис знаходиться від основної маси даних, тому поріг визначає, що вважається аномальним.

Автоматизовані алгоритми прокрутки конвеєрів, вимірювання відстані та значення k, а потім ранжують прогони за внутрішніми балами валідності. Мовні моделі все частіше створюють зрозумілі англійські назви для результуючих сегментів, скорочуючи крок інтерпретації.

Копілот GitHub Створюйте пайплайни scikit-learn, діаграми колін та силуетні діаграми з однорядкового запиту. Перевірте, чи масштабовано об'єкти, та встановіть випадкове початкове значення, яке згенеровані фрагменти коду часто пропускають.

Підсумуйте цей пост за допомогою: