Неконтролируемое машинное обучение: AlgorithmsТипы и примеры

⚡ Умное резюме

Обучение без учителя — это метод машинного обучения, работающий с неразмеченными данными, позволяющий модели самостоятельно обнаруживать структуру посредством кластеризации, правил ассоциации и уменьшения размерности, а не на основе заранее предоставленных ответов.

  • 🔘 Этикетки не требуются: Алгоритм ищет структуру, а не сопоставляет известные ответы.
  • ☑️ Три группы задач: Clustering, поиск ассоциативных правил и снижение размерности.
  • Четыре стиля кластеризации: Исключительный, агломеративный, перекрывающийсяping и вероятностный.
  • 🧪 Именованные алгоритмы: K-средних, иерархическая кластеризация, нечеткие C-средние, PCA, SVD и ICA.
  • 🇧🇷 Где оно оправдывает свою стоимость: Сегментация клиентов, выявление мошенничества и аномалий, анализ потребительской корзины, предварительная обработка данных.
  • ⚙️ Компромисс: Отсутствие эталонных данных означает, что результаты должны быть интерпретированы, проверены и обозначены человеком.

Неконтролируемое машинное обучение: алгоритмы, типы с примерами.

Что такое неконтролируемое обучение?

Обучение без учителя — это метод машинного обучения, при котором пользователю не нужно контролировать модель. Вместо этого он позволяет модели работать самостоятельно, выявляя закономерности и информацию, которые ранее не были обнаружены. В основном он работает с неразмеченными данными.

Обучение без учителя Algorithms

Обучение без учителя Algorithms позволяют пользователям выполнять более сложные задачи обработки по сравнению с контролируемое обучениеОднако обучение без учителя может быть более непредсказуемым, чем методы, обученные на известных ответах. К алгоритмам обучения без учителя относятся кластеризация, обнаружение аномалий, снижение размерности и самоорганизующиеся нейронные сети.

Пример машинного обучения без учителя

Рассмотрим пример обучения без учителя на примере младенца и его домашней собаки. На первом рисунке изображен питомец, которого младенец уже узнает.

Малышка со своей семейной собакой, животным, которое она уже узнает.

Она знает и опознает эту собаку. Несколько недель спустя друг семьи приводит собаку и пытается поиграть с ребенком. Эта вторая, незнакомая собака изображена ниже.

Незнакомая собака, которую малыш никогда раньше не видел.

Ребенок раньше не видел эту собаку. Но она узнает, что многие черты (два уха, глаза, ходьба на четырех лапах) похожи на черты ее домашней собаки. Она определяет новое животное как собаку. Это неконтролируемое обучение, когда вас не учат, а вы учитесь на основе данных (в данном случае данных о собаке). Если бы это было контролируемое обучение, друг семьи сказал бы ребенку, что это собака, как показано в приведенном выше примере неконтролируемого обучения.

Почему обучение без учителя?

Вот основные причины использования обучения без учителя в Машинное обучение:

  • Неконтролируемое машинное обучение позволяет выявлять всевозможные неизвестные закономерности в данных.
  • Неконтролируемые методы помогают найти функции, которые могут быть полезны для категоризации.
  • Она может обрабатывать данные по мере их поступления, поэтому входящие записи анализируются и группируются без ожидания предварительной маркировки человеком.
  • Легче получить неразмеченные данные с компьютера, чем помеченные данные, которые требуют ручного вмешательства.

ClusterТипы обучения без учителя Algorithms

Задачи обучения без учителя подразделяются на задачи кластеризации, ассоциации и снижения размерности. ClusterМетод объединения похожих записей в группы, метод ассоциации находит элементы, которые встречаются вместе, а метод уменьшения размерности сжимает множество признаков в несколько.

ClusterИНГ

ClusterОбучение является важной концепцией, когда речь идет об обучении без присмотра. В основном он занимается поиском структуры или шаблона в коллекции неклассифицированных данных. Обучение без присмотра ClusterАлгоритмы обработки данных обработают ваши данные и найдут естественные кластеры (группы), если они существуют в данных. Вы также можете изменить количество кластеров, которые должны идентифицировать ваши алгоритмы. Это позволяет регулировать детализацию этих групп. На диаграмме ниже показаны разрозненные записи, разделенные на отдельные группы.

ClusterДиаграмма, показывающая немаркированные точки данных, сгруппированные в отдельные кластеры.

Вы можете использовать различные типы кластеризации:

Эксклюзивный (разделение)

В этом методе кластеризации данные группируются таким образом, что одна запись может принадлежать только к одному кластеру.

Пример: K-средних

агломерационных

В этом методе кластеризации каждая запись изначально представляет собой отдельный кластер. Итеративные объединения двух ближайших кластеров уменьшают количество кластеров.

Пример: Иерархическая кластеризация

Перекрытиеping

В этой технике, нечеткие множества Они используются для кластеризации данных. Каждая точка может принадлежать к двум или более кластерам с разными степенями принадлежности.

Здесь данные будут связаны с соответствующим значением членства. Пример: нечеткие C-средства

вероятностный

Этот метод использует распределение вероятностей для создания кластеров.

Пример: следующие ключевые слова

  • «мужская обувь».
  • «женская обувь».
  • «женская перчатка».
  • «мужская перчатка».

Их можно разделить на две категории: «обувь» и «перчатка», или «мужчина» и «женщина».

ClusterТипы

Ниже перечислены алгоритмы, наиболее часто встречающиеся в машинном обучении без учителя. Первые два группируют записи, последние три уменьшают размерность, а не формируют кластеры, а алгоритм K-NN указан, поскольку его часто путают с алгоритмом K-средних.

  • Иерархическая кластеризация — кластеризация
  • Кластеризация методом K-средних — кластеризация
  • K-NN (k ближайших соседей) — это классификатор с обучением под наблюдением, а не метод кластеризации.
  • Метод главных компонент — снижение размерности
  • Сингулярное разложение — уменьшение размерности
  • Анализ независимых компонентов — снижение размерности

иерархическая ClusterИНГ

Иерархическая кластеризация — это алгоритм, который строит иерархию кластеров. Он начинается с того, что все данные присваиваются отдельному кластеру. Затем два близких кластера объединяются в один. Алгоритм завершается, когда остается только один кластер. Он определяет две идеи, которые стоит назвать отдельно.

Агломеративная кластеризация

Этот метод иерархической кластеризации «снизу вверх» не требует указания количества кластеров K в качестве входных данных. Процесс агломерации начинается с формирования каждой записи в виде отдельного кластера.

Этот метод использует некоторую меру расстояния и уменьшает количество кластеров (по одному в каждой итерации) путем процесса слияния. В итоге мы получаем один большой кластер, содержащий все объекты, и аналитик обрезает дерево на высоте, которая дает разумное количество групп.

Дендрограмма

В методе кластеризации по дендрограмме каждый уровень представляет собой возможный кластер. Высота дендрограммы показывает уровень сходства между двумя объединенными кластерами. Чем ближе к нижней границе процесса, тем больше сходство между кластерами; выбор границы, определяющей окончательные группы, не является автоматическим и в основном субъективен.

K-средних ClusterИНГ

Алгоритм K-средних — это итеративный алгоритм кластеризации, который уточняет группы.ping на каждой итерации. Первоначально выбирается желаемое количество кластеров. В этом методе кластеризации необходимо сгруппировать точки данных в k групп. Большее значение k означает меньшие группы с большей детализацией; меньшее значение k означает большие группы с меньшей детализацией.

Результатом работы алгоритма является группа «меток». Он присваивает каждой точке данных одну из k групп. В кластеризации методом k-средних каждая группа определяется путем создания центроида для этой группы. Центроиды подобны сердцу кластера, которое захватывает точки, наиболее близкие к ним, и добавляет их в кластер.

К- Ближайшие соседи

Метод k-ближайших соседей — самый простой из всех классификаторов машинного обучения. Он отличается от других методов машинного обучения тем, что не создает модель. Это простой алгоритм, который хранит все доступные случаи и классифицирует новые экземпляры на основе меры сходства. Поскольку для классификации ему необходимы помеченные случаи, K-NN является методом с обучением под наблюдением; он упоминается здесь только потому, что его логика, основанная на расстоянии, напоминает кластеризацию.

Этот метод отлично работает, когда между примерами существует значительное расстояние. Скорость обучения снижается при большом объеме обучающего набора данных, а вычисление расстояния становится нетривиальной задачей.

Анализ основных компонентов

Метод анализа главных компонентов берет многомерное пространство и выбирает новый базис, сохраняя при этомping Только наиболее важные значения. Каждое направление в этом базисе называется главной компонентой. Сохраненное подмножество образует новое пространство, размер которого невелик по сравнению с исходным пространством. Оно сохраняет как можно больше сложности данных.

Фонды и ассоциации

Правила ассоциации позволяют устанавливать связи между объектами данных в больших базах данных. Этот метод, не требующий обучения под руководством учителя, направлен на выявление интересных взаимосвязей между переменными в больших базах данных и является одним из основных способов решения подобных задач. добыча данныхНапример, люди, покупающие новый дом, чаще всего приобретают и новую мебель.

Другие примеры:

  • Подгруппа онкологических больных, сгруппированная по результатам измерения экспрессии генов.
  • Группы покупателей на основе истории их просмотров и покупок.
  • Фильмы, сгруппированные по оценкам зрителей.

Контролируемое и неконтролируемое машинное обучение

Вот основная разница между Контролируемое и неконтролируемое обучение:

Параметры Метод контролируемого машинного обучения Техника машинного обучения без учителя
Входные данные Algorithms обучаются с использованием размеченных данных. Algorithms используются для данных, которые не помечены
Вычислительная сложность Обучение под присмотром – более простой метод. Обучение без учителя является вычислительно сложным
Точность подачи Точность можно измерить непосредственно по известным меткам. Точность нельзя измерить напрямую; результаты требуют интерпретации.
Типичный выход Прогноз для каждого нового рекорда Группы, правила или сжатые функции

Применение машинного обучения без учителя

К числу областей применения методов обучения без учителя относятся:

  • ClusterФункция автоматически разделяет набор данных на группы на основе их сходства.
  • Обнаружение аномалий может обнаружить необычные точки данных в вашем наборе данных. Это полезно для обнаружения мошеннических транзакций.
  • Анализ ассоциаций идентифицирует наборы элементов, которые часто встречаются вместе в вашем наборе данных.
  • Модели со скрытыми переменными широко используются для предварительной обработки данных, например, для уменьшения количества признаков в наборе данных или разложения набора данных на несколько компонентов.

Недостатки обучения без учителя

  • Получить точную информацию о сортировке данных невозможно, поскольку данные, используемые в обучении без учителя, не размечены, и их истинная структура недоступна.ping не известно
  • Less Точность результатов снижается, поскольку входные данные неизвестны и не размечены людьми заранее. Это означает, что машина должна сделать это самостоятельно.
  • Спектральные классы не всегда соответствуют информационным классам.
  • Пользователю необходимо потратить время на интерпретацию и обозначение классов, полученных в результате классификации.
  • Спектральные свойства классов также могут меняться со временем, поэтому невозможно сохранить одну и ту же информацию о классе при переходе от одного изображения к другому.

Часто задаваемые вопросы (FAQ)

Метод «локтя» строит график внутрикластерной ошибки в зависимости от k и ищет изгиб. Показатель силуэта, варьирующийся от −1 до 1, оценивает, насколько хорошо каждая точка соответствует своему кластеру. Прочитайте оба показателя вместе.

Алгоритмы, основанные на расстоянии, рассматривают каждую единицу одинаково, поэтому столбец с зарплатой в тысячах будет преобладать над столбцом с возрастом в годах. Стандартизация каждой характеристики в первую очередь позволяет каждой переменной справедливо влиять на расстояние.

Apriori — это классический алгоритм поиска ассоциативных правил, используемый в анализе потребительских корзин. Он находит часто встречающиеся наборы товаров, а затем преобразует их в правила, ранжированные по уровню поддержки, достоверности и коэффициенту подъема. FP-growth и Eclat делают то же самое быстрее.

Полуконтролируемое обучение использует небольшой размеченный набор данных наряду с большим неразмеченным набором. Структура, обнаруженная в неразмеченных данных, направляет модель, поэтому точность приближается к результату контролируемого обучения при гораздо меньших затратах на разметку.

PCA — это линейное преобразование, сохраняющее глобальную дисперсию и применяемое к новым записям. t-SNE — нелинейное преобразование, предназначенное для визуализации локальных окрестностей в двух измерениях; расстояния между разделенными группами не следует интерпретировать буквально.

Обычно используются алгоритмы Isolation Forest, One-Class SVM, DBSCAN и ошибка реконструкции автокодировщика. Каждый из них оценивает, насколько запись отличается от основной массы данных, поэтому пороговое значение определяет, что считается аномальным.

Автоматизированные конвейеры обрабатывают различные алгоритмы, меры расстояния и значения k, а затем ранжируют результаты по показателям внутренней валидности. Языковые модели все чаще присваивают результирующим сегментам простые, понятные названия, сокращая этап интерпретации.

Второй пилот GitHub Создает шаблоны конвейеров scikit-learn, диаграммы «локтя» и силуэтные диаграммы из одной строки командной строки. Убедитесь, что масштаб признаков выполнен, и установите случайное начальное значение, которое часто опускается в сгенерированных фрагментах кода.

Подведем итог этой публикации следующим образом: