Неконтролируемое машинное обучение: AlgorithmsТипы и примеры
⚡ Умное резюме
Обучение без учителя — это метод машинного обучения, работающий с неразмеченными данными, позволяющий модели самостоятельно обнаруживать структуру посредством кластеризации, правил ассоциации и уменьшения размерности, а не на основе заранее предоставленных ответов.

Что такое неконтролируемое обучение?
Обучение без учителя — это метод машинного обучения, при котором пользователю не нужно контролировать модель. Вместо этого он позволяет модели работать самостоятельно, выявляя закономерности и информацию, которые ранее не были обнаружены. В основном он работает с неразмеченными данными.
Обучение без учителя Algorithms
Обучение без учителя Algorithms позволяют пользователям выполнять более сложные задачи обработки по сравнению с контролируемое обучениеОднако обучение без учителя может быть более непредсказуемым, чем методы, обученные на известных ответах. К алгоритмам обучения без учителя относятся кластеризация, обнаружение аномалий, снижение размерности и самоорганизующиеся нейронные сети.
Пример машинного обучения без учителя
Рассмотрим пример обучения без учителя на примере младенца и его домашней собаки. На первом рисунке изображен питомец, которого младенец уже узнает.
Она знает и опознает эту собаку. Несколько недель спустя друг семьи приводит собаку и пытается поиграть с ребенком. Эта вторая, незнакомая собака изображена ниже.
Ребенок раньше не видел эту собаку. Но она узнает, что многие черты (два уха, глаза, ходьба на четырех лапах) похожи на черты ее домашней собаки. Она определяет новое животное как собаку. Это неконтролируемое обучение, когда вас не учат, а вы учитесь на основе данных (в данном случае данных о собаке). Если бы это было контролируемое обучение, друг семьи сказал бы ребенку, что это собака, как показано в приведенном выше примере неконтролируемого обучения.
Почему обучение без учителя?
Вот основные причины использования обучения без учителя в Машинное обучение:
- Неконтролируемое машинное обучение позволяет выявлять всевозможные неизвестные закономерности в данных.
- Неконтролируемые методы помогают найти функции, которые могут быть полезны для категоризации.
- Она может обрабатывать данные по мере их поступления, поэтому входящие записи анализируются и группируются без ожидания предварительной маркировки человеком.
- Легче получить неразмеченные данные с компьютера, чем помеченные данные, которые требуют ручного вмешательства.
ClusterТипы обучения без учителя Algorithms
Задачи обучения без учителя подразделяются на задачи кластеризации, ассоциации и снижения размерности. ClusterМетод объединения похожих записей в группы, метод ассоциации находит элементы, которые встречаются вместе, а метод уменьшения размерности сжимает множество признаков в несколько.
ClusterИНГ
ClusterОбучение является важной концепцией, когда речь идет об обучении без присмотра. В основном он занимается поиском структуры или шаблона в коллекции неклассифицированных данных. Обучение без присмотра ClusterАлгоритмы обработки данных обработают ваши данные и найдут естественные кластеры (группы), если они существуют в данных. Вы также можете изменить количество кластеров, которые должны идентифицировать ваши алгоритмы. Это позволяет регулировать детализацию этих групп. На диаграмме ниже показаны разрозненные записи, разделенные на отдельные группы.
Вы можете использовать различные типы кластеризации:
Эксклюзивный (разделение)
В этом методе кластеризации данные группируются таким образом, что одна запись может принадлежать только к одному кластеру.
Пример: K-средних
агломерационных
В этом методе кластеризации каждая запись изначально представляет собой отдельный кластер. Итеративные объединения двух ближайших кластеров уменьшают количество кластеров.
Пример: Иерархическая кластеризация
Перекрытиеping
В этой технике, нечеткие множества Они используются для кластеризации данных. Каждая точка может принадлежать к двум или более кластерам с разными степенями принадлежности.
Здесь данные будут связаны с соответствующим значением членства. Пример: нечеткие C-средства
вероятностный
Этот метод использует распределение вероятностей для создания кластеров.
Пример: следующие ключевые слова
- «мужская обувь».
- «женская обувь».
- «женская перчатка».
- «мужская перчатка».
Их можно разделить на две категории: «обувь» и «перчатка», или «мужчина» и «женщина».
ClusterТипы
Ниже перечислены алгоритмы, наиболее часто встречающиеся в машинном обучении без учителя. Первые два группируют записи, последние три уменьшают размерность, а не формируют кластеры, а алгоритм K-NN указан, поскольку его часто путают с алгоритмом K-средних.
- Иерархическая кластеризация — кластеризация
- Кластеризация методом K-средних — кластеризация
- K-NN (k ближайших соседей) — это классификатор с обучением под наблюдением, а не метод кластеризации.
- Метод главных компонент — снижение размерности
- Сингулярное разложение — уменьшение размерности
- Анализ независимых компонентов — снижение размерности
иерархическая ClusterИНГ
Иерархическая кластеризация — это алгоритм, который строит иерархию кластеров. Он начинается с того, что все данные присваиваются отдельному кластеру. Затем два близких кластера объединяются в один. Алгоритм завершается, когда остается только один кластер. Он определяет две идеи, которые стоит назвать отдельно.
Агломеративная кластеризация
Этот метод иерархической кластеризации «снизу вверх» не требует указания количества кластеров K в качестве входных данных. Процесс агломерации начинается с формирования каждой записи в виде отдельного кластера.
Этот метод использует некоторую меру расстояния и уменьшает количество кластеров (по одному в каждой итерации) путем процесса слияния. В итоге мы получаем один большой кластер, содержащий все объекты, и аналитик обрезает дерево на высоте, которая дает разумное количество групп.
Дендрограмма
В методе кластеризации по дендрограмме каждый уровень представляет собой возможный кластер. Высота дендрограммы показывает уровень сходства между двумя объединенными кластерами. Чем ближе к нижней границе процесса, тем больше сходство между кластерами; выбор границы, определяющей окончательные группы, не является автоматическим и в основном субъективен.
K-средних ClusterИНГ
Алгоритм K-средних — это итеративный алгоритм кластеризации, который уточняет группы.ping на каждой итерации. Первоначально выбирается желаемое количество кластеров. В этом методе кластеризации необходимо сгруппировать точки данных в k групп. Большее значение k означает меньшие группы с большей детализацией; меньшее значение k означает большие группы с меньшей детализацией.
Результатом работы алгоритма является группа «меток». Он присваивает каждой точке данных одну из k групп. В кластеризации методом k-средних каждая группа определяется путем создания центроида для этой группы. Центроиды подобны сердцу кластера, которое захватывает точки, наиболее близкие к ним, и добавляет их в кластер.
К- Ближайшие соседи
Метод k-ближайших соседей — самый простой из всех классификаторов машинного обучения. Он отличается от других методов машинного обучения тем, что не создает модель. Это простой алгоритм, который хранит все доступные случаи и классифицирует новые экземпляры на основе меры сходства. Поскольку для классификации ему необходимы помеченные случаи, K-NN является методом с обучением под наблюдением; он упоминается здесь только потому, что его логика, основанная на расстоянии, напоминает кластеризацию.
Этот метод отлично работает, когда между примерами существует значительное расстояние. Скорость обучения снижается при большом объеме обучающего набора данных, а вычисление расстояния становится нетривиальной задачей.
Анализ основных компонентов
Метод анализа главных компонентов берет многомерное пространство и выбирает новый базис, сохраняя при этомping Только наиболее важные значения. Каждое направление в этом базисе называется главной компонентой. Сохраненное подмножество образует новое пространство, размер которого невелик по сравнению с исходным пространством. Оно сохраняет как можно больше сложности данных.
Фонды и ассоциации
Правила ассоциации позволяют устанавливать связи между объектами данных в больших базах данных. Этот метод, не требующий обучения под руководством учителя, направлен на выявление интересных взаимосвязей между переменными в больших базах данных и является одним из основных способов решения подобных задач. добыча данныхНапример, люди, покупающие новый дом, чаще всего приобретают и новую мебель.
Другие примеры:
- Подгруппа онкологических больных, сгруппированная по результатам измерения экспрессии генов.
- Группы покупателей на основе истории их просмотров и покупок.
- Фильмы, сгруппированные по оценкам зрителей.
Контролируемое и неконтролируемое машинное обучение
Вот основная разница между Контролируемое и неконтролируемое обучение:
| Параметры | Метод контролируемого машинного обучения | Техника машинного обучения без учителя |
| Входные данные | Algorithms обучаются с использованием размеченных данных. | Algorithms используются для данных, которые не помечены |
| Вычислительная сложность | Обучение под присмотром – более простой метод. | Обучение без учителя является вычислительно сложным |
| Точность подачи | Точность можно измерить непосредственно по известным меткам. | Точность нельзя измерить напрямую; результаты требуют интерпретации. |
| Типичный выход | Прогноз для каждого нового рекорда | Группы, правила или сжатые функции |
Применение машинного обучения без учителя
К числу областей применения методов обучения без учителя относятся:
- ClusterФункция автоматически разделяет набор данных на группы на основе их сходства.
- Обнаружение аномалий может обнаружить необычные точки данных в вашем наборе данных. Это полезно для обнаружения мошеннических транзакций.
- Анализ ассоциаций идентифицирует наборы элементов, которые часто встречаются вместе в вашем наборе данных.
- Модели со скрытыми переменными широко используются для предварительной обработки данных, например, для уменьшения количества признаков в наборе данных или разложения набора данных на несколько компонентов.
Недостатки обучения без учителя
- Получить точную информацию о сортировке данных невозможно, поскольку данные, используемые в обучении без учителя, не размечены, и их истинная структура недоступна.ping не известно
- Less Точность результатов снижается, поскольку входные данные неизвестны и не размечены людьми заранее. Это означает, что машина должна сделать это самостоятельно.
- Спектральные классы не всегда соответствуют информационным классам.
- Пользователю необходимо потратить время на интерпретацию и обозначение классов, полученных в результате классификации.
- Спектральные свойства классов также могут меняться со временем, поэтому невозможно сохранить одну и ту же информацию о классе при переходе от одного изображения к другому.



