Aprendizaje automático no supervisado: AlgorithmsTipos y ejemplos
⚡ Resumen inteligente
El aprendizaje no supervisado es una técnica de aprendizaje automático que funciona con datos sin etiquetar, permitiendo que el modelo descubra la estructura por sí mismo a través de la agrupación, las reglas de asociación y la reducción de dimensionalidad, en lugar de a partir de respuestas proporcionadas de antemano.
¿Qué es el aprendizaje no supervisado?
El aprendizaje no supervisado es una técnica de aprendizaje automático en la que el usuario no necesita supervisar el modelo. En cambio, permite que el modelo trabaje por sí mismo para descubrir patrones e información que antes pasaban desapercibidos. Se utiliza principalmente con datos sin etiquetar.
Aprendizaje sin supervisión Algorithms
Aprendizaje sin supervisión Algorithms permitir a los usuarios realizar tareas de procesamiento más complejas en comparación con aprendizaje supervisadoSin embargo, el aprendizaje no supervisado puede ser más impredecible que los métodos entrenados con respuestas conocidas. Los algoritmos de aprendizaje no supervisado incluyen la agrupación, la detección de anomalías, la reducción de dimensionalidad y las redes neuronales autoorganizadas.
Ejemplo de aprendizaje automático no supervisado
Veamos un ejemplo de aprendizaje no supervisado con un bebé y su perro. La primera imagen muestra a la mascota que el bebé ya reconoce.
Ella conoce e identifica a este perro. Unas semanas después, un amigo de la familia trae un perro e intenta jugar con el bebé. Ese segundo perro, desconocido para la familia, se muestra a continuación.
La bebé no había visto a este perro antes. Sin embargo, reconoce que muchas características (dos orejas, ojos, caminar a cuatro patas) son como las de su perro. Identifica al nuevo animal como un perro. Esto es aprendizaje no supervisado, donde no se enseña directamente, sino que se aprende a partir de los datos (en este caso, datos sobre un perro). Si se tratara de aprendizaje supervisado, el amigo de la familia le habría dicho a la bebé que era un perro, como se muestra en el ejemplo de aprendizaje no supervisado anterior.
¿Por qué el aprendizaje no supervisado?
Estas son las principales razones para utilizar el aprendizaje no supervisado en Aprendizaje automático:
- El aprendizaje automático no supervisado encuentra todo tipo de patrones desconocidos en los datos.
- Los métodos no supervisados le ayudan a encontrar funciones que pueden resultar útiles para la categorización.
- Puede procesar los datos a medida que llegan, por lo que los registros entrantes se analizan y agrupan sin necesidad de esperar a que un humano los etiquete previamente.
- Es más fácil obtener datos sin etiquetar de una computadora que datos etiquetados, lo que requiere intervención manual.
ClusterTipos de aprendizaje no supervisado Algorithms
Los problemas de aprendizaje no supervisado se agrupan a su vez en problemas de agrupamiento, asociación y reducción de dimensionalidad. ClusterLa agrupación de registros similares, la asociación encuentra elementos que aparecen juntos y la reducción de dimensionalidad comprime muchas características en unas pocas.
Clusterinsights
Clustering es un concepto importante cuando se trata de aprendizaje no supervisado. Se trata principalmente de encontrar una estructura o patrón en una colección de datos no categorizados. Aprendizaje sin supervisión ClusterLos algoritmos procesarán sus datos y encontrarán agrupaciones naturales (clústeres) si existen. También puede modificar la cantidad de clústeres que deben identificar los algoritmos, lo que le permite ajustar la granularidad de estos grupos. El diagrama a continuación muestra registros dispersos agrupados en distintos conjuntos.
Existen diferentes tipos de agrupamiento que puedes utilizar:
Exclusivo (particionamiento)
En este método de agrupamiento, los datos se agrupan de tal manera que un registro solo puede pertenecer a un clúster.
Ejemplo: K-significa
Aglomerativo
En esta técnica de agrupamiento, cada registro comienza como un grupo independiente. Las uniones iterativas entre los dos grupos más cercanos reducen el número de grupos.
Ejemplo: Agrupamiento jerárquico
superposiciónping
En esta técnica, conjuntos borrosos Se utilizan para agrupar datos. Cada punto puede pertenecer a dos o más grupos con distintos grados de pertenencia.
Aquí, los datos se asociarán con un valor de membresía apropiado. Ejemplo: medias C difusas
Probabilístico
Esta técnica utiliza una distribución de probabilidad para crear los clústeres.
Ejemplo: Las siguientes palabras clave
- "zapato de hombre".
- “zapato de mujer”.
- "guante de mujer".
- "guante de hombre".
se pueden agrupar en dos categorías, "zapato" y "guante", o "hombre" y "mujer".
Clustertipos de ing
A continuación se presentan los algoritmos más comunes en el aprendizaje automático no supervisado. Los dos primeros se agrupan, los tres últimos reducen dimensiones en lugar de formar clústeres, y se incluye K-NN porque suele confundirse con K-means.
- Agrupamiento jerárquico — agrupamiento
- Agrupamiento K-means — agrupamiento
- K-NN (k vecinos más cercanos): un clasificador supervisado, no un método de agrupamiento.
- Análisis de componentes principales: reducción de dimensionalidad
- Descomposición en valores singulares: reducción de dimensionalidad
- Análisis de componentes independientes: reducción de dimensionalidad
Jerárquico Clusterinsights
El agrupamiento jerárquico es un algoritmo que crea una jerarquía de clústeres. Comienza asignando todos los datos a un clúster propio. Dos clústeres cercanos se fusionan en uno solo. El algoritmo finaliza cuando solo queda un clúster. Define dos conceptos que merecen ser mencionados por separado.
Agrupación aglomerativa
Esta forma ascendente de agrupamiento jerárquico no requiere el número de clústeres K como dato de entrada. El proceso de aglomeración comienza formando cada registro como un clúster individual.
Este método utiliza una medida de distancia y reduce el número de clústeres (uno en cada iteración) mediante un proceso de fusión. Finalmente, obtenemos un clúster grande que contiene todos los objetos, y el analista corta el árbol a la altura que proporciona un número razonable de grupos.
Dendograma
En el método de agrupamiento de dendrogramas, cada nivel representa un posible clúster. La altura del dendrograma muestra el grado de similitud entre dos clústeres conectados. Cuanto más cerca de la base se encuentren, más similares serán los clústeres; la elección del punto de corte que define los grupos finales no es automática y es mayormente subjetiva.
K-significa Clusterinsights
K-means es un algoritmo de agrupamiento iterativo que refina el grupo.ping En cada iteración, se selecciona inicialmente el número deseado de clústeres. En este método de agrupamiento, es necesario agrupar los puntos de datos en k grupos. Un valor de k mayor implica grupos más pequeños con mayor granularidad; un valor de k menor implica grupos más grandes con menor granularidad.
El resultado del algoritmo es un conjunto de etiquetas. Asigna cada punto de datos a uno de los k grupos. En el agrupamiento k-means, cada grupo se define mediante la creación de un centroide. Los centroides son como el núcleo del clúster, que captura los puntos más cercanos y los añade al mismo.
K- Vecinos más cercanos
El algoritmo de k vecinos más cercanos (K-NN) es el clasificador de aprendizaje automático más sencillo. Se diferencia de otras técnicas de aprendizaje automático en que no genera un modelo. Es un algoritmo simple que almacena todos los casos disponibles y clasifica las nuevas instancias basándose en una medida de similitud. Dado que necesita casos etiquetados para la clasificación, K-NN es un método supervisado; aparece aquí solo porque su lógica basada en la distancia se asemeja a la agrupación.
Funciona muy bien cuando existe una distancia significativa entre los ejemplos. La velocidad de aprendizaje es lenta cuando el conjunto de entrenamiento es grande y el cálculo de la distancia no es trivial.
Análisis de componentes principales
El análisis de componentes principales toma un espacio de alta dimensión y selecciona una nueva base, manteniendoping Solo sus puntuaciones más importantes. Cada dirección en esta base se conoce como componente principal. El subconjunto que se conserva constituye un nuevo espacio de tamaño reducido en comparación con el espacio original. Mantiene la mayor complejidad posible de los datos.
Asociación
Las reglas de asociación permiten establecer asociaciones entre objetos de datos dentro de grandes bases de datos. Esta técnica no supervisada consiste en descubrir relaciones interesantes entre variables en grandes bases de datos, y es un elemento básico de la minería de datosPor ejemplo, las personas que compran una casa nueva tienen más probabilidades de comprar muebles nuevos.
Otros ejemplos:
- Un subgrupo de pacientes con cáncer agrupados según sus mediciones de expresión genética.
- Grupos de compradores según su historial de navegación y compras.
- Películas agrupadas según las calificaciones otorgadas por los espectadores.
Aprendizaje automático supervisado versus no supervisado
Aquí está la principal diferencia entre Aprendizaje supervisado versus no supervisado:
| Parámetros | Técnica de aprendizaje automático supervisado. | Técnica de aprendizaje automático no supervisado |
| Los datos de entrada | Algorithms se entrenan utilizando datos etiquetados. | Algorithms se utilizan contra datos que no están etiquetados |
| Complejidad computacional | El aprendizaje supervisado es un método más sencillo. | El aprendizaje no supervisado es computacionalmente complejo |
| Exactitud | La exactitud se puede medir directamente comparándola con etiquetas conocidas. | La exactitud no se puede medir directamente; los resultados necesitan interpretación. |
| Salida típica | Una predicción para cada nuevo récord | Grupos, reglas o características comprimidas |
Aplicaciones del aprendizaje automático no supervisado
Algunas aplicaciones de las técnicas de aprendizaje no supervisado son:
- Clustering divide automáticamente el conjunto de datos en grupos en función de sus similitudes.
- La detección de anomalías puede descubrir puntos de datos inusuales en su conjunto de datos. Es útil para encontrar transacciones fraudulentas.
- La minería de asociación identifica conjuntos de elementos que a menudo aparecen juntos en su conjunto de datos.
- Los modelos de variables latentes se utilizan ampliamente para el preprocesamiento de datos, como la reducción del número de características en un conjunto de datos o la descomposición del conjunto de datos en múltiples componentes.
Desventajas del aprendizaje no supervisado
- No se puede obtener información precisa sobre la clasificación de datos, porque los datos utilizados en el aprendizaje no supervisado no están etiquetados y su verdadero grupoping no es conocido
- Less La precisión de los resultados se ve comprometida porque los datos de entrada son desconocidos y no han sido etiquetados previamente por personas. Esto significa que la máquina debe realizar esta tarea por sí misma.
- Las clases espectrales no siempre corresponden a clases informativas.
- El usuario necesita dedicar tiempo a interpretar y etiquetar las clases que resultan de la clasificación.
- Las propiedades espectrales de las clases también pueden cambiar con el tiempo, por lo que no se puede mantener la misma información de clase al pasar de una imagen a otra.



