Tutorial de aprendizaje automático para principiantes: qué es y conceptos básicos de ML

⚡ Resumen inteligente

El aprendizaje automático es una familia de algoritmos informáticos que mejoran a partir de ejemplos en lugar de ser codificados explícitamente, combinando datos con herramientas estadísticas para predecir resultados que las personas pueden convertir en decisiones prácticas.

  • 🔘 Las reglas se aprenden, no se escriben: La programación tradicional codifica cada regla manualmente, mientras que un modelo deriva la regla a partir de pares de entradas y salidas.
  • ☑️ Dos etapas: El aprendizaje descubre patrones y los resume en un modelo; la inferencia aplica ese modelo a datos nunca antes vistos.
  • Dos familias extensas: El aprendizaje supervisado necesita resultados etiquetados, mientras que el aprendizaje no supervisado encuentra estructura sin ellos.
  • 🧪 La elección del algoritmo se basa en el objetivo: La regresión predice valores continuos, la clasificación asigna etiquetas y la agrupación agrupa registros similares.
  • 🛠️ Los datos son la verdadera limitación: La escasez de datos, o la falta de variedad en los mismos, da como resultado un modelo que no puede generalizar.
  • ⚙️ Dónde vale la pena: Detección de fraudes en el sector bancario, detección de imágenes en el sector sanitario, previsión de la demanda en toda la cadena de suministro.

Tutorial de aprendizaje automático para principiantes: Fundamentos del aprendizaje automático

¿Qué es el Aprendizaje Automático?

Aprendizaje automático es un sistema de algoritmos informáticos que pueden aprender de ejemplos a través de la auto-mejora, sin ser codificados explícitamente por un programador. El aprendizaje automático es parte de inteligencia artificial que combina datos con herramientas estadísticas para predecir un resultado que pueda utilizarse para obtener información útil y práctica.

El avance se basa en la idea de que una máquina puede aprender de los datos (es decir, ejemplos) por sí misma para producir resultados precisos. El aprendizaje automático está estrechamente relacionado con la minería de datos y el modelado predictivo bayesiano. La máquina recibe datos como entrada y utiliza un algoritmo para formular respuestas.

Una tarea típica de aprendizaje automático es proporcionar una recomendación. Para aquellos que tienen una Netflix cuenta, todas las recomendaciones de películas o series se basan en los datos históricos del usuario. Las empresas tecnológicas utilizan aprendizaje sin supervisión para mejorar la experiencia del usuario personalizando las recomendaciones.

El aprendizaje automático también se utiliza para diversas tareas, como la detección de fraudes, el mantenimiento predictivo, la optimización de carteras y la automatización de tareas.

Aprendizaje automático versus programación tradicional

La programación tradicional difiere significativamente del aprendizaje automático. En la programación tradicional, un programador codifica todas las reglas en consulta con un experto del sector para el que se desarrolla el software. Cada regla se basa en un fundamento lógico; la máquina produce un resultado siguiendo dicho enunciado lógico. Cuando el sistema se vuelve complejo, es necesario escribir más reglas, y su mantenimiento puede volverse rápidamente insostenible. El siguiente diagrama muestra ese flujo, donde entran los datos y las reglas escritas manualmente y se obtienen las respuestas.

Flujo de programación tradicional: los datos más las reglas codificadas manualmente producen el resultado.
Programación Tradicional

El aprendizaje automático busca solucionar este problema. La máquina aprende cómo se correlacionan los datos de entrada y salida, y genera la regla por sí misma. Los programadores no necesitan escribir nuevas reglas cada vez que hay nuevos datos. Los algoritmos se adaptan en respuesta a los nuevos datos y a la experiencia para mejorar su eficacia con el tiempo. El segundo diagrama invierte el primero: los datos y las respuestas conocidas entran, y la regla sale.

Flujo de aprendizaje automático: los datos más las respuestas conocidas producen la regla.

Aprendizaje automático

¿Cómo funciona el aprendizaje automático?

Una vez establecido ese contraste, la siguiente pregunta es qué sucede realmente dentro de la etapa de aprendizaje.

El aprendizaje automático es el cerebro donde se produce todo el aprendizaje. La forma en que aprende una máquina es similar a la de un ser humano. Los humanos aprendemos de la experiencia: cuanto más sabemos, más fácilmente podemos predecir. Por analogía, cuando nos enfrentamos a una situación desconocida, la probabilidad de éxito es menor que en una situación conocida. Las máquinas se entrenan de la misma manera. Para hacer una predicción precisa, la máquina ve un ejemplo. Cuando le proporcionamos un ejemplo similar, puede deducir el resultado. Sin embargo, al igual que un humano, si se le proporciona un ejemplo que no ha visto antes, la máquina tiene dificultades para predecir.

Los objetivos principales del aprendizaje automático son el aprendizaje y la inferencia. En primer lugar, la máquina aprende mediante el descubrimiento de patrones, y ese descubrimiento es posible gracias a los datos. Una parte crucial del trabajo del científico de datos es elegir cuidadosamente qué datos proporcionar a la máquina. La lista de atributos utilizados para resolver un problema se llama vector de característicaSe puede pensar en un vector de características como un subconjunto de datos que se utiliza para abordar un problema.

La máquina utiliza algoritmos para simplificar la realidad y transformar este descubrimiento en un modelo. Por lo tanto, la etapa de aprendizaje se utiliza para describir los datos y resumirlos en un modelo, como se ilustra a continuación.

Etapa de aprendizaje: los datos de entrenamiento pasan a través de un algoritmo para construir un modelo.

Por ejemplo, la máquina intenta comprender la relación entre el salario de una persona y la probabilidad de que vaya a un restaurante elegante. Resulta que la máquina encuentra una relación positiva entre el salario y la asistencia a un restaurante de alta gama: este es el modelo.

infiriendo

Una vez creado el modelo, es posible probar su eficacia con datos nunca antes vistos. Los nuevos datos se transforman en un vector de características, se procesan con el modelo y se obtiene una predicción. Esta es la parte valiosa del aprendizaje automático. No es necesario actualizar las reglas ni volver a entrenar el modelo: se puede utilizar el modelo previamente entrenado para realizar inferencias con nuevos datos, tal como se muestra en el diagrama a continuación.

Etapa de inferencia: los nuevos datos pasan a través del modelo entrenado para generar una predicción.

La vida de un programa de aprendizaje automático es sencilla y se puede resumir en los siguientes puntos:

  1. Definir una pregunta
  2. Recopilar datos
  3. Visualizar datos
  4. Algoritmo de tren
  5. Prueba el algoritmo
  6. Recopilar comentarios
  7. Refinar el algoritmo
  8. Repita los pasos del 4 al 7 hasta que los resultados sean satisfactorios.
  9. Usa el modelo para hacer una predicción.

Una vez que el algoritmo aprende a sacar las conclusiones correctas, aplica ese conocimiento a nuevos conjuntos de datos.

Aprendizaje automático Algorithms y ¿Dónde se utilizan?

El siguiente gráfico agrupa los algoritmos más comunes según el tipo de tarea que resuelven.

Los algoritmos de aprendizaje automático se agrupan en tareas supervisadas y no supervisadas.

Aprendizaje automático Algorithms

El aprendizaje automático se puede agrupar en dos grandes tareas de aprendizaje: supervisados y sin supervisiónOtras dos familias se sitúan entre ellas y más allá: el aprendizaje semisupervisado, que mezcla un pequeño conjunto etiquetado con uno grande sin etiquetar, y aprendizaje reforzadodonde un agente aprende a partir de recompensas en lugar de respuestas etiquetadas.

Aprendizaje supervisado

Un algoritmo utiliza datos de entrenamiento y retroalimentación humana para aprender la relación entre las entradas y la salida. Por ejemplo, un profesional puede usar los gastos de marketing y el pronóstico del tiempo como datos de entrada para predecir las ventas de latas.

Puedes usar aprendizaje supervisado Cuando se conocen los datos de salida, el algoritmo realizará predicciones con los nuevos datos.

Existen dos categorías de aprendizaje supervisado:

  • Tarea de clasificación
  • Tarea de regresión

Clasificación

Imagina que quieres predecir el género de un cliente para un anuncio. Empezarás recopilando datos sobre altura, peso, trabajo, salario, cesta de la compra, etc., de tu base de datos de clientes. Conoces el género de cada cliente, y solo puede ser masculino o femenino. El objetivo del clasificador es asignar una probabilidad de ser hombre o mujer (es decir, la etiqueta) basándose en la información recopilada (es decir, las características). Cuando el modelo haya aprendido a reconocer hombres y mujeres, podrás usar nuevos datos para hacer una predicción. Por ejemplo, acabas de recibir información de un cliente desconocido y quieres saber si es hombre o mujer. Si el clasificador predice hombre = 70%, significa que el algoritmo tiene un 70% de certeza de que este cliente es hombre y un 30% de certeza de que es mujer.

La etiqueta puede tener dos o más clases. El ejemplo de aprendizaje automático anterior solo tiene dos clases, pero si un clasificador necesita predecir objetos, puede tener docenas de clases (por ejemplo, vaso, mesa, zapatos; cada objeto representa una clase).

Regresión

Cuando el resultado es un valor continuo, la tarea es una regresión. Por ejemplo, un analista financiero podría necesitar pronosticar el valor de una acción basándose en diversas características, como el capital, el rendimiento histórico de la acción y los índices macroeconómicos. El sistema se entrenará para estimar el precio de la acción con el menor error posible.

La tabla que aparece a continuación enumera los algoritmos supervisados ​​que encontrará con mayor frecuencia y la tarea para la que es adecuado cada uno de ellos.

Algoritmo Mareas Ideales para Lecciones Tipo
Regresión lineal Encuentra una manera de correlacionar cada característica con la salida para ayudar a predecir valores futuros. Regresión
Regresión logística Extensión de la regresión lineal que se utiliza para tareas de clasificación. La variable de salida es binaria (por ejemplo, solo blanco o negro) en lugar de continua (por ejemplo, una lista infinita de colores posibles). Clasificación
Árbol de decisión Modelo de clasificación o regresión altamente interpretable que divide los valores de características de datos en ramas en nodos de decisión (por ejemplo, si una característica es un color, cada color posible se convierte en una nueva rama) hasta que se toma una decisión final. Regresión
Clasificación
Bayes ingenuos El método bayesiano es un método de clasificación que utiliza el teorema bayesiano. El teorema actualiza el conocimiento previo de un evento con la probabilidad independiente de cada característica que puede afectar el evento. Regresión
Clasificación
Máquinas de vectores soporte La máquina de vectores de soporte (SVM) se utiliza habitualmente para tareas de clasificación. El algoritmo SVM encuentra un hiperplano que divide las clases de forma óptima. Se recomienda su uso con un solucionador no lineal. Regresión (no muy común)
Clasificación
Bosque al azar El algoritmo se basa en un árbol de decisión para mejorar drásticamente la precisión. El bosque aleatorio genera muchos árboles de decisión simples y utiliza el método de "votación mayoritaria" para determinar qué etiqueta devolver. Para la tarea de clasificación, la predicción final será la que tenga más votos; para la tarea de regresión, la predicción final será el promedio de las predicciones de todos los árboles. Regresión
Clasificación
AdaBoost Técnica de clasificación o regresión que utiliza una multitud de modelos para tomar una decisión, pero los pesa en función de su precisión para predecir el resultado. Regresión
Clasificación
Árboles que aumentan el gradiente Los árboles de potenciación de gradiente son una técnica de clasificación/regresión de vanguardia. Se centran en el error cometido por los árboles anteriores e intentan corregirlo. Regresión
Clasificación

Aprendizaje sin supervisión

En el aprendizaje no supervisado, un algoritmo explora los datos de entrada sin que se le proporcione una variable de salida explícita (por ejemplo, explora los datos demográficos de los clientes para identificar patrones).

Puedes usarlo cuando no sepas cómo clasificar los datos y quieras que el algoritmo encuentre los patrones y los agrupe por ti. Los principales algoritmos no supervisados ​​se resumen a continuación.

Nombre del algoritmo Mareas Ideales para Lecciones Tipo
Agrupación de K-medias Coloca los datos en algunos grupos (k), cada uno de los cuales contiene datos con características similares (según lo determinado por el modelo, no de antemano por los humanos). Clusterinsights
modelo de mezcla gaussiana Una generalización del agrupamiento de k-medias que proporciona más flexibilidad en el tamaño y la forma de los grupos (conglomerados) Clusterinsights
Agrupación jerárquica Divide los grupos a lo largo de un árbol jerárquico para formar un sistema de clasificación. Puede utilizarse para agrupar a los clientes de tarjetas de fidelización. Clusterinsights
Sistema de recomendación Ayuda a definir los datos relevantes para formular una recomendación. Clusterinsights
PCA/t-SNE Se utiliza principalmente para disminuir la dimensionalidad de los datos. Los algoritmos reducen el número de características a 3 o 4 vectores con las variaciones más altas. Reducción de dimensión

Cómo elegir un algoritmo de aprendizaje automático

Existen multitud de algoritmos de aprendizaje automático, y la elección del algoritmo viene determinada por el objetivo más que por las modas.

En el ejemplo de aprendizaje automático que se muestra a continuación, la tarea consiste en predecir el tipo de flor entre tres variedades. Las predicciones se basan en la longitud y el ancho del pétalo. La imagen muestra los resultados de diez algoritmos diferentes. La imagen superior izquierda es el conjunto de datos en sí, con los datos clasificados en tres categorías: rojo, azul claro y azul oscuro. Algunos grupospingSe pueden observar diferencias. Por ejemplo, en la segunda imagen, todo lo que se encuentra en la parte superior izquierda pertenece a la categoría roja, la parte central contiene una mezcla de incertidumbre y azul claro, mientras que la parte inferior corresponde a la categoría oscura. Las demás imágenes muestran cómo diferentes algoritmos intentan clasificar los mismos datos.

Diez algoritmos comparados en el mismo conjunto de datos de flores de tres clases.

Una vez que se elige un candidato, su calidad se juzga en base a datos que nunca ha visto, generalmente con un matriz de confusión y las cifras de exactitud, precisión y exhaustividad derivadas de ello.

Desafíos y limitaciones del aprendizaje automático

El principal desafío del aprendizaje automático es la falta de datos, o la falta de diversidad dentro del conjunto de datos. Una máquina no puede aprender si no hay datos disponibles. Un conjunto de datos que carece de diversidad también dificulta el trabajo de la máquina, porque esta necesita heterogeneidad para obtener información significativa. Es raro que un algoritmo pueda...tracinformación cuando no hay variaciones o hay pocas. Una regla general común es tener al menos 20 observaciones por grupo para ayudar a la máquina a aprender; por debajo de eso, tanto la evaluación como la predicción se ven afectadas.

El volumen de datos no es el único límite. Los modelos entrenados con registros históricos sesgados reproducen ese sesgo, los modelos complejos son difíciles de explicar a un regulador o a un cliente, y cualquier modelo se degrada a medida que cambia el mundo con el que fue entrenado.

Aplicación del aprendizaje automático

Las técnicas descritas anteriormente ya se utilizan en la producción en la mayoría de las industrias. Los ejemplos que se presentan a continuación abarcan desde la asistencia general hasta sectores específicos.

Aumento: El aprendizaje automático ayuda a las personas en sus tareas cotidianas, tanto personales como comerciales, sin tener un control total sobre el resultado. Este tipo de aprendizaje automático se utiliza de diversas maneras, como en asistentes virtuales, análisis de datos y soluciones de software. Su objetivo principal es reducir los errores causados ​​por el sesgo humano.

Automatización: El aprendizaje automático funciona de forma totalmente autónoma en cualquier ámbito, sin necesidad de intervención humana. Por ejemplo, los robots realizan los pasos esenciales del proceso en las plantas de fabricación.

Sector financiero: El aprendizaje automático está ganando popularidad en el sector financiero. Los bancos lo utilizan principalmente para encontrar patrones en los datos, pero también para prevenir el fraude.

Organizaciones gubernamentales: Los gobiernos utilizan el aprendizaje automático para gestionar la seguridad pública y los servicios públicos. Tomemos el ejemplo de China y su programa de reconocimiento facial a gran escala, donde aplicaciones de inteligencia artificial se utilizan para identificar a los peatones que cruzan la calle imprudentemente.

Industria de la salud: El sector sanitario fue uno de los primeros en utilizar el aprendizaje automático, comenzando con la detección de imágenes.

Márketing: El uso generalizado de la IA en marketing se debe al abundante acceso a los datos. Antes de la era de los datos masivos, los investigadores desarrollaron herramientas matemáticas avanzadas, como el análisis bayesiano, para estimar el valor de un cliente. Con el auge de los datos, los departamentos de marketing recurren a la IA para optimizar las relaciones con los clientes y las campañas de marketing.

Ejemplo de aprendizaje automático en la cadena de suministro

El aprendizaje automático ofrece excelentes resultados en el reconocimiento de patrones visuales, lo que abre un amplio abanico de posibles aplicaciones en la inspección física y el mantenimiento a lo largo de toda la cadena de suministro.

El aprendizaje no supervisado permite buscar rápidamente patrones similares en un conjunto de datos diverso. A su vez, la máquina puede realizar inspecciones de calidad en todo el centro logístico e identificar los envíos dañados o desgastados.

Por ejemplo, IBMLa plataforma Watson puede determinar el barcoping Daños en el contenedor. Watson combina datos visuales y basados ​​en sistemas para track, informar y hacer recomendaciones en tiempo real.

En el pasado, los gestores de inventario dependían en gran medida de métodos manuales para evaluar y pronosticar el stock. Al combinar el big data con el aprendizaje automático, se hacen posibles técnicas de pronóstico más eficaces, con mejoras que oscilan entre el 20 y el 30 por ciento respecto a las herramientas tradicionales. En términos de ventas, esto se traduce en un aumento del 2 al 3 por ciento gracias a la posible reducción de los costes de inventario.

Ejemplo de aprendizaje automático en el Google Autos

Todo el mundo conoce el Google El coche está cubierto de láseres en el techo, que le indican su posición con respecto al entorno. En la parte delantera, cuenta con un radar que le informa de la velocidad y el movimiento de todos los coches a su alrededor. Utiliza todos esos datos no solo para determinar cómo conducir, sino también para predecir las acciones de los demás conductores. Lo más impresionante es que el coche procesa casi un gigabyte de datos por segundo.

Sensores de coches autónomos que alimentan modelos de aprendizaje automático en tiempo real.

¿Por qué es importante el aprendizaje automático?

El aprendizaje automático es, hasta el momento, la mejor herramienta para analizar, comprender e identificar patrones en los datos. Una de las ideas principales del aprendizaje automático es que se puede entrenar a una computadora para automatizar tareas que serían agotadoras o imposibles para un ser humano. La clara diferencia con el análisis tradicional radica en que el aprendizaje automático puede tomar decisiones con una mínima intervención humana.

Consideremos el siguiente ejemplo: un agente inmobiliario puede estimar el precio de una casa basándose en su experiencia personal y su conocimiento del mercado.

Se puede entrenar a una máquina para que traduzca el conocimiento de un experto en características. Estas características incluyen todos los aspectos de la vivienda, el vecindario, el entorno económico, etc., que influyen en el precio. Para el experto, probablemente se necesitaron años para dominar el arte de estimar el precio de una vivienda, y su pericia mejora con cada venta.

Para que la máquina domine este arte, se necesitan millones de datos (es decir, ejemplos). Al principio de su aprendizaje, la máquina comete errores, al igual que un vendedor principiante. Una vez que ha visto suficientes ejemplos, tiene el conocimiento necesario para realizar su estimación con gran precisión. Además, la máquina es capaz de corregir sus errores a medida que llegan nuevas ventas.

La mayoría de las grandes empresas han comprendido el valor del aprendizaje automático y de la gestión de datos. El McKinsey Global Institute estimó el valor anual de todas las técnicas analíticas entre 9.5 billones y 15.4 billones de dólares, y atribuyó aproximadamente el 40 por ciento de esa cantidad —entre 3.5 billones y 5.8 billones de dólares al año— a técnicas avanzadas de IA basadas en redes neuronales profundas, como se establece en su Notas desde la frontera de la IA humana y agrícola.

Cuando las reglas son conocidas pero imprecisas en lugar de estar ausentes, un enfoque basado en reglas como lógica difusa puede ajustarse mejor que un modelo aprendido, por lo que ambas técnicas suelen compararse antes de que comience un proyecto.

Preguntas Frecuentes

El aprendizaje semisupervisado se entrena con un pequeño conjunto de datos etiquetados, además de uno grande sin etiquetar, lo que resulta útil cuando el etiquetado es costoso. Aprendizaje reforzado No tiene etiquetas de ningún tipo: un agente actúa, recibe una recompensa o una penalización y ajusta su estrategia tras muchos intentos.

Están anidados. La inteligencia artificial es el objetivo más amplio de la inteligencia similar a la de las máquinas, el aprendizaje automático es el subconjunto que aprende de los datos y deep learning es el subconjunto del aprendizaje automático construido sobre redes neuronales multicapa.

El sobreajuste ocurre cuando un modelo memoriza el conjunto de entrenamiento, incluyendo su ruido, y luego falla con datos nuevos. Validación cruzada, modelos más simples, regularización, parada temprana.ping y más ejemplos de entrenamiento son las defensas habituales.

Un modelo siempre obtiene buenos resultados en las filas con las que fue ajustado, por lo que esa puntuación no demuestra nada. Reservar un conjunto de prueba —y a menudo un conjunto de validación aparte para el ajuste— es la única estimación honesta del rendimiento en datos que el modelo nunca ha visto.

Se requiere familiaridad con estadística básica y probabilidad, álgebra lineal a nivel de vectores y matrices, y un lenguaje de programación. Al principio, el manejo práctico de datos es más importante que las matemáticas avanzadas, por lo que limpiar y explorar un conjunto de datos real es el mejor primer ejercicio.

Python lidera, con scikit-learn para modelos clásicos y TensorFlow o PyTorch para redes neuronales. R Sigue siendo una herramienta sólida para el modelado estadístico y la visualización, mientras que SQL es inevitable para extraer los datos de entrenamiento.

Los modelos predictivos generan una etiqueta o un número para una entrada dada. Los modelos generativos aprenden la distribución de los datos y producen nuevas muestras a partir de ellos: texto, imágenes o código. Ambos se entrenan con datos, pero solo uno se evalúa únicamente en función de su precisión.

Copiloto de GitHub Crea rápidamente plantillas estándar: cargar un conjunto de datos, dividirlo, ajustar un estimador y graficar los resultados. RevAnalice todas las sugerencias, porque un proceso que parezca plausible aún puede filtrar datos de prueba al entrenamiento e inflar la puntuación.

Resumir este post con: