Matriz de confusión en aprendizaje automático con EJEMPLO

¿Qué es la matriz de confusión?

Una matriz de confusión es una técnica de medición del rendimiento para la clasificación del aprendizaje automático. Es una especie de tabla que ayuda a conocer el desempeño del modelo de clasificación sobre un conjunto de datos de prueba para que se conozcan los valores verdaderos. El término matriz de confusión en sí es muy simple, pero su terminología relacionada puede resultar un poco confusa. A continuación se ofrece una explicación sencilla para esta técnica.

Cuatro resultados de la matriz de confusión

La matriz de confusión visualiza la precisión de un clasificador comparando las clases reales y las previstas. La matriz de confusión binaria está compuesta por cuadrados:

Tabla de confusión
Tabla de confusión
  • TP: Verdadero positivo: valores pronosticados correctamente como positivos reales
  • FP: Los valores pronosticados predijeron incorrectamente un positivo real. es decir, valores negativos predichos como positivos
  • FN: Falso Negativo: Valores positivos predichos como negativos
  • TN: Verdadero negativo: valores pronosticados correctamente como negativos reales

Puede calcular el prueba de precisión de la matriz de confusión:

Cuatro resultados de la matriz de confusión

Ejemplo de matriz de confusión

Confusion Matrix es un método útil de aprendizaje automático que le permite medir la recuperación, la precisión, la exactitud y la curva AUC-ROC. A continuación se muestra un ejemplo para conocer los términos Verdadero Positivo, Verdadero Negativo, Falso Negativo y Verdadero Negativo.

Verdadero Positivo:

Proyectaste algo positivo y resultó ser cierto. Por ejemplo, habías predicho que Francia ganaría la copa del mundo y ganó.

Verdadero negativo:

Cuando predijiste algo negativo, y es verdad. Habías predicho que Inglaterra no ganaría y perdió.

Falso positivo:

Tu predicción es positiva y falsa.

Habías predicho que Inglaterra ganaría, pero perdió.

Falso negativo:

Tu predicción es negativa y el resultado también es falso.

Se había predicho que Francia no ganaría, pero ganó.

Debe recordar que describimos los valores predichos como Verdaderos o Falso o Positivos y Negativos.

Cómo calcular una matriz de confusión

Aquí se muestra el proceso paso a paso para calcular una matriz de confusión en la minería de datos

  • Paso 1) Primero, debe probar el conjunto de datos con los valores de resultado esperados.
  • Paso 2) Predecir todas las filas del conjunto de datos de prueba.
  • Paso 3) Calcule las predicciones y resultados esperados:
  1. El total de predicciones correctas de cada clase.
  2. El total de predicciones incorrectas de cada clase.

Después de esto, estos números se organizan según los métodos que se indican a continuación:

  • Cada fila de la matriz se vincula a una clase prevista.
  • Cada columna de la matriz corresponde a una clase real.
  • Los recuentos totales de clasificación correcta e incorrecta se ingresan en la tabla.
  • La suma de las predicciones correctas para una clase va a la columna prevista y a la fila esperada para ese valor de clase.
  • La suma de las predicciones incorrectas para una clase va a la fila esperada para ese valor de clase y a la columna prevista para ese valor de clase específico.

Otros términos importantes que utilizan una matriz de confusión

  • Valor predictivo positivo (PVV): Esto está muy cerca de la precisión. Una diferencia significativa entre los dos términos es que PVV considera la prevalencia. En la situación en la que las clases están perfectamente equilibradas, el valor predictivo positivo es lo mismo que la precisión.
  • Tasa de error nula: Este término se utiliza para definir cuántas veces su predicción sería errónea si pudiera predecir la clase mayoritaria. Puede considerarlo como una métrica de referencia para comparar su clasificador.
  • Puntuación F: La puntuación F1 es una puntuación promedio ponderada del verdadero positivo (recuerdo) y la precisión.
  • Curva Roc: La curva Roc muestra las tasas de verdaderos positivos frente a la tasa de falsos positivos en varios puntos de corte. También demuestra un equilibrio entre la sensibilidad (recuerdo y especificidad o la tasa de verdaderos negativos).
  • Precisión: La métrica de precisión muestra la exactitud de la clase positiva. Mide la probabilidad de que la predicción de la clase positiva sea correcta.

Otros términos importantes que utilizan una matriz de confusión

La puntuación máxima es 1 cuando el clasificador clasifica perfectamente todos los valores positivos. La precisión por sí sola no es muy útil porque ignora la clase negativa. La métrica suele estar emparejada con la métrica de recuperación. La recuperación también se llama sensibilidad o tasa de verdaderos positivos.

  • Sensibilidad: La sensibilidad calcula la proporción de clases positivas detectadas correctamente. Esta métrica indica qué tan bueno es el modelo para reconocer una clase positiva.

Otros términos importantes que utilizan una matriz de confusión

¿Por qué necesitas la matriz de confusión?

A continuación se detallan las ventajas y beneficios de utilizar una matriz de confusión.

  • Muestra cómo cualquier modelo de clasificación se confunde cuando hace predicciones.
  • La matriz de confusión no solo le brinda información sobre los errores que comete su clasificador, sino también los tipos de errores que se cometen.
  • Este desglose le ayuda a superar la limitación de utilizar únicamente la precisión de la clasificación.
  • Cada columna de la matriz de confusión representa las instancias de esa clase predicha.
  • Cada fila de la matriz de confusión representa las instancias de la clase real.
  • Proporciona información no solo de los errores que comete un clasificador sino también de los errores que se cometen.

Resumir este post con: