Por qué un modelo con 95% de acierto puede ser inútil
Cuando lo que se busca es raro, la precisión global deja de significar nada
LA MÉTRICA QUE ENGAÑA
Supongamos un sistema que detecta una condición presente en el uno por ciento de los casos. Un modelo que responda siempre «no» acertará el noventa y nueve por ciento de las veces.
Ese modelo es inútil y tiene mejor exactitud que muchos sistemas genuinamente informativos. La exactitud global es una métrica engañosa siempre que las clases estén desequilibradas, que es la situación normal en detección de fraude, diagnóstico de enfermedades raras y control de calidad.
LAS MÉTRICAS QUE SÍ INFORMAN
Conviene separar dos preguntas que suelen confundirse.
La sensibilidad responde a: de todos los casos positivos reales, ¿cuántos detecta el sistema? Es lo que importa cuando el coste de no detectar es alto.
El valor predictivo positivo responde a: de todos los casos que el sistema marca como positivos, ¿cuántos lo son realmente? Es lo que importa para quien recibe la alerta y tiene que actuar sobre ella.
La segunda depende críticamente de la prevalencia, y ahí está el problema que más veces se pasa por alto en despliegues reales.
EL EFECTO DE LA PREVALENCIA
Consideremos un detector con noventa y nueve por ciento de sensibilidad y noventa y nueve por ciento de especificidad, cifras excelentes.
Aplicado a una población donde la condición aparece en uno de cada diez mil casos, sobre un millón de evaluaciones detectará prácticamente todos los cien positivos reales, y generará además unos diez mil falsos positivos.
De cada cien alertas, aproximadamente una será correcta. El sistema funciona exactamente según sus especificaciones y produce un torrente de alarmas inútiles.
Este es el motivo por el que un modelo validado con buenos resultados en un conjunto de prueba equilibrado puede fracasar en producción: el conjunto de prueba no reproducía la prevalencia real.
LA FATIGA DE ALERTAS
La consecuencia operativa está bien documentada en entornos clínicos e industriales. Cuando la mayoría de las alertas son falsas, los operadores dejan de atenderlas.
El sistema no falla técnicamente; falla socialmente. Y el fallo es difícil de detectar en las métricas del modelo, porque el modelo sigue rindiendo igual que el día de su validación.
QUÉ HACER
Tres medidas resuelven la mayor parte del problema.
Ajustar el umbral de decisión al coste real de cada tipo de error, en lugar de dejarlo en el valor por defecto, que rara vez es el adecuado.
Evaluar sobre datos con la prevalencia del entorno de destino, o corregir explícitamente las métricas por ella.
Y medir el rendimiento del conjunto humano más sistema, no del sistema aislado. Lo que importa no es la calidad del clasificador sino la calidad de las decisiones que produce la organización que lo usa.
Periódico Digital · https://periodico.dreamlabstech.co/inteligencia-artificial-aplicada/articulo_006.html