Métricas de clasificación bien hechas
AUC, Gini y KS son la misma familia; la accuracy miente siempre que los incumplimientos son raros; precision-recall es cómo se siente realmente el desbalance; y la calibración es una virtud aparte que tu métrica de ordenamiento no puede ver.
El modelado de crédito tiene su propio dialecto de evaluación de modelos — Gini y KS de este lado de la oficina, AUC y F1 del otro — y los errores de traducción son una fuente real de malas decisiones. Este módulo ordena el zoológico según lo que cada métrica realmente mide, muestra por qué la métrica más popular del machine learning (la accuracy) es casi insignificante con datos de incumplimiento, y separa las dos virtudes que la gente confunde constantemente: ordenar correctamente a los acreditados y calibrar correctamente sus probabilidades.
El planteamiento: una imagen, todas las métricas
Todo modelo binario de scoring se reduce a la misma imagen: dos distribuciones de score — buenos y malos — que se traslapan. Cada métrica de este módulo es un resumen distinto de ese traslape. Así que empieza con la imagen:
Corre el experimento que motiva todo el módulo antes de seguir leyendo: pon la separación en 1.5σ, el umbral donde sea, y arrastra la tasa base de 50% hasta 2%. Observa qué números se mueven y cuáles no — y luego mira cómo la accuracy sube mientras la utilidad del modelo colapsa. Todo lo de abajo es el desdoblamiento de ese slider.
La familia de ordenamiento: AUC, Gini, KS
Estas tres responden la misma pregunta — ¿el modelo ordena a los malos por encima de los buenos? — y a ninguna le importa la tasa base ni tu punto de corte.
AUC (área bajo la curva ROC) tiene el significado probabilístico más limpio: toma un malo al azar y un bueno al azar; el AUC es la probabilidad de que el malo tenga el score más alto. 0.5 es un volado; 1.0 es separación perfecta. No depende del umbral — la curva ROC recorre cada punto de corte posible, y el AUC integra sobre todos ellos.
Gini es la convención de casa del crédito: . Nada más. Un “Gini de 55” es un AUC de 0.775. Reescala el volado a 0, y por eso les gusta a los talleres de scorecards — las mejoras se leen con más honestidad (AUC 0.75 → 0.80 suena a nada; Gini 50 → 60 suena a lo que es). Cuando alguien cita un “accuracy ratio” de una curva CAP, eso es Gini otra vez — el mismo número por una construcción distinta.
KS (Kolmogorov–Smirnov) es la brecha vertical máxima entre las distribuciones acumuladas de score de buenos y malos — la separación que vale el mejor punto de corte único. Responde una pregunta más angosta que el AUC: no “qué tan bueno es el ordenamiento en general” sino “en el mejor punto de división, ¿qué tan diferentes son las poblaciones?”. Eso es genuinamente útil cuando el punto es una sola decisión de corte (la línea de aprobar/rechazar del Módulo 2), y por eso KS sobrevive en crédito mientras apenas aparece en otros lados. Su debilidad es la imagen en espejo: ignora todo lo que está lejos del óptimo, así que dos modelos con KS iguales pueden diferir mucho en las colas — donde vive tu peor 5% de solicitantes.
Reglas de dedo para scorecards de originación estilo buró: un Gini por debajo de ~30 es débil, 40–60 es la zona de caballo de batalla, 70+ en datos out-of-time debería detonar sospecha de fuga de información (la lección del Módulo 2 de DS) antes que celebración.
Por qué la accuracy miente
La accuracy — proporción de predicciones correctas — importa un supuesto que es falso en crédito: que ambos tipos de error importan igual y que ambas clases son comparablemente comunes. Con una tasa de incumplimiento del 3%, la estrategia “apruébalos a todos” tiene 97% de accuracy y 0% de utilidad. Cualquier modelo que persigue la accuracy aprende a decir “bueno” en todas partes, porque los datos premian exactamente eso.
La lente honesta bajo desbalance es el par precision–recall: de las cuentas que marcaste, ¿cuántas eran realmente malas (precision)? De las verdaderamente malas, ¿cuántas atrapaste (recall)? La precision es donde muerde la tasa base — con 2% de malos, incluso un modelo fuerte produce mayormente falsas alarmas en cualquier corte agresivo, y el equipo de cobranza siente eso, no el AUC. La curva PR hace visible lo que la curva ROC comprime: la tasa de falsos positivos de la ROC se diluye con la enorme población de buenos, así que una curva ROC puede verse gloriosa mientras la precision se queda en 20%. Mismo modelo, mismos scores — pregunta distinta. Para trabajo con eventos raros, mira ambas, pero decide con cantidades estilo PR (o, mejor, con el costo esperado).
Una nota más de honestidad: F1 es una conveniencia, no una ley. Pondera precision y recall por igual, lo cual codifica un supuesto de costos que nadie en crédito cree (un incumplimiento no detectado cuesta el principal; una falsa alarma cuesta una llamada telefónica). Si conoces los costos aunque sea a grandes rasgos, optimiza el costo esperado en el punto de corte directamente — para eso sirve el punto de corte.
Calibración: una virtud completamente distinta
Las métricas de ordenamiento no pueden ver si tus probabilidades significan algo. Un modelo que arroja 0.9 para cada malo y 0.8 para cada bueno tiene un AUC perfecto y probabilidades absurdas. La calibración pregunta: de los préstamos que calificaste con 4%, ¿alrededor del 4% realmente incumplió?
Al crédito le importa la calibración más que a casi cualquier otro campo, porque el nivel de la PD — no solo su ordenamiento — fluye hacia el pricing (la EL del Módulo 1), las provisiones (IFRS 9) y el capital (la fórmula IRB). Un modelo mal calibrado con un gran Gini aprueba a la gente correcta al precio equivocado.
El kit de herramientas: diagramas de confiabilidad (agrupa en bins por PD predicha, grafica lo predicho contra lo realizado — la imagen), el Brier score (error cuadrático medio de las probabilidades — un solo número que mezcla calibración y discriminación), y mapas de recalibración — Platt scaling (logístico) o regresión isotónica (monótona, más flexible) ajustados sobre un holdout. Recalibrar es barato, preserva el ordenamiento exactamente (así que el Gini queda intacto), y es obligatorio siempre que el entrenamiento haya usado un dataset balanceado o sobremuestreado — la distorsión de tasa base del Módulo 3 de la ruta de crédito (la queja de Zmijewski) reencarnada con ropa de ML.
Qué métrica para qué trabajo
| Tarea | Métrica principal | Elenco de apoyo |
|---|---|---|
| Comparar modelos candidatos | Gini/AUC, out-of-time | PR-AUC si los malos son raros; IC de DeLong para no embarcar ruido |
| Fijar el corte de aprobar/rechazar | Costo esperado / utilidad en el corte | KS como el resumen clásico; análisis de swap-sets |
| Alimentar PD al pricing, IFRS 9, IRB | Calibración (confiabilidad, Brier) | Gini como piso de cordura |
| Monitorear un modelo en vivo | Tendencia del Gini + deriva de calibración | PSI sobre score y variables — Módulo 6 |
| Explicar el desempeño a un validador | Todo lo anterior, por segmento | Estabilidad de las métricas entre segmentos y cosechas |
La columna de por-segmento merece su propia oración: el Gini a nivel portafolio puede esconder un modelo que ordena bellamente a los acreditados de expediente grueso y echa un volado con los de expediente delgado. Rebana antes de firmar.
Dónde conecta esto
- Los scores que se evalúan vienen de las variables del Módulo 2 y de los scorecards del Módulo 2 de crédito; las comparaciones champion/challenger viven y mueren por estas métricas.
- La evaluación out-of-time — la única honesta para datos a la deriva — es el tema del Módulo 5, que sigue.
- El decaimiento de métricas en producción, y cuándo debería detonar un reentrenamiento, es el Módulo 6.
- Las PD calibradas son lo que consumen los Módulos 9 y 8 de crédito; una mejora de Gini que arruina la calibración es una pérdida neta ahí.
Pruébalo tú mismo
El notebook de abajo construye cada métrica desde cero sobre un dataset de crédito sintético — curvas ROC y PR trazadas a mano antes de llamar a sklearn, el Gini de tres maneras (transformación del AUC, curva CAP, D de Somers) para demostrar que coinciden, KS con su punto de corte, diagramas de confiabilidad antes y después de la recalibración isotónica, y el experimento de desbalance: el mismo modelo evaluado con tasas base de 50%, 10% y 2%, con una tabla de qué métricas se movieron y cuáles se quedaron quietas. El ejercicio de cierre te entrega dos modelos — uno con mejor Gini, otro con mejor calibración — y una regla de pricing, y te pregunta cuál gana más dinero. (No es el del Gini.)
Recibe los nuevos posts por correo
Un correo por cada artículo nuevo. Sin spam, sin ventas, cancela cuando quieras.