ML en Producción para Riesgo: Monitoreo, Drift y Reentrenamiento

Un modelo de riesgo desplegado empieza a morir el día que sale a producción. Qué vigilar (PSI, tendencia del Gini, calibración, overrides), por qué el rezago de resultados del crédito te obliga a monitorear los insumos, y cómo reentrenar sin perseguir ruido.

Todo lo que hemos visto en esta ruta hasta ahora ocurre antes del deployment. Este módulo trata de la vida más larga y menos glamorosa que empieza después: un modelo de riesgo en producción, calificando solicitantes reales, mientras el mundo que generó sus datos de entrenamiento deja de existir calladamente. El hecho central del ML en producción en crédito es brutal y simple — vas a saber que los insumos cambiaron mucho antes de saber que las salidas están mal — y un stack de monitoreo es la forma de actuar sobre la señal temprana en lugar de esperar la señal cara.

Cómo mueren los modelos

Tres modos de decaimiento distintos, que vale la pena separar porque exigen respuestas diferentes:

PSI: la métrica caballo de batalla para alerta temprana

El detector de drift estándar del crédito es el Population Stability Index. Congela la distribución de scores del desarrollo, pártela en deciles, y compara contra ella a la población de hoy:

PSI=i(actualiesperadoi)×ln ⁣actualiesperadoi\text{PSI} = \sum_{i} \left(\text{actual}_i - \text{esperado}_i\right) \times \ln\!\frac{\text{actual}_i}{\text{esperado}_i}

La misma construcción que el Information Value del Módulo 2es el IV, con otro propósito: en lugar de separar buenos de malos, separa el entonces del ahora. Las convenciones: debajo de 0.10 estable, 0.10–0.25 vigilar de cerca, arriba de 0.25 investigar antes de confiar en el modelo. Siente qué lo mueve:

Medidor de Drift PSI

Barras de contorno: la población con la que se construyó tu modelo (congelada). Barras sólidas: los solicitantes de hoy. El PSI mide qué tanto se ha alejado el hoy del desarrollo.

deciles de score (bins del desarrollo)
PSI
Estatus
Peor bin

Convención: PSI < 0.10 estable · 0.10–0.25 monitorear de cerca · > 0.25 cambio material, investiga antes de confiar en el modelo.

Tres experimentos. Un puro corrimiento de la media de 0.3σ — apenas visible en las barras — ya empuja el PSI hacia la zona de advertencia; la métrica es sensible por diseño, porque los corrimientos promedio pequeños suelen esconder corrimientos de segmento más grandes. Solo con ampliar la dispersión también se dispara — mismo solicitante promedio, mezcla diferente. Y el tercer slider es el escenario realista: un segmento nuevo entrando por el extremo riesgoso. Fíjate cómo una entrada modesta activa la alarma y la lectura del peor bin apunta exactamente a dónde mirar — el valor real del PSI no es el número, es la descomposición por bin diciéndote qué parte de la población es nueva.

Corre la misma estadística por feature (CSI, estabilidad de características) y obtienes triage: el PSI del score dice si algo cambió; los CSI a nivel feature dicen qué. Score estable pero tres features con drift = cambios que se compensan y que de todos modos vale la pena entender. Score con drift con todos los features estables = revisa el pipeline, alguien cambió un mapeo.

El stack de monitoreo, por latencia

La restricción que define el monitoreo de crédito es el rezago de resultados: las aprobaciones de hoy se ganan sus etiquetas a 12 meses dentro de un año (la ventana de desempeño del Módulo 5, ahora trabajando en tu contra). Así que el stack se organiza según qué tan rápido está disponible cada señal:

SeñalLatenciaQué atrapa
Salud del pipeline: tasas de nulos, rangos, esquema, volúmenesMismo díaFallas de plomería — revisa esto primero, siempre
Estabilidad de score y features (PSI/CSI)Mismo díaDrift de población y de pipeline
Tasa de aprobación, mezcla de scores, tasa de overridesDías–semanasInteracciones con políticas, gaming, drift pegándole a las decisiones
Morosidad temprana (30dpd a 3 meses en libros)MesesLa primera señal honesta de resultados
Gini / calibración en cosechas maduras12–18 mesesLa verdad, demasiado tarde para ser tu única alarma

Dos filas merecen comentario. Las tasas de override — qué tan seguido los humanos revierten al modelo — son un detector de drift subestimado: cuando los analistas de crédito notan colectivamente algo que el modelo no puede ver, aparece aquí primero, y una tasa de overrides al alza es tu equipo levantando un reporte de bug a través de su comportamiento. Y la morosidad temprana es el punto medio entre esperar etiquetas reales y volar a ciegas: 30 días de atraso a los tres meses en libros correlaciona lo suficientemente fuerte con el incumplimiento eventual como para servir de indicador adelantado de falla del modelo — síguela por cosecha contra cohortes anteriores a la misma edad (las curvas de cosecha del Módulo 5, corriendo en vivo).

Reentrenamiento: política, no pánico

El instinto ingenuo — “drift detectado, reentrena ya” — falla en crédito por una razón específica: solo puedes reentrenar con datos etiquetados, y las etiquetas se rezagan por la ventana de desempeño. Reentrenar “con los datos más recientes” significa entrenar con créditos colocados hace 12–24 meses — muchas veces más lejos del régimen de hoy que la muestra de tu modelo actual. Reentrenar durante un episodio de drift puede empeorar el modelo.

Una política de reentrenamiento sensata tiene tres partes:

  1. Cadencia + disparadores. Un redesarrollo anual programado (lo que el validador espera de todos modos) más disparadores definidos: PSI del score sostenido por encima del umbral, calibración a la deriva más allá de la tolerancia en cosechas maduras, decaimiento del Gini más allá de su banda histórica de ruido. Los disparadores motivan investigación — reentrenar es un desenlace posible, no el reflejo. Si el drift es un bug del pipeline, reentrenar lava el bug y lo mete al modelo.
  2. Recalibración antes que redesarrollo. La mayor parte del decaimiento aparece como drift de calibración (la distinción del Módulo 4 ganándose el sueldo): el ordenamiento aguanta mientras los niveles de PD se mueven con el ciclo. Una recalibración — reajustar el mapeo de score a PD con resultados recientes ya maduros — es barata, de bajo riesgo, y muchas veces te compra un año. El redesarrollo completo es para cuando el ordenamiento se degrada o el conjunto de features mismo ya caducó.
  3. Primero en sombra. Un retador reentrenado califica todo en paralelo, en silencio, durante meses antes de la promoción — la disciplina campeón/retador del Módulo 2 de crédito es precisamente un mecanismo de seguridad de producción. Compara estabilidad, calibración en resultados tempranos, y los cambios de decisión (cuáles solicitantes cambian de lado, no solo cuántos) antes de cualquier cambio de estafeta.

Gobernanza: el monitoreo es un requisito de riesgo de modelo

Nada de esto es opcional en un banco. SR 11-7 hace del monitoreo continuo uno de los tres pilares de la gestión de riesgo de modelos — con métricas documentadas, umbrales acordados antes del deployment, rutas de escalamiento, y evidencia de que el proceso corre. La traducción práctica: un plan de monitoreo escrito en tiempo de desarrollo (qué métricas, con qué frecuencia, qué umbrales, a quién se le avisa, qué pasa ante una violación), un paquete mensual que un validador pueda auditar, y violaciones de umbral que disparen investigaciones documentadas en lugar de ediciones silenciosas del umbral. La disciplina de alertas importa tanto como la cobertura de alertas — un sistema de monitoreo que grita “¡lobo!” cada semana entrena al equipo a ignorarlo, lo cual es peor que no tener sistema, porque parece control.

Dónde se conecta

Pruébalo tú mismo

El notebook de abajo construye un sistema de monitoreo de punta a punta sobre una corrida de producción simulada de dos años: PSI/CSI desde cero con descomposición por deciles, un inyector de drift (corrimiento de media, segmento nuevo, bug de nulos en el pipeline) para ver cada firma, Gini y calibración rastreados en cosechas que van madurando con el rezago de resultados hecho explícito, una simulación de tasa de overrides, y la trampa del reentrenamiento — un modelo reentrenado a media deriva con etiquetas rezagadas que rinde peor que el original y que una simple recalibración. El ejercicio de cierre: escribe el plan de monitoreo (métricas, umbrales, cadencia, escalamiento) para el modelo que construiste en el notebook del Módulo 2, como si lo fuera a leer un validador. Porque lo va a leer.

Laboratorio de Monitoreo de Modelos y Drift (notebook de Jupyter)
Descarga gratuita, sin registro (archivo en inglés).
Descargar

Recibe los nuevos posts por correo

Un correo por cada artículo nuevo. Sin spam, sin ventas, cancela cuando quieras.