Inferencia Causal en el Crédito

La predicción responde '¿quién va a incumplir?' La política pregunta '¿qué pasa si cambiamos la tasa, el límite, el punto de corte?' Confundir las dos es la manera en que los modelos de pura correlación te exhiben — en comité y frente a los reguladores.

Todos los modelos de esta ruta hasta ahora responden un tipo de pregunta: dado lo que observo, ¿qué va a pasar? Pero casi toda decisión que un prestamista realmente toma es un tipo de pregunta diferente: si cambio algo — la tasa, el límite, el punto de corte, el guion de cobranza — ¿qué va a pasar entonces? La primera es predicción; la segunda es intervención. Se parecen, usan los mismos datos, y tienen respuestas distintas. El módulo final de esta ruta trata de la brecha entre ambas, porque esa brecha es donde los modelos que validaron hermosamente producen políticas que fallan.

La parábola: ¿la tasa de interés causa el incumplimiento?

Jala los datos de tu portafolio y corre el análisis obvio: los acreditados que pagan tasas más altas incumplen más. Muchísimo más. ¿Subir tasas causa incumplimientos — deberías recortar el pricing para recortar pérdidas?

Ya sabes qué está mal: esas tasas las pusiste , con base en el riesgo. Los acreditados riesgosos recibieron tasas altas y además incumplieron más — el riesgo es una variable confusora (confounder), una causa común tanto del “tratamiento” (la tasa) como del resultado (el incumplimiento). La asociación observada mezcla el efecto causal del precio (real: pagos más altos sí presionan a los acreditados — y la selección adversa hace que los cambios de precio cambien quién acepta) con la señal de riesgo que fluye a través de tu propia política de pricing. Descompónlo tú mismo:

Simulador de Confusión: ¿La Tasa Causa el Incumplimiento?

La mitad de la cartera es de riesgo bajo (2% de PD base), la mitad de riesgo alto (10%). El riesgo determina tanto la tasa que recibe un acreditado como su incumplimiento — la variable confusora de libro de texto.

Lectura

El experimento para correr primero: arrastra el efecto causal verdadero a cero. La comparación ingenua sigue reportando que los acreditados de tasa alta incumplen a múltiplos del grupo de tasa baja — una asociación fuerte, estable y completamente no causal, fabricada por tu propio pricing. Cualquier modelo que consuma estos datos la va a aprender; cualquier tomador de decisiones que lea el modelo causalmente va a actuar sobre ella; y la acción no va a producir el resultado predicho. Luego pon el pricing basado en riesgo en cero y observa cómo la estimación ingenua se ajusta de golpe a la verdad — eso es lo que compra la aleatorización, y por eso es el estándar de oro: corta a la fuerza la flecha que va del riesgo al tratamiento.

Por qué los datos de crédito son una máquina de confusión

El ejemplo de la tasa no es un caso desafortunado — es la estructura del dominio. Los datos de crédito los generan las propias decisiones del prestamista, así que el tratamiento que quieres evaluar casi nunca se asigna independientemente del riesgo:

La caja de herramientas, en orden de preferencia

1. Aleatoriza — estás más cerca de lo que crees. El estándar de oro es más barato en el crédito que en casi cualquier industria, porque las decisiones son centralizadas, digitales y repetidas a escala. Pruebas de pricing aleatorizadas, aumentos de límite aleatorizados, tratamientos de cobranza aleatorizados — y los dos diseños aleatorizados que esta ruta ya avaló sin usar el vocabulario: campeón/retador es un A/B test de políticas de decisión, y el arreglo de “aprueba una rebanadita aleatoria de rechazados” para la inferencia de rechazados es un experimento aleatorizado que compra datos insesgados con un presupuesto de incumplimiento conocido. El clásico del género — los experimentos de campo de Karlan y Zinman aleatorizando tasas de oferta — encontró efectos causales del precio reales pero modestos, mucho menores que lo que sugieren las correlaciones ingenuas de portafolio. Exactamente la lección del widget.

2. Ajusta por variables confusoras — con humildad. Cuando no puedes aleatorizar, controla: regresión con controles de riesgo, estratificación, matching, o propensity scores (modela la probabilidad de recibir el tratamiento dadas las observables, y luego compara acreditados tratados y no tratados a la misma propensión — colapsando muchas variables confusoras en un solo score balanceador). La barra “ajustada” del widget recupera la verdad por esta vía — pero solo porque su variable confusora está completamente observada. La advertencia honesta que carga toda estimación ajustada: el ajuste maneja las variables confusoras que mediste. La confusión no observada — el juicio del analista que nunca llegó a un campo, la inseguridad laboral del acreditado — se queda en tu estimación, sin marcar. El análisis de sensibilidad (“¿qué tan fuerte tendría que ser una variable confusora oculta para matar este resultado?”) es el hábito profesional.

3. Caza experimentos naturales. A veces el mundo aleatoriza por ti, y el crédito es rico en estos: discontinuidades de punto de corte — los solicitantes con score 649 vs 651 son personas estadísticamente idénticas que recibieron decisiones diferentes, así que comparar resultados justo alrededor del umbral estima el efecto causal de la política (regresión discontinua — tus propios puntos de corte históricos son un laboratorio que ya pagaste); cambios de política — un programa de aumento de límites desplegado en la región A pero no en la B habilita diferencias en diferencias, comparando el cambio en A contra el cambio en B para que las diferencias estables se cancelen; variables instrumentales — alguna peculiaridad de asignación (asignación aleatorizada de analistas, donde los analistas difieren en indulgencia) que mueve el tratamiento pero plausiblemente no afecta los resultados por otra vía.

La aplicación clásica que lo junta todo es el problema del aumento de línea de crédito: ¿subir un límite causa más incumplimiento, o los acreditados riesgosos simplemente quedan señalados por la solicitud de aumento? Observacionalmente no tiene remedio (las solicitudes señalan estrés); se resuelve bien con aumentos aleatorizados o con discontinuidades en el score de elegibilidad para el aumento. El notebook implementa exactamente esto, de las tres maneras, sobre datos donde conoces la verdad.

Predicción y causalidad, correctamente divididas

La resolución no es que los métodos causales reemplacen a los predictivos — es una división del trabajo:

PreguntaTipoHerramienta correcta
¿Quién es más propenso a incumplir?PredicciónScorecards, XGBoost — esta ruta
¿Qué pasa con las pérdidas si subimos las tasas 200pb?IntervenciónExperimento; ajuste si no queda de otra
¿El nuevo guion de cobranza redujo los roll rates?IntervenciónA/B test; diff-in-diff alrededor del despliegue
¿Debería rechazarse a este solicitante?Predicción (bajo la política actual)Score + punto de corte
¿Deberíamos mover el punto de corte?IntervenciónAnálisis de discontinuidad en el corte viejo; economía del swap-set
¿Por qué el modelo lo rechazó?Atribución (¡ninguna de las dos!)Códigos de razón SHAP — hechos del modelo, no hechos del mundo

Un modelo predictivo es un magnífico dispositivo de targeting dentro de una política evaluada causalmente: usa el experimento para aprender qué hace el tratamiento, usa el modelo para decidir quién lo recibe. El modo de falla es saltarse el primer paso.

La ruta, cerrada

Ocho módulos: las trampas en los datos crudos, los features que vale la pena construir, la dinámica de las series financieras, métricas honestas, validación honesta, mantenerse honesto en producción, razonar con datos escasos, y — hoy — la diferencia entre predecir el mundo y cambiarlo. El arco tiene una sola columna vertebral: los datos financieros los generan procesos que pelean contra tus supuestos — mercados que arbitran la señal hasta desaparecerla, políticas que seleccionan la muestra, ciclos que rompen la estacionariedad, y decisiones que enredan el tratamiento con el riesgo. La ciencia de datos en finanzas es la disciplina de modelar de todos modos, con los modos de falla nombrados por adelantado. En pareja con la ruta de modelos de crédito, ahora tienes las dos mitades: la economía de qué significan los números, y la estadística de cómo calcularlos sin engañarte a ti mismo.

Dónde se conecta

Pruébalo tú mismo

El notebook de abajo construye el argumento completo sobre datos de crédito simulados donde la verdad se conoce: la parábola de la confusión por tasa con estimaciones ingenuas, ajustadas por regresión y emparejadas por propensión; un barrido de sensibilidad a variables confusoras no observadas que muestra cómo se degrada cada estimador; un análisis de regresión discontinua en un punto de corte de score (tu experimento natural gratis); y una evaluación de diferencias en diferencias de un despliegue escalonado de aumentos de límite — más la versión aleatorizada de cada uno, como el benchmark que los métodos observacionales intentan ganarse. El ejercicio de cierre es el memo del aumento de línea de crédito: con los cuatro análisis en mano, escribe la recomendación, con la incertidumbre que de verdad tienes.

Inferencia Causal para Crédito (notebook de Jupyter)
Descarga gratuita, sin registro (archivo en inglés).
Descargar

Recibe los nuevos posts por correo

Un correo por cada artículo nuevo. Sin spam, sin ventas, cancela cuando quieras.