Ciencia de Datos Moderna en Crédito

Por qué el ML en crédito es más difícil que el ML en cualquier otro lado, cuándo XGBoost de verdad le gana al scorecard, cómo SHAP convierte cajas negras en códigos de razón, y las dos disciplinas — riesgo de modelos y fair lending — que deciden qué llega a producción.

El módulo final de este track hace la pregunta que a cada equipo de ciencia de datos de cada banco le ha hecho cada ejecutivo desde aproximadamente 2016: ¿por qué seguimos usando regresión logística de los años sesenta? La respuesta no es “inercia”. El crédito es el dominio donde el playbook habitual del machine learning se topa con cuatro restricciones que no enfrenta en ningún otro lado — y la ingeniería interesante ocurre exactamente en esas restricciones.

Por qué el crédito es el modo difícil del ML

El ciclo de retroalimentación es glacial y está censurado. Un sistema de recomendación aprende de millones de clics al día. Un modelo de crédito registra un crédito hoy y se entera de si fue un error en 18–24 meses — y solo para los créditos que aprobó (el problema de inferencia de rechazados del Módulo 2, permanentemente sin resolver). La velocidad de iteración, el superpoder del ML, en su mayor parte no está disponible.

El mundo se mueve debajo del modelo. Ciclos macro, cambios competitivos, cambios de producto — el proceso generador de datos es no estacionario (el problema de regímenes del post de EDA). Un modelo ajustado en un periodo benigno codifica la física del periodo benigno; 2020 rompió cada modelo en producción en cuestión de semanas, sin culpa alguna del procedimiento de ajuste.

Cada decisión debe ser explicable — individualmente, por ley. No “el modelo tiene 84% de exactitud” sino “tu solicitud fue rechazada por X, Y, Z” — un enunciado específico y veraz sobre una persona, exigido por la regulación (abajo). Esto mata cualquier arquitectura cuyas decisiones no puedan descomponerse.

Los errores son asimétricos y correlacionados. Una mala recomendación de película cuesta un encogimiento de hombros. Las malas decisiones de crédito cuestan principal, se agrupan en las recesiones (Módulo 10) y — lo peor — pueden dañar sistemáticamente a grupos protegidos, lo cual es moralmente serio y legalmente existencial a la vez.

XGBoost para predecir incumplimiento: lo que sí funciona

Los árboles con gradient boosting son el retador de cajón del scorecard, y en datos tabulares de crédito encuentran de manera confiable lo que la regresión logística sobre features WOE binneadas a mano se pierde: interacciones (expediente delgado × utilización alta), no linealidades más allá del binning, y señal en campos desordenados de datos alternativos. Ganancias honestas típicas: 2–6 puntos de AUC/Gini sobre un scorecard bien construido — dinero real a escala de portafolio, pero lejos de la revolución que prometían las pláticas de conferencia, porque un buen scorecard ya captura la mayor parte de la señal en los datos de buró.

El pipeline práctico, destilado:

Las redes neuronales se ganan su complejidad en crédito solo donde los datos dejan de ser una tabla plana: secuencias de transacciones (un LSTM/transformer sobre flujos de open banking), texto, o imágenes de documentos. En datos tabulares estilo buró, los árboles boosted más buenas features siguen siendo tercamente competitivos, y todo lo de abajo sobre explicabilidad se vuelve más difícil.

Interpretabilidad: de caja negra a códigos de razón

El requisito regulatorio no es “entiende el modelo en general” — es “explica esta decisión”. La herramienta que industrializó esto es SHAP (Shapley additive explanations): para una predicción, reparte la brecha entre el output del modelo y el output promedio entre las features, usando el valor de Shapley de la teoría de juegos cooperativos — la única asignación que satisface un pequeño conjunto de axiomas de equidad (features que contribuyen igual reciben crédito igual; las contribuciones suman exactamente la brecha).

El output es una descomposición aditiva por solicitante. Esa es precisamente la estructura que un scorecard te da gratis — que es la ironía profunda de este módulo: el scorecard de los años sesenta nació explicable; SHAP es cómo el modelo de los 2020 recompra esa propiedad. Siente la descomposición:

Explorador de Atribución de Variables

Un modelo de crédito aditivo, abierto: cada variable contribuye log-odds relativos al acreditado promedio (PD base de 4%). El rojo empuja hacia el incumplimiento; el verde, en sentido contrario.

← más seguro (contribución log-odds) más riesgoso →
PD base 4.0%
PD de este acreditado
Principales razones de rechazo (generadas automáticamente)

El modelo del widget es un score aditivo de caja de cristal, así que sus barras son su explicación exacta — para un modelo XGBoost, TreeSHAP calcula el mismo estilo de descomposición de forma eficiente y exacta. Nota la fila de abajo: ordena las contribuciones positivas (las que suben el riesgo), toma las primeras, mapéalas a frases estándar — eso es, casi textualmente, cómo se generan en producción los códigos de razones de rechazo. Empuja la utilización a 90% y observa cómo reclama el lugar #1 entre las razones.

Dos herramientas de apoyo completan el kit: los partial dependence plots (la forma global del efecto de una feature — donde verificas monotonicidad y comportamiento sensato en los bordes) y LIME (aproximaciones lineales locales — útiles, pero lo bastante inestables como para que SHAP los haya desplazado casi por completo en crédito). El notebook construye todos sobre un modelo boosted real.

SR 11-7: la disciplina de no confiar en tus propios modelos

La guía de la Fed de 2011 sobre gestión de riesgo de modelos es el documento que gobierna cómo viven los modelos dentro de los bancos, y su idea central merece más respeto que su reputación de papeleo: los modelos están mal de maneras que sus constructores son estructuralmente incapaces de ver, así que las instituciones deben construir desconfianza organizada. El régimen:

El ML sube la apuesta en cada punto: más hiperparámetros y dependencias de datos que documentar, un effective challenge más difícil (el validador necesita fluidez en SHAP, no solo econometría), modos de falla más rápidos y silenciosos en producción. Si tu organización no puede validarlo, no importa qué tan bien rankee.

Fair lending: la restricción que define el campo

La ley de EE.UU. (ECOA/Regulación B, y la Fair Housing Act para hipotecas) prohíbe la discriminación crediticia por raza, color, religión, origen nacional, sexo, estado civil, edad y recepción de asistencia pública. Dos teorías legales importan para quien modela:

La disciplina de trabajo: prueba los resultados en busca de disparidades por grupo (tasas de aprobación, tasas de error, pricing) aun cuando — incómodamente — a menudo debes inferir la pertenencia al grupo para correr la prueba, ya que tienes prohibido recolectarla; busca alternativas menos discriminatorias (un modelo con AUC ligeramente menor y disparidad materialmente menor suele ser la elección legal y éticamente requerida); y justifica por escrito la lógica de negocio de cada feature, especialmente las de datos alternativos. Los avisos de acción adversa cierran el ciclo: cada solicitante rechazado recibe razones principales específicas — que es por lo que el pipeline de SHAP a códigos de razón de arriba es un requisito de cumplimiento, no un detalle de UX.

Los datos alternativos — flujos de open banking, nómina, pagos de renta y servicios — son genuinamente la frontera más prometedora: le ponen score a acreditados de expediente delgado que el buró no puede ver, a menudo expandiendo el acceso justo. También multiplican el riesgo de proxies y el riesgo de drift simultáneamente. La tecnología es la parte fácil.

El track, cerrado

Hace doce módulos, el riesgo de crédito era una ecuación: EL = PD × LGD × EAD. Todo lo que siguió han sido maneras de ganarse el derecho a un número dentro de ella — scorecards y razones financieras, curvas y bonos, opciones e intensidades, matrices y modelos de factores y cópulas, y finalmente machine learning bajo las disciplinas gemelas de la validación y la equidad. La síntesis que vale la pena conservar: los modelos se volvieron más sofisticados; las preguntas nunca cambiaron. ¿Quién podría no pagar? ¿Cuánto costaría eso? ¿Esos eventos se agrupan? ¿Y puedes explicar tu respuesta — a un regulador, a un validador, y a la persona que rechazaste?

Dónde conecta esto

Pruébalo tú mismo

El notebook de abajo es el pipeline completo sobre un dataset sintético estilo buró: baseline de scorecard (logística sobre features WOE), XGBoost con y sin restricciones monotónicas, evaluación out-of-time (AUC/KS/Gini), calibración isotónica con gráficas de confiabilidad, TreeSHAP — importancia global, dependence plots y cascadas por solicitante individual — y un generador de códigos de razones de rechazo construido a partir del output de SHAP. El ejercicio de cierre corre una prueba simple de impacto dispar sobre una etiqueta de grupo inferida y te pide encontrar el modelo alternativo menos discriminatorio.

Modelo de Crédito XGBoost de Punta a Punta (notebook de Jupyter)
Descarga gratuita, sin registro (archivo en inglés).
Descargar

Recibe los nuevos posts por correo

Un correo por cada artículo nuevo. Sin spam, sin ventas, cancela cuando quieras.