AUC — el resultado del "duelo" del que hablamos arriba: comparar al azar a alguien que pagó contra alguien que no, y ver qué tan seguido el modelo apuesta por el que sí pagó. 0,5 es lanzar una moneda; 1,0 es acertar siempre. Como referencia: por debajo de 0,65 es débil, 0,70-0,80 es bueno, arriba de 0,80 es excelente (y vale la pena revisar que no haya fuga de datos). Nuestro scorecard: 0,87 — excelente. El challenger GBM: 0,87 — prácticamente el mismo número, a pesar de no tener que rendir cuentas punto por punto.
Gini — la métrica estándar en riesgo crediticio. Transformación directa del AUC (Gini = 2×AUC − 1), en escala de 0 a 1: mide qué tan lejos está el modelo de adivinar al azar. Como referencia: por debajo de 0,20 es débil, 0,20-0,40 aceptable, 0,40-0,60 bueno, arriba de 0,60 fuerte. Scorecard: 0,73 (fuerte). Challenger GBM: 0,74 (fuerte) — casi idénticos.
KS — estadístico de Kolmogorov-Smirnov: qué tan lejos quedan, en su punto más favorable, la curva acumulada de buenos pagadores y la de malos pagadores según el score. Cuanto más separadas, mejor distingue el modelo a los dos grupos. Como referencia: por debajo de 20% es pobre, 20%-40% aceptable a bueno, 40%-50% muy bueno, arriba de 50% excelente (y arriba de 70% conviene sospechar de fuga de datos). Nuestro scorecard: 58% — en el rango excelente, y prácticamente empatado con el challenger GBM (58%): la separación entre buenos y malos pagadores no depende de la caja negra.
PSI — Population Stability Index. Compara la distribución de scores de hoy contra la del entrenamiento original. Menos de 0,10: estable, sin acción. Entre 0,10 y 0,25: cambio moderado, vale la pena vigilarlo. Más de 0,25: cambio significativo — el perfil de solicitantes cambió (una crisis regional, un giro en la política de la entidad) y el modelo necesita recalibrarse antes de fallar en silencio. Nuestro scorecard: PSI de 0,002 entre desarrollo y validación (estable) y de 0,13 frente a un choque simulado severo, volatilidad de ingreso x3 (moderado, pero lejos de la alerta). El challenger GBM, ante ese mismo choque, sí cruza a 0,39 — otra razón para que el scorecard, no la caja negra, sea el que decide.
Calibración — que la probabilidad que da el modelo se parezca a lo que realmente pasa: si dice 20% de riesgo, que ronde el 20% de las veces. No es lo mismo que AUC/Gini/KS (que miden si el modelo ordena bien) — un modelo puede ordenar perfecto y aun así dar probabilidades poco creíbles en valor absoluto. Nuestro scorecard: error medio de apenas 0,5 puntos porcentuales por decil frente a la tasa de default real.
Odds — la razón entre la probabilidad de pagar y la de no pagar. Si 9 de cada 10 personas con un perfil pagan, sus odds son 9 a 1. El scorecard traduce puntos directamente a esta razón — por eso "cada 20 puntos duplican" las odds de pago.
WOE — Weight of Evidence. La medida que convierte cada rango de una variable (ej. "antigüedad 12-24 meses") en un peso numérico, comparando cuántos buenos y malos pagadores cayeron en ese rango dentro de la historia real de la entidad. Es el paso intermedio entre el dato crudo y el punto que ve el comité.
Punto de corte — el puntaje mínimo a partir del cual se aprueba automático, se revisa manual o se niega. No lo fijamos nosotros: la entidad lo define según su propia tolerancia al riesgo (ver "Cómo se lee el score" más abajo).
Lift — cuánto mejor ordena el modelo a los solicitantes frente a no usar ningún modelo. Un lift de 4x en el mejor 10% significa que ese grupo tiene 4 veces menos mora que una selección al azar del mismo tamaño.