Kratos Analytics — Score-as-a-service para cooperativas
Kratos Analytics KRATOS ANALYTICS
Kratos Analytics LLC · Score-as-a-service

Ver riesgo donde el buró tradicional no ve nada

Un scorecard con datos transaccionales tipo Bre-B para cooperativas de ahorro y crédito que hoy pierden negocio bueno porque el buró tradicional no puede puntuar a sus asociados sin historial.

Agendar 20 minutos Ver el Score
Cooperativas de ahorro y crédito · Llano / Orinoquía Score explicable: aprobar, negar, definir monto No prestamos y no asumimos riesgo de balance

Qué hacemos

Score-as-a-service. El modelo es el producto.

La entidad entrega datos que ya posee —transaccionales, sociodemográficos, comportamiento de pago interno— y devolvemos un score de riesgo explicable para aprobar, negar o definir monto.

No prestamos, no captamos y no asumimos riesgo de balance. El scorecard es el método de puntos que construimos sobre los datos de la entidad; el score es el número que ese método le asigna a cada persona. Sin producto que implementar ni core que cambiar: un score y los factores que lo sustentan.

CÓMO SE MUEVE UNA DECISIÓN

  1. 01 La entidad envía datos anonimizados bajo acuerdo de encargado.
  2. 02 Ajustamos el scorecard sobre su propia cartera y reportamos las métricas de calidad del modelo (explicadas más abajo).
  3. 03 El score llega por API o archivo por lotes, con los factores que lo movieron.
  4. 04 El comité de crédito decide — y puede justificar la decisión ante el asociado y el regulador.

Qué datos usamos

Cuatro familias de señal que la entidad ya tiene.

01

Flujo de caja

Ingreso promedio, estacionalidad, volatilidad, tendencia. Ejemplo real del demo: un ingreso estable mes a mes suma hasta 66,7 puntos; uno muy volátil resta hasta 26,1. Tener ingreso los 12 meses del último año suma 54,3 puntos; tenerlo en menos de 10 de esos 12 meses, solo 32,2.

02

Comportamiento transaccional tipo Bre-B

Frecuencia, regularidad, contrapartes, saldo. (Bre-B es el nuevo sistema de pagos inmediatos de Colombia: transferencias instantáneas entre cualquier banco o billetera.) Lo que más pesa aquí no es cuánto mueve la persona, sino qué tan predecible es: transacciones regulares mes a mes suman hasta 60,1 puntos, un patrón errático solo 32,3 — más del doble de diferencia que el número de transacciones o de contactos por sí solos.

03

Comportamiento de pago interno

Puntualidad, mora previa, uso de cupo. Es la familia que más separa: cero días de mora previa suma 54 puntos, pero más de 33 días de mora resta 50,9 — más de 100 puntos de diferencia entre el mejor y el peor caso. Pagar puntual el 95% de las veces suma 71,7 puntos; hacerlo menos del 85% de las veces, solo 25,2.

04

Sociodemográfico

Ocupación, cadena productiva, ubicación, antigüedad. En este demo, la antigüedad como socio es la que aporta señal medible: más de 49 meses suma 56,3 puntos; menos de 7 meses, solo 39,2. Es la familia con menor peso relativo — el comportamiento (flujo de caja, transaccional, pago interno) dice más sobre la capacidad de pago que el perfil demográfico por sí solo.

Cómo funciona

El scoring, explicado sin tecnicismos.

No hace falta saber de modelos para entender esto. Así funciona, en el orden en que pasa.

¿Qué es un score?

Un número que resume, con base en datos reales, qué tan probable es que alguien pague un crédito a tiempo. No reemplaza el juicio del comité — lo informa con evidencia.

¿De dónde salen los datos?

De la entidad misma: sus movimientos de cuenta, su historial de pagos internos, datos básicos del asociado. No compramos datos externos ni consultamos el buró — por eso podemos puntuar a quien no tiene historial crediticio formal.

¿Qué pasa después del score?

La entidad define los puntos de corte (aprobar automático arriba de cierto puntaje, revisar manual en el rango medio, negar por debajo de un mínimo). El comité de crédito siempre tiene la última palabra.

¿Cómo se calcula?

Es un proceso de tres pasos

1

Cada una de las variables (unas doce en total) se agrupa en rangos con datos reales de la entidad — por ejemplo, "días de mora previa" se agrupa en "cero días", "1 a 4 días", "5 a 10 días"... hasta "más de 33 días".

2

Para cada rango se mide qué porcentaje de esas personas terminó en mora: en nuestro demo, el rango "cero días de mora previa" termina en mora solo el 14% de las veces, mientras que "más de 33 días" termina en mora el 84% de las veces — esa diferencia es la señal.

3

Esa diferencia se convierte matemáticamente (con una medida llamada WOE, ver glosario) en puntos, calibrados para que sumen a un número final donde 600 es la referencia.

El resultado: cada punto en el score de una persona es trazable a un rango real, con una tasa de mora real detrás — no es una fórmula secreta.

¿Y el segundo modelo, el GBM?

Por qué lo entrenamosAparte del scorecard —el único que se usa para decidir créditos— entrenamos en paralelo un segundo modelo, el "challenger", solo como prueba de techo: para saber si el scorecard se está dejando señal sin explotar en los datos.

Qué esGBM es Gradient Boosting Machine: en vez de una sola fórmula lineal como el scorecard, entrena cientos de árboles de decisión pequeños en secuencia, donde cada árbol nuevo corrige los errores del anterior. Puede capturar relaciones que el scorecard, por diseño, no ve — pero a cambio nadie puede explicar, punto por punto, por qué el árbol número 240 le restó tres puntos a alguien. Por eso nunca decide créditos: solo mide qué tanto nos falta por mejorar.

Cómo los comparamos¿Cómo comparamos los dos? Con una prueba simple: tomamos al azar a una persona que sí pagó y a otra que no, y le preguntamos a cada modelo cuál de las dos le parece mejor pagadora. AUC es qué tan seguido acierta esa apuesta.

El resultado: el scorecard acierta 87 de cada 100 veces; el challenger GBM, prácticamente lo mismo: 87 de cada 100. Que la caja negra apenas le saque ventaja al scorecard confirma justo lo contrario de lo que se suele asumir: casi toda la señal de estos datos alternativos cabe en un modelo que el comité puede auditar punto por punto — no hace falta resignar transparencia para ganar poder predictivo.

GLOSARIO

AUC — el resultado del "duelo" del que hablamos arriba: comparar al azar a alguien que pagó contra alguien que no, y ver qué tan seguido el modelo apuesta por el que sí pagó. 0,5 es lanzar una moneda; 1,0 es acertar siempre. Como referencia: por debajo de 0,65 es débil, 0,70-0,80 es bueno, arriba de 0,80 es excelente (y vale la pena revisar que no haya fuga de datos). Nuestro scorecard: 0,87 — excelente. El challenger GBM: 0,87 — prácticamente el mismo número, a pesar de no tener que rendir cuentas punto por punto.

Gini — la métrica estándar en riesgo crediticio. Transformación directa del AUC (Gini = 2×AUC − 1), en escala de 0 a 1: mide qué tan lejos está el modelo de adivinar al azar. Como referencia: por debajo de 0,20 es débil, 0,20-0,40 aceptable, 0,40-0,60 bueno, arriba de 0,60 fuerte. Scorecard: 0,73 (fuerte). Challenger GBM: 0,74 (fuerte) — casi idénticos.

KS — estadístico de Kolmogorov-Smirnov: qué tan lejos quedan, en su punto más favorable, la curva acumulada de buenos pagadores y la de malos pagadores según el score. Cuanto más separadas, mejor distingue el modelo a los dos grupos. Como referencia: por debajo de 20% es pobre, 20%-40% aceptable a bueno, 40%-50% muy bueno, arriba de 50% excelente (y arriba de 70% conviene sospechar de fuga de datos). Nuestro scorecard: 58% — en el rango excelente, y prácticamente empatado con el challenger GBM (58%): la separación entre buenos y malos pagadores no depende de la caja negra.

PSI — Population Stability Index. Compara la distribución de scores de hoy contra la del entrenamiento original. Menos de 0,10: estable, sin acción. Entre 0,10 y 0,25: cambio moderado, vale la pena vigilarlo. Más de 0,25: cambio significativo — el perfil de solicitantes cambió (una crisis regional, un giro en la política de la entidad) y el modelo necesita recalibrarse antes de fallar en silencio. Nuestro scorecard: PSI de 0,002 entre desarrollo y validación (estable) y de 0,13 frente a un choque simulado severo, volatilidad de ingreso x3 (moderado, pero lejos de la alerta). El challenger GBM, ante ese mismo choque, sí cruza a 0,39 — otra razón para que el scorecard, no la caja negra, sea el que decide.

Calibración — que la probabilidad que da el modelo se parezca a lo que realmente pasa: si dice 20% de riesgo, que ronde el 20% de las veces. No es lo mismo que AUC/Gini/KS (que miden si el modelo ordena bien) — un modelo puede ordenar perfecto y aun así dar probabilidades poco creíbles en valor absoluto. Nuestro scorecard: error medio de apenas 0,5 puntos porcentuales por decil frente a la tasa de default real.

Odds — la razón entre la probabilidad de pagar y la de no pagar. Si 9 de cada 10 personas con un perfil pagan, sus odds son 9 a 1. El scorecard traduce puntos directamente a esta razón — por eso "cada 20 puntos duplican" las odds de pago.

WOE — Weight of Evidence. La medida que convierte cada rango de una variable (ej. "antigüedad 12-24 meses") en un peso numérico, comparando cuántos buenos y malos pagadores cayeron en ese rango dentro de la historia real de la entidad. Es el paso intermedio entre el dato crudo y el punto que ve el comité.

Punto de corte — el puntaje mínimo a partir del cual se aprueba automático, se revisa manual o se niega. No lo fijamos nosotros: la entidad lo define según su propia tolerancia al riesgo (ver "Cómo se lee el score" más abajo).

Lift — cuánto mejor ordena el modelo a los solicitantes frente a no usar ningún modelo. Un lift de 4x en el mejor 10% significa que ese grupo tiene 4 veces menos mora que una selección al azar del mismo tamaño.

UN CASO, DE PRINCIPIO A FIN

Camila, 34 años, agricultora, socia de una entidad del Meta desde hace 22 meses, solicita un crédito de $4.000.000. Estas son las 12 señales reales que el scorecard mide para ella (datos del demo metodológico), agrupadas por familia:

VARIABLEEL DATO DE CAMILAPUNTOS
FLUJO DE CAJA
Variabilidad del ingresoModerada mes a mes+53,2
Estacionalidad del ingresoVariación estacional moderada+46,8
Meses con ingreso (12m)Ingreso casi todos los meses+54,3
Tendencia del ingresoLevemente creciente+48,3
Subtotal flujo de caja202,6
TRANSACCIONAL (BRE-B)
N.º de transacciones de entrada13 a 16 al mes+45,2
N.º de contrapartes5 a 7 contactos distintos+44,4
Regularidad de las transaccionesBuena regularidad+51,9
Saldo promedioEn el rango medio+44,3
Subtotal transaccional185,8
PAGO INTERNO
Días de mora previaCero días+54,0
Ratio de pago puntual92% a 95% de pagos a tiempo+60,7
Uso promedio del cupo46% a 55% del cupo disponible+51,9
Subtotal pago interno166,6
SOCIODEMOGRÁFICO
Antigüedad como socia22 meses+45,0
Score total de Camila600

Cada punto sale de medir, en la historia real de la entidad, cómo pagó la gente con ese mismo perfil — no es una opinión. Los puntos ya vienen calibrados para que 600 sea el punto de referencia del scorecard (ver abajo).

CÓMO SE LEE EL SCORE

Este scorecard se calibró con un punto de referencia (600 puntos) y un factor de escala tal que cada 20 puntos duplican la probabilidad relativa de pago frente a incumplimiento. Camila cae justo en la referencia: 600 puntos.

En este demo, el score va de un piso cercano a 340 hasta un techo cercano a 670. 600 puntos es el punto donde, históricamente, las odds de pago son de 50 a 1 — de cada 51 personas con ese perfil, 50 pagaron y 1 no.

Zona baja — muy por debajo de 600

Odds de pago notoriamente peores que el promedio de la cartera. Se niega o se pide garantía adicional.

Zona gris — cerca de 600 (aquí cae Camila)

Un perfil promedio de la cartera: ni claramente bueno ni claramente malo. Aquí el score no decide solo — pasa a revisión manual del comité.

Zona alta — muy por encima de 600

Odds de pago notoriamente mejores que el promedio de la cartera. Candidato a aprobación directa.

La entidad decide dónde trazar esas líneas con base en su propia tolerancia al riesgo — nosotros entregamos el número y la evidencia detrás de cada punto.

Score

Lo que el modelo separa, en números.

Una corrida de demo sintético: un scorecard interpretable, un challenger de gradient boosting y lo que la diferencia significa en la mesa de aprobación.

SCORECARD · INTERPRETABLE

0.87

AUC · Gini 0,73

Puntos por rango, legible para el comité de crédito. Es el que se despliega primero.

CHALLENGER · GBM

0.87

AUC · Gini 0,74

Gradient boosting marca el techo de lo que estos datos permiten predecir — y confirma que casi no queda señal por capturar fuera del scorecard interpretable.

EN LA MESA DE APROBACIÓN

4.4%

mora esperada al 61% de aprobación · 18,2% sin modelo

El mismo volumen de aprobaciones con una cuarta parte de la pérdida: el trabajo lo hace el ordenamiento, no el corte.

CALIBRACIÓN · SCORECARD

0.5 pp

error medio por decil vs. mora real

Cuando el score dice "20% de riesgo", ronda 20% en la realidad — no solo ordena bien, también acierta el número.

PSI · ESTABILIDAD

0.002

entre desarrollo y validación — sin drift

*Ante un choque simulado severo (volatilidad de ingreso x3), el scorecard se queda en zona moderada — el challenger GBM sí cruza a zona de alerta (0,39).

QUÉ SIGNIFICA ESTO EN LA PRÁCTICA

El score no decide aprobar menos gente — decide a quién aprobar primero. Si hoy la entidad aprueba al 61% de las solicitudes casi al azar, la mora de ese grupo se parece al promedio histórico de la cartera: 18,2%. Si aprueba ese mismo 61%, pero elige a los que el score marca como más propensos a pagar, la mora de ese grupo baja a 4,4% — casi una cuarta parte. El volumen de aprobación no cambia; lo que cambia es a quién se le dice que sí dentro de ese volumen. Por eso decimos que "el trabajo lo hace el ordenamiento, no el corte": la ganancia no viene de aprobar menos gente, sino de ordenar mejor a quién aprobar primero.

Resultados sobre 20.000 asociados sintéticos — demo metodológico, no cartera real.

La oferta

Una prueba de concepto gratis, sobre tu propia cartera.

Sin costo y sin compromiso: corremos el modelo sobre la cartera histórica anonimizada de la entidad y mostramos, con sus números reales, cuánto sube la aprobación sin subir la mora.

El informe de lift es tuyo, sigas o no. Si el modelo no le gana a lo que la entidad ya hace, lo decimos.

Agendar 20 minutos

QUÉ NECESITAMOS

Registros históricos de crédito anonimizados con su desenlace: quién pagó y quién no. Nada que identifique al asociado.

QUÉ RECIBES

Discriminación y calibración sobre tu cartera, curva de aprobación contra mora y el punto de corte que recomendaríamos.

DESPUÉS

Endpoint de score o archivo por lotes, monitoreado en cada corrida. La entidad sigue decidiendo; el modelo solo ordena.

Dónde operamos

Hiperlocal por diseño: Llano y Orinoquía, no Colombia entera.

Conocemos la estacionalidad agropecuaria, las cadenas productivas y los ciclos de pago de cada departamento donde trabajamos — el foso que un modelo genérico nacional no puede replicar.

  • Meta
  • Casanare
  • Putumayo
  • Caquetá
  • Guainía

Manejo de datos

La entidad conserva la propiedad y el control de los datos de sus asociados en todo momento.

Tratamiento bajo acuerdo de encargado, regido por la Ley 1581 de 2012 de Colombia: datos anonimizados o seudonimizados, cifrados en tránsito y en reposo, y minimizados a lo que el modelo realmente necesita.

  • Finalidad limitada al scoring: sin reventa ni uso secundario
  • Eliminación a solicitud y al terminar la relación
  • Cada score trazable a los factores que lo produjeron

Tráenos las solicitudes que hoy estás negando.

Ir a Contacto →