Bogotá - Ciencias Económicas - Maestría en Administración · 2026
Evaluación del riesgo de crédito mediante modelos estadísticos supervisados y de aprendizaje automático : aplicación en una entidad financiera en Bogotá
Este trabajo evalúa y compara enfoques de modelamiento para la estimación del riesgo de crédito bajo NIIF 9 en una entidad financiera de Bogotá, integrando la Probabilidad de Incumplimiento (PD), la Pérdida Dada el Incumplimiento (LGD), la Exposición en Caso de Incumplimiento (EAD) y la clasificación por etapas de deterioro (staging: S1/S2/S3). El estudio adopta un diseño cuantitativo correlacional-predictivo aplicado a un panel obligación-mes para el periodo 2019–2023, construido con información interna contractual y de comportamiento. Para garantizar validez fuera de muestra, se implementa un sello temporal para prevenir fuga de información (data leakage) y se evalúa el desempeño mediante esquemas temporales out-of-time (OOT). Metodológicamente, se contrastan modelos estadísticos supervisados (GLM-probit, regresión Beta, Tobit y GAMLSS) con modelos de aprendizaje automático (Random Forest, XGBoost, redes neuronales y SVM/SVR), incorporando enfoques alternativos cuando aportan valor en precisión, estabilidad o gobernanza. La comparación se fundamenta en métricas coherentes con la naturaleza de cada tarea: para regresión (EAD y LGD), se utilizan R² y métricas de error (MAE y RMSE); para clasificación (staging/SICR y evento de incumplimiento cuando aplica), se emplean métricas de discriminación y calibración (AUC, KS y Brier), complementadas con análisis de estabilidad temporal. Los resultados muestran diferencias sistemáticas por componente. En EAD, Random Forest logra el mejor balance entre ajuste y estabilidad (R²≈0,925; MAE≈$1,66 millones), mientras SVR-RBF resulta competitivo en el rango central de saldos (MAE≈$1,28 millones) y las redes neuronales evidencian menor robustez en colas (R²≈0,49). En staging/SICR, XGBoost se consolida como modelo “champion” por su capacidad discriminante (AUC≈0,934; KS≈0,45), mientras Random Forest presenta mayor sensibilidad para identificar la etapa 2 (Recall-S2≈0,71), clave en decisiones de incremento significativo del riesgo de crédito. En PD, los modelos paramétricos (GLM-probit y regresión Beta) aportan parsimonia e interpretabilidad (R²≈0,905/0,903), en tanto los métodos de ensamble (Random Forest y XGBoost) elevan la precisión (R²≈0,995/0,983). Para LGD, GAMLSS-Beta destaca por capturar heterogeneidad al modelar simultáneamente media y dispersión (MAE≈0,026; R²≈0,491), observándose que las recuperaciones se concentran principalmente en los primeros 12–24 meses y que la tasa efectiva (EIR) afecta de forma material la pérdida en valor presente. Desde una perspectiva aplicada, se recomienda priorizar métricas sensibles a decisiones (KS en la frontera S1↔S2 y Recall-S2) por encima del AUC global, y optimizar umbrales como un problema de pérdida crediticia esperada. En consecuencia, se propone una arquitectura híbrida y gobernable (champion-challenger) que integre capas de calibración (Platt o isotónica), restricciones de monotonicidad en predictores críticos y un esquema de MLOps orientado a backtesting, monitoreo de deriva (por ejemplo, PSI) y trazabilidad (audit trail), fortaleciendo la consistencia técnica y la defendibilidad del modelo en operación. (Texto tomado de la fuente)
Texto completo 210 páginas con texto de 212
Leer la tesis completa Ficha en el repositorio
Contenido
- 1. Marco teóricop. 25
- 1.1. Deterioro de cartera en empresas financierasp. 25
- 1.2. Definición de defaultp. 26
- 1.3. Incremento significativo del riesgo crediticio (SICR)p. 26
- 1.4. Análisis individualizadop. 27
- 1.5. Análisis colectivo: enfoque general y enfoque simplificadop. 27
- 1.5.1. Enfoque general bajo la NIIF 9p. 28
- 1.5.1.2. Pérdida dada el incumplimiento (LGD)p. 29
- 1.5.1.3. Exposición al incumplimiento (EAD)p. 30
- 1.5.1.4. Pérdida crediticia esperada (ECL)p. 30
- 2. Técnicas y modelos de estimaciónp. 31
- 2.1. Modelos estadísticos supervisados (enfoque gerencial)p. 31
- 2.1.1. Regresión logística (binaria y multiclase)p. 32
- 2.1.2. Análisis discriminante (LDA/QDA)p. 33
- 2.1.3. Modelos de panel (logit/probit)p. 34
- 2.1.4. Modelos GAMLSSp. 34
- 2.1.5. Modelos bayesianosp. 35
- 2.2. Modelos basados en aprendizaje automáticop. 35
- 2.2.1. Bosques aleatorios (Random Forest)p. 36
- 2.2.2. Gradient Boosting (GBM, XGBoost, LightGBM, CatBoost)p. 36
- 2.2.3. Redes neuronales artificiales (ANN)p. 37
- 2.2.4. Máquinas de soporte vectorial (SVM / SVR)p. 38
- 2.3. Comparación de enfoquesp. 38
- 2.3.1. Enfoques estadísticos supervisados: fortalezas y límitesp. 39
- 2.3.2. Enfoques de aprendizaje automático: fortalezas y límitesp. 39
- 2.4. Estudios de ECL (NIIF 9) y riesgo de crédito en Colombiap. 41
- 2.4.1. Convergencia NIIFp. 42
- 2.4.2. Evidencia aplicada en Colombiap. 43
- 2.4.3. Modelamiento predictivo en Colombiap. 43
- 2.4.4. Brecha de investigación y contribución de este trabajop. 44
- 3. Metodología de la investigaciónp. 45
- 3.1. Diseño y enfoquep. 45
- 3.2. Unidad de análisis, sello temporal y prevención de fuga de informaciónp. 45
- 3.3. Definición de variables objetivo (etiquetado)p. 46
- 3.4. Preparación de datos y aseguramiento de calidadp. 47
- 3.5. Estrategia de modelamiento y validaciónp. 48
- 3.6. Implementación, esquema champion–challenger y monitoreop. 49
- 3.7. Alcance y limitacionesp. 49
- 3.8. Herramientas tecnológicas y reproducibilidadp. 50
- 4. Aplicación, análisis y resultadosp. 51
- 4.1. Compañía objeto del análisis de casop. 51
- 4.1.1. Información objeto de análisisp. 52
- 4.2. Preparación de la informaciónp. 53
- 4.2.1. Proceso metodológico del análisisp. 53
- 4.2.2. Integración y tratamiento de datosp. 53
- 4.3. Segmentación y stagingp. 54
- 4.3.1. Aplicación y análisis de modelos estadísticos supervisados para stagingp. 56
- 4.3.2. Aplicación y análisis de modelos de aprendizaje automático para stagingp. 62
- 4.3.3. Comparación de resultados, stagingp. 70
- 4.4. Probability of Default (PD)p. 74
- 4.4.1. Aplicación y análisis de modelos estadísticos supervisados, PDp. 182
- 4.4.2. Aplicación y análisis de modelos de aprendizaje automático, PDp. 186
- 4.4.3. Comparación integrada de resultados: Staging y PDp. 90
- 4.5. Loss Given Default (LGD)p. 94
- 4.5.1. Aplicación y análisis de modelos estadísticos supervisados, LGDp. 197
- 4.5.2. Aplicación y análisis de modelos de aprendizaje automático, LGDp. 199
- 4.5.3. Comparación de resultados, LGDp. 112
- 4.6. Exposición en Caso de Incumplimiento (EAD)p. 116
- 4.6.1. Aplicación y análisis de modelos estadísticos supervisados, EADp. 202
- 4.6.1.5. Implicaciones gerenciales y arquitectura recomendadap. 61
- 4.6.2. Aplicación y análisis de modelos de aprendizaje automático, EADp. 129
- 4.6.2.1. Datos, diseño experimental y criterios de labelingp. 56
- 4.6.2.2. Resultados comparativosp. 63
- 4.6.3. Comparación de resultados, EADp. 137
- Conclusiones y recomendacionesp. 142
- Bibliografíap. 147
- Anexosp. 158
- Anexo 1. Fórmulasp. 158
- A.1. Segmentación y staging (NIIF 9)p. 158
- A.2. Modelos estadísticos supervisados aplicados a stagingp. 159
- A.3. Modelos de aprendizaje automático aplicados a stagingp. 161
- Anexo B. Probability of Default (PD)p. 164
- Anexo C. Loss Given Default (LGD)p. 167
- Anexo D. Exposure at Default (EAD)p. 172
- Anexo 2. Gráficasp. 176
- 1. Segmentación y Stagingp. 54
- 2. Probability of Default (PD)p. 74
- 3. Loss Given Default (LGD)p. 94
- 4. EADp. 12
- Anexo 3. Tablasp. 206
- 1. Segmentación y Stagingp. 54
- 2. Probability of Default (PD)p. 74
- 3. Loss Given Default (LGD)p. 94