Maestría Estadística Aplicada y Ciencia de Datos · 2026
Enriquecimiento de modelos de Machine Learning a partir de datos sintéticos: una aproximación para el riesgo de crédito
Solo ficha. El repositorio marca este trabajo como «None»: el PDF no es público, así que aquí no hay texto para leer. Ver la ficha en el repositorio.
Resumen
Este artículo estudia el uso de sintetizadores de datos tabulares como herramienta de apoyo en el desarrollo de modelos de scoring crediticio en entidades de financiamiento digital. Se evaluaron tres sintetizadores de la librería SDV —CTGAN, Copula Gaussiana y TVAE— aplicados a un conjunto de 280.000 registros y 87 variables seleccionadas mediante el algoritmo Boruta. La calidad de los datos sintéticos se midió con métricas de similaridad distribucional (KS-Complement, Similitud del Coseno, KL Invertido y Divergencia Jensen-Shannon), y el desempeño de los modelos de Machine Learning (CatBoost, XGBoost, LightGBM) se evaluó en términos de AUC, calibración de la Probabilidad de Default (PD) y distribución por deciles en datos out-of-time. Los resultados indican que CTGAN obtuvo la mayor calidad promedio con un KS-Complement de 0,86. Las estrategias de entrenamiento con mezcla de datos reales y sintéticos permitieron igualar el AUC baseline de 0,63 en muestra out-of-time, con ganancias de hasta 3 puntos cuando la muestra de validación se diversifica con datos sintéticos generados por CTGAN o TVAE. Los hallazgos evidencian que los datos sintéticos tabulares son viables como soporte en múltiples etapas del proceso analítico en contextos de riesgo financiero. Palabras clave: datos sintéticos tabulares, riesgo de crédito, GAN condicional, CTGAN, scoring crediticio, Machine Learning, Copula Gaussiana, TVAE, generalización de modelos.