Sporala red del conocimiento
Universidad Nacional de Colombia

Bogotá - Ingeniería - Maestría en Ingeniería - Ingeniería de Sistemas y Computación · 2026

Construcción de modelos de detección de fraude con Machine Learning

Córdoba Trillos, Cristhian EnriqueAsesor: Camargo Mendoza, Jorge Eliecer

En este trabajo se construyen y evalúan modelos de detección de fraude transaccional utilizando técnicas de Machine Learning sobre un conjunto de datos de transacciones con tarjetas de crédito. El problema abordado surge de la necesidad de identificar operaciones potencialmente fraudulentas dentro de bases de datos altamente desbalanceadas, donde la mayoría de registros corresponden a transacciones legítimas y los casos de fraude representan una proporción reducida. Esta situación genera un reto metodológico importante, dado que un modelo puede presentar un desempeño aparentemente adecuado en términos generales, pero fallar en la detección de la clase de mayor interés. Para abordar este problema, se desarrolló un flujo de trabajo que incluye la caracterización del conjunto de datos, el tratamiento de variables transaccionales, la ingeniería de características, la división temporal de los datos, la implementación de diferentes familias de modelos y la evaluación comparativa mediante métricas apropiadas para escenarios desbalanceados. El proceso permitió analizar modelos basados en reglas, modelos lineales, árboles de decisión, métodos de ensamble, modelos de boosting, redes neuronales y estrategias asociadas al tratamiento del desbalance de clases. Los resultados muestran que la detección de fraude no depende únicamente del algoritmo utilizado, sino de la construcción completa del flujo de modelamiento. En particular, la preparación de datos, la selección de variables, el manejo del desbalance y la definición del umbral de clasificación resultan elementos fundamentales para obtener modelos más útiles en este tipo de problemas. Así, el trabajo aporta una aproximación reproducible para la construcción y comparación de modelos de detección de fraude transaccional, entendiendo estos modelos como herramientas de apoyo para priorizar alertas y fortalecer los procesos de análisis en contextos financieros. El modelo final seleccionado correspondió a XGBoost con un subconjunto de 100 variables y una estrategia de ponderación basada en scale_pos_weight_manual. En la evaluación final sobre el conjunto de prueba, usando un umbral de clasificación de 0,71, el modelo obtuvo un PR-AUC de 0,661, un ROC-AUC de 0,999, una precisión de 0,391, un recall de 0,808 y un F1-score de 0,527. Estos resultados muestran que el modelo logra identificar una proporción importante de fraudes reales, aunque con una cantidad de falsos positivos que debe interpretarse desde una perspectiva operativa. (Texto tomado de la fuente)

Texto completo 85 páginas con texto

Leer la tesis completa Ficha en el repositorio

Contenido

Tesauro de su biblioteca