Bogotá - Ingeniería - Maestría en Ingeniería - Ingeniería de Sistemas y Computación · 2026
Construcción de modelos de detección de fraude con Machine Learning
En este trabajo se construyen y evalúan modelos de detección de fraude transaccional utilizando técnicas de Machine Learning sobre un conjunto de datos de transacciones con tarjetas de crédito. El problema abordado surge de la necesidad de identificar operaciones potencialmente fraudulentas dentro de bases de datos altamente desbalanceadas, donde la mayoría de registros corresponden a transacciones legítimas y los casos de fraude representan una proporción reducida. Esta situación genera un reto metodológico importante, dado que un modelo puede presentar un desempeño aparentemente adecuado en términos generales, pero fallar en la detección de la clase de mayor interés. Para abordar este problema, se desarrolló un flujo de trabajo que incluye la caracterización del conjunto de datos, el tratamiento de variables transaccionales, la ingeniería de características, la división temporal de los datos, la implementación de diferentes familias de modelos y la evaluación comparativa mediante métricas apropiadas para escenarios desbalanceados. El proceso permitió analizar modelos basados en reglas, modelos lineales, árboles de decisión, métodos de ensamble, modelos de boosting, redes neuronales y estrategias asociadas al tratamiento del desbalance de clases. Los resultados muestran que la detección de fraude no depende únicamente del algoritmo utilizado, sino de la construcción completa del flujo de modelamiento. En particular, la preparación de datos, la selección de variables, el manejo del desbalance y la definición del umbral de clasificación resultan elementos fundamentales para obtener modelos más útiles en este tipo de problemas. Así, el trabajo aporta una aproximación reproducible para la construcción y comparación de modelos de detección de fraude transaccional, entendiendo estos modelos como herramientas de apoyo para priorizar alertas y fortalecer los procesos de análisis en contextos financieros. El modelo final seleccionado correspondió a XGBoost con un subconjunto de 100 variables y una estrategia de ponderación basada en scale_pos_weight_manual. En la evaluación final sobre el conjunto de prueba, usando un umbral de clasificación de 0,71, el modelo obtuvo un PR-AUC de 0,661, un ROC-AUC de 0,999, una precisión de 0,391, un recall de 0,808 y un F1-score de 0,527. Estos resultados muestran que el modelo logra identificar una proporción importante de fraudes reales, aunque con una cantidad de falsos positivos que debe interpretarse desde una perspectiva operativa. (Texto tomado de la fuente)
Texto completo 85 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 6
- Abstractp. 7
- Lista de tablasp. 8
- Lista de Figurasp. 8
- 1. Introducciónp. 9
- 2. Planteamiento del problemap. 12
- 2.1 Justificaciónp. 12
- 2.2 Alcance y delimitacionesp. 13
- 3 Objetivosp. 14
- 3.1 Objetivo generalp. 14
- 3.2 Objetivos específicosp. 14
- 4. Estado del arte y marco teóricop. 15
- 4.1 Fraude transaccional con tarjetas de créditop. 15
- 4.2 Modelos basados en reglasp. 15
- 4.3 Modelos supervisados tradicionalesp. 16
- 4.4 Modelos de ensamble y boostingp. 16
- 4.5 Redes neuronales y aprendizaje profundop. 16
- CTGAN)p. 17
- 4.7 Métricas de evaluación para datos desbalanceadosp. 17
- 4.8 Trabajos previosp. 18
- 4.9 Conclusiones del estado del arte y marco teóricop. 21
- 5. Caracterización del conjunto de datosp. 22
- 5.1 Variable objetivop. 22
- 5.2 Diagnóstico del conjunto de datosp. 23
- 5.3 División temporalp. 25
- 6. Diseño metodológico e implementación de modelos de detección de fraudep. 26
- 6.1 Diseño metodológicop. 26
- Fase 1. Revisión de literaturap. 26
- Fase 2. Caracterización y preparación de datosp. 26
- Fase 3. Diseño e implementación de modelosp. 26
- Fase 4. Entrenamiento y ajustep. 26
- Fase 5. Evaluación comparativap. 27
- Fase 6. Conclusiones y trabajo futurop. 27
- 6.2 Diseño del flujo de modelamientop. 27
- 6.3 Preparación del conjunto de datos para modelamientop. 28
- 6.4 Preprocesamiento de variablesp. 29
- 6.5 Ingeniería de característicasp. 29
- 6.6 Selección de variables para el modelamientop. 31
- 6.7 Modelos implementadosp. 32
- 6.8 Tratamiento del desbalance de clases en la variable objetivop. 33
- 7. Evaluación de modelos y resultadosp. 35
- 7.1 Comparación de modelos en validaciónp. 35
- 7.2 Comparación de modelos reentrenablesp. 36
- 7.3 Evaluación final en conjunto de pruebap. 37
- 7.4 Interpretación de resultadosp. 39
- 7.5 Importancia de variables del modelo seleccionadop. 40
- 8. Discusiónp. 41
- 8.1 Hallazgosp. 41
- 8.2 Limitacionesp. 41
- 8.3 Implicacionesp. 42
- 9. Conclusiones y trabajo futurop. 43
- 9.1 Conclusionesp. 43
- 9.2 Trabajo futurop. 44
- 10. Referencias bibliográficasp. 45
- 11. Anexosp. 48
- Anexo A. Diccionario de variablesp. 47
- Anexo B. Lista final de variables seleccionadasp. 65
- Anexo C. Resultados completos de los experimentos de modelamientop. 75
- Anexo D. Optimización del umbral de clasificación en el conjunto de validaciónp. 81
- Anexo E. Importancia de variables del modelo finalp. 84