Maestría de Analítica de Datos para la Toma de Decisiones · 2026
Modelo de analítica de datos para apoyar la toma de decisiones en la gestión pública mediante la predicción de la percepción de pobreza de los hogares colombianos utilizando técnicas de aprendizaje automático a partir de la Encuesta Nacional de Calidad de Vida
La percepción de pobreza constituye un indicador relevante para comprender las condiciones de vida de los hogares, ya que refleja la valoración que las personas realizan sobre su situación socioeconómica más allá de los indicadores tradicionales de ingreso. En este contexto, el presente proyecto tuvo como objetivo diseñar un modelo de analítica de datos para identificar y predecir la percepción de pobreza utilizando información de la Encuesta Nacional de Calidad de Vida (ECV) 2024 del Departamento Administrativo Nacional de Estadística (DANE). Para el desarrollo del proyecto se adoptó la metodología CRISP-DM, la cual orientó las etapas de comprensión del problema, preparación de los datos, modelado y evaluación. Inicialmente se realizó el proceso ETL, que incluyó la limpieza, transformación, imputación de valores faltantes y estandarización de la información. Posteriormente, se entrenaron y compararon cuatro algoritmos de aprendizaje automático: Regresión Logística, Random Forest, XGBoost y Naive Bayes, evaluados mediante las métricas Accuracy (exactitud), Precision (precisión), Recall (sensibilidad), F1-Score y Área Bajo la Curva ROC (AUC). Adicionalmente, se aplicaron las pruebas estadísticas de Friedman, Nemenyi y McNemar para validar las diferencias entre los modelos y fortalecer la selección del algoritmo final. Los resultados mostraron que los modelos basados en árboles presentaron el mejor desempeño predictivo. Aunque Random Forest obtuvo una Accuracy ligeramente superior, XGBoost fue seleccionado como modelo final debido a la consistencia de su desempeño durante la validación cruzada y al respaldo obtenido mediante las pruebas estadísticas. Asimismo, el análisis de importancia de variables permitió identificar los factores con mayor influencia en la predicción de la percepción de pobreza, mientras que la aplicación del algoritmo K-Means complementó el estudio mediante la segmentación de hogares con características socioeconómicas similares. Como aporte principal, el proyecto demuestra que la aplicación de técnicas de analítica de datos permite apoyar la identificación de hogares con mayor probabilidad de percibirse en condición de pobreza y generar información útil para fortalecer los procesos de análisis y toma de decisiones en el ámbito de la gestión pública. De esta manera, el modelo desarrollado constituye una herramienta complementaria para la focalización de estrategias e intervenciones orientadas al mejoramiento de las condiciones de vida de la población.
Texto completo 46 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 6
- Absctracp. 7
- Capítulo 1. Información general y contextop. 8
- 1.1 Información general del proyecto y contexto de aplicaciónp. 8
- Capítulo 2. Fundamentación teórica y organizacionalp. 9
- 2.1 Marco Teóricop. 9
- 2.2 Descripción del contexto organizacionalp. 9
- 2.3 Planteamiento del problemap. 10
- Capítulo 3. Justificación y objetivosp. 12
- 3.1 Justificaciónp. 12
- 3.2 Objetivo generalp. 12
- 3.3 Objetivos específicosp. 12
- Capítulo 4. Alineación estratégica y valor organizacionalp. 13
- 4.1 Ventaja Competitiva Asociadap. 13
- 4.2 Generación de Valor para la Organizaciónp. 13
- 4.3 Beneficios Esperados (corto, mediano y largo plazo)p. 14
- Capítulo 5. Metodología y solución técnicap. 16
- 5.1 Solución Técnica Empleadap. 16
- 5.1.1 Fuentes de Datosp. 16
- 5.1.2 Tratamiento de Datos (ETL)p. 17
- 5.1.3 Diccionario de Datosp. 20
- 5.1.4 Arquitectura de Datosp. 21
- 5.1.5 Métodos y Algoritmos Utilizadosp. 23
- 5.1.6 Herramientas y Lenguajes de Programaciónp. 23
- 5.1.7 Códigos y Scripts Documentadosp. 24
- 5.1.8 Validación Técnica de la Soluciónp. 25
- 5.2 Fases de Desarrollo del Proyectop. 25
- 5.2.1 Comprensión del problemap. 26
- 5.2.2 Comprensión de los datosp. 26
- 5.2.3 Preparación de los datosp. 25
- 5.2.4 Modeladop. 20
- 5.2.5 Evaluaciónp. 25
- 5.2.6 Desplieguep. 25
- Capítulo 6. Resultados, indicadores y análisisp. 27
- 6.1 Caracterización de la Variable Objetivop. 27
- 6.2 Variables con Mayor Influencia en la Percepción de Pobrezap. 27
- 6.3 Desempeño Comparativo de los Modelosp. 27
- 6.3.1 Comparación mediante métricasp. 27
- 6.3.2 Comparación estadísticap. 24
- 6.3.3 Validaciónp. 20
- 6.4 Justificación del Modelo Seleccionado: XGBoostp. 30
- 6.5 Segmentación Complementaria de Hogares (K-Means)p. 30
- 6.6 Síntesis de Resultados y Cumplimiento de Objetivosp. 31
- Capítulo 7. Conclusiones y recomendacionesp. 33
- 7.1 Conclusionesp. 33
- 7.2 Recomendacionesp. 34
- Referenciasp. 36
- 8. Anexosp. 38
- Tabla 1. Generación de valor del proyecto desde la perspectiva del Balanced Scorecardp. 14
- Tabla 2. Beneficios esperados del proyectop. 14
- Tabla 3. Características de la fuente de datosp. 17
- Tabla 4. Actividades desarrolladas durante el proceso ETLp. 20
- Tabla 5. Diccionario de variables utilizadas en el modelop. 20
- Tabla 6. Algoritmos implementados en el proyectop. 23
- Tabla 7. Herramientas utilizadas durante el desarrollo del proyectop. 24
- Tabla 8. Scripts desarrollados durante el proyectop. 24
- Tabla 9. Fases CRISP-DMp. 25
- Tabla 10. Comparación del desempeño de los modelos mediante métricas de clasificaciónp. 28
- Tabla 11. Resultados de la prueba post hoc de Nemenyip. 29
- Tabla 12. Distribución de hogares por clúster obtenido mediante K-Meansp. 31
- Tabla 13. Cumplimiento de los objetivos específicos del proyectop. 31
- Ilustración 1 Proceso ETL implementado para la preparación de los datosp. 19
- Ilustración 2 Arquitectura de datos implementada para el desarrollo del modelo predictivop. 22