Sporala red del conocimiento
Universidad de Ibagué

Maestría de Analítica de Datos para la Toma de Decisiones · 2026

Modelo de analítica de datos para apoyar la toma de decisiones en la gestión pública mediante la predicción de la percepción de pobreza de los hogares colombianos utilizando técnicas de aprendizaje automático a partir de la Encuesta Nacional de Calidad de Vida

Olivar Rayo, Vivian Rocío · Gómez Vargas, Andrea Yineth · Pérez Hernández, Yovana FernandaAsesor: Palomino Andrade, Jorge Enrique

La percepción de pobreza constituye un indicador relevante para comprender las condiciones de vida de los hogares, ya que refleja la valoración que las personas realizan sobre su situación socioeconómica más allá de los indicadores tradicionales de ingreso. En este contexto, el presente proyecto tuvo como objetivo diseñar un modelo de analítica de datos para identificar y predecir la percepción de pobreza utilizando información de la Encuesta Nacional de Calidad de Vida (ECV) 2024 del Departamento Administrativo Nacional de Estadística (DANE). Para el desarrollo del proyecto se adoptó la metodología CRISP-DM, la cual orientó las etapas de comprensión del problema, preparación de los datos, modelado y evaluación. Inicialmente se realizó el proceso ETL, que incluyó la limpieza, transformación, imputación de valores faltantes y estandarización de la información. Posteriormente, se entrenaron y compararon cuatro algoritmos de aprendizaje automático: Regresión Logística, Random Forest, XGBoost y Naive Bayes, evaluados mediante las métricas Accuracy (exactitud), Precision (precisión), Recall (sensibilidad), F1-Score y Área Bajo la Curva ROC (AUC). Adicionalmente, se aplicaron las pruebas estadísticas de Friedman, Nemenyi y McNemar para validar las diferencias entre los modelos y fortalecer la selección del algoritmo final. Los resultados mostraron que los modelos basados en árboles presentaron el mejor desempeño predictivo. Aunque Random Forest obtuvo una Accuracy ligeramente superior, XGBoost fue seleccionado como modelo final debido a la consistencia de su desempeño durante la validación cruzada y al respaldo obtenido mediante las pruebas estadísticas. Asimismo, el análisis de importancia de variables permitió identificar los factores con mayor influencia en la predicción de la percepción de pobreza, mientras que la aplicación del algoritmo K-Means complementó el estudio mediante la segmentación de hogares con características socioeconómicas similares. Como aporte principal, el proyecto demuestra que la aplicación de técnicas de analítica de datos permite apoyar la identificación de hogares con mayor probabilidad de percibirse en condición de pobreza y generar información útil para fortalecer los procesos de análisis y toma de decisiones en el ámbito de la gestión pública. De esta manera, el modelo desarrollado constituye una herramienta complementaria para la focalización de estrategias e intervenciones orientadas al mejoramiento de las condiciones de vida de la población.

Texto completo 46 páginas con texto

Leer la tesis completa Ficha en el repositorio

Contenido