Especializaciones de la Facultad de Ingeniería · 2021
Modelo predictivo de deserción estudiantil de educación preescolar, básica y media en el municipio de Medellín
RESUMEN : La deserción escolar entendiéndose como la interrupción, retiro o abandono del estudiante del sistema educativo, es un panorama educativo altamente problemático para el Estado y la sociedad en general, por su relación con la afectación al derecho fundamental del acceso a la educación y al desarrollo normal de un individuo en su etapa de escolaridad, soportado en el Artículo 67 de la Constitución Política de Colombia de 1991. Por ello, es de vital importancia para los entes reguladores velar y garantizar la permanencia educativa de todos los niños, jóvenes y adolescentes en su entorno escolar. Es allí, donde el gran potencial de los datos en conjunto con distintos actores multidisciplinarios permitiría la construcción de estrategias de control innovadoras y oportunas que respondan a las necesidades reales de la ciudadanía, aportando al mejoramiento de la calidad educativa y a los procesos de diagnóstico, planeación, ejecución, seguimiento y evaluación. Dada la necesidad de disminuir la tasa de estudiantes que abandonan el sistema educativo, se propone desarrollar un modelo predictivo de deserción estudiantil de Educación Preescolar, Básica y Media en el Municipio de Medellín, que permita a partir de técnicas de Machine Learning clasificar en posibles desertores (1) y no desertores (0) a aquellos estudiantes que según sus características académicas, sociodemográficas, socioeconómicas y familiares presentan un mayor riesgo de abandonar la escuela en el sector Oficial. Para la ejecución del proyecto se recolectó la fuente de información de matrícula al año 2019 suministrada por el Observatorio para la Calidad Educativa de Medellín (OCEM) de la Secretaría de Educación. A partir de la cual, se inició un proceso metodológico que consistió en la preparación de los datos para cruzar con un dataset complementario proveniente de la encuesta del Sisbén en la ciudad, el preprocesamiento de los datos para depurar, limpiar, imputar, transformar y codificar las variables, el balanceo de la clase minoritaria de la variable objetivo a partir de la técnica de sobremuestreo SMOTE, la implementación y entrenamiento de algoritmos de clasificación de aprendizaje supervisado tales como: RandomForestClassifier, StackingClassifier, BaggingClassifier de la librería de Scikit-Learn, así como una red neuronal con autoencoder de la plataforma TensorFlow y un algoritmo de ensemble XGBClassifier de XGBoost, finalizando el proceso con una validación de las métricas obtenidas en cada uno de los modelos y secuencia de iteraciones. Gracias a los resultados obtenidos en cada iteración realizada, fue posible ajustar los parámetros y definir las acciones de mejora en los datos y variables, con el fin de ir de manera progresiva aumentando el porcentaje de verdaderos positivos y disminuyendo la tasa de falsos negativos. Teniendo entonces como resultado final el mejor modelo de XGBClassifier, con una clasificación de los posibles desertores, es decir, de verdaderos positivos del 97% y aproximadamente el 100% de la clasificación de los no desertores.
Texto completo 53 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- 1. RESUMEN EJECUTIVOp. 7
- 2. DESCRIPCIÓN DEL PROBLEMAp. 8
- 2.1 Problema de negociop. 8
- 2.2 Aproximación desde la analítica de datosp. 8
- 2.3 Origen de los datosp. 8
- 3. DATOSp. 10
- 3.1 Datos originalesp. 10
- 3.2 Preparación de los datosp. 18
- 3.3 Ejecución del entornop. 19
- 3.4 Descriptivap. 19
- 3.4.1 Variables categóricasp. 21
- 3.4.2 Variables numéricasp. 22
- 4. PROCESO DE ANALÍTICAp. 24
- 4.1 Pipeline principalp. 24
- 4.2 Preprocesamientop. 25
- 4.2.1 Extracción de característicasp. 25
- 4.2.1.1 Limpieza e imputación de datosp. 25
- 4.2.1.2 Extracción del sector de estudiop. 26
- 4.2.1.3 Extracción de población de estudiop. 26
- 4.2.1.4 Creación de nuevas característicasp. 27
- 4.2.1.5 Transformación del tipo de variablep. 29
- 4.2.2 Tratamiento de valores atípicosp. 30
- 4.2.3 Definición de la variable objetivop. 30
- 4.2.3.1 Visualización del comportamiento de las variablesp. 31
- 4.2.3.2 Análisis de correlación de los datosp. 33
- 4.2.4 Codificación de variables categóricasp. 34
- 4.2.5 Balanceo de clasesp. 36
- 4.3 Dataset de entrenamiento y pruebap. 36
- 4.4 Modelosp. 37
- 4.4.1 Random Forestp. 37
- 4.4.2 Red Neuronal con Autoencoderp. 37
- 4.4.3 Stackingp. 37
- 4.4.4 Baggingp. 37
- 4.4.5 XGBoostp. 38
- 4.5 Métricas de desempeñop. 38
- 5. METODOLOGÍAp. 40
- 5.1 Baselinep. 40
- 5.2 Iteraciones y evoluciónp. 41
- 5.3 Herramientasp. 42
- 6. RESULTADOSp. 44
- 6.1 Métricasp. 44
- 6.2 Evaluación cualitativap. 49
- 7. CONCLUSIONESp. 51
- 8. REFERENCIASp. 53
- Figura 1. Dataset en crudop. 20
- Figura 2. Correlación entre variablesp. 21
- Figura 3. Comportamiento Variable ‘MUN_CODIGO’p. 21
- Figura 4. Variables categóricas dataset en crudop. 21
- Figura 5. Comportamiento de variables categóricas dataset en crudop. 22
- Figura 6. Variables numéricas dataset en crudop. 22
- Figura 7. Variables numéricas con atípicosp. 23
- Figura 8. Distribución de variables numéricas en crudop. 23
- Figura 9. Flujo de trabajo modelo predictivop. 24
- Figura 10. Variables con gran porcentaje de datos nulosp. 25
- Figura 11. Transformación de variables con valores nulosp. 25
- Figura 12. Variables seleccionadas para el modelop. 26
- Figura 13. Filtro sector no oficialp. 26
- Figura 14. Filtro grados complementariosp. 26
- Figura 15. Filtro metodología ciclos complementariosp. 27
- Figura 16. Distribución población víctimap. 27
- Figura 17. Creación variable binaria población víctimap. 28
- Figura 18. Distribución población discapacidadp. 28
- Figura 19. Creación variable binaria población discapacidadp. 28
- Figura 20. Variable de edad ideal por gradop. 29
- Figura 21. Variable extraedadp. 29
- Figura 22. Transformación variables categóricasp. 30
- Figura 23. Tratamiento de outliersp. 30
- Figura 24. Variable objetop. 31
- Figura 25. Distribución variable objetop. 31
- Figura 26. Comportamientos variables categóricasp. 31
- Figura 27. Comportamientos variables numéricasp. 33
- Figura 28. Correlación de variables numéricasp. 34
- Figura 29. Variables categóricas a dummiesp. 34
- Figura 30. Columnas a partir de get_dummies()p. 35
- Figura 31. Columnas correspondientes a SIT_ACAD_ANO_ANTp. 35
- Figura 32. Balanceo de clase minoritaria con SMOTEp. 36
- Figura 33. Separación de dataset de entrenamiento y pruebap. 36
- Figura 34. Métricas primera iteraciónp. 41
- Figura 35. Matriz de confusión modelo XGBClassifierp. 49
- Figura 36. Gráfica ROC AUC modelo XGBClassifierp. 49
- Tabla 1. Descripción de base de datos simat_anexo_201905p. 10
- Tabla 2. Descripción de base de datos BD_SISBENp. 17
- Tabla 3. Matriz de confusiónp. 38
- Tabla 4. Métricas iteración 1 (Baseline)p. 44
- Tabla 5. Métricas iteración 2p. 44
- Tabla 6. Métricas iteración 3p. 44
- Tabla 7. Métricas iteración 4p. 45
- Tabla 8. Métricas iteración 5p. 45
- Tabla 9. Métricas iteración 6p. 45
- Tabla 10. Métricas iteración 7p. 46
- Tabla 11. Métricas generales de modelos implementadosp. 47