Ingeniería Industrial · 2025
Caracterización de los estudiantes en condición de desplazamiento en Santander a través de técnicas de clustering.
Una de las mayores barreras sociales en Colombia se debe al conflicto armado que durante años ha dejado múltiples consecuencias; una de ellas, el desplazamiento forzado. A su vez, esto ha traído problemas en el ámbito de la educación de niños y jóvenes de las zonas afectadas, convirtiéndolos en una población vulnerable. Este estudio tiene como propósito caracterizar a los estudiantes en condición de desplazamiento en el departamento de Santander mediante técnicas de clustering, con el fin de identificar patrones que permitan promover la creación de estrategias y toma de decisiones basados en datos. Para ello, se empleó la metodología KDD que incluyó la limpieza, preprocesamiento y transformación de una base de datos pública generada por entes gubernamentales con más de 12.600 registros. Posteriormente se aplicaron métodos como K-Means y DBSCAN, los cuales se extrajeron de una revisión de literatura y se compararon cuantitativamente mediante métricas como el silhouette score y cualitativamente teniendo en cuenta la interpretabilidad y uso de los resultados. Finalmente, los resultados evidencian que ambos métodos permiten segmentar la población en grupos con diferentes características como edad, grado escolar, carácter y zona de la institución educativa, condición de desplazamiento, entre otras; poniendo en evidencia ciertas desigualdades y retos que presenta cada grupo. Estos hallazgos resultan importantes para la toma de decisiones y creación de estrategias basadas en la evidencia, que promuevan equidad y reinserción de los desplazados por la violencia.
Texto completo 106 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 11
- 1. Planteamiento del problemap. 12
- 2. Objetivosp. 14
- 2.1 Objetivo generalp. 14
- 2.2 Objetivos específicosp. 14
- 3. Metodologíap. 15
- 3.1 Comprensión del problemap. 15
- 3.2 Limpieza de datosp. 16
- 3.3 Preprocesamientop. 17
- 3.4 Desarrollo y aplicación del algoritmo de clusteringp. 17
- 3.5 Interpretación de los resultadosp. 18
- 4. Marco de referenciap. 19
- 4.1 Marco de antecedentesp. 19
- 4.2 Marco teóricop. 21
- 5. Revisión de literaturap. 23
- 5.1 Análisis bibliométricop. 23
- 5.2 Análisis de la literaturap. 30
- 6.2.1 K-meansp. 31
- 6.2.2 DBSCANp. 33
- 6.2.3 Clustering jerárquicop. 33
- 6.2.4 K-medoidsp. 35
- 6.2.5 Anselin Local Moran’s Ip. 36
- 6.2.6 Clustering en dos pasosp. 36
- 6.2.7 Regresión logísticap. 37
- 6.2.8 Minería de datos educativap. 43
- 5.3 Discusiónp. 44
- 6. Limpieza, preprocesamiento y transformación de los datosp. 46
- 6.1 Descripción preliminar de las variablesp. 46
- 6.2 Limpieza de datosp. 16
- 6.3 Transformación de los datosp. 53
- 7. Aplicación de los métodos de clusteringp. 54
- 7.1 K-meansp. 31
- 7.2 DBSCANp. 33
- 8. Resultadosp. 60
- 8.1 Análisis descriptivo de los resultadosp. 69
- 8.1.1 K-meansp. 31
- 8.1.2 DBSCANp. 33
- 8.2 Análisis de los resultadosp. 83
- 8.2.1 K-meansp. 31
- 8.2.2 DBSCANp. 33
- 8.3 Discusiónp. 44
- 9. Conclusionesp. 94
- 10. Recomendacionesp. 96
- Referencias bibliográficasp. 97
- Tabla 1 Otros autores que utilizaron k-meansp. 32
- Tabla 2 Otros autores que utilizaron regresión logísticap. 40
- Tabla 3 Resultado con DBSCAN (eps=1.7)p. 65
- Tabla 4 Resultado con DBSCAN (eps=1.8)p. 66
- Tabla 5 Resultado con DBSCAN (esp=2.0)p. 67
- Tabla 6 Estadísticos descriptivos de edad y grado por clúster (K-means)p. 69
- Tabla 7 Distribución de género por clúster (%)p. 70
- Tabla 8 Distribución de la provincia de residencia por clúster (%)p. 70
- Tabla 9 Distribución por carácter y zona de la institución (%)p. 71
- Tabla 10 Distribución por jornada académica (%)p. 72
- Tabla 11 Distribución por método de enseñanza (%)p. 73
- Tabla 12 Distribución por tipo de desplazamiento (%)p. 74
- Tabla 13 Resumen de distribución por tipo de desplazamientop. 75
- Tabla 14 Estadísticos descriptivos de edad y grado por clúster (DBSCAN)p. 76
- Tabla 15 Distribución por género (DBSCAN)p. 77
- Tabla 16 Distribuciones por provincia (DBSCAN)p. 78
- Tabla 17 Distribución por caracter y zona (%) (DBSCAN)p. 79
- Tabla 18 Distribución por método de enseñanza (%) (DBSCAN)p. 80
- Tabla 19 Distribución por tipo de desplazamiento (%) (DBSCAN)p. 81
- Tabla 20 Resumen de distribución por tipo de desplazamiento (%) (DBSCAN)p. 82
- Figura 1 Fases de la metodología KDDp. 15
- Figura 2 Análisis de concurrenciap. 26
- Figura 3 Relación entre autoresp. 27
- Figura 4 Revistas en donde fueron publicados los artículosp. 28
- Figura 5 Análisis de frecuencia de publicaciones por añop. 29
- Figura 6 Frecuencia por paísesp. 30
- Figura 7 Información de la base de datosp. 47
- Figura 8 Distribución y boxplot de las variables grado y edadp. 49
- Figura 9 Distribución de la variable método de educaciónp. 51
- Figura 10 Distribución de las variables etnia y discapacidadp. 51
- Figura 11 Distribución de la variable provincias de Santanderp. 52
- Figura 12 Método del codop. 55
- Figura 13 Análisis de componentes principalesp. 56
- Figura 14 Varianza explicada por PCAp. 57
- Figura 15 Gráfico k-distancias para el cálculo del parámetro epsilonp. 59
- Figura 16 Gráfico de k-distancias detalladop. 60
- Figura 17 Silhouette score del método DBSCANp. 61
- Figura 18 Silhouette score cambiando el número mínimo de muestrap. 61
- Figura 19 Proporción de clústeres con k-means (k=3)p. 62
- Figura 20 Proporción de clústeres con k-means (k=4)p. 63
- Figura 21 Proporción de clústeres con k-means (k=5)p. 63
- Figura 22 Silhouette score frente a kp. 64
- Figura 23 Proporción de clústeres con DBSCAN (eps=1.7)p. 66
- Figura 24 Proporción de clústeres con DBSCAN (eps=1.8)p. 67
- Figura 25 Proporción de clústeres con DBSCAN (eps=2.0)p. 68