Especialización en Analítica y Ciencia de Datos · 2026
Predicción temprana de la diabetes mediante modelos de aprendizaje supervisado utilizando variables clínicas y de estilo de vida de los pacientes
Los avances en analítica de datos aplicada al sector salud permiten apoyar la detección temprana de enfermedades y la toma de decisiones preventivas. En particular, los modelos de aprendizaje automático identifican patrones en grandes volúmenes de información y generan predicciones útiles para el diagnóstico y seguimiento de enfermedades crónicas como la diabetes. El objetivo de esta investigación fue implementar modelos de aprendizaje automático supervisado para predecir la presencia de diabetes a partir de variables demográficas, clínicas y de hábitos de vida. Para ello, se utilizó el conjunto de datos Behavioral Risk Factor Surveillance System (BRFSS) y se aplicaron etapas de análisis exploratorio, eliminación de valores atípicos, balanceo de clases, escalado de variables y técnicas de reducción de dimensión como SFFS, PCA y LDA. Se evaluaron nueve algoritmos de clasificación, incluyendo Regresión Logística, Naive Bayes, k-Nearest Neighbors, Máquinas de Soporte Vectorial, Árboles de Decisión, Random Forest, AdaBoost, Gradient Boosting y XGBoost. Uno de los principales retos fue equilibrar el desempeño predictivo con la interpretabilidad del modelo. El modelo seleccionado fue Máquinas de Soporte Vectorial con kernel polinómico, entrenado con las variables originales, alcanzando un F1-score de 0.7656 y un recall de 0.8012. Los resultados demuestran que el aprendizaje automático constituye una herramienta efectiva para apoyar la detección temprana de diabetes.
Texto completo 70 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 9
- Abstractp. 10
- Introducciónp. 11
- Descripción del problemap. 11
- Planteamiento del problemap. 13
- Objetivo del estudiop. 14
- Objetivo Generalp. 14
- Objetivos Específicosp. 14
- Metodologíap. 15
- Datos utilizados y su fuentep. 15
- Algoritmos, modelos y técnicas aplicadasp. 15
- Criterios de evaluaciónp. 16
- Estructurap. 17
- Materiales y Métodosp. 18
- Descripción de los datosp. 18
- Análisis exploratorio de datos (EDA)p. 20
- Preprocesamiento y limpieza de datosp. 25
- Métodos de análisis y modeladop. 26
- Evaluación del modelop. 38
- Métricas de evaluaciónp. 38
- Métodos de validaciónp. 38
- Comparación entre modelosp. 39
- Resultados y Discusiónp. 56
- Resultados ajustando el threshold para maximizar el F1-scorep. 58
- Resultados ajustando el threshold para maximizar el recallp. 59
- Interpretaciónp. 62
- Evaluación críticap. 65
- Conclusionesp. 67
- Referencias bibliográficasp. 69
- Anexosp. 70
- Figura 1. Frecuencia de instancias para variables binarias vs diagnósticop. 21
- Figura 2. Frecuencia de instancias para variables ordinales y continuas vs diagnósticop. 22
- Figura 3. Frecuencia de diagnóstico de Diabetesp. 23
- Figura 4. Matriz de correlaciónp. 24
- Figura 5. Selección secuencial de características (SFFS)p. 35
- Figura 7. F1-score en función del número de componentes discriminantes (LDA)p. 37
- Figura 8. Matriz de confusión de la Etapa 1 - Modelo SVM con kernel polinómicop. 56
- Figura 9. Matriz de confusión de la Etapa 4-1 - Modelo SVM con kernel polinómicop. 57
- 0.3p. 40
- de 0.3p. 60
- Tabla 1. Codificación de la Variable Agep. 19
- Tabla 2. Hiperparámetro – Regresión Logisticap. 27
- Tabla 3. Hiperparámetro – Clasificador Bayesianop. 27
- Tabla 4. Hiperparámetro – k-Nearest Neighborsp. 28
- Tabla 5. Hiperparámetro – Máquinas de Soporte Vectorialp. 29
- Tabla 6. Hiperparámetro – Árboles de Decisiónp. 30
- Tabla 7. Hiperparámetro – Random Forestp. 31
- Tabla 8. Hiperparámetro – AdaBoostp. 32
- Tabla 9. Hiperparámetro – Gradient Boostingp. 33
- Tabla 10. Hiperparámetro – Extreme Gradient Boostingp. 34
- Tabla 11. Hiperparámetros óptimos y métrica de desempeño en la etapa 1p. 40
- Tabla 12. Hiperparámetros óptimos y métrica de desempeño en la etapa 2p. 41
- Tabla 13. Hiperparámetros óptimos y métrica de desempeño en la etapa 3p. 43
- Tabla 14. Hiperparámetros óptimos y métrica de desempeño en la etapa 4 – proceso 1p. 44
- Tabla 15. Hiperparámetros óptimos y métrica de desempeño en la etapa 4 – proceso 2p. 46
- Tabla 16. Resultados en conjunto de prueba en la etapa 1 (sin threshold y F1-score)p. 47
- Tabla 17. Resultados en conjunto de prueba en la etapa 1 (sin threshold y Recall)p. 48
- Tabla 18. Resultados en conjunto de prueba en la etapa 1 (Threshold 0.35 y F1-score)p. 48
- Tabla 19. Resultados en conjunto de prueba en la etapa 1 (Threshold 0.35 y Recall)p. 48
- Tabla 20. Resultados en conjunto de prueba en la etapa 2 (sin threshold y F1-score)p. 49
- Tabla 21. Resultados en conjunto de prueba en la etapa 2 (sin threshold y Recall)p. 49
- Tabla 22. Resultados en conjunto de prueba en la etapa 2 (Threshold 0.35 y F1-score)p. 50
- Tabla 23. Resultados en conjunto de prueba en la etapa 2 (Threshold 0.35 y Recall)p. 50
- Tabla 24. Resultados en conjunto de prueba en la etapa 3 (sin threshold y F1-score)p. 51
- Tabla 25. Resultados en conjunto de prueba en la etapa 3 (sin threshold y Recall)p. 51
- Tabla 26. Resultados en conjunto de prueba en la etapa 3 (Threshold 0.3 y F1-score)p. 52
- Tabla 27. Resultados en conjunto de prueba en la etapa 3 (Threshold 0.3 y Recall)p. 52