Maestría en Informática Biomédica · 2025
Predicción de la etiología del dolor torácico en urgencias mediante el uso de datos sintéticos y machine learning
Introducción: El dolor en el tórax es una de las principales causas de ingreso a los servicios de urgencias y representa un desafío diagnóstico debido a la amplia gama de etiologías que incluye tanto condiciones graves como benignas. La identificación rápida y precisa de la causa subyacente es crucial para optimizar el tratamiento, reducir complicaciones y mejorar la asignación de recursos en los servicios de urgencias. Este estudio tuvo como objetivo desarrollar un modelo de predicción basado en aprendizaje automático supervisado para establecer la etiología del dolor torácico, entrenado mediante el uso de un conjunto de datos sintéticos creados a partir de modelos epidemiológicos basados en publicaciones en su mayoría locales, y etiquetados por un grupo de médicos especialistas (urgenciólogos, internistas e intensivistas). Métodos: En la primera fase del estudio se empleó la información epidemiológica disponible principalmente en bases de datos bibliográficas latinoamericanas y de universidades de Colombia para obtener descripciones sobre la prevalencia de antecedentes patológicos, manifestaciones clínicas y hallazgos al examen físico de nueve enfermedades que pueden presentarse con dolor torácico (síndrome coronario agudo, tromboembolia pulmonar, disección aortica aguda, emergencia hipertensiva, insuficiencia cardíaca aguda, neumonía, pericarditis, otras causas gastrointestinales y costocondritis), posteriormente se implementaron diversos métodos de programación en lenguaje Python para la construcción de un conjunto de datos para cada una de las enfermedades, obteniendo como resultado una base de datos conformada por 500 pacientes (4500 observaciones en total para las nueve enfermedades), cada uno de los cuales contenía información de 79 campos o variables (epidemiológicas y clínicas). En la siguiente fase se estableció la construcción del caso clínico a partir de las observaciones registradas en las bases de datos, empelando programación estructurada para obtener como resultado una viñeta clínica por cada observación, esto con el fin de facilitar el proceso de revisión por parte de los médicos especialistas. En la tercera fase dichas viñetas fueron aleatorizadas en grupos de 450 y entregadas en formato de Microsoft Excel a 10 médicos especialistas para su etiquetado, que consistía en consignar el diagnóstico que consideran más probable de un listado de nueve enfermedades. En cuarta fase se estableció la construcción del modelo de predicción de dolor torácico para las nueve enfermedades, a partir de la base de datos completa (4500 observaciones), se aleatorizó y se tomaron 3600 (80%) para entrenar diferentes modelos de machine learning (Random Forest, XGBoost, SVM, etc) y posteriormente se realizó una validación con los 900 casos restantes (20%). Adicionalmente se midió el Kappa de Cohen con respecto a las etiquetas originales de acuerdo con el modelo epidemiológico desarrollado en Python, comparando el rendimiento entre médicos y los modelos de machine learning. Resultados: Se obtuvo una base de datos sintética con 4500 observaciones cada una con su respectiva etiqueta por parte de un equipo de médicos especialistas. Adicionalmente se evaluaron múltiples algoritmos de machine learning, incluyendo Random Forest, Gradient Boosting, LightGBM, XGBoost, CatBoost y Máquinas de vectores de soporte (SVM). Los resultados mostraron que el modelo basado en SVM presentó el mejor desempeño, alcanzando una sensibilidad promedio de 87.6%, especificidad promedio de 98.4%, valor predictivo positivo promedio de 88.5% y valor predictivo negativo promedio de 98.5% con respecto a los datos etiquetados por el grupo médico; así como un área bajo la curva (AUC) de 0.99 y una exactitud de 88% lo que refleja una excelente capacidad para diferenciar entre las nueve etiologías consideradas en el estudio, reforzando su potencial como herramienta de apoyo clínico. En comparación con lo anterior, la exactitud de los médicos fue de 72% con respecto al diagnóstico establecido previo al etiquetado. Conclusiones: Los datos sintéticos prometen ser una alternativa válida para superar las limitaciones de acceso a grandes volúmenes de información médica, proporcionando una base sólida para entrenar modelos predictivos. Por otro lado, el modelo basado en SVM se posiciona como una herramienta eficaz que podría apoyar el diagnóstico diferencial del dolor torácico en entornos de urgencias. Sin embargo, es necesario validar esto incluyendo tanto análisis de usabilidad como de desempeño diagnóstico en escenarios clínicos.
Texto completo 294 páginas con texto de 296
Leer la tesis completa Ficha en el repositorio
Contenido
- VARIABLES EPIDEMIOLÓGICAS Y CLÍNICAS DE LOS PACIENTESp. 3
- 2.1. Código generador tabulado infarto agudo de miocardio (IAM)p. 8
- 2.2. Código generador tabulado tromboembolia pulmonar (TEP)p. 16
- 2.3. Código generador tabulado disección aórtica aguda (DAA)p. 23
- 2.4. Código generador tabulado emergencia hipertensivap. 31
- 2.5. Código generador tabulado insuficiencia cardíaca agudap. 38
- 2.6. Código generador tabulado neumonía adquirida en comunidad (NAC)p. 49
- 2.7. Código generador tabulado pericarditisp. 57
- 2.8. Código generador tabulado enfermedades gastrointestinalesp. 63
- 2.9. Código generador tabulado costocondritisp. 79
- 3. CÓDIGOS PARA GENERAR LAS VIÑETAS CLÍNICASp. 88
- 3.1. Código generador viñetas infarto agudo de miocardio (IAM)p. 88
- 3.2. Código generador viñetas tromboembolia pulmonar (TEP)p. 105
- 3.3. Código generador viñetas disección aórtica aguda (DAA)p. 123
- 3.4. Código generador viñetas emergencia hipertensivap. 140
- 3.5. Código generador viñetas insuficiencia cardíaca agudap. 158
- 3.6. Código generador viñetas neumonía adquirida en comunidad (NAC)p. 177
- 3.7. Código generador viñetas pericarditisp. 194
- 3.8. Código generador viñetas enfermedades gastrointestinalesp. 212
- 3.9. Código generador viñetas costocondritisp. 230
- 4. CÓDIGOS PARA ENTRENAR LOS MODELOS DE MACHINE LEARNINGp. 248
- 4.1. Entrenamiento de modelo de machine learning con algoritmo Random Forestp. 248
- 4.2. Entrenamiento de modelo de machine learning con algoritmo XGBoostp. 251
- 4.3. Entrenamiento de modelo de machine learning con algoritmo SMVp. 256
- 4.4. Entrenamiento de modelo de machine learning con algoritmo CatBoostp. 261
- 4.5 Entrenamiento de modelo de machine learning con algoritmo Deep Learningp. 265
- 4.6. Entrenamiento de modelo de machine learning con algoritmo Light GBMp. 269
- 4.7. Entrenamiento de modelo de machine learning con algoritmo KNNp. 274
- 5. EVALUACIÓN DEL ETIQUETADO DE MÉDICOSp. 279
- 7. IMÁGENES DE APOYO EN EL SOFTWAREp. 294
- 8. ICONO DEL SOFTWAREp. 295
- 9. EVALUADORES PROBANDO EL SOFTWAREp. 295