Bogotá - Ingeniería - Maestría en Bioinformática · 2025
Modelo de inteligencia artificial para realizar gap filling en ensambles de reads cortos de genomas de Acinetobacter baumannii
Las técnicas de secuenciación masiva de nueva generación (NGS) fueron revolucionarias en el campo de la genómica y en el proceso de secuenciación de genomas completos (WGS), debido a que permiten secuenciar un volumen de datos con gran profundidad, y a un costo asequible. Estos procedimientos implementan secuenciación masiva de reads cortos, que permiten la lectura en paralelo de todo el genoma. Pese la alta capacidad de lectura, los reads cortos son fragmentos pequeños de secuencias mucho más grandes. Por ello, las técnicas de ensamblaje son fundamentales en la extensión de contigs y orientación de scaffolds, para obtener genomas completos. No obstante, los ensambladores para secuenciación de reads cortos NGS presentan limitaciones técnicas y teóricas asociadas a las regiones repetitivas o de baja complejidad presentes en los genomas. Estas regiones limitan los cálculos de orientación entre scaffols, lo que genera huecos o gaps en los procesos de ensamblaje. Pese a las limitantes del ensamblaje con reads cortos NGS, el numero proyectos de secuenciación y la disponibilidad de datos de WGS siguen en aumento debido a que es altamente costo efectivo. Uno de los organismos con gran crecimiento en el numero de proyectos de secuenciación es la bacteria multirresistente Acinetobacter baumannii. Debido a que es riesgo para la salud pública mundial dado a su capacidad para sobrevivir en ambientes hospitalarios y de generar infecciones graves. Con el fin de mejorar los procesos de calidad en los ensamblajes y aprovechar el gran número de datos de secuenciación se propone implementar metodologías de inteligencia artificial, para entrenar modelos capaces de cerrar huecos en los ensamblajes de novo de Acinetobacter baumannii, que implementen metodologías de reads cortos. (Texto tomado de la fuente)
Texto completo 79 páginas con texto de 83
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 14
- Marco Teóricop. 18
- Ensamblaje de Novop. 18
- 1.1.1 Cálculo por alineamientosp. 18
- 1.1.2 Cálculo por grafos de Bruijnp. 19
- 1.1.3 Extensión de contigsp. 19
- 1.1.4 Andamiaje (Scaffolding)p. 19
- 1.1.5 Llenado de huecos (Gap filling)p. 20
- 1.1.6 Borrador del genoma (Draft genome)p. 20
- Aprendizaje de máquinap. 20
- 1.2.1 Redes neuronalesp. 21
- Aprendizaje profundop. 23
- 1.3.1 Redes convolucionalesp. 23
- 1.3.2 Redes recurrentesp. 24
- 1.3.3 Modelos basados en transformadoresp. 25
- Antecedentesp. 27
- Antecedentesp. 27
- 2.1.1 Algoritmos basados en grafos de Bruijnp. 27
- 2.1.2 Algoritmos basados en superposición de lecturasp. 28
- 2.1.3 Algoritmos basados en inteligencia artificialp. 29
- Planteamiento del problemap. 33
- Pregunta de investigaciónp. 34
- Objetivosp. 35
- Objetivo generalp. 35
- Objetivos específicosp. 35
- Metodologíap. 36
- Adquisición y filtrado de datosp. 36
- 5.1.1 Criterios de inclusiónp. 36
- 5.1.2 Limpieza de los archivosp. 36
- 5.1.3 Ensamblajep. 37
- Preprocesamientop. 37
- Selección de formato de representaciónp. 39
- Entrenamiento y validaciónp. 39
- 5.4.1 Arquitecturasp. 39
- 5.4.2 Exploración y selección de hiperparámetrosp. 40
- 5.4.3 Conjuntos de entrenamiento, validación y pruebap. 42
- 5.4.4 Métricas de desempeñop. 42
- Comparación de técnicasp. 43
- Resultados y discusiónp. 47
- Conclusionesp. 65
- Recomendaciones y trabajos futurosp. 66
- A. Anexo: Tabla de calidad de los ensamblajes seleccionadosp. 68
- ensamblajes……p. 70
- Bibliografíap. 73
- Figura 1. Arquitectura de un perceptrón. Tomado de (M. Ali et al., 2023)p. 22
- salida. Modificado de (M. Ali et al., 2023)p. 22
- (Zhai et al., 2023)p. 23
- Modificado de (Boetzer & Pirovano, 2012)p. 29
- Modificado de (Chu et al., 2019)p. 29
- Figura 7. Alineamiento entre contigs y genoma completop. 38
- Figura 8. Extracción de las secuencias de los huecosp. 39
- Figura 9. Arquitectura e hiperparámetros del modelo LSTMp. 40
- Figura 10. Arquitectura e hiperparámetros del modelo CNN-LSTMp. 41
- Figura 11. Arquitectura base del modelo GPTp. 42
- contigsp. 47
- respecto a su tamañop. 48
- de 80 mil pares de bases por segmentop. 49
- Figura 15. Árbol filogenético de las muestras de Acinetobacter baumanniip. 51
- salidap. 54
- en formato one-hotp. 54
- de validaciónp. 55
- conjunto de validaciónp. 56
- de validaciónp. 56
- Figura 21. Exploración del modelo LSTM con incremento de embeddingp. 57
- Figura 22. Exploración del modelo CNN-LSTM con incremento de unidades LSTMp. 58
- Figura 24. Curvas de entrenamiento y validación del modelo GPT2p. 60
- Figura 25. Curvas de entrenamiento y validación del modelo CNN-LSTMp. 61
- Figura 26. Curvas de entrenamiento y validación del modelo LSTMp. 61
- 1.1 Ponderación del perceptrónp. 22
- 1.2. Salida del filtro kernel en las redes neuronales convolucionalesp. 24
- 1.3. Estadio actual de la red recurrentep. 24
- 1.4. Salida de la red neuronal recurrentep. 25
- 1.5. Cálculo de atenciónp. 25
- 1.6. Proyección de la atención de cada una de las cabezasp. 26
- 2.1. Función de Bloomp. 28
- 2.2. Identidad del alineamiento de Kmerp. 28
- 5.1. Exactitud multiclasep. 43
- 5.2. Área bajo la curvap. 43
- 5.3. Entropía cruzada categóricap. 43
- Tabla 1. Representación de tabla de coordenadas de alineamientos por contigp. 38
- Tabla 2. Métricas de calidad promedio de los ensamblajesp. 47
- Tabla 3. Identidad promedio de los N contigs más grandesp. 48
- Tabla 4. Distribución del tamaño de los huecos por cuartilesp. 49
- Tabla 5. Porcentaje de coincidencia de los huecos en el genomap. 52
- exploratoriap. 60
- pruebap. 62
- Tabla 8. Desempeño final de los gaps fillersp. 63