Medellín - Minas - Maestría en Ingeniería - Analítica · 2025
Un método para generación de mapas mentales a partir de un dataset de artículos científicos en el contexto de calidad de software mediante técnicas de machine learning
En los últimos años, el análisis de grandes volúmenes de texto ha ganado relevancia en diversas disciplinas, especialmente con el avance de las técnicas de machine learning y el procesamiento de lenguaje natural. En particular, la investigación sobre calidad de software ha generado una gran cantidad de artículos científicos que, debido a su complejidad y volumen, dificultan la comprensión rápida y la identificación de las ideas clave. Una posible solución a este problema es el uso de herramientas automáticas que ayuden a visualizar las relaciones entre los conceptos clave de manera más accesible. En este estudio, se propone un enfoque para generar mapas mentales a partir de un conjunto de artículos científicos relacionados con la calidad de software, utilizando un modelo de lenguaje grande (LLM) como técnica principal. El objetivo es crear representaciones gráficas que permitan identificar las conexiones y temas principales de manera eficiente, simplificando la comprensión del contenido. Para lograr este objetivo, se llevó a cabo una revisión de la literatura para identificar las mejores técnicas de análisis de texto y generación de representaciones jerárquicas. Se decidió optar por el uso de un modelo de lenguaje grande (LLM) debido a su capacidad sobresaliente para procesar grandes volúmenes de texto y capturar relaciones semánticas complejas. Los LLM, entrenados en variados corpus de texto, tienen la capacidad de identificar patrones y extraer conceptos clave con alta precisión, lo que los convierte en una opción ideal para generar mapas mentales detallados y efectivos. En este caso, se implementó un código en Python utilizando el modelo Gemini-1.5-Flash, que, en su versión gratuita disponible en el momento del estudio, permitió realizar múltiples iteraciones para ajustar el modelo y obtener resultados más precisos. Los resultados demostraron que la alternativa propuesta es una herramienta eficaz para la generación de mapas mentales, con un resultado promedio de 88%. La capacidad del modelo para realizar múltiples iteraciones de manera eficiente, utilizando recursos computacionales limitados, abre la posibilidad de explorar otras herramientas de grandes modelos de lenguaje (LLM) y evaluar su desempeño en tareas de análisis cuantitativo de información en otros dominios, como la investigación académica o la ingeniería de software. (Tomado de la fuente)
Texto completo 87 páginas con texto de 99
Leer la tesis completa Ficha en el repositorio
Contenido
- Capítulo introductoriop. 19
- Objetivo generalp. 23
- Objetivos especificosp. 23
- Metodologíap. 23
- Alcances del trabajop. 24
- Marco teóricop. 27
- Mapas mentalesp. 24
- Machine learningp. 16
- 2.2.1 Redes neuronalesp. 30
- Procesamiento de lenguaje naturalp. 31
- Modelos de lenguaje grandep. 32
- 2.4.1 Conceptos importantesp. 32
- 2.4.2 Modelos relevantesp. 33
- Métricasp. 34
- Métricas de similitudp. 35
- 2.6.1 Similitud en la profundidadp. 35
- 2.6.2 Similitud en la ramificaciónp. 36
- 2.6.3 Similitud semánticap. 36
- Revisión de la literaturap. 39
- Preguntas de investigaciónp. 39
- Métodos de revisión bibliográficap. 40
- 3.2.1 Criterios de inclusión y exclusiónp. 40
- 3.2.2 Fuentes de informaciónp. 41
- 3.2.3 Métodos para la disminución de sesgop. 42
- 3.2.4 Métodos de resúmenes de resultadosp. 43
- 3.2.5 Cadena de búsquedap. 44
- 3.2.6 Estudios incluidos y excluidosp. 46
- 3.2.7 Síntesis de los resultadosp. 47
- Discusiónp. 50
- Métodos y procedimientosp. 53
- Caracterización de los modelos más relevantes de la literaturap. 53
- 4.1.1 Mejor modelo para generación automática de mapas mentalesp. 55
- Desarrollo del modelop. 56
- 4.2.1 Conjunto de datosp. 56
- 4.2.2 Elección del modelop. 57
- 4.2.3 Función para limpiar el textop. 60
- 4.2.4 API de Geminip. 60
- 4.2.5 Generación de mapas mentalesp. 62
- 4.2.6 Modelo propuestop. 24
- Metodología proceso de validaciónp. 65
- 4.3.1 Descripción pipeline de validaciónp. 65
- 4.3.2 Métricas de validaciónp. 66
- 4.3.3 Arquitectura de validaciónp. 66
- 4.3.4 Creación del indicador compuestop. 68
- Análisis de resultadosp. 71
- Resultados por métricap. 71
- 5.1.1 Similitud semánticap. 36
- 5.1.2 Similitud en distribución de profundidadp. 74
- 5.1.3 Similitud de ramificaciónp. 77
- Resultados indicador compuestop. 81
- Análisis comparativo entre promptsp. 81
- Discusiónp. 50
- 5.4.1 Comparación con estudios previosp. 83
- 5.4.2 Implicaciones en el áreap. 84
- 5.4.3 Limitacionesp. 53
- Conclusiones y recomendacionesp. 87
- Conclusionesp. 87
- Recomendacionesp. 88
- Bibliografíap. 91
- Número de documentos relacionados a los mapas mentales por añop. 22
- Búsqueda general de “mind map”p. 44
- Búsqueda refinada con términos adicionalesp. 45
- Búsqueda con términos más específicosp. 45
- Búsqueda con el término “AI” incluidop. 46
- Hiperparámetros del modelop. 61
- Arquitectura del modelo propuestop. 64
- Arquitectura del modelo de validaciónp. 67
- (Mapas_Mentales_20250128)p. 73
- (Mapas_Mentales_20250128)p. 73
- profundidad 1.00 (Mapas_Mentales_20250227)p. 76
- profundidad 0.19 (Mapas_Mentales_20250227)p. 77
- (Mapas_Mentales_20241114)p. 79
- (Mapas_Mentales_20241114)p. 79
- Objetivos, actividades e indicadores de logrop. 24
- Síntesis de resultados para revisión de literaturap. 48
- Caracterización de modelos relevantes de literaturap. 53
- Características documentosp. 57
- Características mapas mentalesp. 57
- Comparación ChatGPT vs Gemini vs Llamap. 58
- Similitud semántica por mapa mentales y promptsp. 71
- Similitud de ramificación por mapa mentales y promptsp. 78
- Indicador compuesto por mapa mentales y promptsp. 81
- Resumen del desempeño promedio por prompt y métricap. 82