Maestría en Analítica Estratégica de Datos · 2026
Optimización de estimaciones de puntos de historia en proyectos de software agiles mediante técnicas de análisis de datos
En la gestión de proyectos de software ágiles, la imprecisión al estimar el esfuerzo conduce a sobrecostos, retrasos y, en ocasiones, la cancelación de proyectos. Este proyecto implementa y extiende el método LHC-SE (Latent-semantic Hierarchical Clustering for Software Effort estimation) mediante técnicas de procesamiento de lenguaje natural, siguiendo la metodología CRISP-DM. Se desarrollaron cuatro variantes: LHC-TC-SE (baseline con LDA), LHC-TC-TF-IDF-SE, LHC-TC-W2V-SE y LHC-TC-BERTopic-SE, evaluadas sobre la base de datos TAWOS con 16,615 issues de 23 proyectos open-source. Los experimentos revelan que LHC-TC-BERTopic-SE alcanza el mejor desempeño general con MAE de 1.957 puntos de historia, superando al baseline en 0.018 puntos, mientras que TF-IDF logra el mejor desempeño individual con MAE de 1.975. El análisis estadístico mediante pruebas de Wilcoxon con corrección de Bonferroni valida que BERTopic y TF-IDF son superiores a Word2Vec y LDA. El 69.6% de los proyectos alcanza MAE ≤ 2.0, demostrando aplicabilidad práctica en contextos ágiles reales.
Texto completo 179 páginas con texto de 180
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 9
- Resumenp. 10
- Planteamiento del problemap. 11
- Descripción del problema de investigaciónp. 11
- Antecedentesp. 12
- Pregunta de investigaciónp. 13
- Hipótesisp. 13
- Justificaciónp. 14
- Marco de referenciap. 15
- Marco teóricop. 15
- Desarrollo ágil de softwarep. 15
- Estimación de esfuerzo en softwarep. 22
- Puntos de historia (Story Points)p. 23
- Técnicas tradicionales de estimaciónp. 24
- Desafíos en la estimaciónp. 27
- Fundamentos de Machine Learning (Aprendizaje Automatico)p. 30
- Procesamiento de lenguaje natural (NLP)p. 46
- Técnicas de clusteringp. 59
- Estado del artep. 66
- Objetivosp. 73
- Objetivo generalp. 73
- Objetivos específicosp. 73
- Metodologíap. 74
- Tipo, alcance y diseño de la investigaciónp. 74
- Comprensión del negociop. 76
- Contexto del proyectop. 76
- Plan del proyectop. 77
- Comprensión de los datosp. 80
- Definición conceptual y operacional de variablesp. 82
- Población estadística y estrategia de muestreop. 84
- Identificación y análisis de sesgos del conjunto de datosp. 89
- Análisis de puntos de historia por proyectop. 92
- Análisis Exploratorio del Corpusp. 95
- Preparación de los datosp. 99
- Limpieza y preprocesamiento de textop. 99
- Formateo y almacenamiento de datosp. 101
- Modeladop. 101
- Replicación del Método Base: LHC-SEp. 101
- Iteración 1: Variantes con Representaciones Semánticasp. 77
- Iteración 2: Variante con BERTopicp. 78
- Evaluaciónp. 144
- Consolidación de resultadosp. 144
- Análisis estadístico de significanciap. 150
- Visualización comparativa de resultadosp. 154
- Validación de hipótesis de investigaciónp. 156
- Consideraciones éticasp. 166
- Conclusionesp. 171
- Referenciasp. 177
- Anexosp. 180
- Tabla 1 Factores de fracaso de los proyectos de TI - CHAOS Reportp. 13
- Tabla 2 Diferencias entre metodologías agiles y tradicionales en desarrollo de softwarep. 18
- Tabla 3 Conjuntos de datos más usados para la estimación del esfuerzo de softwarep. 70
- Tabla 4 Estadísticas de puntos de historia por proyectop. 92
- Tabla 5 Métricas de evaluaciónp. 107
- Tabla 6 Métricas promedio por variante (promedio ± desviación estándar)p. 109
- Tabla 7 Mejora porcentual entre variantesp. 111
- Tabla 8 Distribución de los valores de MAE obtenidos en los proyectos evaluadosp. 112
- Tabla 9 Comparación Global - con MAE, MdAE, RMSEp. 113
- Tabla 10 Distribución de proyectos por categoría de rendimientop. 114
- Tabla 11 Distribución de victorias por variantep. 116
- Tabla 12 Diferencias implementación BERTopic respecto a LDAp. 132
- Tabla 13 Comparación Global de Variantes (Iteración 1 vs 2)p. 134
- Tabla 14 Comparación BERTopic vs mejor método previo de la Iteración 1 (MAE)p. 136
- Tabla 15 Comparación global de variantesp. 145
- Tabla 16 Distribución de victorias por variantep. 146
- Tabla 17 Top 10 proyectos (menor MAE)p. 149
- Tabla 18 Análisis estadístico de comparacionesp. 152
- Tabla 19 Comparación de precisión de variantes según MAEp. 157
- Tabla 20 Desempeño de técnicas de representación textual en la estimación (MAE)p. 159
- Tabla 21 Desempeño de embeddings vs. TF-IDF en la estimación (MAE)p. 162
- Tabla 22 Modelado de tópicos: clustering automático vs. K fijo (MAE)p. 164
- Figura 1 Planning onionp. 19
- Figura 2 Proceso estimación planning pokerp. 25
- Figura 3 Estimación mediante juicio de expertosp. 26
- Figura 4 Proceso estimación por analogíap. 27
- Figura 5 Preprocesamiento de texto NLPp. 49
- Figura 6 Arquitectura Transformerp. 53
- Figura 7 LDA: Latent Dirichlet Allocationp. 57
- Figura 8 Clustering jerárquico vs. particionalp. 60
- Figura 9 Método del codo para determinar el número óptimo de clustersp. 62
- Figura 10 Evaluación del coeficiente de silueta para distintos valores de kp. 62
- Figura 11 Clustering jerárquicop. 63
- Figura 12 K-Meansp. 64
- Figura 13 DBSCAN clustering, utilizando dos radios de vecindad diferentesp. 66
- Figura 14 Ciclo de vida - CRISP-DMp. 75
- Figura 15 Cronograma detallado del proyecto (6 meses)p. 79
- Figura 16 Diagrama Entidad Relación, Base Tawosp. 80
- Figura 17 Estadísticas generales del corpusp. 95
- Figura 18 Distribución de frecuencias de palabrasp. 96
- Figura 19 Nube de palabrasp. 97
- Figura 20 Categorización de los textos por longitudp. 98
- Figura 21 Análisis de complejidad y legibilidadp. 99
- Figura 22 Pipeline LHC-TC-TFIDF-SEp. 106
- Figura 23 Comparación de las Tres Métricas por Variantep. 110
- Figura 24 Distribución MAE por variablep. 112
- Figura 25 Mejora porcentual de representaciones semánticas vs línea basep. 117
- Figura 26 Flujo implementación LHC-TC-BERTopic-SEp. 126
- Figura 27 Comparación de variantes: Iteración 1 vs iteración 2p. 135
- Figura 28 Rendimiento de métodos por tamaño de proyectop. 140
- Figura 29 Distribución de vitorias por variantep. 149
- Figura 30 Distribución de diferencias emparejadasp. 153
- Figura 31 Distribución de Métricas de Error por Variantep. 154
- Figura 32 Comparación MAE BERTopic vs TF-IDFp. 155