Maestría en Analítica Estratégica de Datos · 2026
Optimización de modelos de Question Answering: técnicas de fine-tuning para el análisis del español periodístico en corpus de Colombia y México
Esta investigación busca optimizar los modelos Question Answering extractivos en español mediante el fine-tuning, con noticias escritas en Colombia y México, señalando la escasez de datos en español para entrenar los modelos BERT. Propone generar automáticamente los pares de preguntas y respuestas, apoyadas en entidades nombradas que se extraen de las noticias. Se limpiaron, normalizaron y estructuraron los datos en el formato SQuAD 2.0 para ser usados en el entrenamiento de BERT y DistilBERT. El análisis de los resultados señala una mejoría en los modelos entrenados en alrededor del 84% en F1 en la evaluación en comparación con los modelos base. Se concluye que el método propuesto funciona adecuadamente para mejorar el rendimiento de los modelos QA extractivos en el lenguaje castellano, constituyéndose en una opción de bajo costo para aumentar las referencias disponibles en este idioma al aportar un conjunto de datos útiles para venideras investigaciones similares.
Texto completo 106 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 7
- Introducciónp. 8
- Planteamiento del problemap. 9
- Descripción del problema de investigaciónp. 9
- Contextop. 9
- Problema de investigaciónp. 10
- Planteamiento del problemap. 9
- Pregunta de investigaciónp. 12
- Hipótesisp. 12
- Objetivosp. 12
- Objetivo generalp. 12
- Objetivos específicosp. 12
- Justificaciónp. 13
- Marco teóricop. 14
- Estado del Artep. 14
- Antecedentes teóricosp. 21
- Procesamiento del lenguaje naturalp. 19
- Aprendizaje profundo (Deep Learning)p. 22
- Los transformadoresp. 24
- from Transformers)p. 29
- Los modelos de familia BERT en españolp. 35
- Técnicas de Reconocimiento de entidades nombradas (NER)p. 36
- Question Answeringp. 17
- Fine-tuningp. 43
- Las métricasp. 45
- Metodología empleadap. 47
- Tipo de investigaciónp. 47
- CRISP-DMp. 47
- Consideraciones éticasp. 49
- Comprensión de los datosp. 49
- Propósito de la fasep. 50
- Objetivos operativos de la comprensión de los datosp. 50
- Recolección de los datos de todas las fuentesp. 50
- Preprocesamiento de los datosp. 51
- Descripción de los datosp. 60
- Exploración de los datosp. 62
- escrita y tipo de secciónp. 62
- Variedades lingüísticas y léxicasp. 69
- Reconocimiento de entidadesp. 77
- Preparación de los datosp. 82
- Limpieza del textop. 83
- Extracción de entidades nombradasp. 83
- Filtrado de entidades irrelevantesp. 83
- Estructuración final del conjunto de datos:p. 84
- Generación automática de pares de preguntas y respuestasp. 84
- Modeladop. 87
- Evaluaciónp. 86
- Limitaciones en esta investigaciónp. 98
- Conclusionesp. 99
- Referenciasp. 100
- Figura 1p. 22
- Figura 2p. 23
- Figura 3p. 25
- Figura 4p. 30
- Figura 5p. 31
- Figura 6p. 36
- Figura 7p. 40
- Figura 8p. 41
- Figura 9p. 45
- Figura 10p. 52
- Figura 11p. 62
- Figura 12p. 63
- Figura 13p. 64
- Figura 14p. 65
- Figura 15p. 66
- Figura 16p. 68
- Figura 17p. 69
- Figura 18p. 70
- Figura 19p. 70
- Figura 20p. 72
- Figura 21p. 72
- Figura 22p. 73
- Figura 23p. 74
- Figura 24p. 75
- Figura 25p. 76
- Figura 26p. 77
- Figura 27p. 78
- Figura 28p. 79
- Figura 29p. 80
- Figura 30p. 81
- Figura 31p. 82
- Figura 32p. 84
- Tabla 1p. 14
- Tabla 2p. 56
- Tabla 3p. 56
- Tabla 4p. 57
- Tabla 5p. 58
- Tabla 6p. 58
- Tabla 7p. 59
- Tabla 8p. 60
- Tabla 9p. 60
- Tabla 10p. 88
- Tabla 11p. 89
- Tabla 12p. 90
- Tabla 13p. 91
- Tabla 14p. 91
- Tabla 15p. 93
- Tabla 16p. 94
- Tabla 17p. 95
- Tabla 18p. 96