Sporala red del conocimiento
Fundación Universitaria Konrad Lorenz

Maestría en Analítica Estratégica de Datos · 2026

Optimización de modelos de Question Answering: técnicas de fine-tuning para el análisis del español periodístico en corpus de Colombia y México

Nieto Angarita, Guillermo Luigui UbaldoAsesor: De la Pava Roys, Nasser Stefan

Esta investigación busca optimizar los modelos Question Answering extractivos en español mediante el fine-tuning, con noticias escritas en Colombia y México, señalando la escasez de datos en español para entrenar los modelos BERT. Propone generar automáticamente los pares de preguntas y respuestas, apoyadas en entidades nombradas que se extraen de las noticias. Se limpiaron, normalizaron y estructuraron los datos en el formato SQuAD 2.0 para ser usados en el entrenamiento de BERT y DistilBERT. El análisis de los resultados señala una mejoría en los modelos entrenados en alrededor del 84% en F1 en la evaluación en comparación con los modelos base. Se concluye que el método propuesto funciona adecuadamente para mejorar el rendimiento de los modelos QA extractivos en el lenguaje castellano, constituyéndose en una opción de bajo costo para aumentar las referencias disponibles en este idioma al aportar un conjunto de datos útiles para venideras investigaciones similares.

Texto completo 106 páginas con texto

Leer la tesis completa Ficha en el repositorio

Contenido