Sporala red del conocimiento
Universidad El Bosque

Maestría Estadística Aplicada y Ciencia de Datos · 2026

Un clasificador interpretable basado en LLM para artículos de investigación sobre el Conocimiento Especializado del Profesor de Matemáticas

Rojas Celis, Carolina · Elorreaga Rodríguez, Luz MaricelAsesor: Hortúa, Héctor Javier

Solo ficha. El repositorio marca este trabajo como «None»: el PDF no es público, así que aquí no hay texto para leer. Ver la ficha en el repositorio.

Resumen

Ante la ausencia de herramientas automatizadas para organizar el creciente corpus trilingüe sobre el Conocimiento Especializado del Profesor de Matemáticas (MTSK, por sus siglas en inglés), este estudio aprovecha los modelos de lenguaje de gran escala (LLM) mediante fine-tuning para generar un nuevo modelo de lenguaje especializado en el dominio, diseñado específicamente para la literatura de investigación en MTSK. Entre tres arquitecturas evaluadas, intfloat/multilingual-e5-large demostró ser la óptima para capturar los matices conceptuales de un corpus que abarca español, inglés y portugués. Ajustado (fine-tuned) sobre documentos etiquetados por expertos, el modelo alcanzó un macro F1-score de 0.7776 y una exactitud de 0.7966, con una variación en el desempeño que refleja el solapamiento semántico intrínseco de la taxonomía MTSK. El análisis de interpretabilidad basado en SHAP identificó los rasgos léxicos más influyentes en las decisiones de clasificación, confirmando su alineación con marcadores teóricamente válidos y revelando la principal fuente de ambigüedad de clasificación en la frontera entre dos categorías específicas. El refinamiento iterativo de prompts sobre DeepSeek-V3, evaluado bajo condiciones simétricas, alcanzó un macro F1 de 0.9490, con un patrón de error cualitativamente distinto y más concentrado. El agrupamiento no supervisado mediante HDBSCAN confirmó la mayor cohesión semántica para dos categorías, mientras que otras exhibieron fronteras difusas, consistentes con los hallazgos de interpretabilidad. Este trabajo constituye el primer enfoque computacional para la clasificación automática de literatura de investigación en MTSK, proporcionando a la comunidad APIs de acceso abierto para la organización sistemática de un corpus multilingüe en rápido crecimiento.

Palabras clave