Especialización en Analítica y Ciencia de Datos · 2026
Construyendo un modelo de lenguaje pequeño paso a paso: una experiencia aplicada a texto en árabe a nivel de carácter
Solo ficha. El repositorio marca este trabajo como «Acceso abierto»: el PDF no es público, así que aquí no hay texto para leer. Ver la ficha en el repositorio.
Resumen
Este trabajo documenta el proceso de construcción de un modelo de lenguaje pequeño (SLM) siguiendo los contenidos del programa AI Research Foundations de Google DeepMind, disponible en Google Cloud Skills Boost. Se trabajó con un dataset de textos cortos en árabe y se implementó el pipeline completo de un proyecto de procesamiento de lenguaje natural: limpieza del texto, tokenización a nivel de carácter, un modelo n-grama como referencia probabilística para la generación de texto, y la preparación de secuencias de entrenamiento con ventanas superpuestas. La implementación se ejecutó en Vertex AI Colab Enterprise sobre un proyecto de Google Cloud. Los resultados evidencian que el dominio de los fundamentos del pipeline —representación de datos, esquema de tokenización y construcción de secuencias— condiciona la calidad del modelo de forma tan determinante como la elección de la arquitectura, y que decisiones de preprocesamiento aparentemente menores tienen consecuencias directas sobre la reproducibilidad y la seguridad del sistema final.