Especialización en Analítica y Ciencia de Datos · 2026
Soberanía tecnológica y tokenización: el sesgo del norte global en los LLMs modernos
El procesamiento de información a escala global se ha transformado gracias a los Modelos de Lenguaje Extensos (LLMs), estos se establecen desde la arquitectura Transformer y sus mecanismos de atención. Empero, existe poca neutralidad dentro de este avance puesto que los datos de entrenamiento de estos modelos reflejan una predominancia de las perspectivas del Norte Global. Este aspecto genera un borramiento digital de las culturas, lenguas y saberes de regiones como América Latina. Este informe, analiza las posibilidades de acción frente a dicho sesgo a partir del curso Google DeepMind: AI Research Foundations, articulando sus contenidos técnicos con un marco teórico crítico en torno a tres categorías: los LLMs, la tokenización y la soberanía tecnológica. Metodológicamente, se adopta un enfoque cualitativo, descriptivo-analítico, desarrollado en tres fases: análisis sistemático del curso, revisión documental especializada y triangulación crítica módulo por módulo. Aquí se evidencia que el sesgo algorítmico opera desde las capas más fundamentales del entrenamiento —tokenización, embeddings, backpropagation— y que técnicas como el ajuste fino supervisado (SFT), LoRA y el aprendizaje por refuerzo con retroalimentación humana (RLHF) situado representan vías viables hacia una soberanía tecnológica contextualizada. De esta manera, se reflexiona ante la posibilidad de cerrar la brecha entre los LLMs modernos y las comunidades por fuera del norte global requiere gobernanza democrática, curaduría ética de datos y participación colectiva en el diseño de los modelos.