Especialización en Analítica y Ciencia de Datos · 2026
El mecanismo de atención en LLMs: fundamento, límites y evolución hacia una atención eficiente
Solo ficha. El repositorio marca este trabajo como «None»: el PDF no es público, así que aquí no hay texto para leer. Ver la ficha en el repositorio.
Resumen
El presente ensayo analiza el mecanismo de atención como principio arquitectónico central de los modelos de lenguaje de gran escala (LLMs). A partir de una revisión bibliográfica que articula los aportes seminales de Bahdanau et al. (2015) y Vaswani et al. (2017) con desarrollos recientes en atención eficiente, se examinan tres niveles del problema: el fundamento matemático del self-attention, incluyendo el origen y rol de las matrices de consultas, claves y valores, la operación softmax( y su 𝑄𝐾 𝑇 𝑑 𝑘 )𝑉 extensión multi-head; la importancia histórica del mecanismo, que al eliminar la dependencia secuencial de las RNN habilitó la paralelización masiva y el escalamiento que dio origen a los LLMs; y sus limitaciones actuales, derivadas de la complejidad cuadrática O(n²) que se vuelve crítica en aplicaciones de contexto largo. El análisis discute las tres familias de respuestas más relevantes —implementaciones IO-eficientes como FlashAttention, atención dispersa y atención lineal—, así como la emergencia de modelos de espacio de estados (Mamba, Mamba-2) que redefinen el problema desde una recurrencia selectiva. Se concluye que la atención no es solo una técnica matemática, sino el componente que reorganizó el procesamiento del lenguaje natural; sin embargo, su eficiencia, interpretabilidad y veracidad seguirán siendo retos centrales para el futuro de los LLMs.