Sporala red del conocimiento
Universidad de Antioquia

Especialización en Analítica y Ciencia de Datos · 2026

El mecanismo de atención en LLMs: fundamento, límites y evolución hacia una atención eficiente

Bonilla Cruz, Sebastian

Solo ficha. El repositorio marca este trabajo como «None»: el PDF no es público, así que aquí no hay texto para leer. Ver la ficha en el repositorio.

Resumen

El presente ensayo analiza el mecanismo de atención como principio arquitectónico central de los modelos de lenguaje de gran escala (LLMs). A partir de una revisión bibliográfica que articula los aportes seminales de Bahdanau et al. (2015) y Vaswani et al. (2017) con desarrollos recientes en atención eficiente, se examinan tres niveles del problema: el fundamento matemático del self-attention, incluyendo el origen y rol de las matrices de consultas, claves y valores, la operación softmax( y su 𝑄𝐾 𝑇 𝑑 𝑘 )𝑉 extensión multi-head; la importancia histórica del mecanismo, que al eliminar la dependencia secuencial de las RNN habilitó la paralelización masiva y el escalamiento que dio origen a los LLMs; y sus limitaciones actuales, derivadas de la complejidad cuadrática O(n²) que se vuelve crítica en aplicaciones de contexto largo. El análisis discute las tres familias de respuestas más relevantes —implementaciones IO-eficientes como FlashAttention, atención dispersa y atención lineal—, así como la emergencia de modelos de espacio de estados (Mamba, Mamba-2) que redefinen el problema desde una recurrencia selectiva. Se concluye que la atención no es solo una técnica matemática, sino el componente que reorganizó el procesamiento del lenguaje natural; sin embargo, su eficiencia, interpretabilidad y veracidad seguirán siendo retos centrales para el futuro de los LLMs.

Tesauro de su biblioteca