Ingeniería de Sistemas · 2026
Evaluación comparativa de agentes de inteligencia artificial en la resolución de vulnerabilidades de seguridad en entornos de integración continua
Esta investigación evaluó la viabilidad de integrar Agentes Autónomos basados en Modelos de Lenguaje Extensos (LLMs) como apoyo en arquitecturas de software complejas. El objetivo principal fue superar la evaluación tradicional basada en generación de código aislado, midiendo la capacidad de la Inteligencia Artificial moderna para mitigar vulnerabilidades reales sin introducir regresiones funcionales que afecten el ciclo de Integración Continua y Despliegue Continuo (CI/CD). La metodología empleó la aplicación web OWASP Juice Shop como entorno vulnerable, interconectado y de alta complejidad, comparando el desempeño de tres modelos de vanguardia disponibles en GitHub Copilot: Gemini 3.1 Pro, Claude Opus 4.6 y GPT-5.4. Los resultados evidenciaron una eficacia del 100 % en la tarea aislada de corrección de una vulnerabilidad de inyección SQL, sin generación de regresiones funcionales en los escenarios verificados. Ante la subsecuente petición de una auditoría masiva, los modelos evidenciaron conciencia contextual al activar filtros éticos reconociendo el repositorio, estableciendo marcadores no antes vistos en competencia contextual de los modelos de lenguaje de generaciones anteriores. Se concluye que los agentes evaluados han superado la asistencia en tareas puntuales y muestran potencial para apoyar procesos de mantenimiento, ciberseguridad y validación en entornos de software complejos. No obstante, su adopción en flujos CI/CD requiere mecanismos rigurosos de trazabilidad, validación automatizada y control de cambios, especialmente por la posible contaminación de datos de entrenamiento asociada al uso de repositorios públicos.