Bogotá - Ingeniería - Maestría en Ingeniería - Ingeniería de Sistemas y Computación · 2025
Implementación de un sistema de monitorización y detección inteligente de anomalías en métricas de servidores mediante modelos de machine learning
La administración de infraestructuras de servidores, especialmente a gran escala, representa un desafío constante para las organizaciones debido a la necesidad de garantizar alta disponibilidad y continuidad operativa. Las fallas por uso sostenido del hardware, consumo excesivo de recursos y herramientas de monitoreo ineficientes impactan directamente en la calidad del servicio. Este trabajo tiene como objetivo implementar un modelo de observabilidad para entornos on-premise que permita recopilar métricas críticas de los servidores y generar alertas en tiempo real mediante el uso de tecnologías existentes. Además, se incorpora una capa de aprendizaje automático para la detección de patrones anómalos, lo cual contribuye a la prevención proactiva de fallos. La solución propuesta busca resolver los problemas derivados de arquitecturas de monitoreo fragmentadas y poco integradas, como las evidenciadas en un caso real con un cliente de la cartera de la empresa donde se desarrolló esta práctica profesional. Para ello, se seleccionaron herramientas de monitoreo compatibles con bases de datos de series de tiempo, se entrenaron modelos de Machine Learning, y se evaluó su desempeño mediante criterios como precisión visual, tiempos de ejecución y escalabilidad. Modelos como DBSCAN e Isolation Forest demostraron ser adecuados y complementarios, destacándose según el tipo de métrica evaluada y las necesidades operativas del entorno, constituyendo una solución adaptable y confiable para el monitoreo y la gestión de infraestructuras tecnológicas complejas. (Texto tomado de la fuente)
Texto completo 131 páginas con texto de 135
Leer la tesis completa Ficha en el repositorio
Contenido
- Agradecimientosp. 7
- Resumenp. 9
- Abstractp. 10
- Lista de figurasp. 16
- Lista de tablasp. 17
- Introducciónp. 19
- Marco conceptualp. 21
- herramientas de monitoreo y alertas en tiempo realp. 22
- sistemas críticosp. 26
- Conceptos fundamentales de detección de anomalíasp. 26
- Retos en la detección de anomalíasp. 27
- Enfoques de aprendizaje de máquina para detección de anomalíasp. 28
- Bases de datos de series de tiempo para almacenamiento de métricasp. 31
- Herramientas popularesp. 32
- Premisep. 33
- Desarrollo metodológicop. 33
- Implementaciónp. 34
- Resultados obtenidosp. 35
- Conclusionesp. 36
- Resumen del capítulop. 37
- 4.1 Desarrollo metodológicop. 33
- 4.2 Implementación técnicap. 38
- 4.3 Definición de métricasp. 40
- 4.4 Instalación, configuración y visualización del sistema de monitoreop. 41
- 4.5 Resultados obtenidosp. 35
- 4.6 Conclusionesp. 36
- 4.7 Resumen del capítulop. 37
- infraestructura On-Premisep. 53
- 5.1 Enfoque metodológicop. 53
- 5.2 Recolección y estructuración de datos históricosp. 55
- 5.3 Preprocesamiento y enriquecimiento de datosp. 56
- 5.4 Modelos de detección de anomalías aplicadosp. 57
- 5.5 Visualización y análisis cualitativop. 60
- 5.6 Conclusionesp. 36
- 5.7 Resumen del capítulop. 37
- Evaluación del desempeño de los modelos de detección de anomalíasp. 68
- 6.1 Limitaciones de evaluación tradicionalp. 68
- 6.2 Tiempos de ejecución y consideraciones de escalabilidadp. 68
- 6.3 Conclusionesp. 36
- Conclusionesp. 36
- 7.1 Cumplimiento de los objetivos específicos y del objetivo generalp. 73
- 7.2 Reflexión sobre los modelos aplicados: elección, comportamiento y escalabilidadp. 74
- proyección futurap. 74
- Próximos pasosp. 75
- Bibliografíap. 77
- Anexosp. 80
- Servidor1p. 80
- 7.1.1 Label Spreadingp. 59
- 7.1.2 DBSCANp. 61
- 7.1.3 Isolation Forestp. 57
- Servidor 2p. 96
- 7.2.1 DBSCANp. 61
- 7.2.2 Isolation Forestp. 57
- Servidor 3p. 107
- 7.3.1 DBSCANp. 61
- 7.3.2 Isolation Forestp. 57
- Servidor 4p. 115
- 7.4.1 DBSCANp. 61
- 7.4.2 Isolation Forestp. 57
- Servidor 5p. 127
- 7.5.1 DBSCANp. 61
- 7.5.1 Isolation Forestp. 57
- Reproducido con permisop. 21
- Ilustración 2 - Arquitectura Linux de la soluciónp. 39
- Ilustración 3 - Arquitectura Windows de la soluciónp. 39
- Ilustración 4 - Alertamiento por correo (información confidencial ofuscada)p. 43
- Ilustración 7 - Tablero Grafana S.O. Linux (información confidencial ofuscada)p. 48
- Ilustración 8 - Tablero Grafana orientado al rol SREp. 49
- Ilustración 9 - Alertamiento por Grafanap. 49
- Ilustración 10 - Código extraído del modelo Isolation Forestp. 57
- Ilustración 11 - Código extraído del modelo DBScanp. 58
- Ilustración 12 - Código extraído del modelo Label Spreadingp. 59
- Ilustración 13 – Servidor 1 - DBSCAN - plot_disk _usage.pngp. 62
- Ilustración 14- Servidor1 - DBSCAN - plot_total_processes.pngp. 63
- Ilustración 15 - Servidor1 - IsolationForest - plot_disk_usage_percent_C.pngp. 63
- Ilustración 16 - Servidor1 - IsolationForest - plot_disk_usage_percent_E.pngp. 64
- plot_disk_usage_percent_HarddiskVolume1.pngp. 64
- Ilustración 18 - Servidor2 - DBSCAN - plot_cpu_queue_length.pngp. 65
- Ilustración 19 - Servidor4 - IsolationForest - plot_system_threads.pngp. 65
- anomalías. Adaptado de Bablu (2023)p. 27
- Tabla 2 - Comportamiento de los modelos por servidor de análisis visualp. 61
- Tabla 3 - Tiempos de ejecucion promedio por modelop. 69