Ingeniería Industrial · 2025
Análisis de Logs de las APIs de TABi Connect usando Machine Learning: Optimización del proceso de monitoreo de APIs de TABi connect en el proceso automático de cotización de cargas usando Inteligencia Artificial. Semestre de industria
RESUMEN : Este proyecto hecho en TABi Connect tiene como objetivo desarrollar un sistema de análisis de logs de APIs utilizando Inteligencia Artificial con el fin de optimizar el monitoreo y la identificación de problemas en su proceso de cotización automática de cargas. El proyecto siguió un enfoque cuantitativo, aplicando la metodología CRISP-DM en cuatro etapas: comprensión del problema, preparación de datos, modelamiento y evaluación de resultados. Se implementó un pipeline de datos que extrae, transforma, carga y limpia los logs desde Amazon CloudWatch utilizando Python. Posteriormente, se ajustaron y evaluaron modelos de Machine Learning no supervisados, como DBSCAN y Latent Dirichlet Allocation (LDA), para identificar patrones y categorizar errores. Los resultados muestran que el modelo LDA clasificó los errores en cuatro temas principales: validación de datos, excepciones internas, errores de servidor y solicitudes externas, con un impacto significativo en la priorización de problemas. Por otro lado, aunque el modelo DBSCAN mostró un buen rendimiento en las métricas Silhouette y Calinski-Harabasz, sus patrones no fueron completamente interpretables desde el punto de vista del negocio. Las implicaciones prácticas incluyen la reducción del tiempo y recursos humanos requeridos para las tareas de monitoreo de las APIs. Además, la jerarquización de errores permite abordar problemas críticos en etapas iniciales, reduciendo así su propagación. Finalmente, se destaca la necesidad de seguir explorando técnicas avanzadas de Machine Learning y Deep Learning para manejar el creciente volumen de datos y mejorar aún más la eficiencia del sistema con patrones más robustos.
Texto completo 50 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 8
- Abstractp. 9
- 1. Introducciónp. 10
- 2. Objetivosp. 12
- 2.1 Objetivo generalp. 12
- 2.2 Objetivos específicosp. 12
- 3. Marco teóricop. 13
- 4. Metodologíap. 18
- 5. Análisis de resultadosp. 19
- 5.1. Comprensión del proceso y la importancia de los logs y las APIsp. 19
- 5.1.1. Problemap. 19
- 5.1.2. Proceso de monitoreo actualp. 19
- 5.1.3. Diseño de soluciónp. 19
- 5.2. Implementación de pipeline de datosp. 20
- 5.2.1. Extracción de datosp. 20
- 5.2.2. Limpieza y procesamientop. 20
- 5.2.3. Análisis exploratoriop. 22
- 5.3. Ajuste de modelo no supervisadop. 26
- 5.3.1. LDAp. 7
- 5.3.1.1. 1-gramsp. 27
- 5.3.1.2. N-gramsp. 32
- 5.3.2. Clusteringp. 34
- 5.3.2.1. DBSCANp. 35
- 5.3.2.1.1. Bag of Wordsp. 7
- 5.3.2.1.2. TF-IDFp. 7
- 5.3.2.1.3. Word2Vecp. 39
- 5.4. Análisis y evaluación del modelop. 40
- 5.4.1. DBSCANp. 35
- 5.4.2. LDAp. 7
- 6. Conclusiones y recomendacionesp. 46
- Referenciasp. 48
- Tabla 1. Estructura de los logs parseadosp. 21
- Tabla 2. Frecuencias logs documentsp. 24
- Tabla 3. Validación cruzada para n-gramas - Perplexityp. 32
- Tabla 4. Validación cruzada - Bag of Wordsp. 35
- Tabla 5. Validación cruzada - TF-IDFp. 37
- Tabla 6. Validación cruzada - Word2Vecp. 39
- Tabla 7. Resultado métricas para Clusteringp. 41
- Tabla 8. Representación de temasp. 44
- Figura 1. Estructura de los logs en JSONp. 21
- Figura 2. Distribución Tipo y Apip. 22
- Figura 3. Distribución Status codep. 23
- Figura 4. Distribución Detail y Domainp. 23
- Figura 5. Distribución logs documentsp. 24
- Figura 6. Nube de palabras con Bag of Wordsp. 25
- Figura 7. Nube de palabras con tf-idfp. 26
- Figura 8. Validación cruzada - Perplexityp. 28
- Figura 9. Distribución de temas LDA – Mejores parámetros según la Perplexityp. 29
- Figura 10. Top 10 palabras LDA - Mejores parámetros según la Perplexityp. 29
- Figura 11. Validación cruzada - Coherencep. 30
- Figura 12. Distribución de temas LDA – Mejores parámetros según la Coherencep. 31
- Figura 13. Top 10 palabras LDA - Mejores parámetros según la Coherencep. 31
- Figura 14. Distribución de temas LDA – Mejor segmentación según evaluación manualp. 33
- Figura 15. Top 20 palabras LDA - Mejor segmentación según evaluación manualp. 34
- Figura 16. Distribución de logs - Bag of Wordsp. 35
- Figura 17. Resultado de clusters - Bag of Wordsp. 36
- Figura 18. Distribución de logs - TF-IDFp. 37
- Figura 19. Resultado de clusters - TF-IDFp. 38
- Figura 20. Distribución de logs - Word2Vecp. 39
- Figura 21. Resultado de clusters - Word2Vecp. 40
- Figura 22. Resultados LDA - PyLDAvisp. 42
- Figura 23. Resultados LDA – Términos más relevantes por temap. 42