Maestrías de la Facultad de Ingeniería · 2022
Modelo de clasificación de incidentes tecnológicos para una empresa aseguradora desde un enfoque machine learning
RESUMEN : La clasificación de tales incidentes por humanos demanda tiempo y conocimiento y, con frecuencia, se ejecuta de manera errónea. Este documento aborda este problema de clasificación desde un enfoque de aprendizaje automático. Se compara el desempeño de cinco métodos de aprendizaje supervisado (regresión logística, árboles de clasificación, bosque aleatorio, análisis lineal discriminante y máquinas de vectores de apoyo) en tres escenarios de inclusión de predictores: estructurado, textos y ambos. El uso de variables no estructuradas mejora considerablemente la exactitud de los modelos (ej., Random Forest, muestra de validación: 0,709 con datos estructurados; 0,881 con datos de texto). Además, considerando las implicaciones prácticas de la tasa de clasificación humana correcta (66%) frente a la máquina (88%, Random Forest, SVM o regresión logística), la máquina favorece el ahorro de recursos en la organización. Este artículo es un caso exitoso del aprendizaje automático en la industria de seguros.
Texto completo 94 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 10
- Planteamiento del problemap. 12
- Descripción del contextop. 12
- Definición del problemap. 13
- Objetivosp. 15
- 2.3.1 Objetivo generalp. 15
- 2.3.2 Objetivos específicosp. 15
- Preguntas de investigaciónp. 16
- Justificación e importanciap. 17
- Marco conceptualp. 20
- Definición de incidentep. 20
- Proceso de gestión de incidentesp. 21
- Características de un incidentep. 23
- Machine learningp. 24
- Uso de los términos Agrupación/clasificaciónp. 25
- Ingeniería de característicasp. 26
- desde un enfoque de aprendizaje automáticop. 27
- procedimiento y recomendaciones para su aplicaciónp. 35
- 4.1.1 Regresión logísticap. 33
- 4.1.2 Árboles de clasificaciónp. 38
- 4.1.3 Random forestp. 33
- 4.1.4 LDAp. 42
- 4.1.5 SVMp. 44
- Profundización en el sector del problema de incidentes tecnológicosp. 47
- Modelo de investigaciónp. 52
- Metodologíap. 54
- Recolección y limpieza de datosp. 54
- 6.1.1 Limpieza y tratamiento de datosp. 56
- Análisis univariadop. 59
- 6.2.1 Variables numéricasp. 59
- 6.2.2 Variables categóricasp. 60
- Entrenamiento de los métodos por comparar usando Rp. 65
- Resultadosp. 68
- más importantes seleccionadas y los cinco métodos de aprendizaje supervisadop. 69
- 7.1.1 Análisis de sensibilidad selección de parámetros random forestp. 71
- 7.1.2 Variación parámetro ntree método Random Forestp. 72
- 7.1.3 Variación parámetro mtry método Random Forestp. 73
- texto) y los cinco métodos de aprendizaje supervisadop. 74
- 7.2.1 Minería de textop. 75
- no estructuradasp. 78
- 7.3.1 Variación parámetro ntree método Random Forestp. 72
- 7.3.2 Variación parámetro mtry método Random Forestp. 73
- humano (eficacia y eficiencia)p. 81
- Discusiónp. 84
- Conclusionesp. 87
- Trabajos futurosp. 89
- Referencias bibliográficasp. 90
- Tabla 1. Dominio y objetivo principal del estudiop. 28
- Tabla 2. Atributo del modelop. 29
- Tabla 3. Variable a predecirp. 29
- revisadosp. 33
- Tabla 5. Matriz de confusiónp. 35
- Tabla 6. Resumen métodos de entrenamiento supervisadop. 46
- Tabla 7. Distribución de software por grupo solucionadorp. 49
- cierra o solucionap. 51
- Tabla 9. Diccionario de variablesp. 55
- Tabla 10. Resumen estadísticop. 59
- Tabla 11. Frecuencia de reporte por tipo de víap. 60
- Tabla 12. Frecuencia de reporte por ciudad/zonap. 61
- Tabla 13. Frecuencia tipo de sede origen de reportep. 61
- Tabla 14. Reporte por gerenciap. 62
- Tabla 15. Frecuencia tipo de falla reportadap. 63
- Tabla 16. Reporte por día de la semanap. 63
- Tabla 17. Reportes por semestrep. 64
- Tabla 18. Reporte por equipo solucionadorp. 64
- Tabla 19. Parámetros de los métodos a compararp. 67
- Tabla 20. Variables relevantes para cada modelop. 69
- Tabla 21. Métricas matriz de confusión comparación métodosp. 71
- Tabla 22. Precisión para variaciones de ntree y grafico asociadop. 72
- Tabla 23. Precisión para variaciones de mtry y gráfico asociadop. 73
- estructuradasp. 76
- Tabla 25. Variaciones de número de palabras incluidas en el modelop. 77
- especificidad para un modelo combinado de variables estructuradas y no estructuradasp. 78
- gráfico asociadop. 79
- Tabla 28. Precisión para variaciones de mtryp. 80
- Tabla 29. Eficiencia humano-máquinap. 83
- Tabla 30. Sensibilidad y especificidad humano-máquinap. 84
- Tabla 31. Comparativa escenarios entrenados con random forestp. 85
- Figura 1. Tomado de la ITILp. 21
- variable solucionador, bajo una comparativa entre cinco métodos de aprendizaje automáticop. 52
- Figura 3. Sigmoide regresión logísticap. 37
- Figura 4. Hiperplano de separaciónp. 45
- Figura 5. Histograma de frecuencias variable fecha.cierrep. 59
- Figura 6. Resultados de precisión comparativa con variables estructuradasp. 70