Especializaciones de la Facultad de Ingeniería · 2021
Modelos de aprendizaje supervisado para predecir la cantidad de pasajeros que saldrán de la Terminal de Transporte Norte de Medellín a otras regiones de País
RESUMEN : El proyecto pretende a partir del análisis de datos, predecir la cantidad de pasajeros que se saldrán de la Terminal de Transporte Norte de Medellín en determinada fecha, empleando diferentes modelos de machine learning como LinearRegression, RandomForestRegressor, KNeighborsRegressor, los cuales basan sus predicciones , en dadas unas variables etiquetadas de entrada(predictoras) predecir un número para realizar este análisis predictivo.
Texto completo 44 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Dedicatoriap. 3
- Agradecimientosp. 3
- Listas de tablasp. 6
- Listas de Figurasp. 7
- Resumen ejecutivop. 8
- Descripción del problemap. 9
- 2.1 Problema de negociop. 9
- 2.3 Origen de los datosp. 11
- 2.4 Métricas de desempeñop. 11
- Datosp. 12
- 3.1 Datos originalesp. 12
- 3.2 Datasetp. 13
- 3.2.1 Exploración de los datosp. 16
- 3.3 Descriptivap. 17
- 3.3.1 Descriptiva datos después reactivación económicap. 22
- 4.Proceso de analíticap. 28
- 4.1 Preprocesamientop. 29
- 4.1.2 Preprocesamiento para primera iteraciónp. 29
- 4.1.3 Preprocesamiento para segunda iteraciónp. 30
- 4.1.4 Preprocesamiento para tercera iteraciónp. 30
- 4.1.5 Transformación de los datos para todas las iteracionesp. 31
- 4.2 Modelosp. 8
- Regresión Linealp. 31
- Bosques Aleatorios (RandomForestRegressor)p. 32
- K vecinos más cercanos regresión (KNNeighborsRegressor)p. 32
- 4.3 Métricasp. 32
- 5.Metodologíap. 33
- 5.1 Baselinep. 33
- 5.2 Validaciónp. 33
- 5.3 Iteraciones y Evoluciónp. 34
- 5.3.1 Iteración Baselinep. 34
- 5.3.2 Primera iteraciónp. 35
- 5.3.3 Segunda iteraciónp. 36
- 5.3.4 Tercera iteraciónp. 37
- 5.3.5 Cuarta iteraciónp. 38
- 5.4 Herramientasp. 39
- 6.Resultadosp. 40
- 6.1 Métricasp. 32
- 6.2 Consideraciones de producciónp. 42
- Conclusionesp. 43
- Referenciasp. 44
- Tabla 1 Descripción datos originalesp. 12
- Tabla 2 Columnas eliminadas del Datasetp. 14
- Tabla 3 Resultado exploración de las variablesp. 16
- Tabla 4 Estadísticos 1p. 17
- Tabla 5 Estadísticos 2p. 22
- Tabla 6 Métricas Baseline evoluciónp. 35
- Tabla 7 Métricas primera Iteración evoluciónp. 36
- Tabla 8 Métricas segunda Iteración evoluciónp. 37
- Tabla 9 Métricas tercera Iteración evoluciónp. 38
- Tabla 10 Métricas cuarta Iteración evoluciónp. 39
- Tabla 11 Primera iteración:p. 41
- Tabla 12 Segunda iteración:p. 41
- Tabla 13 Tercera iteración:p. 41
- Tabla 14 Cuarta iteración:p. 42
- Figura 1 Formula matemática error absoluto mediop. 11
- Figura 2 Formula matemática error porcentual absoluto mediop. 12
- Figura 3 Filtro por Terminal de Transporte Medellín Nortep. 13
- Figura 4 Exportar Nuevo Datasetp. 14
- Figura 5 Lectura Dataset almacenados en GitHubp. 14
- Figura 6 Cambio formato columna fechap. 15
- Figura 7 Fecha como índice y agrupación registros por díap. 15
- Figura 8 Dataset resultantep. 16
- Figura 9 Grafico comportamiento variable pasajeros en el tiempop. 18
- Figura 10 Comportamiento variable despachos en el tiempop. 19
- Figura 11 Grafico de dispersión variables DESPACHOS Y PASAJEROSp. 19
- Figura 12 Grafico de barras y boxplot variable PASAJEROSp. 20
- Figura 13 Grafico de barras y boxplot variable DESPACHOSp. 21
- Figura 14 Grafico comportamiento en el tiempo variable PASAJERO desde oct 2020 a sep 2021p. 23
- Figura 15 Grafico comportamiento en el tiempo variable DESPACHOS desde oct 2020 a sep 2021p. 24
- Figura 16 Grafico de barras y boxplot variable PASAJEROS desde oct 2020 a sep 2021p. 24
- Figura 17 Grafico de barras y boxplot variable DESPACHOS desde oct 2020 a sep. 2021p. 25
- Figura 18 Autocorrelación parcial variable PASAJEROSp. 26
- Figura 19 Autocorrelación parcial variable DESPACHOSp. 27
- Figura 20 fases del proceso de machine learningp. 28
- Figura 21 Normalización de los datosp. 29
- Figura 22 Código para crear columnas DAY , HOLIDAYp. 30
- Figura 23 Filtrar registros a partir de octubre de 2020p. 31
- Figura 24 División de los datos entrenamiento y validaciónp. 33
- Figura 25 Datos para entrenamiento y validacionp. 33
- Figura 26 Grafico de los datos de entrenamiento y validaciónp. 34
- Figura 27 Grafico error medio absoluto de cada modelo baselinep. 34
- Figura 28 Grafico error medio absoluto de cada modelo primera iteracionp. 35
- Figura 29 Grafico error medio absoluto de cada modelo segunda iteraciónp. 36
- Figura 30 Grafico error medio absoluto de cada modelo tercera iteraciónp. 37
- Figura 31 Grafico error medio absoluto de cada modelo cuarta iteraciónp. 38
- Figura 32 Despliegue del modelo en Azurep. 42