Maestría en Analítica Aplicada · 2026
Predicción de caudales del río Bogotá mediante modelos estadísticos y de machine learning
This project presents a hydrological forecasting model for the Bogotá River section at Puente La Virgen (Cota, Cundinamarca), aimed at anticipating streamflow using statistical methods and machine learning techniques. Historical discharge data (2007–2022) at this location and precipitation data from a nearby station were integrated. The study implemented traditional models (ARIMA/ARIMAX), machine learning algorithms (HistGradientBoosting, LSTM), and hybrid approaches, evaluated with statistical metrics (R², RMSE, MAE) and hydrological indicators (Nash-Sutcliffe Efficiency, NSE). The results indicate that hybrid models outperform individual approaches, reaching acceptable values of R² = 0.84 during training and R² = 0.77 during testing. Furthermore, these models show improved capabilities in detecting extreme streamflows, defined by percentile thresholds (90% and 95%). These findings demonstrate that combining statistical and computational methods strengthens peak flow prediction and provides a solid foundation for an early warning system in flood risk management within the Bogotá Savanna.
Texto completo 62 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 8
- Tramo Puente La Virgenp. 9
- Justificación del estudiop. 11
- Pregunta de investigaciónp. 12
- Estado del artep. 13
- Modelación hidrológica tradicionalp. 13
- Modelos de Machine Learning aplicados a hidrologíap. 14
- Antecedentes en Colombiap. 16
- Objetivosp. 17
- Objetivo generalp. 17
- Objetivos específicosp. 18
- Marco conceptualp. 18
- Conceptos hidrológicosp. 18
- Precipitaciónp. 18
- Caudalp. 19
- Modelación estadísticap. 20
- ARIMA / ARIMAXp. 20
- Regresiones lineales y no linealesp. 21
- HGB y Random Forestp. 22
- LSTMp. 24
- Modelos híbridosp. 26
- Métricas de evaluaciónp. 29
- Coeficiente de determinación (R²)p. 29
- Raíz del Error Cuadrático Medio (RMSE)p. 29
- Error Absoluto Medio (MAE)p. 30
- Eficiencia de Nash-Sutcliffe (NSE)p. 30
- Eficiencia de Kling–Gupta (KGE)p. 31
- Sesgo porcentual (PBIAS)p. 31
- Análisis y preparación de datosp. 32
- Limpieza y tratamiento de vacíosp. 32
- Generación de variables derivadasp. 33
- Escalado y normalizaciónp. 34
- Modeladop. 35
- Modelos estadísticos: ARIMA / ARIMAXp. 35
- Modelos de Machine Learning: HistGradientBoosting y Random Forestp. 37
- Modelos híbridosp. 26
- Estrategia de validación y evaluaciónp. 43
- División temporal train/val/testp. 43
- Resultados y discusiónp. 46
- Análisis exploratorio de datos (EDA)p. 46
- Estadísticos descriptivosp. 46
- Correlaciones precipitación–caudalp. 47
- Visualizacionesp. 48
- Resultados de modelosp. 50
- Propuesta de aplicación prácticap. 53
- Conclusiones y recomendacionesp. 55
- Bibliografíap. 57
- Tabla 1 Comparación del desempeño de modelos en distintas cuencas (valores NSE)p. 49
- Tabla 2 Rendimiento comparativo: LSTM vs. EA-LSTM y modelos conceptualesp. 52
- Tabla 3 Ejemplos de aplicación de modelos híbridos en predicción hidrológicap. 54
- Tabla 4: ARIMA/ARIMAX - Métricas38
- Tabla 5: HGB — HistGradientBoosting40
- Tabla 740
- Figura 1 Ubicación del Puente La Virgen en Chía (adaptado de Google Maps, 2025)p. 36
- Figura 2 Heatmap de correlación48
- Figura 3 Serie temporal – precipitaciones y caudal49
- Figura 4 Boxplots de precipitación y caudal50
- Figura 5 Comparación entre caudal real y caudal predicho por el modelo54
- Ecuación 1 = R2p. 29
- Ecuación 2 = Raíz del Error Cuadrático Medio (RMSE)p. 30
- Ecuación 3 = Error absoluto medio (MAE)p. 30
- Ecuación 4 = Eficiencia de Nash-Sutcliffe (NSE)p. 30
- Ecuación 5 = Eficiencia de Kling–Gupta (KGE)p. 31
- Ecuación 6 = Sesgo porcentual (PBIAS)p. 31