Medellín - Minas - Doctorado en Ingeniería - Sistemas · 2025
Modelo para la predicción de patrones de deforestación en el departamento de Antioquia empleando aprendizaje de máquinas
Los cambios en coberturas y usos del suelo (CCUS) son especialmente importantes en áreas estratégicas para la provisión de servicios ecosistémicos de los cuales depende la población. Modelos espacialmente explícitos se han desarrollado para facilitar el monitoreo de patrones de deforestación, sin embargo, implementar estos modelos continúa siendo uno de los problemas más difíciles de abordar, esto se debe a que la deforestación es un proceso que se caracteriza por su alta complejidad, dinamismo y no linealidad. Dada esta dificultad y las diferentes aproximaciones metodológicas, el uso conjunto de técnicas de aprendizaje de máquinas (Machine Learning - ML) y sistemas de información geográfica (SIG) es uno de los enfoques más prometedores para modelar el problema específico de la evolución del uso del suelo. A nivel nacional y latinoamericano son pocos los estudios en los cuales se ha empleado ML para modelar CCUS a partir de imágenes satelitales de alta resolución espacial (<10m). Esta investigación con el uso de imágenes del programa NICFI (Norway’s International Climate & Forests Initiative) a una resolución de 4.7m desarrolló un modelo para la clasificación de coberturas y para la predicción de patrones de deforestación en el departamento de Antioquia, área que se caracteriza por su topografía montañosa y diversidad de ecosistemas. La metodología se llevó a cabo en tres etapas, la primera corresponde a un modelo de aprendizaje profundo (Deep Learning - DL) para la segmentación de coberturas, cuyos resultados se usaron como insumo en la segunda etapa de construcción de variables geográficas y explicativas del proceso de deforestación. Finalmente, la tercera etapa corresponde al modelo de predicción de deforestación. Para el modelo de segmentación de coberturas se usó un enfoque supervisado con la arquitectura U-Net y se exploraron 2 metodologías para el etiquetado de los datos, una a partir del uso de mapas globales existentes y otra con apoyo del algoritmo Kmeans y digitalización manual. Los conjuntos de datos se encuentran disponibles en formato TIF (Tagged Image File Format) con cuatro bandas R (rojo), G (verde), B (Azul), NIR (Infrarrojo cercano) y la etiqueta correspondiente a las coberturas: bosques denso, arbustales, pastos, áreas agrícolas heterogéneas, cuerpos de agua, áreas construidas y tierras desnudas y degradadas. Para la exploración y entrenamiento de los modelos tipo U-Net se construyeron 4 conjuntos de datos, para el primero se usó una estrategia de muestreo aleatorio, para el segundo y tercero una estrategia de muestreo balanceado, donde cada sección de imagen del conjunto de datos tiene una representación mínima por clase de 50% y 70% respectivamente y para el conjunto de datos 4 se usó un muestreo balanceado de 70% y se incluyeron datos multitemporales digitalizados de forma manual. Para la etapa 2, la selección y construcción de las variables explicativas se realizó con base en la metodología PRISMA, la disponibilidad de datos geográficos y las capas de coberturas generadas del modelo de segmentación. En total se construyeron 10 variables explicativas y la variable dependiente binaria (deforestado/no deforestado) para el periodo de análisis 2018-2019 y se usó el método de bosques aleatorios con el criterio de permutación para identificar la importancia relativa de las variables en el proceso de deforestación. En la etapa 3 se propone el desarrollo de un modelo covolucional con la arquitectura U-Net con atención para la predicción de la deforestación y al igual que en la etapa 1 de segmentación de coberturas, se entrenaron varios modelos empleando diferentes estrategias de muestreo para tratar el desbalance extremo de los datos. Finalmente se realizó una comparación de los resultados obtenidos para la métrica F1 macro entre las arquitecturas U-Net con atención, U-Net-estandar y U-Net residual con atención, encontrando mejores resultados en el rendimiento global del modelo con la arquitectura propuesta. La investigación representa en Colombia el primer intento a gran escala de utilizar un modelo DL para la predicción de la deforestación y el mapeo de coberturas a partir de imágenes satelitales de alta resolución espacial. Además de los modelos propuestos, el trabajo ofrece nuevos enfoques metodológicos para el manejo de datos espaciales que presentan desafíos distintos a otros tipos de datos y que tienen un potencial significativo para avanzar en el área de ML. (Tomado de la fuente)