Especialización en Analítica y Ciencia de Datos · 2025
Predicción del comportamiento de compra en tiendas de barrio utilizando modelos de machine learning
El proyecto busca evaluar el comportamiento de compra a nivel local, identificando los productos de la canasta familiar con mayor demanda, la base de datos principal se obtiene de la plataforma Kaggle, la cual contiene registros de compras de productos en 2022 para 217 municipios en 5 departamentos de Colombia; fue necesario complementar la base de datos con múltiples fuentes externas (plataforma Kaggle, Dane y Fuente propia) que se describen a lo largo de la monografía. Se pretende implementar modelos de Machine Learning, con el fin de ayudar en la identificación de preferencias y demanda frente a distintas categorías de productos para poder proyectar un comportamiento de consumo. Esto proporcionará información relevante a los establecimientos comerciales para que puedan crear estrategias que les permita entrar en mercados potenciales y mejorar sus ventas. Para la implementación de modelos de regresión, previamente se entrenaron distintos modelos de clasificación de productos en categorías, para alimentar el dataset final de predicción. El mejor modelo de clasificación fue el SVC que alcanza una precisión del 96% en la asignación de categorías. Para la predicción de demanda, se ajustan modelos de regresión tanto de machine learning como de Deep learning, sobre un dataset alimentado con variables socioeconómicas, categorías de productos y dos métodos de imputación distintos. Con el primer método de imputación con ceros, los modelos presentan un RMSE de 6 unidades. Para el segundo caso, se usa interpolación lineal obteniendo métricas de un MAPE cercano al 40% y un RMSE de aproximadamente 16 unidades.
Texto completo 44 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- RESUMENp. 8
- ABSTRACTp. 9
- INTRODUCCIÓNp. 10
- FUENTES DE DATOSp. 14
- PROCESAMIENTO DE DATOS (METODOLOGÍA)p. 17
- 3.1. Generación base de datos Compras Categorizadasp. 18
- 3.2. Generación de Dataset principalp. 18
- 3.3. Selección de características y generación de dataset finalp. 20
- 3.4. Predicción de ventasp. 21
- 3.5. Métricas de desempeñop. 22
- RESULTADOSp. 22
- 4.1. Resultados del modelo de clasificación y generación BD finalp. 22
- 4.2. Analítica descriptivap. 23
- 4.3. Limpieza y organización de datos para series de tiempop. 25
- 4.4. Resultados del modelo de regresiónp. 27
- 4.4.1. Primer acercamiento modelosp. 27
- 4.4.2. Variación de Modelosp. 28
- CONCLUSIONESp. 31
- REFERENCIASp. 34
- ANEXOSp. 37
- Anexo 1. Resumen revisión de la literatura modelos analíticosp. 37
- Anexo 2. Comparación y Selección modelo de clasificaciónp. 38
- Anexo 3. Detalle de columnas, tipología y cantidad de registrosp. 40
- Anexo 4. Comparación métricas primer acercamiento modelos de regresiónp. 43
- Anexo 5. Comparación métricas desempeño modelos de regresiónp. 43
- Tabla 1. Descripción de tablas originalesp. 15
- Figura 1. Modelo de Clasificaciónp. 17
- Figura 2. Modelo entidad relación para el dataset conformadop. 19
- Figura 3. Métricas modelo LinearSVC de clasificación de productosp. 23
- Figura 4. Distribución de cantidades vendidas por categoría de productop. 24
- Figura 5. Ejemplo distribución de cantidades vendidas por subregiónp. 24
- Figura 6. Distribución de cantidades vendidas por subcategoría sin atípicosp. 26
- Figura 7. Distribución de variables socioeconómicasp. 26
- Figura 8. Predicción primeros modelos regresión (red neuronal)p. 28
- Figura 9. Predicciones modelos de regresión con relleno en cerop. 29
- Figura 10. Predicciones modelos de regresión con interpolación linealp. 30