Bogotá - Ingeniería - Maestría en Ingeniería - Ingeniería de Sistemas y Computación · 2025
Prototipo de modelo de aprendizaje automático para estimar la viabilidad de productos tecnológicos mediante la predicción de la satisfacción del consumidor
En este trabajo se propone y construye un prototipo de modelo predictor de viabilidad de productos tecnológicos, cuyo objetivo es transformar información textual estructurada en un indicador numérico. Este indicador es el resultado de la interpretación cuantitativa de la satisfacción del consumidor, expresada a través de reseñas de usuarios en el contexto del comercio electrónico, y está orientado a apoyar la planeación de productos tecnológicos, particularmente en etapas tempranas de análisis del entorno y caracterización del producto. El prototipo se fundamenta en un modelo de aprendizaje de máquina que analiza los componentes textuales presentes tanto en la información descriptiva de los productos como en las reseñas publicadas en línea, permitiendo estimar finalmente la satisfacción del consumidor como un indicador numérico. Como aproximaciones cuantificables para la construcción de este indicador, se emplean la calificación numérica otorgada por los usuarios y los votos de utilidad asociados a las reseñas. Para la construcción del prototipo, se inició con la adquisición de un conjunto de datos compuesto por información de productos y reseñas provenientes de la plataforma de comercio en línea Amazon. Sobre este conjunto se ejecutaron procesos de exploración, limpieza y transformación de datos para obtener un conjunto de entidades y atributos representativos de las percepciones de usuarios en internet. Por otro lado, a partir de las definiciones propuestas por diversos autores en el contexto del análisis de productos, se definió un conjunto de métricas que permiten la conversión de información semántica codificada en el indicador numérico propuesto. En función de la caracterización de dichas métricas objetivo, se construyó el prototipo de modelo de aprendizaje de máquina, el cual integra la codificación de información textual en vectores numéricos, la agrupación de productos similares para una comparación consistente de entidades y la selección de estrategias supervisadas y formuladas basadas en la calificación numérica de reseñas de usuario. Como resultado, el modelo seleccionado logró representar la viabilidad de un producto con un nivel de precisión de hasta 96%, de acuerdo con las interpretaciones de negocio analizadas. Finalmente, la estructura del prototipo fue seleccionada a partir de la evaluación de métricas de desempeño por modelo y la ejecución de flujos de validación manual. (Texto tomado de la fuente)
Texto completo 83 páginas con texto de 84
Leer la tesis completa Ficha en el repositorio
Contenido
- Resumenp. 18
- Abstractp. 19
- Contenidop. 21
- Lista de figurasp. 24
- Lista de tablasp. 27
- Introducciónp. 15
- 1.1 Necesidadp. 15
- 1.2 Conjunto de datosp. 16
- 1.3 Objetivosp. 16
- 1.4 Contribucionesp. 16
- 1.5 Estructura del documentop. 17
- Estado del artep. 18
- 2.1 Contexto del negociop. 18
- 2.2 Contexto tecnológicop. 19
- 2.3 Trabajos previosp. 21
- Caracterización de información de productos y reseñasp. 28
- 3.1 Recolección y acceso a los datosp. 28
- 3.1.1 Origen de los datosp. 28
- 3.1.2 Estrategia de recolecciónp. 29
- 3.2 Descripción del conjunto de datosp. 29
- 3.2.1 Información de productosp. 29
- 3.2.2 Información de reseñasp. 31
- 3.3 Diagnóstico de calidad del conjunto de datosp. 32
- 3.3.1 Valores nulos y arreglos vacíosp. 32
- 3.4 Análisis exploratorio de los datosp. 35
- 3.4.1 Exploración de campos textualesp. 35
- 3.4.2 Exploración de esquemas en detalles de publicacionesp. 38
- 3.4.3 Distribución de calificaciones de usuariosp. 41
- 3.4.4 Distribución de cantidad de reseñas por productop. 41
- 3.1.1 Distribución de subcategorías de productop. 42
- 3.4.5 Relación de variables numéricas en reseñas de productop. 43
- 3.5 Selección de variables relevantesp. 44
- 3.6 Limpieza y preprocesamientop. 47
- 3.7 Conclusiones de capítulop. 48
- Métricas para medir la satisfacción del consumidorp. 50
- 4.1 Recopilación de métricas candidatop. 50
- 4.1.1 Métrica basada en metodología SHELLp. 50
- 4.1.2 Métrica basada en metodología JTBDp. 50
- 4.1.3 Métrica basada en puntuación de usuariop. 51
- 4.2 Construcción y definición de métricas candidatop. 51
- 4.3 Conclusiones de capítulop. 48
- Implementación de modelo predictor de viabilidad numéricap. 57
- 5.1 Metodología de modelamientop. 57
- 5.2 Identificación de algoritmos y herramientasp. 58
- 5.2.1 Módulos pre-entrenadosp. 58
- 5.3 Codificación de entidadesp. 58
- 5.4 Búsqueda de productos similaresp. 61
- 5.4.1 LSH (Locality Sensitive Hashing)p. 61
- 5.5 Plan de entrenamiento y selección de hiperparámetrosp. 62
- 5.6 Arquitecturas de modelado para predicción de viabilidad numéricap. 63
- 5.6.1 Modelo de regresión mediante valoración binariap. 63
- 5.6.2 Modelo de clasificación mediante valoración categóricap. 64
- de categoría)p. 65
- 5.6.4 Valoración mediante modelado formuladop. 66
- 5.7 Conclusiones de capítulop. 48
- Evaluación de modelo predictor de viabilidad numéricap. 68
- 6.1 Planteamiento de métricas de desempeñop. 68
- 6.2 Evaluación de desempeño de modelosp. 69
- 6.2.1 Modelo de clasificación mediante valoración binariap. 69
- 6.2.2 Modelo de clasificación mediante valoración categóricap. 64
- de categoría)p. 71
- 6.2.4 Modelo de regresión formuladop. 73
- 6.3 Ejemplificación de caso de usop. 73
- 6.4 Análisis de resultados y selección de mejores modelosp. 76
- 6.5 Conclusiones de capítulop. 48
- Conclusiones y trabajo futurop. 78
- 7.1 Conclusionesp. 78
- 7.2 Recomendacionesp. 79
- 7.3 Trabajo Futurop. 79
- Referenciasp. 83
- cabo por [1] (Imagen adaptada)p. 19
- mismos. Adaptado de [9]p. 20
- [12]p. 21
- fracaso en Startups. Metodología planteada por [1] (Imagen adaptada)p. 22
- un negocio real. Tomado de: [5] (Imagen adaptada)p. 23
- productos. Adaptado de [13]p. 24
- trabajos previos. [17] (Imagen adaptada)p. 25
- Figura 3-1. Diagrama descriptivo de la arquitectura medallion. Adaptado de [20]p. 29
- la información de productosp. 33
- productos originalp. 33
- Figura 3-4. Listas de imágenes vacías en el conjunto de datos de reseñasp. 34
- Figura 3-5. Productos sin detalles especificadosp. 34
- Figura 3-6. Distribución de cantidades de palabras en descripciones de productosp. 36
- Figura 3-7. Distribución de cantidades de palabras en títulos de productosp. 36
- productosp. 33
- información de productop. 37
- Figura 3-10. Distribución de largos textuales para información de reseñasp. 38
- Figura 3-11. Distribución de campos detalle en descripciones de productop. 39
- para las 4 subcategorías más frecuentesp. 41
- datosp. 30
- Figura 3-14. Distribución logarítmica de cantidad de reseñas de usuario por productop. 42
- Figura 3-15. Distribución de subcategorías de productop. 43
- Figura 3-16. Correlación de variables: Calificación, votos útiles y número de palabrasp. 44
- Figura 3-17. Descripción gráfica de flujo de preprocesamientop. 48
- similaresp. 53
- un nuevo productop. 54
- un determinado grupo de productos y las definiciones dadas por JTBD [5]p. 55
- Figura 5-3. Generación de codificaciones mediante PCA para información de reseñasp. 60
- reseñas de usuariop. 64
- información de calificación de reseñap. 65
- Figura 5-7. Modelo para la predicción de categoría de productop. 66
- finalp. 16
- clasificación binaria sobre información de calificación de reseñap. 69
- clasificación binaria sobre información de calificación de reseñap. 70
- clasificación multiclase sobre información de calificación de reseñap. 71
- clasificación multiclase sobre información de calificación de reseñap. 71
- etiqueta booleana modificado para inclusión de información de categoría de productop. 72
- etiqueta booleana modificado para inclusión de información de categoría de productop. 73
- entrante al proceso de inferencia construidop. 73
- características y capacidades de productos de uso finalp. 27
- Tabla 3-1. Campos presentes en entidad de producto en conjunto de datos originalp. 31
- Tabla 3-2. Campos presentes en entidad de reseña en conjunto de datos originalp. 32
- análisis realizadop. 46
- Tabla 3-4. Subcategorías seleccionadas para análisisp. 47
- representación finalp. 52
- Tabla 6-1. Estructura de ejemplo generado como entrada para flujo de modelop. 74
- Tabla 6-2. Estructura de productos similares asociados a ejemplo de la Tabla 6-1p. 75
- Tabla 6-3. Resultados de predicción para ejemplo de flujo completo planteadop. 76