Especializaciones de la Facultad de Ingeniería · 2021
Análisis del sentimiento del lenguaje en comentarios de películas de Rotten Tomatoes
RESUMEN : El presente trabajo aborda el desarrollo de un modelo de analítica para el procesamiento natural del lenguaje, más específicamente la clasificación multiclase para los comentarios de películas extraídas de la plataforma de reseñas Rotten Tomatoes. La importancia de este tipo de algoritmos, reside en el conocimiento de la expectativa y experiencia de los usuarios frente al consumo de un bien o servicio. Esto genera una migración de los modelos tradicionales de evaluación de satisfacción del cliente, donde se otorgan puntuaciones en escalas cualitativas, hacia una retroalimentación personal y detallada frente a su experiencia. El dataset inicial consta de 156.060 comentarios en inglés con clases desbalanceadas, adicional, como se menciona en la descripción en la página de competición Kaggle (Kaggle, 2014) presenta particulares obstáculos frente al sarcasmo, ambigüedad en el lenguaje y la brevedad en las reseñas. Se plantea abordar el problema con la metodología planteada para procesamiento del lenguaje en una revisión de la literatura por Jain et al. (2021), la cual abarca, en el marco del procesamiento de los datos, tokenización, remoción de stopwords y lematización sobre el remanente de palabras. Posteriormente durante la extracción de características, se usan dos tipos de metodologías, seleccionadas de acuerdo con el tipo de modelo aplicado, para los modelos denominados como soft clasiffier se aplica la vectorización del vocabulario a través de un Term Frecuency Inverse Document Frecuency (TF-IDF), mientras que para el modelo de Deep Learning se aplica una red tipo Embedding. Como resultados generales, se obtiene un modelo con un accuracy del 73.02% y una tasa de F1-Score Micro y Macro del 73.01% y 72.11% respectivamente.
Texto completo 23 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- RESUMENp. 3
- INTRODUCCIÓNp. 6
- MARCO TEÓRICOp. 7
- METODOLOGÍAp. 8
- DESCRIPCIÓN DEL EXPERIMENTOp. 10
- 4.1 Exploración de datosp. 10
- 4.1.1. Histograma de palabras por frasep. 10
- 4.1.2 Datos nulos y duplicadosp. 11
- 4.1.3. Descripción de clasesp. 11
- 4.2. Preprocesamientop. 12
- 4.2.1. Clases desbalanceadasp. 12
- 4.2.2. Limpieza de datosp. 12
- 4.2.3. Datos nulos y duplicadosp. 11
- 4.2.4 Word Embedding:p. 14
- 4.2.3 Modelos Machine Learningp. 15
- RESULTADOS Y ANÁLISISp. 16
- DISCUSIÓN DE LOS RESULTADOSp. 20
- CONCLUSIONES Y TRABAJOS A FUTUROp. 20
- REFERENCIAS BIBLIOGRÁFICASp. 23
- ANEXOSp. 23
- Figura 1. Diagrama de proceso Análisis de sentimiento. Tomado de Jain et al., 2021p. 7
- Figura 2. Metodología solución problema. Fuente: Elaboración propiap. 9
- Figura 3. Representación del datasetp. 10
- Figura 4. Cantidad de palabras por frase antes de preprocesamientop. 11
- Figura 5. Valores duplicadosp. 11
- Figura 6. Cantidad datos por clase antes preprocesamientop. 12
- Figura 7. Distribución cantidad de palabras después de la limpiezap. 13
- Figura 8. Top 35 palabras más comunesp. 14
- Figura 9. Matriz de confusión por clase Multi Naive Bayesp. 17
- Figura 10. Matriz de confusión Random Forest Classifierp. 18
- Figura 11. Matriz de confusión KNNp. 18
- Figura 12. Matriz de confusión Voting Classifierp. 19
- Figura 13. Matriz de confusión RNNp. 19
- Tabla 1. Balanceo de clasesp. 12
- Tabla 2. Métricas Generales modelos implementadosp. 16
- Tabla 3. Resumen Tasas clasificaciones verdaderasp. 19