Electrónica · 2025
Implementación de aprendizaje de máquinas para la traducción del lenguaje de señas colombiano
Este documento aborda la implementación de aprendizaje de máquinas para la traducción del Lenguaje de Señas Colombiano (LSC) al español, con el propósito de facilitar la comunicación entre personas sordas y oyentes. Para ello, se desarrollaron dos modelos de aprendizaje profundo: una red neuronal profunda (DNN) para el reconocimiento de gestos estáticos y una red de memoria a largo y corto plazo (LSTM) para la identificación de gestos dinámicos. Se construyó una base de datos con 29 gestos representativos del LSC, a partir de los cuales se extrajeron puntos clave de las manos mediante MediaPipe. Este enfoque permitió optimizar la representación de los gestos, reduciendo la complejidad computacional en comparación con métodos basados en imágenes. El modelo de gestos estáticos alcanzó una precisión del 99%, mientras que el modelo de gestos dinámicos logró un 96%. Para la validación del sistema, se implementó un método de reconocimiento en tiempo real utilizando OpenCV, permitiendo la captura y procesamiento de video para la detección y predicción de gestos. Aunque los modelos demostraron un desempeño satisfactorio, se identificaron limitaciones como la imposibilidad de ejecutarlos simultáneamente. Como trabajos futuros, se propone la integración de ambos modelos en un único sistema, la ampliación del conjunto de gestos reconocidos y la optimización de la latencia para mejorar la experiencia del usuario en aplicaciones prácticas.
Texto completo 83 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- Introducciónp. 11
- 1.1 Planteamiento del problema y justificación del estudiop. 11
- 1.2 Objetivosp. 13
- 1.2.1 Objetivo Generalp. 13
- 1.2.2 Objetivos específicosp. 13
- 1.3 Estructura del documentop. 13
- Fundamentos y estado del artep. 16
- 2.1 Lenguaje de señasp. 16
- 2.2 Aprendizaje de máquinasp. 19
- 2.2.1 Aprendizaje Supervisadop. 20
- 2.2.2 Aprendizaje profundop. 21
- 2.3 Visión por computadorp. 24
- 2.3.1 MediaPipep. 25
- 2.4 Aplicacionesp. 27
- Metodologíap. 32
- 3.1 Adquisición y preparación de datosp. 34
- 3.2 Modelamientop. 40
- 3.2.1 Modelo para identificación de gestos estáticosp. 41
- 3.2.2 Modelo para identificación de gestos dinámicosp. 44
- 3.3 Evaluaciónp. 50
- 3.3.1 Evaluación del entrenamiento del modelo DNNp. 51
- 3.3.2 Evaluación del entrenamiento del modelo LSTMp. 55
- 3.4 Desplieguep. 64
- Resultadosp. 67
- 4.1 Reconocimiento en tiempo real para gestos estáticosp. 67
- 4.2 Reconocimiento en tiempo real para gestos dinámicosp. 72
- 4.3 Comparación de resultados con trabajos previosp. 77
- Conclusiones y trabajos futurosp. 79
- 5.1 Conclusionesp. 79
- 5.2 Trabajos futurosp. 80
- Referencias bibliográficasp. 81
- Figura 2.1 Puntos de referencia de las manos para la articulación de la señap. 18
- neuronales artificialesp. 20
- Figura 2.3 Diagrama del proceso de entrenamiento e inferencia en aprendizaje supervisadop. 21
- Figura 2.4 Diagrama neurona artificialp. 22
- Figura 2.5 Estructura de una neurona LSTMp. 24
- Figura 2.6 Puntos de referencia detectados por MediaPipe para el seguimiento de manosp. 26
- Figura 2.7 Arquitectura red neuronal VGG16p. 28
- Figura 2.8 Guante sensorial utilizado para la detección del lenguaje de señas americanop. 30
- Figura 3.1 Metodología CRISP-DMp. 33
- Figura 3.2 Detección puntos clave en gesto “L” de la LSC mediante MediaPipep. 35
- Figura 3.3 Ejemplo de gestos estáticos y dinámicos de la LSCp. 38
- Figura 3.4 Ejemplo de una secuencia para el gesto “J”p. 39
- Figura 3.5 Proceso de normalización de los datosp. 41
- Figura 3.6 Arquitectura modelo DNN para la identificación de gestos estáticosp. 43
- Figura 3.7 Arquitectura inicial modelo LSTM para la identificación de gestos dinámicosp. 46
- Figura 3.8 Ilustración del proceso de Padding en secuencias con longitudes variablesp. 48
- Figura 3.9 Resultados entrenamiento modelo DNNp. 52
- Figura 3.10 Matriz de confusión para el modelo DNNp. 54
- Figura 3.11 Resultados primer entrenamiento modelo LSTMp. 56
- Figura 3.12 Matriz de confusión para el primer entrenamiento del modelo LSTMp. 57
- Figura 3.13 Resultados segundo entrenamiento modelo LSTMp. 59
- Figura 3.14 Matriz de confusión para el segundo entrenamiento del modelo LSTMp. 60
- Figura 3.15 Arquitectura final modelo LSTM para la identificación de gestos dinámicosp. 61
- Figura 3.16 Resultados último entrenamiento modelo LSTMp. 62
- Figura 3.17 Matriz de confusión para el último entrenamiento del modelo LSTMp. 63
- Figura 3.18 Diagrama de flujo del sistema de detección y predicción de gestosp. 66
- Figura 4.1 Predicción del modelo estático para la letra "M" en Lengua de Señas Colombianap. 68
- Figura 4.2 Predicción del modelo estático para la letra "N" en Lengua de Señas Colombianap. 68
- Figura 4.3 Predicción del modelo estático para la letra "D" en Lengua de Señas Colombianap. 69
- Figura 4.4 Predicción del modelo estático para la letra "L" en Lengua de Señas Colombianap. 69
- Figura 4.5 Predicción del modelo estático para la letra "E" en Lengua de Señas Colombianap. 70
- Figura 4.6 Predicción del modelo estático para la letra "W" en Lengua de Señas Colombianap. 70
- Figura 4.7 Predicción del modelo estático para la letra "O" en Lengua de Señas Colombianap. 71
- Figura 4.8 Predicción del modelo estático para la letra "Q" en Lengua de Señas Colombianap. 71
- Figura 4.9 Predicción del modelo dinámico para la letra "G" en Lengua de Señas Colombianap. 73
- Figura 4.10 Predicción del modelo dinámico para la letra "J" en Lengua de Señas Colombianap. 73
- Figura 4.11 Predicción del modelo dinámico para la letra "S" en Lengua de Señas Colombianap. 74
- Figura 4.12 Predicción del modelo dinámico para la letra "Z" en Lengua de Señas Colombianap. 74
- Colombianap. 75
- Colombianap. 75
- Colombianap. 75
- Tabla 2.1: Traducción de los puntos de referencia de MediaPipep. 27
- Tabla 3.1: Gestos seleccionados para la construcción de la base de datosp. 34
- Tabla 3.2: Clasificación de los gestos en estáticos y dinámicosp. 37
- Tabla 3.3: Codificación de clases para el entrenamiento del modelo estáticop. 42
- Tabla 3.4: Hiperparametros utilizados en el modelo DNNp. 44
- Tabla 3.5: Codificación de clases para el entrenamiento del modelo dinámicop. 45
- Tabla 3.6: Cantidad de secuencias por gestop. 49
- Tabla 3.7: Hiperparametros del primer entrenamiento del modelo LSTMp. 50
- Tabla 3.8: Informe de evaluación del modelo DNNp. 53
- Tabla 3.9: Informe de evaluación del primer modelo LSTMp. 56
- Tabla 3.10: Hiperparámetros del segundo entrenamiento del modelo LSTMp. 58
- Tabla 3.11: Informe de evaluación del segundo modelo LSTMp. 59
- Tabla 3.11: Informe de evaluación modelo definitivo LSTMp. 63
- Tabla 4.1: Comparación de resultados en el reconocimiento de gestosp. 78