Ingeniería de Sistemas y Telecomunicaciones · 2026
DESARROLLO DE UN SISTEMA DE APOYO EN LA ATENCIÓN AL PÚBLICO MEDIANTE TRADUCCIÓN BIDIRECCIONAL DE LENGUA DE SEÑAS COLOMBIANA Y VOZ A TEXTO
Este proyecto presenta el desarrollo de un prototipo funcional de traductor bidireccional entre Lengua de Señas Colombiana (LSC) y voz/texto, orientado a fortalecer los procesos de atención al público y la inclusión comunicativa en la Universidad Católica de Pereira. El sistema integra técnicas de visión por computadora, mediante la arquitectura YOLOv8, y procesamiento del lenguaje natural para permitir tanto la interpretación automática de señas capturadas por cámara como la transcripción de voz en tiempo real. El enfoque metodológico se basó en el modelo de desarrollo en cascada y un diseño de investigación de tipo cuantitativo, centrado en la evaluación técnica del prototipo más que en la validación con usuarios finales. Para el entrenamiento del modelo se conformó un conjunto de datos compuesto por imágenes propias y por el dataset público Dynamic LSC70, aunque con un alcance limitado a letras del abecedario y un conjunto reducido de palabras básicas. Este corpus permitió ejecutar múltiples entrenamientos, cuyos resultados mostraron un desempeño estable con valores destacados como un mAP@0.5 superior al 84% en el mejor modelo, así como un equilibrio adecuado entre precisión y exhaustividad. El sistema desarrollado logró integrar de manera eficiente componentes de visión por computadora y reconocimiento de voz dentro de una interfaz gráfica fácil de entender, permitiendo la visualización de video, traducción de señas y transcripción de voz. A pesar del tamaño del dataset, la capacidad computacional disponible y la falta de pruebas con usuarios reales, los resultados obtenidos demuestran la viabilidad técnica del enfoque y sientan las bases para futuras mejoras orientadas a ampliar el vocabulario reconocido, mejorar el rendimiento del modelo y validar el sistema en escenarios reales. En resumen, este proyecto es un paso importante hacia la facilitación de herramientas tecnológicas accesibles que ayuden a cerrar la brecha de comunicación entre la comunidad sorda que utiliza LSC y los funcionarios públicos, y es un ejemplo del potencial de la IA en los procesos de inclusión y servicio a la ciudadanía.
Texto completo 100 páginas con texto
Leer la tesis completa Ficha en el repositorio
Contenido
- RESUMENp. 11
- ABSTRACTp. 12
- INTRODUCCIÓNp. 13
- PLANTEAMIENTO DEL PROBLEMAp. 15
- DELIMITACIÓNp. 18
- JUSTIFICACIÓNp. 18
- OBJETIVOSp. 21
- 4.1 OBJETIVO GENERALp. 21
- 4.2 OBJETIVOS ESPECÍFICOSp. 21
- MARCO TEÓRICOp. 22
- 5.1 VISIÓN POR COMPUTADORA Y RECONOCIMIENTO DE SEÑALES MANUALESp. 22
- 5.1.1 Reconocimiento gestualp. 22
- 5.1.2 Modelos YOLOv5 y YOLOv8p. 23
- 5.1.3 MediaPipep. 23
- 5.2 REDES NEURONALES CONVOLUCIONALES (CNN)p. 24
- 5.2.1 Arquitectura general de una CNNp. 24
- 5.2.2 Aprendizaje profundo y entrenamientop. 24
- 5.2.3 Aplicación de CNN en el reconocimiento de señasp. 25
- 5.2.4 Limitaciones y desafíos actualesp. 25
- 5.3 RECONOCIMIENTO AUTOMÁTICO DEL HABLA (ASR)p. 26
- 5.3.1 Funcionamiento general del ASRp. 26
- 5.3.2 Modelos neuronales y aprendizaje profundop. 26
- 5.3.3 Implementaciones prácticas y bibliotecas en Pythonp. 27
- 5.4 INGENIERÍA DEL SOFTWAREp. 27
- 5.4.1 Metodologías ágilesp. 27
- 5.4.2 Modelos de ciclo de vidap. 28
- 5.4.3 Paradigmas de programaciónp. 28
- 5.4.4 Lenguajes de programaciónp. 29
- 5.4.5 APIp. 29
- 5.5 HERRAMIENTAS DE DESARROLLOp. 30
- Control de versionesp. 30
- 5.5.2 Gestión del proyectop. 31
- METODOLOGÍAp. 32
- 6.1 CRONOGRAMAp. 32
- 6.2 PRESUPUESTOp. 34
- DESARROLLO DEL PROYECTOp. 36
- 7.1 ANTECEDENTESp. 36
- 7.2 TECNOLOGÍAS UTILIZADASp. 37
- 7.2.1 Python 3.10p. 38
- 7.2.2 PyTorch y Ultralytics YOLOv8p. 38
- 7.2.3 MediaPipep. 23
- 7.2.4 OpenCVp. 39
- 7.2.5 JavaScript y Web Speech APIp. 39
- 7.2.6 HTML y CSSp. 39
- 7.2.7 GitHubp. 30
- 7.2.8 Entorno de ejecuciónp. 40
- 7.3 APLICACIÓN DEL MÉTODO DE DESARROLLOp. 40
- 7.3.1 Recolección y análisis de requerimientosp. 40
- 7.3.2 Diseñop. 43
- 7.3.3 Desarrollop. 35
- 7.4 APLICACIÓN DE LA METODOLOGÍA SCRUMp. 65
- 7.5 PRUEBAS FUNCIONALES Y DE USABILIDADp. 68
- 7.5.1 Metodología de pruebasp. 68
- 7.5.2 Pruebas funcionalesp. 69
- 7.5.4 Resultados de pruebasp. 71
- 8. ANÁLISIS DE RESULTADOSp. 71
- 8.1 EVALUACIÓN DE LA METODOLOGÍA APLICADAp. 75
- EVALUACIÓN DEL MODELO DE VISIÓN POR COMPUTADORAp. 78
- 8.3 CONFIGURACIÓN DEL ENTORNO Y PARÁMETROS DE ENTRENAMIENTOp. 79
- 8.3.1 Análisis de las métricas de entrenamientop. 80
- Evaluación de precisión y generalizaciónp. 80
- Conclusión del primer entrenamientop. 83
- Evolución y comparación entre modelosp. 84
- CONCLUSIONESp. 88
- USO DE HERRAMIENTAS DE IAp. 91
- RECOMENDACIONESp. 91
- REFERENCIASp. 94
- Ilustración 1.Diagrama de casos de usop. 44
- Ilustración 2.Diagrama de actividades traducción señas a textop. 47
- Ilustración 3. Diagrama de actividades transcripción voz a textop. 48
- Ilustración 4. Diagrama de secuencia traducción señas a textop. 49
- Ilustración 5. Diagrama de secuencia transcripción voz a textop. 50
- Ilustración 6. Mockup traducción señas a textop. 51
- Ilustración 7. Mockup transcripción voz a textop. 52
- Ilustración 8. Captura de pantalla datos organizadosp. 53
- Ilustración 9. Captura de pantalla divide_corpus.pyp. 54
- Ilustración 10. Captura de pantalla generate_labels.pyp. 55
- Ilustración 11. Captura de pantalla fix_txt.pyp. 55
- Ilustración 12. Captura de pantalla generate_yaml.pyp. 56
- Ilustración 13. Captura de pantalla main.pyp. 57
- Ilustración 14. Ubicación archivos voz a textop. 59
- Ilustración 15. Captura de pantalla parámetros voice.jsp. 59
- Ilustración 16. Captura de pantalla inicio escucha voice.jsp. 60
- Ilustración 17. Captura de pantalla procesamiento de resultados voice.jsp. 60
- Ilustración 18. Captura de pantalla manejo de errores voice.jsp. 61
- Ilustración 19. Captura de pantalla finalizar reconocimiento voice.jsp. 61
- Ilustración 20. Captura de pantalla control de usuario voice.jsp. 62
- Ilustración 21. Captura de pantalla interfaz de usuario index.htmlp. 63
- Ilustración 22. Captura de pantalla interfaz de usuariop. 63
- Ilustración 23. Prueba de reconocimientop. 72
- Ilustración 24. Prueba de reconocimiento con OpenCVp. 73
- Ilustración 25. Prueba de reconocimiento desde Cámara Webp. 74
- Ilustración 26. Prueba de reconocimiento desde Cámara Webp. 74
- Ilustración 27. Prueba de Speach to Textp. 75
- Ilustración 28. Diagrama ciclo de vida en cascadap. 76
- de precisión, pérdida y métricas de validación)p. 79
- durante la primera iteración del modelop. 80
- durante la fase de entrenamiento del modelop. 82
- 50 épocas de entrenamientop. 83
- YOLOv8np. 85
- Ilustración 34. Relación entre precisión y recall para los entrenamientos adicionalesp. 86
- Tabla 1. Cronograma de actividadesp. 33
- Tabla 2. Presupuesto del proyectop. 35
- Tabla 3. Requerimientos funcionalesp. 40
- Tabla 4. Requerimientos no funcionalesp. 41
- Tabla 5. Requerimientos de negociop. 42
- Tabla 6. Caso de uso traducir seña a textop. 44
- Tabla 7. Caso de uso traducir voz a textop. 45
- Tabla 8. Caso de uso visualizar traducción en tiempo realp. 45
- Tabla 9. Caso de uso visualizar transcripción en tiempo realp. 46
- Tabla 10. Product Backlog del proyectop. 65
- Tabla 11. Pruebas funcionales del Sistemap. 69
- Tabla 12. Pruebas de usabilidad (Task-Based Testing)p. 70
- Tabla 13. Resumen resultados primer entrenamientop. 81
- Tabla 14. Análisis de convergenciap. 81
- Tabla 15. Entrenamientos más representativosp. 84
- Tabla 16. Valores mejor entrenamientop. 87