SignSpeak es un proyecto desarrollado a partir de LENSEGUA (Lengua de Señas de Guatemala), orientado a facilitar la comunicación entre personas sordas y oyentes mediante el reconocimiento de señas y su traducción a texto y voz.
LENSEGUA: Base del sistema.
Señas manuales: Detecta señas realizadas con una o dos manos.
Reconocimiento de gestos: Identifica las señas mediante visión por computadora.
IA: Clasifica las señas utilizando un modelo de Random Forest.
TTS: Convierte el texto generado en voz.
Interfaz gráfica: Muestra la seña detectada, el nivel de confianza y el estado del sistema.
Controles: Permite pausar la reproducción, activar o desactivar la voz, limpiar el texto, eliminar caracteres y salir del programa mediante el teclado.
1. La cámara captura la imagen en tiempo real.
2. MediaPipe detecta la mano y extrae sus puntos clave.
3. Los datos son procesados por el modelo de inteligencia artificial.
4. El sistema identifica la seña y muestra su nivel de confianza.
5. La seña reconocida se agrega a una cadena de texto.
6. El texto puede reproducirse mediante TTS y controlarse utilizando los controles del sistema.
En el siguiente video se muestra el funcionamiento del sistema SignSpeak, donde se realiza el reconocimiento de señas en tiempo real para su debida traducción.
MediaPipe, OpenCV, Random Forest, Inteligencia Artificial, Programación Orientada a Objetos (POO), Dataset, Cámara web y TTS (Text To Speech).
Durante el desarrollo del proyecto se reestructuró completamente la arquitectura del sistema mediante la implementación de programación orientada a objetos, organizando el código en módulos, clases y métodos para mejorar su mantenimiento y escalabilidad. Se desarrollaron los módulos AppController, encargado de controlar el funcionamiento general del programa, App, responsable de la interfaz gráfica, y Main, encargado de integrar todos los módulos del sistema. Asimismo, se implementó la conversión de texto a voz (TTS), se optimizó el reconocimiento de señas incrementando la precisión del modelo y se mejoró la interfaz gráfica incorporando la visualización de la seña detectada, el nivel de confianza y el estado del programa. Finalmente, se añadieron controles mediante teclado para pausar la reproducción de voz, activar o desactivar el TTS, limpiar el texto, eliminar caracteres y finalizar la aplicación.
0.9619
5960
23
Clases detectadas:
A, B, C, D, E, G, H, I, K, L, M, N, O, P, Q, R, T, U, V, W, X, Y, Ñ
Danna
Karen
Eduardo
Japhet
Alejandra
Meredith
Allan
Yefry
Brandon
Airverson
Gloria
Alisson
Cristian
Sylvia
Frederick
Cesar
Anderson
Nathalia
Samuel
Jaime