Google lanza una tecnología de traducción de lenguaje de señas impulsada por inteligencia artificial

Written by

Picture of فريقنا

فريقنا

Communications Consultant

Google DeepMind ha presentado el innovador modelo de inteligencia artificial SL2T, diseñado para traducir el lenguaje de señas a texto escrito en tiempo real. Esta es la primera vez que un modelo de inteligencia artificial para lenguaje de señas se integra como una función de consumo principal en los teléfonos inteligentes a través de la serie Pixel 11.

Este informe periodístico avanzado fue preparado para cubrir los antecedentes y los detalles del lanzamiento de la tecnología de traducción de lenguaje de señas con inteligencia artificial por parte de Google, así como los temas relacionados con el sector tecnológico y normativo global.

Índice del artículo:

Integración de la traducción de lenguaje de señas en los teléfonos Pixel 11

Google DeepMind ha anunciado oficialmente el lanzamiento de su modelo de inteligencia artificial dedicado a traducir el lenguaje de señas a texto, denominado SL2T, marcando la primera vez que se incluye una función de inteligencia artificial especializada en lenguaje de señas dentro de una aplicación de consumo en teléfonos inteligentes. El modelo admite el dictado de señas a texto escrito a través del teclado de Google y la aplicación de transcripción instantánea en la nueva serie de teléfonos Pixel 11, comenzando con la traducción del lenguaje de señas estadounidense al inglés escrito. Esta característica única permite a los usuarios sordos y con problemas de audición apuntar con la cámara del teléfono y hacer señas en cualquier lugar donde suelan escribir; ya sea al buscar en la web, redactar mensajes y correos electrónicos, hacer consultas al sistema Gemini o incluso responder de inmediato en conversaciones cara a cara a través de la aplicación de transcripción presente. Google afirmó que los evaluadores de la tecnología encontraron que el uso del lenguaje de señas era más rápido y natural en comparación con la escritura tradicional en inglés.

Cómo funciona el modelo y análisis de los puntos de referencia

El modelo SL2T fue entrenado con más de 100 000 horas de diversos datos de lenguaje de señas que cubren más de 50 lenguajes de señas en todo el mundo, siendo el lenguaje de señas estadounidense el que representó aproximadamente una cuarta parte de dichos datos. En lugar de procesar secuencias de video en bruto, lo cual consume una gran capacidad de procesamiento y plantea riesgos para la privacidad, el sistema se basa en un modelo local que opera en el dispositivo llamado MediaPipe Holistic para rastrear 130 puntos clave en el rostro, el cuerpo y las manos de la persona, enviando únicamente las coordenadas geométricas resultantes a los servidores avanzados de Google, con la eliminación inmediata y completa de la fuente de video original para evitar cualquier violación de la privacidad del usuario y garantizar una seguridad estricta.

Traducción directa y superación de los estándares tradicionales

El modelo traduce directamente de las coordenadas de la postura corporal y los puntos de referencia al texto escrito, superando las transcripciones intermedias en las que confiaban los sistemas anteriores. DeepMind destaca que las antiguas transcripciones no lograban capturar las dimensiones ricas y no lineales del lenguaje de señas, como las expresiones faciales, las estructuras espaciales y el movimiento corporal. La traducción directa a partir de los puntos de referencia permite elevar significativamente la calidad de la traducción a medida que aumenta el volumen de datos disponibles sin límites impuestos. En la escala de evaluación de referencia dedicada al lenguaje de señas estadounidense, el modelo logró un resultado excepcional de 70 puntos, superando ampliamente cualquier resultado previo registrado en este campo.

Gobernanza, restricciones normativas y principios de uso

Para garantizar el uso responsable de la tecnología, Google creó el Comité Asesor de Inteligencia Artificial para el Lenguaje de Señas, que incluye a destacadas organizaciones globales como la Asociación Nacional de Sordos y la Federación Mundial de Sordos. El informe de impacto publicado por la compañía indicó que la primera versión del modelo está diseñada exclusivamente como una herramienta de asistencia para contextos no críticos, descartando explícitamente el uso de la función en entornos médicos, legales, policiales o para la toma de decisiones laborales y de salud. El informe también aclaró que la función no se considera un sustituto legal de las obligaciones oficiales en virtud de la ley estadounidense sobre discapacidades en aras de la seguridad pública.

Limitaciones técnicas y perspectivas de expansión futura

Las limitaciones técnicas actuales incluyen una menor precisión en condiciones de poca iluminación, la falta de compatibilidad con la interacción de varias personas haciendo señas simultáneamente, además de un límite de tiempo específico de 60 segundos por segmento sin memoria de conversación entre múltiples fragmentos. Asimismo, el modelo no ha sido entrenado en categorías de menores de 18 años. Cabe destacar que el proyecto comenzó por iniciativa de un ingeniero sordo dentro de Google llamado Sam Sepah, con la participación de talentos sordos en cada etapa de la recopilación de datos, el desarrollo y el despliegue. Google planea expandir la tecnología para incluir nuevos lenguajes de señas y dispositivos adicionales sin costos adicionales para los usuarios, mientras continúa la investigación activa para generar lenguaje de señas en el futuro.

Preguntas frecuentes

Pregunta: ¿Cuál es la nueva tecnología lanzada por Google DeepMind para el lenguaje de señas?
Respuesta: Google lanzó el modelo SL2T para traducir el lenguaje de señas directamente a texto escrito a través de la cámara de los teléfonos Pixel 11.

Pregunta: ¿Cómo protege el modelo de traducción de lenguaje de señas la privacidad de los usuarios?
Respuesta: El modelo analiza puntos geométricos de referencia del rostro y las manos, enviando únicamente sus coordenadas y eliminando instantáneamente el video original de la cámara.

Pregunta: ¿Se puede utilizar la función en exámenes médicos o tribunales legales?
Respuesta: No, la función ha sido clasificada oficialmente como una herramienta de asistencia diaria y se prohíbe su uso en entornos médicos, legales, policiales y para decisiones oficiales.

Pregunta: ¿Cuáles son los límites de interacción temporal y la edad de los usuarios disponible actualmente?
Respuesta: El límite máximo por segmento es de 60 segundos, centrándose actualmente en usuarios mayores de 18 años para garantizar la precisión del modelo.

شارك هذا الموضوع:

شارك هذا الموضوع:

اترك رد

الفئات

المنشورات الأخيرة

Discover more from بازينجا

Subscribe now to keep reading and get access to the full archive.

Continue reading