ElevenLabs lanzó sus modelos de cuarta generación y la versión turbo diseñados para conversión de texto a voz con una nueva arquitectura de programación que admite más de 90 idiomas. Los nuevos modelos permiten la clonación de voz en solo 10 segundos con la introducción de directrices de interpretación emocional.
- Nueva arquitectura de programación y expansión en los idiomas compatibles
- Velocidad de clonación extraordinaria y directrices de interpretación integradas
- Versión turbo ultrarrápida para agentes de conversación telefónica
- Salto en los ingresos financieros y expectativas de oferta pública
- Preguntas frecuentes
Nueva arquitectura de programación y expansión en los idiomas compatibles
La empresa líder «ElevenLabs» lanzó el lunes sus dos nuevos modelos de generación de voz, «Eleven Versión 4» y la versión ultrarrápida «Eleven Versión 4 Turbo», construidos sobre una arquitectura neuronal completamente nueva que, según afirma la compañía, ofrece los niveles más altos de expresión vocal y capacidad de control de tonos e interpretación hasta la fecha. Los nuevos modelos ya están disponibles de inmediato para desarrolladores y público general a través de la interfaz de programación de aplicaciones (API) de la empresa y sus diversos productos de consumo, incluido el plan de uso gratuito.
Los nuevos modelos amplían la cobertura lingüística para admitir más de 90 idiomas globales, en comparación con los cerca de 70 idiomas que admitía la versión anterior, con mejoras sustanciales en la precisión de la pronunciación y la simulación de acentos locales. La compañía señaló que los mayores saltos en la calidad vocal se manifestaron claramente en japonés, portugués de Brasil, chino mandarín y cantonés, lo que otorga a los creadores herramientas de pronunciación natural sin precedentes que eliminan la sensación robótica y monótona.
Velocidad de clonación extraordinaria y directrices de interpretación integradas
La cuarta generación introduce una función revolucionaria que consiste en la capacidad de clonar cualquier voz humana con absoluta precisión a través de un clip de audio de referencia que no supera los 10 segundos de duración, lo que representa una reducción drástica en los requisitos de datos auditivos necesarios para el entrenamiento. Asimismo, la empresa incorporó compatibilidad con etiquetas de directrices de voz textuales integradas, que permiten a los usuarios incluir instrucciones de actuación y lenguaje natural directamente dentro del texto escrito; tales como la inclusión de expresiones de risa, susurros y portazos violentos, para que el modelo los traduzca vocalmente con una naturalidad asombrosa.
Esta versión marcó el retorno de la función de «clonación de voces profesionales», que estuvo ausente en el modelo de la tercera versión lanzado el año pasado. Los modelos admiten la generación de textos largos de hasta 10 000 caracteres por lote, y están provistos de la función inteligente de «tejido de contexto» diseñada para mantener la estabilidad del tono de lectura, el ritmo y la continuidad de la voz en proyectos de audio prolongados, como audiolibros y novelas extensas, sin interrupción alguna en el estilo.
Versión turbo ultrarrápida para agentes de conversación telefónica
La versión «Turbo» destinada a la cuarta generación fue optimizada específicamente para operar con aplicaciones de inteligencia artificial conversacional en tiempo real, ya que admite transmisión de audio bidireccional que comienza a reproducir y pronunciar las salidas de voz para el oyente incluso antes de que se complete la generación de la frase textual en el sistema. ElevenLabs registró un tiempo medio asombroso para alcanzar la primera pronunciación de aproximadamente 150 milisegundos en las pruebas de rendimiento comparativas internas de la empresa, frente a unos 262 milisegundos del modelo Cartesia Sonic 3.6 y 814 milisegundos del modelo de voz OpenAI GPT-4o mini.
De acuerdo con un informe publicado por el medio «TechCrunch», el modelo posee capacidades de comportamiento avanzadas para gestionar situaciones de diálogo complejas durante llamadas automatizadas; ya que puede lidiar con flexibilidad ante interrupciones verbales, situaciones de escalada de reclamaciones, retención de llamadas y puesta en espera de los clientes. Estas funciones avanzadas han sido diseñadas específicamente para satisfacer las necesidades de los centros de llamadas y de atención al cliente en grandes empresas que buscan una automatización confiable que emule el comportamiento humano.
Salto en los ingresos financieros y expectativas de oferta pública
ElevenLabs ha experimentado un crecimiento acelerado e impresionante en su estructura y operaciones desde que recaudó una financiación de 500 millones de dólares de la mano de «Sequoia Capital» a principios de este año, con una valoración financiera de 11 000 millones de dólares. La tasa de ingresos operativos anuales de la empresa saltó desde unos 330 millones de dólares a principios de año para superar la barrera de los 600 millones de dólares, con más del 55 % de dichos ingresos fluyendo directamente de clientes del sector corporativo y grandes empresas, al tiempo que su número de empleados se infló para superar los 800 trabajadores repartidos entre la India, Europa y Brasil.
En los mercados financieros circulan fuertes rumores sobre una nueva y próxima ronda de financiación que podría elevar la valoración de la compañía a 22 000 millones de dólares. Mati Staniszewski, cofundador y director ejecutivo, declaró a TechCrunch que la empresa tiene como objetivo llevar a cabo una oferta pública inicial (OPI) de sus acciones en la bolsa de valores «en los próximos años» sin comprometerse con un cronograma estricto. Estos pasos se producen en medio de una feroz competencia que presencia el sector de la voz generativa con empresas emergentes como Cartesia y Deepgram, además de los proyectos competitivos de Google y OpenAI.
Preguntas frecuentes
Pregunta: ¿Cuál es el número de idiomas compatibles con la cuarta generación de los modelos de ElevenLabs?
Respuesta: El modelo admite más de 90 idiomas globales con mejoras notables en los idiomas asiáticos orientales y europeos.
Pregunta: ¿Cuál es la duración mínima de la grabación de voz requerida para clonar la voz?
Respuesta: La nueva tecnología requiere únicamente una grabación de audio de referencia de 10 segundos de duración para clonar la identidad vocal con gran precisión.
Pregunta: ¿Qué velocidad alcanza el modelo Turbo en el inicio de la pronunciación interactiva?
Respuesta: El modelo registra un tiempo medio de inicio de voz de 150 milisegundos, lo que lo hace ideal para agentes de conversación en centros de llamadas.