ElevenLabs ha estrenado Eleven v4 y Eleven v4 Turbo, la nueva generación de sus modelos de voz. La compañía pone el foco en algo que cada vez importa más en la síntesis de voz: no solo que una IA pronuncie bien, sino que sea capaz de interpretar un texto con intención, emoción y cambios de tono más naturales.
Según la documentación oficial de ElevenLabs, Eleven v4 es su modelo de síntesis más avanzado hasta la fecha. Soporta más de 90 idiomas, frente a los más de 70 de Eleven v3, admite generaciones de hasta 10.000 caracteres y mejora la clonación de voz y la conservación del hablante cuando trabaja con textos largos.
La voz ya no solo tiene que sonar bien
El salto de v4 está especialmente pensado para usos donde la interpretación importa tanto como la calidad del audio. ElevenLabs cita entre sus escenarios principales los doblajes de personajes, los diálogos emocionales, los audiolibros y los proyectos multilingües.
También mantiene el soporte para diálogos naturales con varios interlocutores, una de las funciones más interesantes para crear conversaciones, ficción sonora o contenido donde intervienen distintas voces sin tener que generar cada fragmento por separado.
Eleven v4 Turbo apunta a asistentes y agentes de voz
Junto al modelo principal llega Eleven v4 Turbo, diseñado para situaciones en las que la latencia es crítica. ElevenLabs sitúa su latencia mediana de inferencia en torno a los 100 milisegundos, sin contar la latencia de la aplicación o de la red. Como referencia, Eleven v3 Conversational ronda los 280 ms.
Eso hace que Turbo tenga especial sentido en asistentes, agentes de voz y conversaciones en tiempo real, donde cualquier retraso adicional hace que la interacción resulte mucho menos natural. El modelo también incorpora etiquetas de audio para controlar con mayor precisión la interpretación.
El lanzamiento no viene acompañado de un aumento anunciado de los límites incluidos en los planes de ElevenLabs. La compañía mantiene su sistema de créditos y continúa separando sus modelos según calidad, velocidad y coste de generación.
La evolución es bastante clara: la carrera de las voces sintéticas ya no consiste únicamente en conseguir que suenen humanas. El siguiente paso es conseguir que sepan interpretar lo que están diciendo, y ElevenLabs quiere que v4 sea precisamente ese salto.