IA

ElevenLabs v4 clona tu voz con solo 10 segundos de audio y la pone a hablar 90 idiomas

Susan Hill
Añádenos en Google

ElevenLabs lanzó Eleven v4, un modelo de texto a voz que lee textos en voz alta con una risa, un suspiro o un acento francés de enojo, según lo que pida quien escribe. Para clonar una voz al instante basta con una grabación más corta que un mensaje de voz; después, la voz clonada puede hablar decenas de idiomas sin perder su timbre. Cualquier persona con una cuenta gratuita de ElevenLabs puede usarlo.

Para quienes crean contenido con sonido, esto elimina jornadas enteras de trabajo. Un podcaster puede doblar un episodio al japonés con su propia voz, un desarrollador de videojuegos independiente puede darles una forma de hablar distintiva a todos los personajes secundarios sin reservar un estudio, y un narrador de audiolibros puede insertar una pausa o una risita directamente en el guion. La otra cara de la moneda es igual de concreta: una nota de voz, un fragmento de una videollamada o unos segundos de una publicación pública bastan ahora como material para crear una copia convincente de alguien.

El principal cambio está en el control, y clonar una voz requiere apenas 10 segundos de audio. Los modelos anteriores de ElevenLabs leían los textos con fluidez, pero tenían que adivinar el estado de ánimo. La versión 4 acepta indicaciones escénicas escritas entre corchetes dentro del texto, como [se ríe] o [dicho con enojo y acento francés], e incluso indicaciones de fondo como [lluvia ligera] o [teléfono vibrando]. La empresa afirma que el modelo también capta el tono y el ritmo a partir del contexto, de modo que una frase en una escena tensa suena tensa sin necesidad de agregar una etiqueta. En escenas con varios hablantes, cada voz se mantiene consistente a lo largo de pasajes extensos, algo que suele ser un punto débil de la narración sintética, cuyas voces tendían a cambiar durante un capítulo.

La cobertura de idiomas pasa de 70 en la versión anterior a más de 90, y ElevenLabs destacó el japonés, el portugués de Brasil, el mandarín y el cantonés como los idiomas en los que más mejoró la calidad, según TechCrunch. Una voz clonada conserva su identidad al cambiar de idioma, así que la versión clonada de alguien que habla español, al leer en alemán, sigue sonando como esa persona, pero con acento nativo alemán. Un segundo modelo, v4 Turbo, está diseñado para asistentes de voz y agentes de centros de atención telefónica. Empieza a hablar en unos 150 milisegundos —más o menos la pausa entre dos personas cuando se turnan para hablar— y puede comenzar a responder antes de que el chatbot que lo alimenta termine de redactar su respuesta.

ElevenLabs no está sola en este mercado. Google, OpenAI, Cartesia, Deepgram y Fish Audio también ofrecen voces sintéticas a los mismos desarrolladores. A las pocas horas del lanzamiento, la firma independiente de evaluación Artificial Analysis ubicó a v4 en el primer puesto de su clasificación de voces, donde los oyentes califican muestras anónimas en comparaciones lado a lado. ElevenLabs también afirma que cerca de tres de cada cuatro oyentes prefirieron v4 en comparaciones a ciegas con sus competidores, una cifra que proviene de sus propias pruebas.

Las salvedades empiezan con esos 10 segundos. ElevenLabs dice que sus clones requieren el consentimiento de la persona cuya voz se carga; además, cuenta con un clasificador público que puede detectar audio creado con sus herramientas y bloquea directamente la clonación de algunas figuras políticas. Estas medidas frenan los usos indebidos más casuales, pero dependen de que quien sube el audio diga la verdad, y a un estafador le basta una muestra breve de la voz de un familiar para montar una falsa llamada de emergencia. El plan gratuito también es limitado: ofrece unos 10 minutos de audio generado al mes, según el desglose de los planes de Unite.AI, y las opciones de pago comienzan en $6 al mes.

Eleven v4 y v4 Turbo se lanzaron el 28 de septiembre en la aplicación para creadores de ElevenLabs, su plataforma de agentes y su API para desarrolladores. La empresa, con sede en Londres, recaudó $500 millones de Sequoia en febrero, con una valoración de $11.000 millones, y TechCrunch informa que sus ingresos anualizados ya superaron los $600 millones. El director ejecutivo, Mati Staniszewski, le dijo a TechCrunch que la compañía apunta a cotizar en bolsa en los próximos años, aunque no se comprometió con una fecha.

Para los creadores, una voz que se ríe cuando se lo piden en 90 idiomas es un estudio de grabación en una pestaña del navegador. Para todos los demás, es un motivo más para colgar y volver a llamar cuando una voz conocida al teléfono pide dinero.

Etiquetas: , , , , ,

Añádenos en Google

Discussion

There are 0 comments.