IA

Gemini 3.8 Live le pone cara en tiempo real al asistente de IA

Adrian Kessler
Añádenos en Google

El sistema es Gemini 3.8 Live con Live Avatar. Combina el modelo de voz a voz de Google con una capa de video en tiempo real que genera movimientos de labios y expresiones faciales, mientras ejecuta llamadas a herramientas en segundo plano sin interrumpir la conversación. La detección del idioma es automática: el avatar cambia de idioma hablado a mitad de la llamada sin transferirla a otra persona, recargar el sistema ni generar una pausa perceptible.

Lo que distingue esta tecnología de las técnicas de superposición de video es que la generación de audio y video se ejecuta en la misma ruta de inferencia en vivo, en lugar de realizarse en pasos consecutivos. Esta integración mantiene la latencia lo suficientemente baja como para conservar el ritmo natural de una conversación. Google incorpora de manera imperceptible la marca de agua SynthID tanto al audio como al video: cada segundo incluye una etiqueta legible por máquina que lo identifica como contenido generado por IA, incluso si la transmisión se graba y se reproduce más adelante. La marca de agua resiste la recodificación, por lo que es posible verificar la procedencia de los clips exportados.

Equal AI, que gestiona implementaciones empresariales en toda India, ofrece el indicio más claro de lo que esta tecnología permite a escala operativa: nueve idiomas de India activos de manera simultánea, más de un millón de llamadas en vivo al día y una cobertura total de 97 idiomas. Alcanzar ese volumen con agentes humanos, con una disponibilidad y una cobertura horaria equivalentes, sería económicamente inviable. El supuesto de diseño detrás de esta implementación no es una prueba de concepto: es el volumen de operaciones.

Lo que Google no ha dado a conocer con el lanzamiento es el precio. La empresa no ha publicado los costos y remite las consultas a su equipo de ventas empresariales. La creación de avatares personalizados —es decir, que las organizaciones generen un rostro a partir de sus propias imágenes de referencia— requiere que Google autorice su inclusión en una lista empresarial, mediante un proceso de verificación independiente; no es una opción de autoservicio. Las capacidades de Extended Thinking para el modelo Live siguen en vista previa privada, lo que limita la profundidad de razonamiento en comparación con otras ofertas de Gemini de Google. Tampoco se han informado los límites de sesiones simultáneas. El alcance restringido del lanzamiento coincide con el patrón de Google para las implementaciones empresariales por etapas, en las que el precio y la capacidad se negocian en lugar de publicarse.

Gemini 3.8 Live con Live Avatar ya está disponible en la consola de Gemini Enterprise y a través de Live API, con puntos de conexión en Estados Unidos y la Unión Europea. Google no ha anunciado un calendario para ampliar el acceso a Extended Thinking para el modelo Live más allá del grupo que participa actualmente en la vista previa privada.

Las empresas que lo implementen responderán una pregunta que la tecnología no puede resolver: si eliminar la señal visual que delata una interacción automatizada mejora la experiencia de los usuarios o les quita el último indicio honesto de que están hablando con un sistema automatizado.

Etiquetas: , , , , ,

Añádenos en Google

Discussion

There are 0 comments.