IA

Google presenta un modelo de voz que descarta muletillas en 85 idiomas

Adrian Kessler

Gemini 3.5 Transcribe no solo captura lo que alguien dice. Convierte lo que dijeron en lo que realmente querían decir. Cuando un hablante se corrige a mitad de frase — ‘Agendémoslo para el martes, no, miércoles’ — el modelo produce ‘miércoles’ y descarta la corrección. Las muletillas desaparecen. El ruido de fondo no lo detiene. El resultado llega como texto pulido y formateado, no como una captura de audio en bruto.

Para cualquiera que grabe entrevistas, podcasts o contenido multilingüe, esta distinción es todo el flujo de trabajo. Todas las herramientas de transcripción del mercado se encargan de ‘lo que se dijo’. El editor humano que lo limpiaba después se encargaba de todo lo demás. Google ahora está integrando ese editor directamente en el modelo.

El modelo admite dos rutas de API distintas. La API en vivo maneja transmisión bidireccional continua con latencia de menos de un segundo — diseñada para agentes de voz en tiempo real, bots de atención al cliente y cualquier cosa que necesite transcripción instantánea. La API de interacciones maneja audio grabado: reuniones completas, registros de llamadas y entrevistas, devolviendo atribución de hablantes para hasta tres participantes con marcas de tiempo. Ambas logran una tasa de error de palabras del 4.0% en modo streaming y del 2.6% en modo no streaming — medida por la firma independiente de evaluación comparativa Artificial Analysis. El modelo anterior de reconocimiento de voz de Google, Chirp 3, requería un 70% más de tiempo para llegar a la transcripción final.

El lado de consumo del lanzamiento es más modesto. En Android, Gboard Rambler ya utiliza Gemini 3.5 Transcribe para la entrada de voz a texto. La aplicación de Gemini para macOS lo soporta en inglés a través de la función Speak to Window. Chrome aparece como ‘próximamente’, lo que permitiría a los usuarios dictar en cualquier campo web — respuestas, publicaciones, formularios — sin cambiar de aplicación. No se ha confirmado una fecha específica para ese despliegue.

Los límites del modelo importan. La atribución de múltiples hablantes tiene un tope de tres participantes; los paneles y mesas redondas con más integrantes requieren soluciones alternativas. La aplicación Rambler para consumidores está actualmente disponible en ‘países e idiomas seleccionados’, no en los 85 que soporta el modelo. Google no ha anunciado precios para la API, que está en vista previa pública a través de Google AI Studio. El acceso empresarial se realiza a través de la Gemini Enterprise Agent Platform, donde los precios se negocian por separado. Para los creadores más pequeños, la pregunta del costo sigue abierta.

El marco competitivo también es relevante. OpenAI‘s Whisper, que sigue siendo la opción predeterminada para desarrolladores independientes, logra tasas de error de palabras en el rango del 5–7% en audio en inglés y requiere código de posprocesamiento para manejar la eliminación de muletillas y el formateo. Servicios como AssemblyAI y Deepgram ofrecen diarización de hablantes, pero no la corrección integrada de lenguaje natural que Gemini 3.5 Transcribe aplica por defecto. La diferencia es medible, aunque cómo se sostiene en el extremo más difícil del rango de 85 idiomas — acentos regionales, idiomas con pocos recursos, entornos ruidosos — requerirá pruebas independientes para establecerse.

La característica que más señala sobre la dirección a largo plazo de Google es la integración con Chrome. Una vez que la entrada de voz funcione en cualquier campo web, el modelo ya no es una herramienta para desarrolladores — es infraestructura para la forma en que las personas escriben. El cronograma de despliegue de ese cambio no se ha confirmado.

Etiquetas: , , , , ,

Discussion

There are 0 comments.