IA

La IA de voz de OpenAI ya no espera turnos — cuesta $0.05 el minuto

Susan Hill

Cada asistente de voz en el mercado hoy te pide que esperes antes de hablar. El GPT-Live-1 de OpenAI no lo hace. El modelo, disponible a través de la API de OpenAI, escucha y habla simultáneamente — manejando interrupciones, pausas y superposición de voz como lo haría una persona en una llamada.

El precio es de 0,05 dólares por minuto para la capa de voz — 1,50 dólares por una conversación de 30 minutos, o 50 dólares por cada 1.000 minutos de conversación. Los desarrolladores pagan por separado un motor de razonamiento: el propio GPT-6 Astra de OpenAI o cualquier modelo compatible que maneje llamadas a herramientas y lógica de negocio. La capa de voz gestiona la mecánica de la conversación; la capa de razonamiento decide lo que la IA realmente dice y hace.

Lo que esa separación significa en la práctica: un bot de servicio al cliente puede escuchar “espera, en realidad quiero la otra opción” a media frase y responder a eso, en lugar de seguir a rajatabla con una respuesta preparada. Un tutor de idiomas puede detectar que un estudiante tropieza con una palabra sin esperar a que termine. Un sistema de reservas puede manejar el tipo de llamada del mundo real donde la gente se repite, cambia de opinión y habla unos sobre otros.

En el Full Duplex Bench — la evaluación diseñada específicamente para probar el manejo de voz en dirección simultánea — el GPT-Live-1 obtiene 30 puntos porcentuales más que su predecesor, el GPT-Realtime-2.1. Cuando se combina con GPT-6 Astra como motor de razonamiento, supera a Tau3, el punto de referencia de servicio al cliente que prueba consultas complejas de múltiples pasos sin pausas en la conversación.

La arquitectura de dos capas refleja una decisión de diseño deliberada. La sincronización del habla y el razonamiento se facturan por separado porque escalan de manera diferente: una startup que construye una aplicación ligera de tutoría paga menos en ambas capas que una empresa que ejecuta miles de llamadas de servicio al cliente simultáneas en GPT-6 Astra. El piso es de 0,05 dólares por minuto para la voz, independientemente de lo que funcione detrás.

Lo que GPT-Live-1 no cambia es la calidad de las respuestas. La capa de voz maneja cuándo y cómo habla la IA — no lo que sabe. Una respuesta mala y bien sincronizada sigue siendo una respuesta mala. Los desarrolladores que construyen aplicaciones de servicio al cliente deberán evaluar ambas capas por separado, y el motor de razonamiento podría añadir más a la factura que la propia capa de voz. OpenAI tampoco ha publicado datos sobre cómo se desempeña la arquitectura full-duplex en entornos de bajo ancho de banda o en líneas telefónicas ruidosas, donde la entrada de audio continua es más difícil de mantener.

GPT-Live-1 ya está disponible en la API de OpenAI. La compañía no ha anunciado un producto orientado al consumidor basado en el modelo, aunque ha indicado que versiones futuras del modo de voz de ChatGPT podrían basarse en la misma arquitectura subyacente. La tarifa de 0,05 dólares por minuto aplica desde el lanzamiento; OpenAI no ha publicado un cronograma para cambios de precios ni una lista de modelos de razonamiento de terceros aprobados para su uso con la capa de voz.

Etiquetas: , , , , ,

Discussion

There are 0 comments.