IA

10 personas en Microsoft construyeron un modelo de voz que supera a OpenAI y Google — y cuesta 72 % menos

Adrian Kessler

El modelo se llama MAI-Transcribe-2. Microsoft AI, la división liderada por Mustafa Suleyman, lo lanzó el 3 de septiembre a $0.10 por hora de audio — vigente hasta finales de 2026. La versión anterior, MAI-Transcribe-1.5, costaba $0.36 por hora. Esa reducción de precio del 72% no es un redondeo de marketing. Un centro de contacto que procesa 100,000 horas de audio al año pagaba $36,000 por el modelo anterior; la misma carga de trabajo ahora cuesta $10,000.

El rendimiento en benchmarks es lo que hace que el precio sea inusual. En la evaluación multilingüe FLEURS, MAI-Transcribe-2 ocupa el primer lugar en 60 idiomas con una tasa de error de palabras promedio del 5.2% — mejor que GPT-Transcribe de OpenAI, Gemini 3.5 Transcribe de Google, ElevenLabs Scribe v2 y Whisper V3-Large de Meta. En el ranking de Artificial Analysis, que mide precisión y latencia juntas, se sitúa en segundo lugar general y define lo que los investigadores llaman la frontera de Pareto — el límite más allá del cual no se puede mejorar una métrica sin degradar la otra. El modelo fue entrenado para ubicarse en el borde eficiente de esa frontera, no para perseguir el primer lugar en ninguna tabla de una sola métrica.

La velocidad es el segundo aspecto que vale la pena examinar. Microsoft afirma que MAI-Transcribe-2 procesa audio 10 veces más rápido que GPT-Transcribe, 7 veces más rápido que ElevenLabs Scribe v2 y 5 veces más rápido que Gemini 3.5 Transcribe. Para audio de larga duración — transcripción de podcasts, declaraciones legales, notas clínicas — esa diferencia determina si un flujo de trabajo se ejecuta en segundos o minutos. El modelo también hace diarización de hablantes (identificar quién habló y cuándo), marcas de tiempo a nivel de palabra, sesgo de palabras clave para terminología de dominio y soporte para cambio de código en idiomas que se mezclan a mitad de oración, citando específicamente hinglish y spanglish como ejemplos probados.

El equipo que lo construyó es notable en proporción a lo que construyó. Microsoft describe al grupo central como 10 personas, que operan con un mínimo de burocracia interna y son apoyadas por equipos más grandes que manejan la adquisición de datos y la gestión de proveedores. La afirmación resultante sobre eficiencia de GPU es específica: MAI-Transcribe-2 funciona a la mitad del costo de GPU de los modelos de última generación de la competencia. Si eso se mantiene bajo carga empresarial a escala no se puede verificar a partir del anuncio, pero la afirmación sobre la arquitectura es lo suficientemente precisa como para probarla.

El modelo ya está disponible en Microsoft Foundry, el MAI Playground y Open Router — lo que significa que el acceso no requiere un contrato con Azure ni una relación empresarial con Microsoft. Esa amplitud de distribución es deliberada. El impulso de Microsoft AI hacia las API directas para desarrolladores es parte de un reposicionamiento más amplio tras la reestructuración de la asociación con OpenAI. Las enmiendas de octubre de 2025 y abril de 2026 eliminaron los acuerdos de exclusividad y reparto de ingresos que habían definido la relación desde 2019. Microsoft ahora tiene un incentivo directo para competir a nivel de modelos en lugar de solo distribuir los resultados de OpenAI.

El precio de $0.10 está marcado como vigente hasta finales de 2026. El precio estándar después de esa fecha no ha sido revelado. Los compradores que evalúan MAI-Transcribe-2 para cargas de trabajo de producción están cotizando un producto cuyo costo no conocen para el año calendario 2027. Eso es un riesgo que vale la pena mencionar claramente, incluso si la tarifa actual hace que el modelo sea atractivo frente a cualquier alternativa visible.

Etiquetas: , , , , ,

Discussion

There are 0 comments.