IA

El chip Jalapeño de OpenAI realiza inferencias con una eficiencia 1,9 veces superior a Nvidia Blackwell por vatio

Adrian Kessler

OpenAI creó su propio chip. La compañía presentó Jalapeño en la conferencia Hot Chips el 25 de agosto, un diseño de silicio desarrollado en colaboración con Broadcom que procesa solicitudes de inferencia a 85.448 tokens por segundo por kilovatio. La arquitectura Blackwell de Nvidia, el estándar actual del mercado, alcanza 44.960 en la misma métrica. La proporción es de 1,9 veces.

La métrica importa porque la inferencia es la forma en que los sistemas de IA operan en producción. El entrenamiento ocurre una sola vez; la inferencia ocurre cada vez que alguien envía una consulta a ChatGPT, usa una API o interactúa con cualquier aplicación que ejecuta un modelo de lenguaje. El costo de la inferencia a escala es el principal motor de la economía de los servicios de IA. Un chip que reduce el consumo energético de la inferencia aproximadamente a la mitad, si se despliega ampliamente, cambia el costo por consulta de ejecutar modelos.

En cargas de trabajo interactivas, donde la latencia de respuesta es el factor limitante, la ventaja de Jalapeño se extiende aún más. El informe de SemiAnalysis sobre la presentación en Hot Chips situó el rango entre 2,1 y 4,1 veces mejor que Blackwell en esos puntos de referencia. La dispersión refleja la variación entre tipos de tareas específicos; el límite inferior es la comparación más conservadora.

El chip solo maneja inferencia. No ejecuta las cargas de trabajo de entrenamiento que produjeron los modelos que Jalapeño está diseñado para ejecutar. Esas todavía requieren hardware de Nvidia. Broadcom fabricó el chip bajo un acuerdo de diseño personalizado con OpenAI, en lugar de venderlo como producto comercial. El acuerdo le da a OpenAI una capa de inferencia hecha a la medida sin exigirle competir en el mercado de chips comercial.

El cronograma de despliegue de OpenAI es limitado. El lanzamiento a pequeña escala está previsto antes de que termine 2026; el despliegue más amplio es una meta para 2027. El chip sigue en la fase de muestra de ingeniería, lo que significa que la versión de producción aún no se ha enviado a escala. Los puntos de referencia de Hot Chips representan el objetivo de diseño, no una corrida de producción verificada. La brecha entre el anuncio en una conferencia y el despliegue operativo de un silicio personalizado suele medirse en años.

El anuncio encaja en un cambio más amplio entre las grandes empresas de IA hacia el silicio personalizado. Google ha operado sus propias Tensor Processing Units en producción durante una década. Amazon utiliza Trainium e Inferentia en AWS. Meta opera sus propios chips de inferencia internamente. La entrada de OpenAI confirma que, a la escala de cientos de millones de usuarios activos, la economía de depender por completo de proveedores externos de GPU se vuelve lo bastante difícil como para justificar el costo de un programa de diseño personalizado.

Etiquetas: , , , , ,

Discussion

There are 0 comments.