IA

AMD apuesta por grabar pesos de IA en silicio para ganar la carrera de inferencia a Nvidia

Susan Hill

AMD está adquiriendo Taalas, una startup de Toronto que fabrica chips que integran los pesos de los modelos de IA de forma permanente en el silicio, en lugar de cargarlos desde la memoria durante la inferencia. El chip HC1 de la compañía genera 16,960 tokens por segundo en el modelo Llama 3.1 8B de Meta, una cifra que AMD asegura es 48 veces más rápida que las GPU de Nvidia y 8.5 veces más rápida que Cerebras, el especialista en chips de inferencia.

La tecnología detrás de Taalas aprovecha una ineficiencia estructural en la forma en que funciona la inferencia de IA actual. Las GPU estándar son flexibles: pueden ejecutar cualquier modelo, cambiar de tarea bajo demanda y reprogramarse cuando se actualiza un modelo. Esa flexibilidad también es el cuello de botella. Cargar miles de millones de pesos del modelo desde la memoria de alto ancho de banda a las unidades de cómputo en cada solicitud de inferencia genera una latencia que agregar más GPU no puede eliminar.

Taalas integra esos pesos directamente en el silicio del chip en el momento de fabricación. El modelo vive en el hardware, no en la memoria que se recupera por solicitud. Las cifras de rendimiento que AMD está publicitando reflejan esa decisión arquitectónica, pero a un precio que la compañía no minimiza: una vez que un chip se fabrica con un modelo específico integrado, actualizarlo requiere un nuevo tape-out de silicio. Taalas dice que solo es necesario cambiar dos capas de metal para una actualización del modelo, lo que acorta el ciclo, pero estos chips no pueden adaptarse sobre la marcha a una versión más reciente del modelo.

Bajo el plan de integración de AMD, los chips de Taalas se encargarán de la generación de tokens —la fase más lenta de la inferencia— mientras que las GPU Instinct de AMD manejarán el prefill y el cálculo de atención al inicio de cada solicitud. El sistema combinado funciona sobre la plataforma Helios a escala de rack de AMD. Para los operadores de nube que ejecutan cargas de trabajo con modelos fijos —bots de atención al cliente, tuberías de procesamiento de documentos, traducción en tiempo real— la promesa es un rendimiento por vatio de rack que los clústeres flexibles de GPU no pueden igualar a un costo equivalente.

Si ese cálculo sobrevive al ritmo de actualización de modelos de la industria es la pregunta central. Los principales laboratorios ahora actualizan sus modelos de producción aproximadamente cada seis meses. Un chip bloqueado a Llama 3.1 8B hoy puede necesitar ser retirado cuando un sucesor se convierta en el objetivo de despliegue estándar. La afirmación de Taalas sobre la actualización de dos capas de metal ayuda, pero un tape-out de silicio aún toma meses en completarse, un rezago significativo cuando los modelos se renuevan más rápido que los ciclos del hardware.

La adquisición llega siete meses después de que Nvidia comprara Groq —un enfoque diferente al mismo problema de velocidad de inferencia— por un reportado $20 mil millones. Los procesadores de flujo tensorial de Groq también optimizan el rendimiento pero conservan la capacidad de cargar diferentes modelos. AMD está pagando una suma no revelada pero presumiblemente menor por una startup que hizo la apuesta opuesta.

Para los compradores, la adquisición de Taalas pertenece a la hoja de ruta más que al catálogo. El chip HC2, dirigido a modelos de hasta 20 mil millones de parámetros, aún está en desarrollo. La referencia de 48x se aplica al HC1 bajo condiciones específicas: los despliegues del mundo real con tráfico mixto y tamaños de lote variables producirán resultados diferentes. Se espera que el cierre del acuerdo ocurra en el cuarto trimestre de 2026, sujeto a revisión regulatoria. El HC1 se envió en febrero en 6nm; la fecha de envío del HC2 y el nodo de proceso objetivo siguen sin confirmarse.

Etiquetas: , , , ,

Discussion

There are 0 comments.