IA

DeepSeek V4.1 Flash: 8.000 millones de parámetros activos, caché 60% más barato y empate con Opus 5

Adrian Kessler

DeepSeek V4.1 Flash funciona con una nueva arquitectura que la compañía denomina Causal Encoder-Decoder. Sus 552 mil millones de parámetros abarcan un codificador de 20 capas y un decodificador de 20 capas, pero solo se activan 8 mil millones en los tokens de entrada y 16 mil millones en los de salida. Esto la hace estructuralmente más ligera que los modelos que activan porciones de parámetros más grandes para cada operación, un diseño que se traduce directamente en menores costos de inferencia y mayor eficiencia de memoria.

Las ganancias en memoria son concretas. La caché KV de V4.1 Flash ocupa 890 bytes por token, aproximadamente una cuarta parte de la de V4-Flash. El almacenamiento en caché FP4 y Compressed Sparse Attention 2 reducen la huella de la caché persistente a un octavo de la generación anterior. La entrada en caché ahora cuesta $0.003 por millón de tokens en horario valle, un 60 % menos que en V4-Flash. La entrada sin caché bajó un 33 % y la salida un 11 %.

En los benchmarks que más siguen los desarrolladores, el modelo se defiende. DeepSWE v1.1, la prueba autónoma de ingeniería de software, le otorga 74.2, ligeramente por delante de Opus 5 de Anthropic con 74.0 y por encima de GPT-5.6 Sol con 73.0. GPQA Diamond obtiene 90.9. La brecha que destaca es Terminal-Bench 3.0: 30.0 frente a los 43.3 de Opus 5, una diferencia real en tareas que requieren depuración interactiva prolongada.

La visión está integrada desde el preentrenamiento. Anteriormente, V4 separaba la visión en una variante Vision-Exp aparte. V4.1 Flash reemplaza ambas con un solo modelo construido alrededor de DeepSeek-ViT, un codificador entrenado específicamente y desarrollado en conjunto con el modelo de lenguaje desde el principio. El nivel multimodal ha desaparecido: cada llamada obtiene visión por defecto.

La ventana de contexto es de 1 millón de tokens, con un límite de salida de 384.000, suficiente para el análisis de documentos extensos y flujos de trabajo agénticos prolongados sin necesidad de fragmentación. Los llamados existentes a la API que usaban los identificadores antiguos deepseek-v4-flash y deepseek-v4-flash-vision-exp ya están siendo redirigidos a V4.1 Flash. El 14 de septiembre, el tráfico de DeepSeek V4 Pro también cambiará, y al precio de Flash.

DeepSeek describió a V4.1 Flash como «el modelo más pequeño de nuestra nueva familia de arquitecturas». Se da a entender que habrá un V4.1 Pro más grande con el mismo diseño Causal Encoder-Decoder. Si mantiene la trayectoria de eficiencia de Flash, extendería la relación rendimiento por dólar de esta arquitectura más arriba en la curva de benchmarks, hacia un territorio actualmente ocupado por modelos que cuestan significativamente más por millón de tokens.

El punto arquitectónico importa más allá de la tabla de precios. El crecimiento de la caché KV es una limitación principal para ejecutar modelos grandes con contextos largos, y escala con cada token procesado. El enfoque de V4.1 Flash —menos parámetros activos, caché comprimida— aborda esa limitación directamente. Es una plantilla utilizable para despliegues de contexto largo, no una optimización de casos extremos.

Etiquetas: , , , , ,

Discussion

There are 0 comments.