Qué pasó
- Quan Nguyen-Tri, Mukul Ranjan y Zhiqiang Shen, de la Universidad Mohamed bin Zayed de Inteligencia Artificial (MBZUAI), publicaron el 22 de septiembre en arXiv el método Flash-dLLM.
- El trabajo ataca la inferencia de modelos de lenguaje por difusión combinando un caché de claves y valores que considera el costo de mover datos, con decodificación paralela en la que el propio modelo propone y verifica.
- Reportan aceleraciones de 5,1 veces en GSM8K y 11 veces en HumanEval frente a Elastic-Cache, la mejor base previa, y de entre 22,3 y 148,2 veces frente a decodificación voraz sin caché.
- Declaran además 48% menos memoria de tarjeta gráfica que Fast-dLLM, rendimiento de 148 a 211 tokens por segundo sobre LLaDA-1.5 y funcionamiento hasta lotes de 32. El método no requiere entrenamiento adicional.
Por qué importa
- Los modelos por difusión venían perdiendo la discusión de costo frente a los autorregresivos por lentitud de inferencia, no por calidad. Este trabajo mueve esa comparación, y lo hace sin reentrenar, que es la parte cara.
- Para equipos que operan modelos en infraestructura propia —bancos, seguros y salud en Chile y la región, que no pueden mandar todo a una interfaz de programación externa—, 48% menos memoria significa correr en tarjetas que ya tienen, no en las que habría que importar.
- Consecuencia que el paper no desarrolla: una ganancia de eficiencia publicada sin restricción de licencia llega antes a quien opera servidores propios que a quien depende del calendario de su proveedor. La brecha de costo entre ambos se angosta por abajo.
El dato
48% es la reducción de memoria de tarjeta gráfica respecto de la base previa, con el mismo modelo.
Contexto
La competencia por bajar el costo de inferencia dejó de ser solo de precios de lista, como mostró el descuento por horario de menor demanda de DeepSeek, y pasó a ser de ingeniería. El reverso ya lo cubrimos: una vulnerabilidad sin parche en un motor de inferencia afecta a todos los que adoptaron la optimización de moda.
Qué viene
- El trabajo está en arXiv desde el 22 de septiembre, sin revisión de pares.
- Sin plazos anunciados para integrar el método en motores de inferencia de uso común.
Cierre
Cada vez que alguien publica una aceleración de dos dígitos, el mismo día alguien la integra sin leer el resto del paper. Esa es la parte que después aparece en un boletín de seguridad.
Fuentes
Editado por Rodrigo Cornejo. Cómo seleccionamos, verificamos y corregimos cada nota.


