Desarrollo cuántico

Un método de MBZUAI acelera 11 veces la inferencia por difusión sin reentrenar nada


El trabajo combina caché de atención consciente del disco y decodificación paralela, y usa 48% menos memoria de tarjeta gráfica que su base previa.

23 de septiembre de 2026 · Read in English

Qué pasó

Por qué importa

El dato

48% es la reducción de memoria de tarjeta gráfica respecto de la base previa, con el mismo modelo.

Contexto

La competencia por bajar el costo de inferencia dejó de ser solo de precios de lista, como mostró el descuento por horario de menor demanda de DeepSeek, y pasó a ser de ingeniería. El reverso ya lo cubrimos: una vulnerabilidad sin parche en un motor de inferencia afecta a todos los que adoptaron la optimización de moda.

Qué viene

Cierre

Cada vez que alguien publica una aceleración de dos dígitos, el mismo día alguien la integra sin leer el resto del paper. Esa es la parte que después aparece en un boletín de seguridad.

Fuentes

Editado por Rodrigo Cornejo. Cómo seleccionamos, verificamos y corregimos cada nota.

Notas relacionadas

← Todas las notas