Qué pasó
- Liquid AI publicó el 24 de septiembre en el blog de Hugging Face LFM2.5-VL-3B-DSpark, una versión de su modelo de visión y lenguaje de 3.000 millones de parámetros acelerada con decodificación especulativa.
- La técnica usa un modelo auxiliar —un borrador— que propone varios tokens a la vez y deja que el modelo grande solo los verifique. El borrador pesa 280 millones de parámetros, un 8,9% de sobrecarga sobre el modelo principal.
- Las cifras publicadas por la compañía: en un portátil con chip M5 Max, la decodificación sube entre 2,30 y 3,13 veces, con ganancia total de hasta 2,62 veces. En un M3 Ultra con llama.cpp, entre 1,57 y 2,14 veces. En una GPU H100, 2,66 veces de decodificación y entre 1,64 y 2,27 veces de extremo a extremo.
- Los pesos quedan abiertos en Hugging Face, en formatos Safetensors y GGUF, con soporte desde el primer día en llama.cpp, MLX-VLM y SGLang.
Por qué importa
- El caso de uso que esto habilita en la región no es el laboratorio: es el terreno. Un modelo que lee imágenes a esa velocidad en un portátil sirve para revisar fichas de producto, leer boletas o clasificar fotos de inventario sin subir nada a un servidor externo.
- Eso toca directamente el problema regulatorio. Bajo la Ley 21.719, el dato que nunca sale del dispositivo evita buena parte de las obligaciones de transferencia internacional. La aceleración no es una mejora de rendimiento: es una condición para que el procesamiento local sea viable.
- La consecuencia que el anuncio no menciona: la ganancia se mide en hardware caro. Un M5 Max o una H100 no son el parque instalado promedio de una pyme chilena, y el número que importa —cuánto acelera en un equipo de gama media— no está publicado.
El dato
8,9% de sobrecarga en parámetros es lo que cuesta el borrador que, en el mejor caso medido, más que triplica la velocidad de decodificación.
Contexto
Es la segunda publicación en tres días sobre el mismo cuello de botella. El 23 de septiembre un grupo de MBZUAI presentó Flash-dLLM, que acelera la inferencia por difusión sin reentrenar el modelo. Las dos atacan el costo por token, no la capacidad.
Qué viene
- Sin plazos anunciados para versiones de otros tamaños ni para mediciones en hardware de gama media.
- Los pesos ya están disponibles; no hay fecha comprometida para una licencia distinta de la actual.
Cierre
La competencia por pesos abiertos dejó de medirse en puntajes de referencia. Xiaomi lo mostró al publicar MiMo con pesos abiertos y quedar sobre modelos cerrados en dos pruebas. Lo que se disputa ahora es dónde corre el modelo, no qué tan bien responde.
Fuentes
Editado por Rodrigo Cornejo. Cómo seleccionamos y verificamos: quiénes escriben estas notas.


