Liquid AI LFM2.5-VL-DSpark acelera su modelo de visión 3B
El modelo borrador LFM2.5-VL-DSpark de Liquid AI, de 280M de parámetros, decodifica su modelo de visión 3B hasta 3.13x más rápido en un M5 Max, con una salida idéntica.
3 min de lectura

En cifras
- parameters in the DSpark draft model
- 279.5M
- added on top of the 3B target model
- 8.9%
- best decode speedup, Apple M5 Max
- 3.13x
- Apple M5 Max (MLX)
- 3.13x
- Nvidia H100
- 2.66x
- Apple M3 Ultra (llama.cpp)
- 2.14x
Liquid AI lanzó LFM2.5-VL-DSpark el 24 de septiembre de 2026, un pequeño modelo complementario que hace que su modelo de visión y lenguaje de 3000 millones de parámetros responda más rápido. En el chip M5 Max de Apple decodifica hasta 3.13 veces más rápido, según la publicación de Liquid AI en Hugging Face. La salida sigue siendo exactamente la misma, algo importante para quien ejecuta modelos de comprensión de imágenes en hardware local.
Un modelo de visión y lenguaje lee imágenes y texto y responde con texto. El modelo de Liquid AI para esto es LFM2.5-VL-3B. DSpark no lo sustituye. Funciona a su lado y lo ayuda a escribir respuestas más rápido.
Cómo un modelo borrador acelera las respuestas
La técnica se llama decodificación especulativa. Un pequeño modelo "borrador" adivina rápidamente las siguientes palabras, conocidas como tokens. El gran modelo "objetivo" comprueba después todas esas conjeturas en una sola pasada. Se queda con las que acepta y descarta el resto.
Comprobar un lote de conjeturas de una vez es mucho más barato que escribir cada token uno por uno. En su anterior publicación sobre DSpark, Liquid AI explica por qué: "La mayor parte de la latencia proviene de transferir los pesos de la DRAM a la SRAM, no de un cálculo intensivo." Dicho de forma sencilla, lo lento es mover el modelo por la memoria, no las operaciones en sí.
Como el modelo objetivo aprueba cada token, la respuesta final no cambia. Liquid AI afirma que el método "cambia un aumento mínimo del uso de memoria por una mayor aceleración sin alterar la calidad de la salida."
Qué hay dentro de LFM2.5-VL-DSpark
RuntimeWire sitúa el modelo borrador en 279.5 millones de parámetros, aproximadamente el 8.9 % del tamaño del modelo objetivo. Usa cuatro capas solo de atención y propone bloques de ocho a nueve tokens cada vez.
La publicación de Liquid AI desglosa aún más el borrador: una pila de decodificador de 193.0M, una capa de proyección de 21.0M y una "cabeza de Markov" de 65.5M. El borrador trabaja sobre las representaciones internas del modelo objetivo, así que trata igual las entradas de imagen y de texto.
Aceleración según el hardware
Las mejoras dependen de la máquina. La velocidad de decodificación es la rapidez con la que el modelo escribe su respuesta. La velocidad de extremo a extremo incluye además la lectura de la imagen y del prompt.
| Hardware | Aceleración de decodificación | Aceleración de extremo a extremo |
|---|---|---|
| Apple M5 Max (MLX) | 2.30x-3.13x | 1.56x-2.62x |
| Apple M3 Ultra (llama.cpp) | 1.57x-2.14x | 1.30x-1.77x |
| Nvidia H100 GPU | 2.04x-2.66x | 1.64x-2.27x |
RuntimeWire informa de que el modelo objetivo acepta entre 3.2 y 4.5 tokens del borrador por comprobación. Esas pruebas usaron un tamaño de lote de uno y pesos de 16 bits.
Los límites que señala Liquid AI
La decodificación especulativa "acelera solo la decodificación, no la codificación visual ni el prefill", dice la publicación de Hugging Face. La codificación visual convierte la imagen en números que el modelo puede usar. El prefill lee el prompt antes de que empiece la respuesta. En dispositivos pequeños esos pasos ocupan buena parte del tiempo, por lo que las mejoras de extremo a extremo son menores que las de decodificación.
Además, el borrador no puede funcionar solo. Solo sirve emparejado con LFM2.5-VL-3B.
Qué significa para los desarrolladores
Si ejecutas LFM2.5-VL-3B en local, prueba el borrador ya. Liquid AI dice que ya está integrado en llama.cpp, MLX-VLM y SGLang, así que debería encajar en una configuración existente.
Mide tu propia carga de trabajo, no la cifra del titular. Las respuestas cortas sobre imágenes grandes tendrán las mejoras más pequeñas, porque domina la codificación de la imagen. Las respuestas de texto largas, como describir un gráfico en detalle, tendrán las mayores.
Reserva memoria. El borrador añade menos del 9 % al tamaño del modelo, lo cual es poco pero no cero en un teléfono o un portátil con poca RAM.
Fíjate también en la tendencia. Liquid AI ya lanzó en agosto borradores DSpark para sus modelos de texto, donde informó de una aceleración media de 2.67x en una H100 para LFM2.5-2.6B. Un borrador equivalente para el modelo de visión sugiere que estos pequeños modelos auxiliares se están convirtiendo en parte estándar de los lanzamientos de pesos abiertos, no en un extra.
Fuentes
Artículos relacionados

Las decisiones tipadas de Laya, explicadas
Un modelo de decisiones tipadas rellena preguntas fijas con respuestas tipadas y un número de confianza. Los pesos abiertos de Laya, 421M, le permiten comprobarlo usted mismo.

Laya responde a Jev con un modelo abierto de 421M
Laya devuelve decisiones tipadas en 32,8 milisegundos con 421 millones de parámetros y licencia Apache 2.0. Sin ajuste, su acierto roza el azar.

Qwen3.5-9B gasta 32 KB por token en la caché KV
Qwen3.5-9B usa atención completa en solo 8 de sus 32 capas, así que su caché KV cuesta 32 KB por token. Esa proporción decide si cabe en 8 GB.