Saltar al contenido

Liquid AI LFM2.5-VL-DSpark acelera su modelo de visión 3B

El modelo borrador LFM2.5-VL-DSpark de Liquid AI, de 280M de parámetros, decodifica su modelo de visión 3B hasta 3.13x más rápido en un M5 Max, con una salida idéntica.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
Liquid AI's diagram of the DSpark method in three steps: the target model prefills, the draft model proposes a block of tokens, and the target model verifies them.
Foto: Liquid AI

En cifras

parameters in the DSpark draft model
279.5M
added on top of the 3B target model
8.9%
best decode speedup, Apple M5 Max
3.13x
LFM2.5-VL-DSpark best decode speedup by hardware
Apple M5 Max (MLX)
3.13x
Nvidia H100
2.66x
Apple M3 Ultra (llama.cpp)
2.14x

Liquid AI lanzó LFM2.5-VL-DSpark el 24 de septiembre de 2026, un pequeño modelo complementario que hace que su modelo de visión y lenguaje de 3000 millones de parámetros responda más rápido. En el chip M5 Max de Apple decodifica hasta 3.13 veces más rápido, según la publicación de Liquid AI en Hugging Face. La salida sigue siendo exactamente la misma, algo importante para quien ejecuta modelos de comprensión de imágenes en hardware local.

Un modelo de visión y lenguaje lee imágenes y texto y responde con texto. El modelo de Liquid AI para esto es LFM2.5-VL-3B. DSpark no lo sustituye. Funciona a su lado y lo ayuda a escribir respuestas más rápido.

Cómo un modelo borrador acelera las respuestas

La técnica se llama decodificación especulativa. Un pequeño modelo "borrador" adivina rápidamente las siguientes palabras, conocidas como tokens. El gran modelo "objetivo" comprueba después todas esas conjeturas en una sola pasada. Se queda con las que acepta y descarta el resto.

Comprobar un lote de conjeturas de una vez es mucho más barato que escribir cada token uno por uno. En su anterior publicación sobre DSpark, Liquid AI explica por qué: "La mayor parte de la latencia proviene de transferir los pesos de la DRAM a la SRAM, no de un cálculo intensivo." Dicho de forma sencilla, lo lento es mover el modelo por la memoria, no las operaciones en sí.

Como el modelo objetivo aprueba cada token, la respuesta final no cambia. Liquid AI afirma que el método "cambia un aumento mínimo del uso de memoria por una mayor aceleración sin alterar la calidad de la salida."

Qué hay dentro de LFM2.5-VL-DSpark

RuntimeWire sitúa el modelo borrador en 279.5 millones de parámetros, aproximadamente el 8.9 % del tamaño del modelo objetivo. Usa cuatro capas solo de atención y propone bloques de ocho a nueve tokens cada vez.

La publicación de Liquid AI desglosa aún más el borrador: una pila de decodificador de 193.0M, una capa de proyección de 21.0M y una "cabeza de Markov" de 65.5M. El borrador trabaja sobre las representaciones internas del modelo objetivo, así que trata igual las entradas de imagen y de texto.

Aceleración según el hardware

Las mejoras dependen de la máquina. La velocidad de decodificación es la rapidez con la que el modelo escribe su respuesta. La velocidad de extremo a extremo incluye además la lectura de la imagen y del prompt.

HardwareAceleración de decodificaciónAceleración de extremo a extremo
Apple M5 Max (MLX)2.30x-3.13x1.56x-2.62x
Apple M3 Ultra (llama.cpp)1.57x-2.14x1.30x-1.77x
Nvidia H100 GPU2.04x-2.66x1.64x-2.27x

RuntimeWire informa de que el modelo objetivo acepta entre 3.2 y 4.5 tokens del borrador por comprobación. Esas pruebas usaron un tamaño de lote de uno y pesos de 16 bits.

Los límites que señala Liquid AI

La decodificación especulativa "acelera solo la decodificación, no la codificación visual ni el prefill", dice la publicación de Hugging Face. La codificación visual convierte la imagen en números que el modelo puede usar. El prefill lee el prompt antes de que empiece la respuesta. En dispositivos pequeños esos pasos ocupan buena parte del tiempo, por lo que las mejoras de extremo a extremo son menores que las de decodificación.

Además, el borrador no puede funcionar solo. Solo sirve emparejado con LFM2.5-VL-3B.

Qué significa para los desarrolladores

Si ejecutas LFM2.5-VL-3B en local, prueba el borrador ya. Liquid AI dice que ya está integrado en llama.cpp, MLX-VLM y SGLang, así que debería encajar en una configuración existente.

Mide tu propia carga de trabajo, no la cifra del titular. Las respuestas cortas sobre imágenes grandes tendrán las mejoras más pequeñas, porque domina la codificación de la imagen. Las respuestas de texto largas, como describir un gráfico en detalle, tendrán las mayores.

Reserva memoria. El borrador añade menos del 9 % al tamaño del modelo, lo cual es poco pero no cero en un teléfono o un portátil con poca RAM.

Fíjate también en la tendencia. Liquid AI ya lanzó en agosto borradores DSpark para sus modelos de texto, donde informó de una aceleración media de 2.67x en una H100 para LFM2.5-2.6B. Un borrador equivalente para el modelo de visión sugiere que estos pequeños modelos auxiliares se están convirtiendo en parte estándar de los lanzamientos de pesos abiertos, no en un extra.

Fuentes

  1. Accelerating vision-language models with LFM2.5-VL-DSpark - Hugging Face
  2. Liquid AI adds a 280M draft model to speed up its 3B vision model - RuntimeWire
  3. LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook - Liquid AI

Artículos relacionados

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
IA y LLM

Las decisiones tipadas de Laya, explicadas

Un modelo de decisiones tipadas rellena preguntas fijas con respuestas tipadas y un número de confianza. Los pesos abiertos de Laya, 421M, le permiten comprobarlo usted mismo.