Aller au contenu

Liquid AI LFM2.5-VL-DSpark accélère son modèle de vision 3B

Le modèle brouillon LFM2.5-VL-DSpark de Liquid AI, avec 280M de paramètres, décode son modèle de vision 3B jusqu'à 3.13x plus vite sur un M5 Max, avec une sortie identique.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
Liquid AI's diagram of the DSpark method in three steps: the target model prefills, the draft model proposes a block of tokens, and the target model verifies them.
Photo: Liquid AI

En chiffres

parameters in the DSpark draft model
279.5M
added on top of the 3B target model
8.9%
best decode speedup, Apple M5 Max
3.13x
LFM2.5-VL-DSpark best decode speedup by hardware
Apple M5 Max (MLX)
3.13x
Nvidia H100
2.66x
Apple M3 Ultra (llama.cpp)
2.14x

Liquid AI a publié LFM2.5-VL-DSpark le 24 septembre 2026, un petit modèle complémentaire qui permet à son modèle vision-langage de 3 milliards de paramètres de répondre plus vite. Sur la puce M5 Max d'Apple, il décode jusqu'à 3.13 fois plus vite, selon le billet de Liquid AI sur Hugging Face. La sortie reste exactement la même, ce qui compte pour quiconque fait tourner des modèles de compréhension d'images sur du matériel local.

Un modèle vision-langage lit des images et du texte et répond en texte. Le modèle de Liquid AI pour cela est LFM2.5-VL-3B. DSpark ne le remplace pas. Il fonctionne à ses côtés et l'aide à rédiger ses réponses plus vite.

Comment un modèle brouillon accélère les réponses

La technique s'appelle le décodage spéculatif. Un petit modèle "brouillon" devine rapidement les mots suivants, appelés tokens. Le grand modèle "cible" vérifie ensuite toutes ces suppositions en une seule passe. Il garde celles avec lesquelles il est d'accord et jette le reste.

Vérifier un lot de suppositions d'un coup coûte bien moins cher que d'écrire chaque token un par un. Dans son précédent billet sur DSpark, Liquid AI explique pourquoi : "La majeure partie de la latence vient du transfert des poids de la DRAM vers la SRAM, pas d'un calcul intensif." En clair, la partie lente consiste à déplacer le modèle dans la mémoire, pas le calcul lui-même.

Comme le modèle cible valide chaque token, la réponse finale ne change pas. Liquid AI affirme que la méthode "échange une augmentation minimale de l'empreinte mémoire contre une accélération plus importante, sans modifier la qualité de la sortie."

Ce que contient LFM2.5-VL-DSpark

RuntimeWire chiffre le modèle brouillon à 279.5 millions de paramètres, soit environ 8.9 % de la taille du modèle cible. Il utilise quatre couches composées uniquement d'attention et propose des blocs de huit à neuf tokens à la fois.

Le billet de Liquid AI détaille davantage le brouillon : une pile de décodeur de 193.0M, une couche de projection de 21.0M et une "tête de Markov" de 65.5M. Le brouillon travaille sur les représentations internes du modèle cible, il traite donc les entrées image et texte de la même façon.

Accélérations selon le matériel

Les gains dépendent de la machine. La vitesse de décodage est la vitesse à laquelle le modèle écrit sa réponse. La vitesse de bout en bout inclut aussi la lecture de l'image et du prompt.

MatérielAccélération du décodageAccélération de bout en bout
Apple M5 Max (MLX)2.30x-3.13x1.56x-2.62x
Apple M3 Ultra (llama.cpp)1.57x-2.14x1.30x-1.77x
Nvidia H100 GPU2.04x-2.66x1.64x-2.27x

RuntimeWire indique que le modèle cible accepte 3.2 à 4.5 tokens brouillons par vérification. Ces tests utilisaient une taille de lot de un et des poids en 16 bits.

Les limites citées par Liquid AI

Le décodage spéculatif "n'accélère que le décodage, pas l'encodage visuel ni le prefill", indique le billet sur Hugging Face. L'encodage visuel transforme l'image en nombres que le modèle peut utiliser. Le prefill lit le prompt avant que la réponse ne commence. Sur les petits appareils, ces étapes prennent une grande part du temps, donc les gains de bout en bout sont plus faibles que ceux du décodage.

Le brouillon ne peut pas non plus fonctionner seul. Il ne marche qu'associé à LFM2.5-VL-3B.

Ce que cela signifie pour les développeurs

Si vous faites tourner LFM2.5-VL-3B en local, essayez le brouillon dès maintenant. Liquid AI indique qu'il est déjà intégré à llama.cpp, MLX-VLM et SGLang, il devrait donc s'insérer dans une installation existante.

Mesurez votre propre charge de travail, pas le chiffre mis en avant. Les réponses courtes sur de grandes images verront les gains les plus faibles, car l'encodage de l'image domine. Les longues réponses textuelles, comme la description détaillée d'un graphique, verront les plus importants.

Prévoyez la mémoire. Le brouillon ajoute moins de 9 % à la taille du modèle, ce qui est peu mais pas nul sur un téléphone ou un ordinateur portable avec peu de RAM.

Surveillez aussi la tendance. Liquid AI a déjà livré en août des brouillons DSpark pour ses modèles de texte, avec une accélération moyenne de 2.67x annoncée sur une H100 pour LFM2.5-2.6B. Un brouillon équivalent pour le modèle de vision suggère que ces petits modèles d'appoint deviennent une partie standard des publications à poids ouverts, et non un extra.

Sources

  1. Accelerating vision-language models with LFM2.5-VL-DSpark - Hugging Face
  2. Liquid AI adds a 280M draft model to speed up its 3B vision model - RuntimeWire
  3. LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook - Liquid AI

Articles liés

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
IA & LLM

Les décisions typées de Laya, expliquées

Un modèle à décisions typées remplit des questions fixes avec des réponses typées et un indice de confiance. Les poids ouverts de Laya, 421M, permettent de vérifier cela soi-même.