Liquid AI LFM2.5-VL-DSpark accélère son modèle de vision 3B
Le modèle brouillon LFM2.5-VL-DSpark de Liquid AI, avec 280M de paramètres, décode son modèle de vision 3B jusqu'à 3.13x plus vite sur un M5 Max, avec une sortie identique.
3 min de lecture

En chiffres
- parameters in the DSpark draft model
- 279.5M
- added on top of the 3B target model
- 8.9%
- best decode speedup, Apple M5 Max
- 3.13x
- Apple M5 Max (MLX)
- 3.13x
- Nvidia H100
- 2.66x
- Apple M3 Ultra (llama.cpp)
- 2.14x
Liquid AI a publié LFM2.5-VL-DSpark le 24 septembre 2026, un petit modèle complémentaire qui permet à son modèle vision-langage de 3 milliards de paramètres de répondre plus vite. Sur la puce M5 Max d'Apple, il décode jusqu'à 3.13 fois plus vite, selon le billet de Liquid AI sur Hugging Face. La sortie reste exactement la même, ce qui compte pour quiconque fait tourner des modèles de compréhension d'images sur du matériel local.
Un modèle vision-langage lit des images et du texte et répond en texte. Le modèle de Liquid AI pour cela est LFM2.5-VL-3B. DSpark ne le remplace pas. Il fonctionne à ses côtés et l'aide à rédiger ses réponses plus vite.
Comment un modèle brouillon accélère les réponses
La technique s'appelle le décodage spéculatif. Un petit modèle "brouillon" devine rapidement les mots suivants, appelés tokens. Le grand modèle "cible" vérifie ensuite toutes ces suppositions en une seule passe. Il garde celles avec lesquelles il est d'accord et jette le reste.
Vérifier un lot de suppositions d'un coup coûte bien moins cher que d'écrire chaque token un par un. Dans son précédent billet sur DSpark, Liquid AI explique pourquoi : "La majeure partie de la latence vient du transfert des poids de la DRAM vers la SRAM, pas d'un calcul intensif." En clair, la partie lente consiste à déplacer le modèle dans la mémoire, pas le calcul lui-même.
Comme le modèle cible valide chaque token, la réponse finale ne change pas. Liquid AI affirme que la méthode "échange une augmentation minimale de l'empreinte mémoire contre une accélération plus importante, sans modifier la qualité de la sortie."
Ce que contient LFM2.5-VL-DSpark
RuntimeWire chiffre le modèle brouillon à 279.5 millions de paramètres, soit environ 8.9 % de la taille du modèle cible. Il utilise quatre couches composées uniquement d'attention et propose des blocs de huit à neuf tokens à la fois.
Le billet de Liquid AI détaille davantage le brouillon : une pile de décodeur de 193.0M, une couche de projection de 21.0M et une "tête de Markov" de 65.5M. Le brouillon travaille sur les représentations internes du modèle cible, il traite donc les entrées image et texte de la même façon.
Accélérations selon le matériel
Les gains dépendent de la machine. La vitesse de décodage est la vitesse à laquelle le modèle écrit sa réponse. La vitesse de bout en bout inclut aussi la lecture de l'image et du prompt.
| Matériel | Accélération du décodage | Accélération de bout en bout |
|---|---|---|
| Apple M5 Max (MLX) | 2.30x-3.13x | 1.56x-2.62x |
| Apple M3 Ultra (llama.cpp) | 1.57x-2.14x | 1.30x-1.77x |
| Nvidia H100 GPU | 2.04x-2.66x | 1.64x-2.27x |
RuntimeWire indique que le modèle cible accepte 3.2 à 4.5 tokens brouillons par vérification. Ces tests utilisaient une taille de lot de un et des poids en 16 bits.
Les limites citées par Liquid AI
Le décodage spéculatif "n'accélère que le décodage, pas l'encodage visuel ni le prefill", indique le billet sur Hugging Face. L'encodage visuel transforme l'image en nombres que le modèle peut utiliser. Le prefill lit le prompt avant que la réponse ne commence. Sur les petits appareils, ces étapes prennent une grande part du temps, donc les gains de bout en bout sont plus faibles que ceux du décodage.
Le brouillon ne peut pas non plus fonctionner seul. Il ne marche qu'associé à LFM2.5-VL-3B.
Ce que cela signifie pour les développeurs
Si vous faites tourner LFM2.5-VL-3B en local, essayez le brouillon dès maintenant. Liquid AI indique qu'il est déjà intégré à llama.cpp, MLX-VLM et SGLang, il devrait donc s'insérer dans une installation existante.
Mesurez votre propre charge de travail, pas le chiffre mis en avant. Les réponses courtes sur de grandes images verront les gains les plus faibles, car l'encodage de l'image domine. Les longues réponses textuelles, comme la description détaillée d'un graphique, verront les plus importants.
Prévoyez la mémoire. Le brouillon ajoute moins de 9 % à la taille du modèle, ce qui est peu mais pas nul sur un téléphone ou un ordinateur portable avec peu de RAM.
Surveillez aussi la tendance. Liquid AI a déjà livré en août des brouillons DSpark pour ses modèles de texte, avec une accélération moyenne de 2.67x annoncée sur une H100 pour LFM2.5-2.6B. Un brouillon équivalent pour le modèle de vision suggère que ces petits modèles d'appoint deviennent une partie standard des publications à poids ouverts, et non un extra.
Sources
Articles liés

Les décisions typées de Laya, expliquées
Un modèle à décisions typées remplit des questions fixes avec des réponses typées et un indice de confiance. Les poids ouverts de Laya, 421M, permettent de vérifier cela soi-même.

Laya répond à Jev avec un modèle ouvert de 421M
Laya rend des décisions typées en 32,8 millisecondes à partir de 421 millions de paramètres, sous Apache 2.0. Sans réglage, sa précision frôle le hasard.

Qwen3.5-9B dépense 32 Ko par jeton pour son cache KV
Qwen3.5-9B n'utilise l'attention complète que sur 8 de ses 32 couches, donc son cache KV coûte 32 Ko par jeton. Ce rapport décide s'il tient dans 8 Go.