Liquid AI LFM2.5-VL-DSpark beschleunigt sein 3B-Vision-Modell
Das Draft-Modell LFM2.5-VL-DSpark von Liquid AI mit 280M Parametern dekodiert sein 3B-Vision-Modell auf einem M5 Max bis zu 3.13x schneller, bei identischer Ausgabe.
3 Min. Lesezeit

Die Zahlen
- parameters in the DSpark draft model
- 279.5M
- added on top of the 3B target model
- 8.9%
- best decode speedup, Apple M5 Max
- 3.13x
- Apple M5 Max (MLX)
- 3.13x
- Nvidia H100
- 2.66x
- Apple M3 Ultra (llama.cpp)
- 2.14x
Liquid AI hat am 24. September 2026 LFM2.5-VL-DSpark veröffentlicht, ein kleines Zusatzmodell, mit dem sein Vision-Language-Modell mit 3 Milliarden Parametern schneller antwortet. Auf Apples M5-Max-Chip dekodiert es bis zu 3.13-mal schneller, laut dem Beitrag von Liquid AI auf Hugging Face. Die Ausgabe bleibt exakt gleich, was für alle wichtig ist, die Modelle zum Bildverständnis auf lokaler Hardware betreiben.
Ein Vision-Language-Modell liest Bilder und Text und antwortet in Text. Das Modell von Liquid AI dafür ist LFM2.5-VL-3B. DSpark ersetzt es nicht. Es arbeitet neben ihm und hilft ihm, Antworten schneller zu schreiben.
Wie ein Draft-Modell Antworten beschleunigt
Die Technik heißt spekulatives Dekodieren. Ein kleines "Draft"-Modell errät schnell die nächsten Wörter, die sogenannten Tokens. Das große "Ziel"-Modell prüft dann alle diese Vermutungen in einem Durchgang. Es behält die, denen es zustimmt, und verwirft den Rest.
Einen Stapel Vermutungen auf einmal zu prüfen ist viel günstiger, als jedes Token einzeln zu schreiben. In seinem früheren DSpark-Beitrag erklärt Liquid AI, warum: "Der Großteil der Latenz entsteht durch das Streamen der Gewichte aus dem DRAM in den SRAM, nicht durch intensive Berechnung." Einfach gesagt: Langsam ist das Bewegen des Modells durch den Speicher, nicht die Rechnung selbst.
Weil das Zielmodell jedes Token freigibt, ändert sich die endgültige Antwort nicht. Liquid AI sagt, die Methode "tauscht einen minimalen Mehrbedarf an Speicher gegen einen größeren Geschwindigkeitsgewinn, ohne die Ausgabequalität zu verändern."
Was in LFM2.5-VL-DSpark steckt
RuntimeWire beziffert das Draft-Modell auf 279.5 Millionen Parameter, etwa 8.9 % der Größe des Zielmodells. Es nutzt vier reine Attention-Schichten und schlägt jeweils Blöcke von acht bis neun Tokens vor.
Der Beitrag von Liquid AI schlüsselt den Draft weiter auf: ein Decoder-Stack mit 193.0M, eine Projektionsschicht mit 21.0M und ein "Markov-Head" mit 65.5M. Der Draft arbeitet mit den internen Repräsentationen des Zielmodells und behandelt Bild- und Texteingaben daher gleich.
Beschleunigung nach Hardware
Die Gewinne hängen von der Maschine ab. Die Dekodiergeschwindigkeit gibt an, wie schnell das Modell seine Antwort schreibt. Die End-to-End-Geschwindigkeit umfasst auch das Lesen des Bildes und des Prompts.
| Hardware | Beschleunigung beim Dekodieren | Beschleunigung End-to-End |
|---|---|---|
| Apple M5 Max (MLX) | 2.30x-3.13x | 1.56x-2.62x |
| Apple M3 Ultra (llama.cpp) | 1.57x-2.14x | 1.30x-1.77x |
| Nvidia H100 GPU | 2.04x-2.66x | 1.64x-2.27x |
RuntimeWire berichtet, dass das Zielmodell pro Prüfung 3.2 bis 4.5 Draft-Tokens akzeptiert. Diese Tests liefen mit einer Batchgröße von eins und 16-Bit-Gewichten.
Die Grenzen, die Liquid AI nennt
Spekulatives Dekodieren "beschleunigt nur das Dekodieren, nicht die Bildkodierung oder das Prefill", heißt es im Hugging-Face-Beitrag. Die Bildkodierung verwandelt das Bild in Zahlen, die das Modell verwenden kann. Das Prefill liest den Prompt, bevor die Antwort beginnt. Auf kleinen Geräten beanspruchen diese Schritte einen großen Teil der Zeit, daher fallen die End-to-End-Gewinne geringer aus als die beim Dekodieren.
Der Draft kann außerdem nicht allein laufen. Er funktioniert nur zusammen mit LFM2.5-VL-3B.
Was das für Entwickler bedeutet
Wenn Sie LFM2.5-VL-3B lokal betreiben, probieren Sie den Draft jetzt aus. Liquid AI sagt, er sei bereits in llama.cpp, MLX-VLM und SGLang integriert, sollte sich also in ein bestehendes Setup einfügen.
Messen Sie Ihre eigene Arbeitslast, nicht die Schlagzeilenzahl. Kurze Antworten zu großen Bildern profitieren am wenigsten, weil die Bildkodierung dominiert. Lange Textantworten, etwa die detaillierte Beschreibung eines Diagramms, profitieren am meisten.
Planen Sie den Speicher ein. Der Draft erhöht die Größe des Modells um weniger als 9 %, was wenig ist, aber auf einem Smartphone oder einem Laptop mit wenig RAM nicht null.
Achten Sie auch auf das Muster. Liquid AI hat bereits im August DSpark-Drafts für seine Textmodelle ausgeliefert und dort für LFM2.5-2.6B eine durchschnittliche Beschleunigung von 2.67x auf einer H100 gemeldet. Ein passender Draft für das Vision-Modell deutet darauf hin, dass diese kleinen Hilfsmodelle zum festen Bestandteil von Open-Weight-Veröffentlichungen werden, nicht zu einem Extra.
Quellen
Ähnliche Artikel

Layas typisierte Entscheidungen, erklärt
Ein Modell für typisierte Entscheidungen füllt feste Fragen mit typisierten Antworten und einer Vertrauenszahl. Layas offene 421M-Gewichte lassen Sie das selbst prüfen.

Laya ist eine offene Antwort auf Jev mit 421M Parametern
Laya liefert typisierte Entscheidungen in 32,8 Millisekunden aus 421 Millionen Parametern unter Apache 2.0. Ohne Feinabstimmung liegt die Trefferquote nahe am Zufall.

Qwen3.5-9B braucht 32KB pro Token für den KV-Cache
Qwen3.5-9B nutzt volle Attention in nur 8 seiner 32 Schichten, daher kostet sein KV-Cache 32KB pro Token. Dieses Verhältnis entscheidet, ob er in 8GB passt.