Zum Inhalt springen

Liquid AI LFM2.5-VL-DSpark beschleunigt sein 3B-Vision-Modell

Das Draft-Modell LFM2.5-VL-DSpark von Liquid AI mit 280M Parametern dekodiert sein 3B-Vision-Modell auf einem M5 Max bis zu 3.13x schneller, bei identischer Ausgabe.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
Liquid AI's diagram of the DSpark method in three steps: the target model prefills, the draft model proposes a block of tokens, and the target model verifies them.
Foto: Liquid AI

Die Zahlen

parameters in the DSpark draft model
279.5M
added on top of the 3B target model
8.9%
best decode speedup, Apple M5 Max
3.13x
LFM2.5-VL-DSpark best decode speedup by hardware
Apple M5 Max (MLX)
3.13x
Nvidia H100
2.66x
Apple M3 Ultra (llama.cpp)
2.14x

Liquid AI hat am 24. September 2026 LFM2.5-VL-DSpark veröffentlicht, ein kleines Zusatzmodell, mit dem sein Vision-Language-Modell mit 3 Milliarden Parametern schneller antwortet. Auf Apples M5-Max-Chip dekodiert es bis zu 3.13-mal schneller, laut dem Beitrag von Liquid AI auf Hugging Face. Die Ausgabe bleibt exakt gleich, was für alle wichtig ist, die Modelle zum Bildverständnis auf lokaler Hardware betreiben.

Ein Vision-Language-Modell liest Bilder und Text und antwortet in Text. Das Modell von Liquid AI dafür ist LFM2.5-VL-3B. DSpark ersetzt es nicht. Es arbeitet neben ihm und hilft ihm, Antworten schneller zu schreiben.

Wie ein Draft-Modell Antworten beschleunigt

Die Technik heißt spekulatives Dekodieren. Ein kleines "Draft"-Modell errät schnell die nächsten Wörter, die sogenannten Tokens. Das große "Ziel"-Modell prüft dann alle diese Vermutungen in einem Durchgang. Es behält die, denen es zustimmt, und verwirft den Rest.

Einen Stapel Vermutungen auf einmal zu prüfen ist viel günstiger, als jedes Token einzeln zu schreiben. In seinem früheren DSpark-Beitrag erklärt Liquid AI, warum: "Der Großteil der Latenz entsteht durch das Streamen der Gewichte aus dem DRAM in den SRAM, nicht durch intensive Berechnung." Einfach gesagt: Langsam ist das Bewegen des Modells durch den Speicher, nicht die Rechnung selbst.

Weil das Zielmodell jedes Token freigibt, ändert sich die endgültige Antwort nicht. Liquid AI sagt, die Methode "tauscht einen minimalen Mehrbedarf an Speicher gegen einen größeren Geschwindigkeitsgewinn, ohne die Ausgabequalität zu verändern."

Was in LFM2.5-VL-DSpark steckt

RuntimeWire beziffert das Draft-Modell auf 279.5 Millionen Parameter, etwa 8.9 % der Größe des Zielmodells. Es nutzt vier reine Attention-Schichten und schlägt jeweils Blöcke von acht bis neun Tokens vor.

Der Beitrag von Liquid AI schlüsselt den Draft weiter auf: ein Decoder-Stack mit 193.0M, eine Projektionsschicht mit 21.0M und ein "Markov-Head" mit 65.5M. Der Draft arbeitet mit den internen Repräsentationen des Zielmodells und behandelt Bild- und Texteingaben daher gleich.

Beschleunigung nach Hardware

Die Gewinne hängen von der Maschine ab. Die Dekodiergeschwindigkeit gibt an, wie schnell das Modell seine Antwort schreibt. Die End-to-End-Geschwindigkeit umfasst auch das Lesen des Bildes und des Prompts.

HardwareBeschleunigung beim DekodierenBeschleunigung End-to-End
Apple M5 Max (MLX)2.30x-3.13x1.56x-2.62x
Apple M3 Ultra (llama.cpp)1.57x-2.14x1.30x-1.77x
Nvidia H100 GPU2.04x-2.66x1.64x-2.27x

RuntimeWire berichtet, dass das Zielmodell pro Prüfung 3.2 bis 4.5 Draft-Tokens akzeptiert. Diese Tests liefen mit einer Batchgröße von eins und 16-Bit-Gewichten.

Die Grenzen, die Liquid AI nennt

Spekulatives Dekodieren "beschleunigt nur das Dekodieren, nicht die Bildkodierung oder das Prefill", heißt es im Hugging-Face-Beitrag. Die Bildkodierung verwandelt das Bild in Zahlen, die das Modell verwenden kann. Das Prefill liest den Prompt, bevor die Antwort beginnt. Auf kleinen Geräten beanspruchen diese Schritte einen großen Teil der Zeit, daher fallen die End-to-End-Gewinne geringer aus als die beim Dekodieren.

Der Draft kann außerdem nicht allein laufen. Er funktioniert nur zusammen mit LFM2.5-VL-3B.

Was das für Entwickler bedeutet

Wenn Sie LFM2.5-VL-3B lokal betreiben, probieren Sie den Draft jetzt aus. Liquid AI sagt, er sei bereits in llama.cpp, MLX-VLM und SGLang integriert, sollte sich also in ein bestehendes Setup einfügen.

Messen Sie Ihre eigene Arbeitslast, nicht die Schlagzeilenzahl. Kurze Antworten zu großen Bildern profitieren am wenigsten, weil die Bildkodierung dominiert. Lange Textantworten, etwa die detaillierte Beschreibung eines Diagramms, profitieren am meisten.

Planen Sie den Speicher ein. Der Draft erhöht die Größe des Modells um weniger als 9 %, was wenig ist, aber auf einem Smartphone oder einem Laptop mit wenig RAM nicht null.

Achten Sie auch auf das Muster. Liquid AI hat bereits im August DSpark-Drafts für seine Textmodelle ausgeliefert und dort für LFM2.5-2.6B eine durchschnittliche Beschleunigung von 2.67x auf einer H100 gemeldet. Ein passender Draft für das Vision-Modell deutet darauf hin, dass diese kleinen Hilfsmodelle zum festen Bestandteil von Open-Weight-Veröffentlichungen werden, nicht zu einem Extra.

Quellen

  1. Accelerating vision-language models with LFM2.5-VL-DSpark - Hugging Face
  2. Liquid AI adds a 280M draft model to speed up its 3B vision model - RuntimeWire
  3. LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook - Liquid AI

Ähnliche Artikel

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
KI & LLMs

Layas typisierte Entscheidungen, erklärt

Ein Modell für typisierte Entscheidungen füllt feste Fragen mit typisierten Antworten und einer Vertrauenszahl. Layas offene 421M-Gewichte lassen Sie das selbst prüfen.