Liquid AIのLFM2.5-VL-DSpark、3B視覚モデルを高速化
Liquid AIの280MパラメータのドラフトモデルLFM2.5-VL-DSparkは、投機的デコーディング (スペキュレイティブ・デコーディング)で3B視覚モデルのデコードをM5 Maxで最大3.13x高速化し、出力は同一のままです。
3 分で読めます

数字で見る
- parameters in the DSpark draft model
- 279.5M
- added on top of the 3B target model
- 8.9%
- best decode speedup, Apple M5 Max
- 3.13x
- Apple M5 Max (MLX)
- 3.13x
- Nvidia H100
- 2.66x
- Apple M3 Ultra (llama.cpp)
- 2.14x
Liquid AIは2026年9月24日、LFM2.5-VL-DSparkを公開しました。30億パラメータの視覚言語モデルの応答を速くする、小さな追加モデルです。Hugging FaceでのLiquid AIの投稿によると、AppleのM5 Maxチップではデコードが最大3.13倍速くなります。出力はまったく変わりません。これは画像理解モデルをローカルのハードウェアで動かす人にとって重要です。
視覚言語モデルは画像とテキストを読み、テキストで答えます。Liquid AIのこの種のモデルがLFM2.5-VL-3Bです。DSparkはこれを置き換えるものではありません。その横で動き、回答をより速く書く手助けをします。
ドラフトモデルが回答を速くする仕組み
この手法は投機的デコーディングと呼ばれます。小さな「ドラフト」モデルが、次に来る複数の単語(トークンと呼ばれます)をすばやく推測します。次に大きな「ターゲット」モデルが、それらの推測を1回の処理でまとめて確認します。同意したものは残し、残りは捨てます。
推測をまとめて確認するほうが、トークンを1つずつ書くよりはるかに低コストです。Liquid AIは以前のDSparkの投稿でその理由を説明しています。「レイテンシの大部分は、集中的な計算ではなく、重みをDRAMからSRAMへ転送することから生じます」。平たく言えば、遅いのは計算そのものではなく、モデルをメモリ内で動かすことです。
ターゲットモデルがすべてのトークンを承認するため、最終的な回答は変わりません。Liquid AIによると、この手法は「出力品質を変えずに、メモリ使用量のわずかな増加と引き換えに、より大きな高速化を得る」ものです。
LFM2.5-VL-DSparkの中身
RuntimeWireによると、ドラフトモデルは2億7,950万パラメータで、ターゲットモデルの約8.9%の大きさです。アテンションのみの層を4つ使い、一度に8〜9トークンのブロックを提案します。
Liquid AIの投稿はドラフトをさらに細かく分けています。193.0Mのデコーダスタック、21.0Mの射影層、65.5Mの「マルコフヘッド」です。ドラフトはターゲットモデルの内部表現を使って動くため、画像入力とテキスト入力を同じように扱えます。
ハードウェア別の高速化
効果はマシンによって異なります。デコード速度は、モデルが回答を書く速さです。エンドツーエンドの速度には、画像とプロンプトの読み込みも含まれます。
| ハードウェア | デコードの高速化 | エンドツーエンドの高速化 |
|---|---|---|
| Apple M5 Max (MLX) | 2.30x-3.13x | 1.56x-2.62x |
| Apple M3 Ultra (llama.cpp) | 1.57x-2.14x | 1.30x-1.77x |
| Nvidia H100 GPU | 2.04x-2.66x | 1.64x-2.27x |
RuntimeWireによると、ターゲットモデルは1回の確認で3.2〜4.5個のドラフトトークンを受け入れます。これらのテストはバッチサイズ1、16ビットの重みで行われました。
Liquid AIが挙げる制約
投機的デコーディングは「デコードだけを高速化し、画像エンコードやプレフィルは高速化しない」と、Hugging Faceの投稿は述べています。画像エンコードは、画像をモデルが使える数値に変換する処理です。プレフィルは、回答が始まる前にプロンプトを読み込む処理です。小型デバイスではこれらの処理が時間の大きな割合を占めるため、エンドツーエンドの効果はデコードの効果より小さくなります。
また、ドラフトは単独では動きません。LFM2.5-VL-3Bと組み合わせたときにだけ機能します。
開発者にとっての意味
LFM2.5-VL-3Bをローカルで動かしているなら、今すぐドラフトを試してください。Liquid AIによると、すでにllama.cpp、MLX-VLM、SGLangに統合されているので、既存の環境にそのまま組み込めるはずです。
見出しの数字ではなく、自分のワークロードを測定してください。大きな画像についての短い回答では、画像エンコードが大半を占めるため、効果は最も小さくなります。グラフを詳しく説明するような長いテキストの回答では、効果が最も大きくなります。
メモリも見込んでおきましょう。ドラフトによるモデルサイズの増加は9%未満です。小さな量ですが、RAMの少ないスマートフォンやノートPCではゼロではありません。
この流れにも注目してください。Liquid AIは8月にすでにテキストモデル向けのDSparkドラフトを出しており、H100上のLFM2.5-2.6Bで平均2.67xの高速化を報告していました。視覚モデル向けのドラフトが続いたことは、こうした小さな補助モデルがオープンウェイトのリリースで、おまけではなく標準的な要素になりつつあることを示しています。
出典
関連記事


LayaはJevに対する4億2100万パラメータの公開モデル
Layaは4億2100万パラメータでApache 2.0のもと、32.8ミリ秒で型付きの判断を返す。ただし追加学習なしの正解率は偶然に近い。

Qwen3.5-9B、KVキャッシュに1トークン32KBを使う
Qwen3.5-9Bは32層のうち8層だけがフルアテンション(全体参照型の注意機構)で、KVキャッシュの費用は1トークン32KBです。この比率が8GBに収まるかを決めます。