本文へスキップ

Liquid AIのLFM2.5-VL-DSpark、3B視覚モデルを高速化

Liquid AIの280MパラメータのドラフトモデルLFM2.5-VL-DSparkは、投機的デコーディング (スペキュレイティブ・デコーディング)で3B視覚モデルのデコードをM5 Maxで最大3.13x高速化し、出力は同一のままです。

著者 Tech AI Wire Team

3 分で読めます

Liquid AIによるDSpark手法の3段階の図。ターゲットモデルがプレフィルを行い、ドラフトモデルがトークンのブロックを提案し、ターゲットモデルがそれらを検証する。
写真: Liquid AI

数字で見る

parameters in the DSpark draft model
279.5M
added on top of the 3B target model
8.9%
best decode speedup, Apple M5 Max
3.13x
LFM2.5-VL-DSpark best decode speedup by hardware
Apple M5 Max (MLX)
3.13x
Nvidia H100
2.66x
Apple M3 Ultra (llama.cpp)
2.14x

Liquid AIは2026年9月24日、LFM2.5-VL-DSparkを公開しました。30億パラメータの視覚言語モデルの応答を速くする、小さな追加モデルです。Hugging FaceでのLiquid AIの投稿によると、AppleのM5 Maxチップではデコードが最大3.13倍速くなります。出力はまったく変わりません。これは画像理解モデルをローカルのハードウェアで動かす人にとって重要です。

視覚言語モデルは画像とテキストを読み、テキストで答えます。Liquid AIのこの種のモデルがLFM2.5-VL-3Bです。DSparkはこれを置き換えるものではありません。その横で動き、回答をより速く書く手助けをします。

ドラフトモデルが回答を速くする仕組み

この手法は投機的デコーディングと呼ばれます。小さな「ドラフト」モデルが、次に来る複数の単語(トークンと呼ばれます)をすばやく推測します。次に大きな「ターゲット」モデルが、それらの推測を1回の処理でまとめて確認します。同意したものは残し、残りは捨てます。

推測をまとめて確認するほうが、トークンを1つずつ書くよりはるかに低コストです。Liquid AIは以前のDSparkの投稿でその理由を説明しています。「レイテンシの大部分は、集中的な計算ではなく、重みをDRAMからSRAMへ転送することから生じます」。平たく言えば、遅いのは計算そのものではなく、モデルをメモリ内で動かすことです。

ターゲットモデルがすべてのトークンを承認するため、最終的な回答は変わりません。Liquid AIによると、この手法は「出力品質を変えずに、メモリ使用量のわずかな増加と引き換えに、より大きな高速化を得る」ものです。

LFM2.5-VL-DSparkの中身

RuntimeWireによると、ドラフトモデルは2億7,950万パラメータで、ターゲットモデルの約8.9%の大きさです。アテンションのみの層を4つ使い、一度に8〜9トークンのブロックを提案します。

Liquid AIの投稿はドラフトをさらに細かく分けています。193.0Mのデコーダスタック、21.0Mの射影層、65.5Mの「マルコフヘッド」です。ドラフトはターゲットモデルの内部表現を使って動くため、画像入力とテキスト入力を同じように扱えます。

ハードウェア別の高速化

効果はマシンによって異なります。デコード速度は、モデルが回答を書く速さです。エンドツーエンドの速度には、画像とプロンプトの読み込みも含まれます。

ハードウェアデコードの高速化エンドツーエンドの高速化
Apple M5 Max (MLX)2.30x-3.13x1.56x-2.62x
Apple M3 Ultra (llama.cpp)1.57x-2.14x1.30x-1.77x
Nvidia H100 GPU2.04x-2.66x1.64x-2.27x

RuntimeWireによると、ターゲットモデルは1回の確認で3.2〜4.5個のドラフトトークンを受け入れます。これらのテストはバッチサイズ1、16ビットの重みで行われました。

Liquid AIが挙げる制約

投機的デコーディングは「デコードだけを高速化し、画像エンコードやプレフィルは高速化しない」と、Hugging Faceの投稿は述べています。画像エンコードは、画像をモデルが使える数値に変換する処理です。プレフィルは、回答が始まる前にプロンプトを読み込む処理です。小型デバイスではこれらの処理が時間の大きな割合を占めるため、エンドツーエンドの効果はデコードの効果より小さくなります。

また、ドラフトは単独では動きません。LFM2.5-VL-3Bと組み合わせたときにだけ機能します。

開発者にとっての意味

LFM2.5-VL-3Bをローカルで動かしているなら、今すぐドラフトを試してください。Liquid AIによると、すでにllama.cpp、MLX-VLM、SGLangに統合されているので、既存の環境にそのまま組み込めるはずです。

見出しの数字ではなく、自分のワークロードを測定してください。大きな画像についての短い回答では、画像エンコードが大半を占めるため、効果は最も小さくなります。グラフを詳しく説明するような長いテキストの回答では、効果が最も大きくなります。

メモリも見込んでおきましょう。ドラフトによるモデルサイズの増加は9%未満です。小さな量ですが、RAMの少ないスマートフォンやノートPCではゼロではありません。

この流れにも注目してください。Liquid AIは8月にすでにテキストモデル向けのDSparkドラフトを出しており、H100上のLFM2.5-2.6Bで平均2.67xの高速化を報告していました。視覚モデル向けのドラフトが続いたことは、こうした小さな補助モデルがオープンウェイトのリリースで、おまけではなく標準的な要素になりつつあることを示しています。

出典

  1. Accelerating vision-language models with LFM2.5-VL-DSpark - Hugging Face
  2. Liquid AI adds a 280M draft model to speed up its 3B vision model - RuntimeWire
  3. LFM2.5-DSpark: Up to 3.2x Faster Inference from H100 to MacBook - Liquid AI

関連記事

An NVIDIA Tesla T4 graphics card standing upright on a plain gray studio backdrop, the class of hardware Laya's latency was measured on.
AI・LLM

Layaの型付き判断とは何か、解説

型付き判断モデルは、決まった質問に型付きの答えと確信度の数値で答える。Layaの4億2100万パラメータは公開されているので、自分で確かめられる。

無地のグレーのスタジオ背景に立つ、ファン2基を備えたGeForceのグラフィックスカード。シュラウドにGeForceのロゴがある。
AI・LLM

Qwen3.5-9B、KVキャッシュに1トークン32KBを使う

Qwen3.5-9Bは32層のうち8層だけがフルアテンション(全体参照型の注意機構)で、KVキャッシュの費用は1トークン32KBです。この比率が8GBに収まるかを決めます。