Strands Decider 2Bはエージェントの判断を115ミリ秒で下す
AWSのStrands Decider 2Bは、テキストを書かずに選択肢から選ぶオープンソースのデシジョンモデルだ。RTX 3090で115ミリ秒で答え、JevBenchで72.3%を記録した。
4 分で読めます

数字で見る
- median latency on an RTX 3090
- 115 ms
- accuracy on JevBench v1's 231 tasks
- 72.3%
- parameters in the pointer head that replaces text output
- 1M
- license, per Tech Times
- Apache 2.0
AWSのStrands Labsチームは2026年10月1日、オープンソースのモデル「Strands Decider 2B」を公開した。AIエージェントのために、テキストを一切書かずに判断を下すモデルだ。質問と選択肢のリストを受け取り、各選択肢にスコアを付けて、確信度の値とともに選んだ答えを返す。Strandsの発表によると、RTX 3090グラフィックスカードでの応答時間の中央値は115ミリ秒だ。大規模言語モデルへの高価な呼び出しの前に毎回走らせても、負担にならない速さである。
デシジョンモデルの役割
多くのAIエージェントは、大規模言語モデル、つまりLLMに、小さな選択を一日中させている。次にどのツールを動かすか。どのモデルに答えさせるか。このリクエストは許可されるか。LLMは答えをトークンごとにテキストとして書く。これは遅く、お金もかかる。
デシジョンモデルは、書く工程を省く。質問と許可された答えのリストを読み、各答えにスコアを付ける。選択肢は尋ねる瞬間に渡される。そのため、同じモデルが、ある呼び出しではツールを選び、次の呼び出しではポリシーを選べる。
Strandsは、次の用途を挙げている。
- モデルルーティング。各リクエストを適切なモデルに送る
- ツールの選択
- 評価
- ガードレール。ポリシーに違反するリクエストを止める
- メモリとコンテキストの管理
限界も同じくらいはっきりしている。AWSは、このモデルが「コードを書くこと、文書を要約すること、会話をすること、複雑な推論タスクで高い成績を出すことはできない」と述べているとTechstrong.aiは報じている。
仕組み
Decider 2Bは、AlibabaのQwen3.5-2B-Baseモデルから出発している。Strandsは言語モデリングヘッドを取り除いた。これは、モデルの内部状態を単語に変える最後の層だ。代わりに置かれたのが、約100万パラメーターの「ポインターヘッド」だとSiliconANGLEは伝えている。
Tech Timesはヘッドの動きを説明している。モデルが読み取った入力と各候補の選択肢を、内積という単純な類似度スコアで比べる。結果は、確率付きの選択肢のランキングだ。Strands自身の投稿によると、モデルはランク16のLoRAアダプターで適応させた。これは、重み全体の代わりに学習させる小さな追加部品である。
報道では、サイズは約19億パラメーターとされている。Strandsは名前の上で20億に丸めている。
数字
| 指標 | 結果 | 報じた媒体 |
|---|---|---|
| 中央値のレイテンシ、RTX 3090 | 115 ms | Strands、Tech Times |
| 95パーセンタイルのレイテンシ | 299 ms | Tech Times |
| レイテンシ、Apple M3 MacBook | 153 ms | Strands |
| JevBench v1の精度 | 72.3%(231タスク中167) | Tech Times、Techstrong.ai |
| 易しい段階のタスク | 100% | Techstrong.ai |
| 難しい段階のタスク | 50.5% | Techstrong.ai |
| 期待キャリブレーション誤差 | 0.052 | Tech Times |
JevBenchは、デシジョンモデル向けの公開テストセットだ。Strandsによると、Decider 2Bは2Bクラスの33モデル中3位だった。20億パラメーターをわずかに超えるモデルを除くと、30モデル中1位になる。
キャリブレーション誤差は、モデルの確信度が現実とどれだけ合っているかを測る。0.052のような低い値は、モデルが90%確実だと言うとき、その近い割合で正解することを意味する。次のセクションで説明するとおり、ここでは生の精度よりこちらが重要になる。
モデルとコードは無料でダウンロードできる。Tech TimesはApache 2.0ライセンスだと報じている。重みはHugging FaceのStrandsAgentsという組織にあり、学習コードはGitHubのstrands-labs/strands-deciderにある。
広がるモデルの分類
デシジョンモデルは独自のカテゴリーになりつつある。Techstrong.aiによると、Strandsは、9月に公開されたTypeSafe AIのJevがこの手法への注目を集めたと評価している。オープンウェイトのライバルであるLayaがJevに応えたのも同じ月だ。Cloudflareは10月4日に、判断を返すオープンウェイトモデルClefで続いた。
AWSは、このトレードオフを速度の問題として捉えている。このモデルは「大量のトークンを消費してレスポンスの遅延を増やす、テキスト生成の必要をなくす」と、AWSはSiliconANGLEに語った。
開発者にとっての意味
- LLMの代わりではなく、LLMの前に置くこと。 Decider 2Bは、エージェントの中で選択肢が決まっている工程に使う。ルーティング、ツールの選択、ポリシーの確認などだ。文章の作成と推論は大きなモデルに任せる。
- 確信度のスコアを関門に使うこと。 このモデルはキャリブレーションがよく取れているので、しきい値を設定できる。それを超えたら選択に従って動く。下回ったら、判断をより大きなモデルか人に回す。
- 難しい判断には使わないこと。 難しいタスクでの50.5%は、2択ならコイン投げに近い。信用する前に、自分の判断をテストし、難易度別に仕分けること。
- モデルが区別できる選択肢を書くこと。 ポインターヘッドは、入力と各選択肢のテキストを比べる。はっきり違う選択肢のラベルは、ほぼ同じものより多くの手がかりを与える。
- ローカルで動かすこと。 約20億パラメーターなら、一般向けのGPUやノートパソコンに収まる。日常的な判断を従量課金とネットワークから切り離せる。
まず、自分のエージェントの実際のログから小さなテストセットを作る。次に、Decider 2Bの選択をLLMの選択と比べて、どれだけ一致するかを測ることだ。
出典
- Introducing Strands Decider 2B: a small, open source, decision model - Strands Agents
- AWS debuts Strands Decider 2B, a first lightweight decision model for accelerate agentic workflows - SiliconANGLE
- AWS Releases Decision Model for AI Agents That Routes Without Generating Any Text - Tech Times
- AWS Explores Decision Models With Strands Decider 2B - Techstrong.ai
関連記事

Cloudflare Clef:文章ではなく判断を返すオープンウェイトモデル
CloudflareのClef(クレフ、27B)とClef-flash(9B)は、文章を書く代わりに型付きの質問に答えます。レイテンシの中央値は209ミリ秒と39ミリ秒で、ライセンスはApache 2.0です。

Qwen3.5-9B、KVキャッシュに1トークン32KBを使う
Qwen3.5-9Bは32層のうち8層だけがフルアテンション(全体参照型の注意機構)で、KVキャッシュの費用は1トークン32KBです。この比率が8GBに収まるかを決めます。

EmbeddingGemma 2、マルチモーダル検索をスマートフォンで実現
Google DeepMindのEmbeddingGemma 2は、テキスト、コード、画像、動画、音声を7億4000万パラメーターで1つのベクトル空間に写す。テキストのみなら、必要なRAMは約191 MBだ。エンベディングの新世代である。