本文へスキップ

Strands Decider 2Bはエージェントの判断を115ミリ秒で下す

AWSのStrands Decider 2Bは、テキストを書かずに選択肢から選ぶオープンソースのデシジョンモデルだ。RTX 3090で115ミリ秒で答え、JevBenchで72.3%を記録した。

著者 Tech AI Wire Team

4 分で読めます

Strands Agentsのブログ記事「Introducing Strands Decider 2B: a small, open source, decision model」のスクリーンショット。日付は2026年10月1日。

数字で見る

median latency on an RTX 3090
115 ms
accuracy on JevBench v1's 231 tasks
72.3%
parameters in the pointer head that replaces text output
1M
license, per Tech Times
Apache 2.0

AWSのStrands Labsチームは2026年10月1日、オープンソースのモデル「Strands Decider 2B」を公開した。AIエージェントのために、テキストを一切書かずに判断を下すモデルだ。質問と選択肢のリストを受け取り、各選択肢にスコアを付けて、確信度の値とともに選んだ答えを返す。Strandsの発表によると、RTX 3090グラフィックスカードでの応答時間の中央値は115ミリ秒だ。大規模言語モデルへの高価な呼び出しの前に毎回走らせても、負担にならない速さである。

デシジョンモデルの役割

多くのAIエージェントは、大規模言語モデル、つまりLLMに、小さな選択を一日中させている。次にどのツールを動かすか。どのモデルに答えさせるか。このリクエストは許可されるか。LLMは答えをトークンごとにテキストとして書く。これは遅く、お金もかかる。

デシジョンモデルは、書く工程を省く。質問と許可された答えのリストを読み、各答えにスコアを付ける。選択肢は尋ねる瞬間に渡される。そのため、同じモデルが、ある呼び出しではツールを選び、次の呼び出しではポリシーを選べる。

Strandsは、次の用途を挙げている。

  • モデルルーティング。各リクエストを適切なモデルに送る
  • ツールの選択
  • 評価
  • ガードレール。ポリシーに違反するリクエストを止める
  • メモリとコンテキストの管理

限界も同じくらいはっきりしている。AWSは、このモデルが「コードを書くこと、文書を要約すること、会話をすること、複雑な推論タスクで高い成績を出すことはできない」と述べているとTechstrong.aiは報じている。

仕組み

Decider 2Bは、AlibabaのQwen3.5-2B-Baseモデルから出発している。Strandsは言語モデリングヘッドを取り除いた。これは、モデルの内部状態を単語に変える最後の層だ。代わりに置かれたのが、約100万パラメーターの「ポインターヘッド」だとSiliconANGLEは伝えている。

Tech Timesはヘッドの動きを説明している。モデルが読み取った入力と各候補の選択肢を、内積という単純な類似度スコアで比べる。結果は、確率付きの選択肢のランキングだ。Strands自身の投稿によると、モデルはランク16のLoRAアダプターで適応させた。これは、重み全体の代わりに学習させる小さな追加部品である。

報道では、サイズは約19億パラメーターとされている。Strandsは名前の上で20億に丸めている。

数字

指標結果報じた媒体
中央値のレイテンシ、RTX 3090115 msStrands、Tech Times
95パーセンタイルのレイテンシ299 msTech Times
レイテンシ、Apple M3 MacBook153 msStrands
JevBench v1の精度72.3%(231タスク中167)Tech Times、Techstrong.ai
易しい段階のタスク100%Techstrong.ai
難しい段階のタスク50.5%Techstrong.ai
期待キャリブレーション誤差0.052Tech Times

JevBenchは、デシジョンモデル向けの公開テストセットだ。Strandsによると、Decider 2Bは2Bクラスの33モデル中3位だった。20億パラメーターをわずかに超えるモデルを除くと、30モデル中1位になる。

キャリブレーション誤差は、モデルの確信度が現実とどれだけ合っているかを測る。0.052のような低い値は、モデルが90%確実だと言うとき、その近い割合で正解することを意味する。次のセクションで説明するとおり、ここでは生の精度よりこちらが重要になる。

モデルとコードは無料でダウンロードできる。Tech TimesはApache 2.0ライセンスだと報じている。重みはHugging FaceのStrandsAgentsという組織にあり、学習コードはGitHubのstrands-labs/strands-deciderにある。

広がるモデルの分類

デシジョンモデルは独自のカテゴリーになりつつある。Techstrong.aiによると、Strandsは、9月に公開されたTypeSafe AIのJevがこの手法への注目を集めたと評価している。オープンウェイトのライバルであるLayaがJevに応えたのも同じ月だ。Cloudflareは10月4日に、判断を返すオープンウェイトモデルClefで続いた。

AWSは、このトレードオフを速度の問題として捉えている。このモデルは「大量のトークンを消費してレスポンスの遅延を増やす、テキスト生成の必要をなくす」と、AWSはSiliconANGLEに語った。

開発者にとっての意味

  • LLMの代わりではなく、LLMの前に置くこと。 Decider 2Bは、エージェントの中で選択肢が決まっている工程に使う。ルーティング、ツールの選択、ポリシーの確認などだ。文章の作成と推論は大きなモデルに任せる。
  • 確信度のスコアを関門に使うこと。 このモデルはキャリブレーションがよく取れているので、しきい値を設定できる。それを超えたら選択に従って動く。下回ったら、判断をより大きなモデルか人に回す。
  • 難しい判断には使わないこと。 難しいタスクでの50.5%は、2択ならコイン投げに近い。信用する前に、自分の判断をテストし、難易度別に仕分けること。
  • モデルが区別できる選択肢を書くこと。 ポインターヘッドは、入力と各選択肢のテキストを比べる。はっきり違う選択肢のラベルは、ほぼ同じものより多くの手がかりを与える。
  • ローカルで動かすこと。 約20億パラメーターなら、一般向けのGPUやノートパソコンに収まる。日常的な判断を従量課金とネットワークから切り離せる。

まず、自分のエージェントの実際のログから小さなテストセットを作る。次に、Decider 2Bの選択をLLMの選択と比べて、どれだけ一致するかを測ることだ。

出典

  1. Introducing Strands Decider 2B: a small, open source, decision model - Strands Agents
  2. AWS debuts Strands Decider 2B, a first lightweight decision model for accelerate agentic workflows - SiliconANGLE
  3. AWS Releases Decision Model for AI Agents That Routes Without Generating Any Text - Tech Times
  4. AWS Explores Decision Models With Strands Decider 2B - Techstrong.ai

関連記事

無地のグレーのスタジオ背景に立つ、ファン2基を備えたGeForceのグラフィックスカード。シュラウドにGeForceのロゴがある。
AI・LLM

Qwen3.5-9B、KVキャッシュに1トークン32KBを使う

Qwen3.5-9Bは32層のうち8層だけがフルアテンション(全体参照型の注意機構)で、KVキャッシュの費用は1トークン32KBです。この比率が8GBに収まるかを決めます。