Microsoft ThinkingBox、AIエージェントをデータベースで採点
MicrosoftのThinkingBox(シンキングボックス)は、AIエージェントがデータベースに書き込んだ内容を確認します。失敗した79,853回の実行のうち67.24%は、有効なツール呼び出しで正常に終わり、データは誤っていました。
3 分で読めます

数字で見る
- tasks across five business domains
- 507
- runs of every task, to separate luck from reliability
- 20
- of failed runs ended cleanly with valid tool calls
- 67.24%
- of failures came from tool handling, not reasoning
- 79.9%
- Claude Opus 5.5
- 67.16%
- Claude Opus 5
- 66.5%
- GPT-5.4
- 65.36%
- GPT-6 Astra
- 58.31%
- Kimi-K3
- 57.37%
MicrosoftはThinkingBoxを公開しました。AIエージェントの発言を無視し、実際に何を変更したかを確認するテストです。Microsoftは2026年10月3日、Hugging Faceのブログ記事で発表しました。その中心的な発見は、エージェントを提供するすべての人にとって気がかりなものです。失敗した79,853回の試行のうち、67.24%は有効なツール呼び出しでエラーなく正常に終わっていました。それでも、裏側のデータは誤っていました。
ThinkingBoxはエージェントをどうテストするか
AIエージェントとは、注文の更新や予約の変更など、ツールを通じて操作を行うモデルです。多くのテストは、エージェントの最終的な返答を評価するか、ツール呼び出しの形式が正しいかを確認します。ThinkingBoxは代わりに、タスクの終了後にバックエンドのデータベースを調べます。
RuntimeWireは、データベースが最終判断を下すベンチマークだと説明しています。507のタスクはそれぞれ、実際の業務ワークフローを再現しています。各タスクは20回実行されるため、運よく一度成功しただけでは信頼できるとは見なされません。
Microsoftの記事によると、タスクは5つの分野にわたります。
| 分野 | タスク数 |
|---|---|
| 小売 | 98 |
| 自動車保険 | 100 |
| コンサルティング(ITおよび人事サポート) | 101 |
| 旅行 | 104 |
| ネオバンクのサポート | 104 |
3つのスコア
RuntimeWireによると、ThinkingBoxはモデルごとに3つの数値を報告します。pass@1は、1回の試行で成功する確率です。pass@20は、20回の実行のうち少なくとも1回タスクに成功したことを意味します。「Observed 20/20」は、モデルが毎回欠かさず合格したタスクの数です。
これらの数値の差こそが本題です。Claude Opus 5.5はpass@1で67.16%と首位でしたが、20回すべてに合格したのはタスクの47.53%、241件だけでした。Kimi-K3はpass@1で57.37%を記録し、20回すべてに合格したのはわずか13.41%、68件でした。
Microsoftの記事によると、20回の試行を通じてpass@1スコアの70%超を保てたモデルは3つだけでした。
エージェントが静かに失敗する理由
Microsoftは、失敗のおよそ5件に4件、79.9%が推論ではなくツールの扱いに起因していることを突き止めました。モデルは仕事を理解していたものの、ツールの呼び出し方を誤ったり、誤ったレコードに対して呼び出したり、一部しか実行しなかったりしました。
こうして、実行は完璧に見えても誤っていることがあります。「エージェントの最終メッセージは、エージェントが起きたと信じていることの証拠であり、ソフトウェアが実際に記録した内容の証明ではない」とRemioは書いています。Remioは、注文やサブスクリプション、権限に関する誤った確認が、後でほかのシステムがそれに基づいて動いたときに問題を引き起こすと警告しています。
試行あたりで安くても、タスクあたりで安いとは限らない
Microsoftは信頼性のコストも算出しました。GPT-5.6 Solは、成功した試行1回あたり0.127ドルです。確実に完了できるタスク1件あたりで数えると、コストは9.76ドルに上がります。呼び出し1回あたりは安いモデルでも、再試行と失敗の分まで支払うと高くつくことがあります。
開発者にとっての意味
ThinkingBoxと同じ方法でエージェントをテストしましょう。テストを実行するたびにデータベースを照会し、変わるべきだったフィールドを正確にアサートします。ほかに何も変わっていないこともアサートしましょう。合格した返答ときれいなツールログだけでは、ほとんど何も証明できません。
各テストケースは1回ではなく、何度も実行しましょう。Kimi-K3の数値が示すように、一度合格したタスクでも本番環境では頻繁に失敗することがあります。平均だけでなく、毎回合格するタスクの割合も追跡しましょう。
ツール層に力を注ぎましょう。失敗の大半がツールの扱いから来ているなら、修正の多くは地道なエンジニアリングで済みます。より明確なツールの説明を書き、より厳密な引数スキーマを使い、モデルが対処できるエラーメッセージを返しましょう。
本番環境では、モデルの外側にチェックを加えましょう。注文が変更されたとユーザーに伝える前に、正式な記録システムから注文を読み直します。Remioの指摘は的を射ています。エージェント自身の報告は主張であって、証明ではありません。
予算はトークン単位ではなく、確実に完了するタスク単位で組みましょう。MicrosoftのGPT-5.6 Solの数値は、呼び出し単位の価格が実際のコストを大幅に過小評価しうることを示しています。
出典
関連記事

Holo4のオープンウェイトなエージェントモデル、OSWorld 2.0で61.7%
H CompanyのHolo4-27BはOSWorld 2.0で61.7%、1タスクあたり1.22ドルです。ただし商用で自社運用(セルフホスト)できるのは、Apache 2.0の兄弟モデル35B-A3Bだけです。

NVIDIA Kumo Tabular、オープンウェイトでTabArena首位に
NVIDIAのKumo Tabularは、ラベル付きの表形式データ(タブラーデータ)から1回の処理で予測し、学習の実行は不要です。TabArenaでは1,950 Eloで首位に立ち、サイズは28Mから215Mまでです。

Liquid AIのLFM2.5-VL-DSpark、3B視覚モデルを高速化
Liquid AIの280MパラメータのドラフトモデルLFM2.5-VL-DSparkは、投機的デコーディング (スペキュレイティブ・デコーディング)で3B視覚モデルのデコードをM5 Maxで最大3.13x高速化し、出力は同一のままです。