AstaBrief 8B:引用付きの研究レポートを書くAi2のオープンモデル
Ai2は、Qwen3-8BをベースにしたApache 2.0ライセンスのモデル、AstaBrief 8B(アスタブリーフ)を公開しました。引用付きの研究レポートを51.1秒で書き、AstaのThinkingモードより3.5倍高速です。
3 分で読めます

- Fast mode (AstaBrief 8B)
- 51.1s
- Thinking mode (Claude-powered)
- 178.5s
Allen Institute for AI(Ai2)は2026年10月2日、AstaBrief 8Bを公開しました。研究論文を、引用付きのレポートにまとめる小型のオープンモデルです。レポート1本を平均51.1秒で書きます。これは、隣に並ぶClaude搭載のモードより約3.5倍高速です。重みはApache 2.0ライセンスなので、チームは自社のハードウェアで動かし、製品に組み込むことができます。
AstaはAi2のプラットフォームで、科学文献をもとに研究上の質問に答えます。AstaBriefは現在、そのAstaの「Fastモード」になっています。AnthropicのClaudeで動く、より遅い「Thinkingモード」も引き続き使えます。
AstaBriefは何をするのか
AstaBriefへの入力は2つです。研究上の質問と、検索ステップがすでに見つけた論文の抜粋です。Ai2の発表によると、AstaBriefはそれらの抜粋への引用を付けた、文章のレポートを返します。
速さの理由は、作業を1回のパスで済ませることにあります。従来のレポート作成パイプラインは、情報源を要約し、それらをクラスタリングしてから、セクションごとに下書きします。AlphaSignalによると、AstaBriefはこうした中間段階を省き、レポート全体を一度に書きます。
このモデルのパラメーターは80億個です。パラメーターとは、モデルが学習中に身につける、調整可能な値です。ベースはQwen3-8Bで、AlibabaのQwenチームによるオープンモデルです。Hugging Faceのモデルカードには、コンテキスト長が16,000トークンと記されています。トークンとは、単語または単語の一部です。つまりこれが、質問と論文の抜粋を合わせて読める量の、おおよその目安です。
Ai2はどう学習させたのか
Ai2は、Astaユーザーから寄せられた実際の研究クエリ約90,000件を出発点にし、品質でふるい分けました。そこから、教師ありファインチューニング用の例を47,000件作りました。これは、モデルがよい回答をまねて学ぶ手法です。続いて、約6,000組の選好ペアを直接選好最適化(DPO)にかけました。DPOでは、モデルは同じ質問に対する2つのレポートを見て、よい方を選ぶように学びます。
お手本となるレポートは、ほかのモデルが書いたものです。Claude 3.5 Sonnetと3.7 Sonnet、o3、o4-mini、GPT-4.1、DeepSeek-V3、DeepSeek-R1です。GPT-4.1とDeepSeek-R1は審査役を務め、各ペアのうちよい方のレポートを選びました。モデルカードによると、これらの審査役の判断は、95%の割合で人間の選好と一致しました。
ひとつの教訓が際立っていました。引用の多いレポートを選んで学習データをふるい分けたことが、「グラウンディングの品質を左右した、ただ一つの最大の要因」だったとAi2は述べています。AlphaSignalが引用した発言です。ここでいうグラウンディングとは、レポートの主張を、引用した論文までさかのぼれることを指します。
学習には、NvidiaのH100 GPUを8基使いました。モデルカードによると、推論はメモリーの大きいコンシューマー向けGPU 1枚に収まり、TransformersとvLLMの両ライブラリで動きます。
ベンチマークの結果
Ai2は、SQABench-CS2でAstaBriefをテストしました。コンピューターサイエンス分野の研究上の質問200件を集めたセットです。AlphaSignalは、同じセットをScholarQA-CS2と呼んでいます。
| SQABench-CS2での指標 | AstaBrief 8B |
|---|---|
| 平均スコア | 87.0 |
| 引用の適合率 | 90.5 |
| 要素の再現率(想定される要点をどれだけ網羅したか) | 90.2 |
| 回答の適合率 | 89.0 |
| 引用の再現率 | 78.2 |
引用の再現率が弱点です。これは、引用が必要な主張のうち、実際に引用が付いたものがどれだけあるかを測る指標です。AlphaSignalによると、2つ目のテストであるDeepScholarBenchでは、AstaBriefのスコアは53.5でした。このテストは、arXivをもとにした63件のクエリで作られています。
できないこと
AstaBriefは書くだけです。AlphaSignalによると、オープンなWebを検索することも、質問をサブ質問に分けることも、追加の検索を行うこともしません。論文は、先に別の仕組みが見つける必要があります。AlphaSignalはさらに、引用が、論文が実際に明らかにした内容を誇張する場合があると警告しています。
比較のデータも古くなっています。Unite.AIは、学習と評価が2025年に行われ、現在のフロンティアモデルを相手にやり直されていないと指摘しています。
これが開発者にとって意味すること
役に立つのは、すべてを公開している点です。Ai2は、重み、学習データセット(AstaBrief_DPO_Mix)、コード例、ハイパーパラメーターを公開しました。そのためAstaBriefは、モデルであると同時にレシピでもあります。法律文書、サポートチケット、社内Wiki向けのレポート作成ツールを作るチームは、自社のデータで同じ構成をまねることができます。
すでにリトリーバル(検索)パイプラインを動かしているなら、AstaBriefはその最後の段に収まります。検索ステップが文章の一節を見つけ、AstaBriefが引用付きの要約を書きます。重みがオープンなので、文書を自社のサーバーの外に出す必要はありません。多くの企業にとって、それがホスト型のモデルではなく8Bモデルを選ぶ一番の理由です。
製品に組み込む前に、弱点をテストしてください。引用の再現率が78.2ということは、レポート内の一部の主張が出典なしで届くということです。レポートを抜き取って手作業で確認し、すべての引用を参照先の一節と突き合わせてください。そして、読み手が行動のよりどころにするものには、必ず人間が関わるようにしてください。
出典
関連記事

Qwenの研究用ライセンス「Qwen Research License」を解説
Qwen Research License(Qwenのリサーチライセンス)では、誰でもQwen-Image-2.1をダウンロードできるが、用途は研究または評価に限られる。商用利用には、Qwenから別のライセンスを得る必要がある。

Xiaomi、1兆パラメーターのMiMo-V2.6-ProをMITライセンスのオープンウェイトで公開
Xiaomi(シャオミ)のMiMo-V2.6-Proは、パラメーター数が1.02兆、うちアクティブなものが420億で、100万トークンのコンテキストを持ち、重みはMITライセンスです。ただし、約680GBのGPUメモリーが必要です。

NVIDIA Kumo Tabular、オープンウェイトでTabArena首位に
NVIDIAのKumo Tabularは、ラベル付きの表形式データ(タブラーデータ)から1回の処理で予測し、学習の実行は不要です。TabArenaでは1,950 Eloで首位に立ち、サイズは28Mから215Mまでです。