AstaBrief 8B : le modèle ouvert d'Ai2 rédige des rapports avec citations
Ai2 a publié AstaBrief 8B, un modèle sous Apache 2.0 bâti sur Qwen3-8B qui rédige des rapports de recherche avec citations en 51,1 secondes, 3,5 fois plus vite que le mode Thinking d'Asta.
3 min de lecture

- Fast mode (AstaBrief 8B)
- 51.1s
- Thinking mode (Claude-powered)
- 178.5s
L'Allen Institute for AI (Ai2) a publié AstaBrief 8B le 2 octobre 2026, un petit modèle ouvert qui transforme des articles de recherche en un rapport avec citations. Il rédige un rapport en 51,1 secondes en moyenne, environ 3,5 fois plus vite que le mode propulsé par Claude à côté duquel il se trouve. Les poids sont sous licence Apache 2.0 : une équipe peut donc le faire tourner sur son propre matériel et l'intégrer à un produit.
AstaBrief est désormais le « Fast mode » d'Asta, la plateforme d'Ai2 qui répond à des questions de recherche à partir de la littérature scientifique. Le « Thinking mode », plus lent, qui tourne sur Claude d'Anthropic, reste disponible.
Ce que fait AstaBrief
AstaBrief prend deux entrées : une question de recherche et des extraits d'articles qu'une étape de recherche a déjà trouvés. Il renvoie un rapport rédigé avec des citations vers ces extraits, selon l'annonce d'Ai2.
La vitesse vient du fait qu'il fait le travail en une seule passe. Les anciens pipelines de rapports résument les sources, les regroupent, puis rédigent section par section. AlphaSignal rapporte qu'AstaBrief saute ces étapes intermédiaires et écrit tout le rapport d'un coup.
Le modèle compte 8 milliards de paramètres, les valeurs ajustables qu'un modèle apprend pendant son entraînement. Il est construit sur Qwen3-8B, un modèle ouvert de l'équipe Qwen d'Alibaba. Sa fiche de modèle sur Hugging Face indique une longueur de contexte de 16 000 tokens. Un token est un mot ou une partie de mot. C'est donc à peu près le budget de lecture pour la question et les extraits d'articles réunis.
Comment Ai2 l'a entraîné
Ai2 est parti d'environ 90 000 vraies requêtes de recherche d'utilisateurs d'Asta, filtrées sur leur qualité. À partir de celles-ci, il a construit 47 000 exemples pour le fine-tuning supervisé, où le modèle apprend en imitant de bonnes réponses. Il a ensuite fait passer environ 6 000 paires de préférences par l'optimisation directe des préférences (DPO). Avec la DPO, le modèle voit deux rapports pour la même question et apprend à privilégier le meilleur.
Les rapports d'exemple venaient d'autres modèles : Claude 3.5 et 3.7 Sonnet, o3, o4-mini, GPT-4.1, DeepSeek-V3 et DeepSeek-R1. GPT-4.1 et DeepSeek-R1 ont servi de juges pour choisir le meilleur rapport de chaque paire. La fiche de modèle indique que ces juges étaient d'accord avec les préférences humaines dans 95 % des cas.
Une leçon s'est détachée. Filtrer les données d'entraînement pour garder des rapports riches en citations a été « le principal facteur, à lui seul, de la qualité de l'ancrage », selon Ai2, cité par AlphaSignal. L'ancrage (grounding) signifie ici que les affirmations du rapport remontent aux articles qu'il cite.
L'entraînement a tourné sur huit GPU Nvidia H100. La fiche de modèle précise que l'inférence tient sur un seul GPU grand public doté de beaucoup de mémoire et fonctionne avec les bibliothèques Transformers et vLLM.
Ses résultats
Ai2 a testé AstaBrief sur SQABench-CS2, un ensemble de 200 questions de recherche en informatique. AlphaSignal appelle ce même ensemble ScholarQA-CS2.
| Indicateur sur SQABench-CS2 | AstaBrief 8B |
|---|---|
| Score moyen | 87,0 |
| Précision des citations | 90,5 |
| Rappel des éléments (points clés attendus couverts) | 90,2 |
| Précision des réponses | 89,0 |
| Rappel des citations | 78,2 |
Le rappel des citations est le point faible. Il mesure combien des affirmations qui ont besoin d'une citation en reçoivent vraiment une. Sur un second test, DeepScholarBench, construit à partir de 63 requêtes tirées d'arXiv, AstaBrief a obtenu 53,5, selon AlphaSignal.
Ce qu'il ne sait pas faire
AstaBrief ne fait qu'écrire. Il ne cherche pas sur le Web ouvert, ne découpe pas une question en sous-questions et ne lance pas de recherches complémentaires, rapporte AlphaSignal. Quelque chose d'autre doit d'abord trouver les articles. AlphaSignal prévient aussi que ses citations peuvent exagérer ce qu'un article a réellement établi.
Les comparaisons datent, en outre. Unite.AI note que l'entraînement et l'évaluation ont été faits en 2025 et n'ont pas été refaits face aux modèles de pointe actuels.
Ce que cela signifie pour les développeurs
L'intérêt tient à la publication complète. Ai2 a publié les poids, le jeu de données d'entraînement (AstaBrief_DPO_Mix), des exemples de code et les hyperparamètres. Cela fait d'AstaBrief une recette autant qu'un modèle. Une équipe qui construit un outil de rédaction de rapports pour des documents juridiques, des tickets de support ou des wikis internes peut reproduire la configuration avec ses propres données.
Si vous faites déjà tourner un pipeline de récupération (retrieval), AstaBrief se place à son extrémité. Votre étape de recherche trouve des passages, et AstaBrief rédige la synthèse avec citations. Comme les poids sont ouverts, les documents n'ont jamais à quitter vos serveurs. Pour beaucoup d'entreprises, c'est la raison principale de choisir un modèle 8B plutôt qu'un modèle hébergé.
Testez le point faible avant de le mettre en production. Un rappel des citations de 78,2 signifie que certaines affirmations d'un rapport arriveront sans source. Échantillonnez des rapports à la main, vérifiez chaque citation par rapport au passage qu'elle désigne et gardez une personne dans la boucle pour tout ce sur quoi un lecteur va agir.
Sources
Articles liés

La Qwen Research License expliquée
La Qwen Research License permet à chacun de télécharger Qwen-Image-2.1, mais en limite l'usage à la recherche ou à l'évaluation. L'usage commercial exige une licence distincte de Qwen.

Xiaomi publie MiMo-V2.6-Pro, 1 000 milliards de paramètres en poids ouverts sous MIT
Le MiMo-V2.6-Pro de Xiaomi compte 1 020 milliards de paramètres, dont 42 milliards actifs, un contexte de 1 million de tokens et des poids sous licence MIT, mais il demande environ 680 Go de mémoire GPU.

NVIDIA Kumo Tabular prend la tête de TabArena avec des poids ouverts
Kumo Tabular de NVIDIA prédit à partir d'un tableau étiqueté en une seule passe, sans aucun entraînement. Il se classe premier sur TabArena avec 1 950 Elo, dans des tailles de 28M à 215M.