Zum Inhalt springen

AstaBrief 8B: Ai2s offenes Modell schreibt Berichte mit Quellenangaben

Ai2 hat AstaBrief 8B veröffentlicht, ein Apache-2.0-Modell auf Basis von Qwen3-8B, das Forschungsberichte mit Quellenangaben in 51,1 Sekunden schreibt, 3,5-mal schneller als Astas Thinking mode.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
Screenshot of the allenai/AstaBrief_8B model page on Hugging Face, showing its Apache 2.0 license tag and the start of its model card.
Average time per Asta report
Fast mode (AstaBrief 8B)
51.1s
Thinking mode (Claude-powered)
178.5s

Das Allen Institute for AI (Ai2) hat am 2. Oktober 2026 AstaBrief 8B veröffentlicht, ein kleines offenes Modell, das aus Forschungsarbeiten einen Bericht mit Quellenangaben macht. Es schreibt einen Bericht im Durchschnitt in 51,1 Sekunden, etwa 3,5-mal schneller als der Claude-gestützte Modus, neben dem es steht. Die Gewichte stehen unter der Apache-2.0-Lizenz, sodass ein Team das Modell auf eigener Hardware betreiben und in ein Produkt einbauen kann.

AstaBrief ist jetzt der "Fast mode" in Asta, Ai2s Plattform, die Forschungsfragen anhand der wissenschaftlichen Literatur beantwortet. Der langsamere "Thinking mode", der auf Claude von Anthropic läuft, bleibt verfügbar.

Was AstaBrief tut

AstaBrief erhält zwei Eingaben: eine Forschungsfrage und Auszüge aus Fachartikeln, die ein Suchschritt bereits gefunden hat. Es liefert einen geschriebenen Bericht mit Quellenangaben zu diesen Auszügen, so die Ankündigung von Ai2.

Das Tempo kommt daher, dass die Aufgabe in einem Durchgang erledigt wird. Ältere Berichts-Pipelines fassen Quellen zusammen, gruppieren sie und entwerfen dann Abschnitt für Abschnitt. AlphaSignal berichtet, dass AstaBrief diese Zwischenschritte überspringt und den ganzen Bericht auf einmal schreibt.

Das Modell hat 8 Milliarden Parameter, also die anpassbaren Werte, die ein Modell im Training lernt. Es basiert auf Qwen3-8B, einem offenen Modell des Qwen-Teams von Alibaba. Seine Modellkarte auf Hugging Face nennt eine Kontextlänge von 16.000 Tokens. Ein Token ist ein Wort oder ein Teil eines Wortes. Das ist also grob das Lesebudget für die Frage und die Auszüge aus den Fachartikeln zusammen.

Wie Ai2 es trainiert hat

Ai2 begann mit rund 90.000 echten Forschungsanfragen von Asta-Nutzern, die nach Qualität gefiltert wurden. Daraus baute es 47.000 Beispiele für überwachtes Fine-Tuning, bei dem das Modell lernt, indem es gute Antworten nachahmt. Danach ließ es rund 6.000 Präferenzpaare durch Direct Preference Optimization (DPO) laufen. Bei DPO sieht das Modell zwei Berichte zur selben Frage und lernt, den besseren zu bevorzugen.

Die Beispielberichte stammten von anderen Modellen: Claude 3.5 und 3.7 Sonnet, o3, o4-mini, GPT-4.1, DeepSeek-V3 und DeepSeek-R1. GPT-4.1 und DeepSeek-R1 dienten als Richter und wählten in jedem Paar den besseren Bericht aus. Laut Modellkarte stimmten diese Richter in 95 % der Fälle mit menschlichen Präferenzen überein.

Eine Lehre stach heraus. Die Trainingsdaten nach Berichten mit vielen Quellenangaben zu filtern, war "der wichtigste einzelne Treiber der Grounding-Qualität", sagt Ai2, wie AlphaSignal zitiert. Grounding bedeutet hier, dass sich die Aussagen des Berichts auf die Fachartikel zurückführen lassen, die er zitiert.

Das Training lief auf acht Nvidia-H100-GPUs. Laut Modellkarte passt die Inferenz auf eine einzige Consumer-GPU mit viel Speicher und funktioniert mit den Bibliotheken Transformers und vLLM.

Wie es abschneidet

Ai2 hat AstaBrief mit SQABench-CS2 getestet, einem Satz von 200 Forschungsfragen aus der Informatik. AlphaSignal nennt denselben Satz ScholarQA-CS2.

Kennzahl auf SQABench-CS2AstaBrief 8B
Durchschnittswert87,0
Zitationspräzision90,5
Ingredient Recall (abgedeckte erwartete Kernpunkte)90,2
Antwortpräzision89,0
Zitations-Recall78,2

Der Zitations-Recall ist die Schwachstelle. Er misst, wie viele der Aussagen, die eine Quellenangabe brauchen, tatsächlich eine bekommen. In einem zweiten Test, DeepScholarBench, der aus 63 arXiv-basierten Anfragen besteht, erzielte AstaBrief laut AlphaSignal 53,5.

Was es nicht kann

AstaBrief schreibt nur. Es durchsucht nicht das offene Web, zerlegt eine Frage nicht in Teilfragen und führt keine Folgesuchen aus, berichtet AlphaSignal. Etwas anderes muss die Fachartikel zuerst finden. AlphaSignal warnt außerdem, dass seine Quellenangaben übertreiben können, was ein Artikel tatsächlich herausgefunden hat.

Auch die Vergleiche sind nicht mehr frisch. Unite.AI weist darauf hin, dass Training und Evaluierung 2025 stattfanden und nicht gegen aktuelle Frontier-Modelle wiederholt wurden.

Was das für Entwickler bedeutet

Der nützliche Teil ist die vollständige Veröffentlichung. Ai2 hat die Gewichte, den Trainingsdatensatz (AstaBrief_DPO_Mix), Codebeispiele und Hyperparameter veröffentlicht. Damit ist AstaBrief ebenso sehr ein Rezept wie ein Modell. Ein Team, das einen Berichtsgenerator für Rechtsdokumente, Support-Tickets oder interne Wikis baut, kann das Setup mit eigenen Daten nachbauen.

Wenn Sie bereits eine Retrieval-Pipeline betreiben, passt AstaBrief an deren Ende. Ihr Suchschritt findet Textpassagen, und AstaBrief schreibt die Zusammenfassung mit Quellenangaben. Weil die Gewichte offen sind, müssen die Dokumente Ihre Server nie verlassen. Für viele Unternehmen ist das der Hauptgrund, ein 8B-Modell einem gehosteten vorzuziehen.

Testen Sie die Schwachstelle, bevor Sie es ausliefern. Ein Zitations-Recall von 78,2 bedeutet, dass manche Aussagen in einem Bericht ohne Quelle ankommen werden. Prüfen Sie Stichproben von Berichten von Hand, gleichen Sie jede Quellenangabe mit der Passage ab, auf die sie verweist, und lassen Sie bei allem, worauf ein Leser handeln wird, einen Menschen mitprüfen.

Quellen

  1. Open-sourcing AstaBrief, the fast report-generation model in Asta - Ai2
  2. allenai/AstaBrief_8B - Hugging Face
  3. Ai2 Open-Sources AstaBrief 8B for Fast Scientific Report Generation - Unite.AI
  4. Ai2's AstaBrief 8B Writes Cited Research Reports 3.5x Faster in One Pass - AlphaSignal

Ähnliche Artikel

Screenshot of the Qwen Research License Agreement file for Qwen-Image-2.1 on Hugging Face, showing its September 20, 2026 release date, the definition of non-commercial use and the clause barring commercial use.
KI & LLMs

Die Qwen Research License erklärt

Mit der Qwen Research License darf jeder Qwen-Image-2.1 herunterladen, aber nur für Forschung oder Evaluierung nutzen. Kommerzielle Nutzung erfordert eine gesonderte Lizenz von Qwen.