Qwen3.8-Omni-Flash senkt Audio-Eingabekosten um 98 %
Alibabas neues omnimodales Modell liest Text, Bilder, Audio und Video in einem 1M-Token-Kontext und senkt die Preise für Audio-Eingaben um über 98 Prozent.
3 Min. Lesezeit

Die Zahlen
- token context window, with up to 991K input tokens
- 1M
- per million text input tokens
- $0.15
- languages supported
- 113
- Audio
- 98%
- Audio-visual
- 93%
- Video
- 89%
Alibaba veröffentlichte Qwen3.8-Omni-Flash am 18. September 2026, ein Modell, das Text, Bilder, Audio und Video annimmt und in Text antwortet. Der Preis ist die Schlagzeile. Verglichen mit Qwen3.5-Omni-Plus kostet Audio-Eingabe pro Stunde über 98 Prozent weniger, audiovisuelle Eingabe über 93 Prozent weniger und Video-Eingabe rund 89 Prozent weniger, laut MarkTechPost und AlphaSignal.
Omnimodal heißt, dass ein Modell mehrere Eingabearten direkt verarbeitet, statt einer Kette, die Audio zuerst transkribiert und dann das Transkript liest. Text kostet 0,15 Dollar je Million Eingabe-Token und 0,47 Dollar je Million Ausgabe-Token, zwischengespeicherte Eingaben 0,016 Dollar je Million.
Was es aufnimmt
| Grenze | Wert |
|---|---|
| Kontextfenster | 1M Token, bis zu 991K Eingabe und 131K Ausgabe |
| Länge des Nachdenkens | Bis zu 262K Token |
| Video | Bis zu 2 Stunden, 2 GB, bis zu 15fps abgetastet |
| Audio | Bis zu 3 Stunden |
| Sprachen | 113 |
Die Verfügbarkeit ist der Haken für alle, denen die letzte Version gefiel. Diese läuft nur über die API, über QwenCloud, Alibaba Cloud Model Studio und Qwen Studio, ohne angekündigte offene Gewichte. Das ist eine Änderung der Haltung gegenüber Qwen3.8-Flash-Next, das im August 2026 mit offenen Gewichten erschien und die Architektur hier liefert.
Diese Architektur ist ein Mixture of Experts. Das Netz hält rund 125 Milliarden Parameter über 512 Experten, aktiviert aber nur etwa 6 Milliarden je Token, dazu kommt eine Embedding-Tabelle mit 51 Milliarden Parametern. Dieser Aufbau ist der Grund, warum ein so großes Modell wie ein kleines bepreist werden kann.
Agentische Wahrnehmung und die Token-Ersparnis
Interessanter ist die Aussage dazu, wie das Modell Video betrachtet. Statt Bilder in festen Abständen abzutasten, prüft es die Quelle in zwei Durchgängen: ein grober Überblick, um den relevanten Abschnitt zu finden, dann ein genauerer Blick auf diesen Abschnitt. AlphaSignal beschreibt das als agentische Wahrnehmung und zitiert Qwen mit den Worten, es sei "das erste Modell seiner Familie, das omnimodale Wahrnehmung zum Teil eines Agenten-Workflows macht".
Die berichteten Einsparungen unterscheiden sich je Benchmark, deshalb lohnen beide Zahlen. MarkTechPost berichtet von einer Aufgabe, die von 145.736 auf 79.117 Token fiel, ein Rückgang um 45,7 Prozent. AlphaSignal nennt 51,8 Prozent weniger Token auf OmniVideoBench, bei einem durchschnittlichen Agenten-Zugewinn von 19,5 Punkten gegenüber dem Vorgängermodell. BenchLM, das veröffentlichte Benchmark-Zeilen verfolgt, hält fest, bislang nur Ergebnisse für 19 seiner 446 Benchmarks zu haben, und veröffentlicht noch keine Gesamtwertung.
Alibaba veröffentlichte außerdem Qwen-MM-Plugins unter der Apache-2.0-Lizenz. Der Werkzeugkasten ergänzt Gedächtnis, Video-zu-Notiz und Bearbeitungsfunktionen und soll multimodale Eingaben in bestehende Agenten-Frameworks wie Claude Code und Gemini CLI einbinden. Erweitertes Nachdenken ist standardmäßig auf der höchsten Stufe aktiv und lässt sich abschalten.
Was das für Entwickler bedeutet
Preisänderungen dieser Größe ändern, was zu bauen sich lohnt. Ein Support-Anruf, der transkribiert wird, eine aufgezeichnete Besprechung, die zusammengefasst wird, oder das Sichten von Überwachungsaufnahmen waren Projekte, bei denen die Modellrechnung das Design bestimmte. Bei unter einem Dollar für eine große Menge Text-Token, und mit 98 Prozent weniger für Audio, verschiebt sich die Rechnung dahin, die Medien einfach zu schicken.
Prüfen Sie dennoch die Token-Mathematik, bevor Sie einem Angebot trauen. Audio und Video verbrauchen Token je nach Länge, Bildrate und dem Anteil der Quelle, den das Modell genauer ansieht. Agentische Wahrnehmung bedeutet, dass die Tokenzahl mit dem Inhalt schwankt. Messen Sie daher Ihren eigenen schlechtesten Fall statt eines Durchschnitts.
Die reine API-Veröffentlichung ist die eigentliche Einschränkung für Teams mit Regeln dazu, wohin Daten fließen. Audio und Video sind genau die Eingaben, die persönliche Informationen tragen, und dieses Modell läuft in Alibabas Cloud. Wenn Ihr letzter Qwen-Einsatz auf lokalen Gewichten beruhte, ist dies kein direkter Nachfolger. Die Benchmark-Abdeckung ist noch dünn, behandeln Sie die Agenten-Zahlen also als Herstellerangaben, bis unabhängige Auswertungen sie füllen.
Quellen
- Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use - MarkTechPost
- Alibaba's Qwen3.8-Omni-Flash Cuts Video AI Costs by 89% With Agent Tool Use - AlphaSignal
- Qwen3.8-Omni-Flash Benchmarks & Context (September 2026) - BenchLM
Ähnliche Artikel

TypeSafes Jev liefert typisierte Entscheidungen, nicht Text
Jev antwortet in 70 bis 500 Millisekunden und kostet 0,042 Dollar pro Million Eingabe-Token, Ausgabe gratis. Text erzeugen kann es überhaupt nicht.

GPT-6 Astra ist auf Bedrock und in Copilot allgemein verfügbar
GPT-6 Astra ist auf Amazon Bedrock für 10 Dollar pro Million Eingabe-Tokens allgemein verfügbar, und in GitHub Copilot für die Pläne Pro+, Max, Business und Enterprise.

DeepSeek warnt Entwickler vor einer deutlichen API-Preiserhöhung
DeepSeek warnte Entwickler am 6. August, dass die API-Preise bald 'deutlich' steigen - ohne Zahlen oder Termine, während V4-Flash das günstigste namhafte Modell im Betrieb ist.