Skip to content

Qwen3.8-Omni-Flash、音声入力の費用を98%削減

Alibabaの新しいomnimodal(オムニモーダル)モデルは、テキスト、画像、音声、動画を100万トークンの文脈で読み、音声入力の価格を98%以上下げます。

著者 Tech AI Wire Team

3 分で読めます

中国・杭州にあるAlibaba Groupの本社キャンパスで、芝生を囲むガラス張りのオフィス棟を写した写真。
写真: Danielinblue

数字で見る

token context window, with up to 991K input tokens
1M
per million text input tokens
$0.15
languages supported
113
Input price cuts versus Qwen3.5-Omni-Plus
Audio
98%
Audio-visual
93%
Video
89%

Alibabaは2026年9月18日にQwen3.8-Omni-Flashを公開しました。テキスト、画像、音声、動画を受け取り、テキストで答えるモデルです。見出しは価格です。MarkTechPostとAlphaSignalによれば、Qwen3.5-Omni-Plusと比べて、音声入力は1時間あたり98%以上、音声と映像を合わせた入力は93%以上、動画入力はおよそ89%安くなっています。

omnimodalとは、音声をまず書き起こしてからその文字を読むような連結ではなく、1つのモデルが複数の入力形式をそのまま扱うという意味です。テキストは入力100万トークンあたり0.15ドル、出力100万トークンあたり0.47ドル、キャッシュ済み入力は100万トークンあたり0.016ドルです。

受け取れるもの

上限
文脈の長さ100万トークン、入力は最大991K、出力は最大131K
思考の長さ最大262Kトークン
動画最大2時間、2 GB、最大15fpsで抽出
音声最大3時間
言語113

前回の公開を歓迎した人にとっての難点は、提供のされ方です。今回はAPIのみで、QwenCloud、Alibaba Cloud Model Studio、Qwen Studioを通じて提供され、重みの公開は告知されていません。これは、2026年8月に重みを公開し、今回の土台となる構造を供給したQwen3.8-Flash-Nextからの姿勢の変化です。

その構造はmixture of expertsです。ネットワークは512の専門家にまたがる約1,250億パラメータを持ちながら、1トークンあたりに動かすのは約60億で、さらに510億パラメータの埋め込み表を伴います。これほど大きなモデルを小さなモデルのように値付けできる理由が、この設計です。

エージェント的な知覚と、トークンの節約

より興味深いのは、動画の見方についての主張です。一定の間隔でフレームを抽出するのではなく、2段階で元の素材を調べます。まず粗く見て該当する区間を探し、次にその区間を詳しく見ます。AlphaSignalはこれをエージェント的な知覚と表現し、Qwenの言葉として「omnimodalな知覚をエージェントの作業手順の一部にした、同系列で最初のモデル」を引用しています。

報告されている節約はベンチマークごとに異なるため、両方の数字を挙げる価値があります。MarkTechPostは、ある課題が145,736トークンから79,117トークンへ、45.7%減ったと伝えています。AlphaSignalはOmniVideoBenchで51.8%少ないトークンとし、前のモデルに対する平均19.5ポイントのエージェント面の向上を挙げています。公開されたベンチマークの行を追うBenchLMは、現時点で446件のうち19件しか結果がなく、総合点はまだ出していないと述べています。

AlibabaはQwen-MM-PluginsもApache 2.0ライセンスで公開しました。この道具立ては記憶、動画からのメモ作成、編集の機能を加え、Claude CodeやGemini CLIのような既存のエージェント基盤へ多様な入力を差し込むためのものです。拡張思考は既定で最も高い設定で有効になっており、切ることもできます。

これが開発者にとって意味すること

この規模の価格変更は、作る価値のあるものを変えます。問い合わせ通話の書き起こし、録画した会議の要約、防犯映像の走査は、これまでモデルの請求額が設計を決める案件でした。大量のテキストトークンで1ドルを切り、音声が98%下がるなら、計算は「素材をそのまま送る」ほうへ傾きます。

ただし、見積もりを信じる前にトークンの計算を確かめてください。音声と動画が消費するトークンは、長さ、フレーム率、そしてモデルが詳しく見ると決めた割合によって変わります。エージェント的な知覚とは、トークン数が内容によって動くということです。平均ではなく、自分にとって最悪の場合で測ってください。

APIのみでの提供は、データの置き場所に規則がある組織にとって本当の制約です。音声と動画はまさに個人情報を含みやすい入力であり、このモデルはAlibabaのクラウドで動きます。前回のQwenの導入が手元の重みに依っていたなら、これはそのまま置き換えられる後継ではありません。ベンチマークの網羅はまだ薄いので、独立した評価が埋まるまで、エージェント面の数字は提供元の発表として扱ってください。

出典

  1. Alibaba Qwen Releases Qwen3.8-Omni-Flash: A 1M-Context Omni-Modal Model Built Around Agentic Audio-Video Understanding and Tool Use - MarkTechPost
  2. Alibaba's Qwen3.8-Omni-Flash Cuts Video AI Costs by 89% With Agent Tool Use - AlphaSignal
  3. Qwen3.8-Omni-Flash Benchmarks & Context (September 2026) - BenchLM

関連記事

The GitHub Copilot model picker in Visual Studio Code, open and showing GPT-6 Astra among the selectable models.
AI & LLMs

GPT-6 Astra、Amazon BedrockとGitHub Copilotで一般提供に

GPT-6 AstraがAmazon Bedrock(ベッドロック)で100万入力トークンあたり10ドルで一般提供(GA)に。GitHub Copilot(コパイロット)ではPro+、Max、Business、Enterpriseの各プランで使えます。