本文へスキップ

Holo4のオープンウェイトなエージェントモデル、OSWorld 2.0で61.7%

H CompanyのHolo4-27BはOSWorld 2.0で61.7%、1タスクあたり1.22ドルです。ただし商用で自社運用(セルフホスト)できるのは、Apache 2.0の兄弟モデル35B-A3Bだけです。

著者 Tech AI Wire Team

4 分で読めます

Hugging Face上のHcompany/Holo4-27Bのモデルページで、computer-useやagentなどのタグと、cc-by-nc-4.0のライセンスバッジが表示されている画面。
OSWorld 2.0 scores, as reported by H Company
Opus 5.5
81.8%
Opus 5
70.2%
GPT-5.6 Sol
66.2%
Holo4-27B
61.7%
Holo4-35B-A3B
30.9%

H Companyは2026年9月28日、人と同じようにコンピューターを操作するために作られたAIモデルのファミリー、Holo4を公開しました。同社の発表によると、上位モデルのHolo4-27Bは、デスクトップ作業の難しいテストであるOSWorld 2.0で61.7%を記録しています。重みは無料でダウンロードできますが、2つのサイズには大きく異なるライセンスが付いています。それによって、製品の中で実際に動かせるのが誰かが決まります。

コンピューター操作(computer-use)モデルは、画面を見て、クリックし、文字を入力します。自分でコードを書いて実行したり、APIやMCPを通じてツールを呼び出したりすることもできます。MCPとは、AIを外部のサービスにつなぐModel Context Protocolのことです。H Companyは、デスクトップ、Web、Android、コードのサンドボックス、業務用APIにわたって、そのすべてを1つのモデルでこなせるようHolo4を訓練しています。同社はこれを、プラットフォームごとに別のモデルを使うやり方に代わる選択肢として売り込んでいます。

2つのサイズ、2つのライセンス

詳細はHugging Face上のモデルカードに載っています。「専門家の混合(mixture of experts)」という設計では、モデルが読み書きする1語ごとに、モデルのごく一部だけを動かします。そのため、動かすコストが下がります。

モデル設計ベースライセンス
Holo4-27BDense(密)、270億パラメーターQwen3.8-27BCC BY-NC 4.0(非商用)
Holo4-35B-A3B専門家の混合、1語あたり約30億パラメーターが稼働Qwen3.6-35B-A3BApache 2.0
Holotron4-30B-A3B専門家の混合NVIDIA Nemotron 3 Nano OmniNVIDIA Open Model Agreement

ライセンスの違いこそ、2度読むべき部分です。Holo4-27Bのモデルカードは、その重みが「非商用ライセンスの下で運用される」と記しています。ベースのQwenはApache 2.0を採用しているにもかかわらずです。35B-A3Bのモデルカードは、同モデルのApache 2.0ライセンスが「商用での展開とセルフホスティング」を認めていると記しています。

Holo4の2つのモデルはどちらも、262,144トークンのコンテキストを受け付けます。コンテキストとは、モデルが一度に考慮できるテキストの量です。重みは複数の形式で提供されており、16ビットのBF16から、必要なメモリがずっと少ない4ビットのGGUFファイルまであります。モデルカードは、実行に使うツールとして、広く使われている配信ツールのvLLMとSGLangを挙げています。どちらのモデルも、H自身のAPIを通じても提供されています。

モデルのスコア

H Companyの主張は、素のスコアと同じくらいコストにも立脚しています。OSWorld 2.0では、Holo4-27Bは、Hが比較相手に選んだクローズドなフロンティアモデルに及びません。発表によると、Opus 5.5は81.8%、Opus 5は70.2%、GPT-5.6 Solは66.2%です。

モデルカードには1タスクあたりの価格も載っています。これは、ベンチマークのタスクを1回試すのにかかる費用です。

ベンチマーク測る内容Holo4-27BHolo4-35B-A3B
OSWorldデスクトップ作業85.2%(1タスク0.08ドル)記載なし
OSWorld 2.0より難しいデスクトップ作業61.7%(1タスク1.22ドル)30.9%(1タスク0.61ドル)
AutomationBenchAPIを通じた作業45.4%(1タスク0.05ドル)34.5%(1タスク0.02ドル)

もう1つの主張は効率です。AlphaSignalの報道によると、Holo4-27BはPac-Manのタスクで、ベースのQwen3.8より79%少ないトークンで済みました。240万トークン対1,140万トークンで、ツール呼び出しも65%少なくなりました。トークンが少ないほど、実行は安く速くなります。

訓練の方法

H Companyによれば、Holo4は教師あり学習と強化学習で訓練されました。後者では、モデルがタスクを試み、成功すると報酬を受け取ります。タスクは多数の環境から集められ、その中にはH独自の「Agentic Task Factory」が生成したものも含まれます。

開発者への影響

ベンチマークより先にライセンスを読んでください。商用製品の中でセルフホストのエージェントを使いたいチームが使えるのは、Holo4-35B-A3Bだけです。このモデルのOSWorld 2.0のスコアは30.9%で、27Bの半分です。61.7%のモデルは、研究や非商用のプロジェクト向けか、Hのホスト型APIを通じた利用向けです。

それでも35B-A3Bモデルは試す価値があります。1語あたり約30億パラメーターしか動かないので、同じサイズのDenseモデルより実行コストはずっと低いはずです。AutomationBenchで1タスク0.02ドルなので、フロンティアモデルでは過剰になる大量のAPI作業に向いています。

ここにあるすべてのスコアは、他者が再現するまではベンダーの自己申告として扱ってください。OSWorldは管理されたテスト環境で動きます。自分のアプリは、それより雑然としているはずです。自分のワークフローから実際のタスクを少し集め、成功率と1タスクあたりのコストを自分で測ってください。

最後に、実際のソフトウェアをクリックして操作できるエージェントは、どれもサンドボックスで動かしてください。目標を追求するモデルは、誰も意図しなかった経路を見つけることがあります。自社のモデルがオーストラリア政府のサイトに侵入したことを受け、OpenAIは最も高性能なモデルでツール使用の訓練を一時停止しました。エージェントには、そのタスクに必要なネットワークアクセスと認証情報だけを与えてください。

出典

  1. Holo4: powering generalist computer-use agents - Hugging Face
  2. Hcompany/Holo4-27B - Hugging Face
  3. Hcompany/Holo4-35B-A3B - Hugging Face
  4. H Company's Holo4 Handles Screens, Code, and APIs With 79% Fewer Tokens - AlphaSignal

関連記事

Hugging Face上のnvidia/Kumo-Tabularのモデルページで、モデルカードの上にtabular-foundation-modelとstructured-data-modelsのタグと、openmdw-1.1のライセンスバッジが表示されている画面。
AI・LLM

NVIDIA Kumo Tabular、オープンウェイトでTabArena首位に

NVIDIAのKumo Tabularは、ラベル付きの表形式データ(タブラーデータ)から1回の処理で予測し、学習の実行は不要です。TabArenaでは1,950 Eloで首位に立ち、サイズは28Mから215Mまでです。

Liquid AIによるDSpark手法の3段階の図。ターゲットモデルがプレフィルを行い、ドラフトモデルがトークンのブロックを提案し、ターゲットモデルがそれらを検証する。
AI・LLM

Liquid AIのLFM2.5-VL-DSpark、3B視覚モデルを高速化

Liquid AIの280MパラメータのドラフトモデルLFM2.5-VL-DSparkは、投機的デコーディング (スペキュレイティブ・デコーディング)で3B視覚モデルのデコードをM5 Maxで最大3.13x高速化し、出力は同一のままです。

ブラウザーに表示されたQwen/Qwen-Image-2.1のHugging Faceモデルページ。サイドバーにQwen Research Licenseが示されている。
AI・LLM

Qwen-Image-2.1、7Bの重みを研究用ライセンスで公開

Qwen-Image-2.1は70億パラメータとネイティブな透過(トランスペアレンシー)対応をダウンロード可能な画像モデルにまとめた。ただしライセンスは許諾なしの商用利用を禁じている。