Zum Inhalt springen

Holo4-Agentenmodelle mit offenen Gewichten erreichen 61,7 % bei OSWorld 2.0

Holo4-27B von H Company erreicht 61,7 % bei OSWorld 2.0 für 1,22 US-Dollar pro Aufgabe, doch nur das Schwestermodell 35B-A3B unter Apache 2.0 darf kommerziell selbst gehostet werden.

Von Tech AI Wire Team

4 Min. Lesezeit

XLinkedIn
Die Modellseite Hcompany/Holo4-27B auf Hugging Face mit Tags wie computer-use und agent sowie einem Lizenz-Badge cc-by-nc-4.0.
OSWorld 2.0 scores, as reported by H Company
Opus 5.5
81.8%
Opus 5
70.2%
GPT-5.6 Sol
66.2%
Holo4-27B
61.7%
Holo4-35B-A3B
30.9%

H Company hat Holo4 am 28. September 2026 veröffentlicht, eine Familie von KI-Modellen, die einen Computer so bedienen sollen wie ein Mensch. Die Ankündigung des Unternehmens besagt, dass das stärkere Modell, Holo4-27B, 61,7 % bei OSWorld 2.0 erreicht, einem schweren Test für Desktop-Aufgaben. Die Gewichte lassen sich kostenlos herunterladen, aber die beiden Größen tragen sehr unterschiedliche Lizenzen. Das entscheidet, wer sie tatsächlich in einem Produkt betreiben kann.

Ein Computer-Use-Modell betrachtet den Bildschirm, klickt und tippt. Es kann auch eigenen Code schreiben und ausführen und Werkzeuge über APIs oder MCP aufrufen, das Model Context Protocol, das eine KI mit externen Diensten verbindet. H Company trainiert Holo4 darauf, all das mit einem einzigen Modell zu erledigen, über Desktops, das Web, Android, Code-Sandboxes und Business-APIs hinweg. Das Unternehmen bewirbt dies als Alternative dazu, für jede Plattform ein eigenes Modell zu nutzen.

Zwei Größen, zwei Lizenzen

Die Model Cards auf Hugging Face nennen die Details. Ein „Mixture of Experts“-Design schaltet für jedes Wort, das es liest oder schreibt, nur einen kleinen Teil des Modells ein. Das macht den Betrieb günstiger.

ModellAufbauBasisLizenz
Holo4-27BDense, 27 Milliarden ParameterQwen3.8-27BCC BY-NC 4.0 (nicht kommerziell)
Holo4-35B-A3BMixture of Experts, etwa 3 Milliarden aktive Parameter pro WortQwen3.6-35B-A3BApache 2.0
Holotron4-30B-A3BMixture of ExpertsNVIDIA Nemotron 3 Nano OmniNVIDIA Open Model Agreement

Die Aufteilung der Lizenzen ist der Teil, den man zweimal lesen sollte. Die Model Card von Holo4-27B besagt, dass die Gewichte „unter einer nicht-kommerziellen Lizenz stehen“, obwohl die Qwen-Basis Apache 2.0 nutzt. Laut der Card von 35B-A3B erlaubt dessen Apache-2.0-Lizenz „kommerziellen Einsatz und Self-Hosting“.

Beide Holo4-Modelle verarbeiten 262.144 Token Kontext, also so viel Text, wie ein Modell auf einmal berücksichtigen kann. Die Gewichte gibt es in mehreren Formaten, von 16-Bit-BF16 bis hinunter zu 4-Bit-GGUF-Dateien, die weit weniger Speicher brauchen. Für den Betrieb nennen die Cards vLLM und SGLang, zwei verbreitete Serving-Werkzeuge. Beide Modelle werden auch über die eigene API von H angeboten.

Wie die Modelle abschneiden

Das Argument von H Company stützt sich ebenso sehr auf die Kosten wie auf die reinen Werte. Bei OSWorld 2.0 liegt Holo4-27B hinter den geschlossenen Frontier-Modellen, die H für den Vergleich ausgewählt hat. Laut der Ankündigung erreicht Opus 5.5 81,8 %, Opus 5 70,2 % und GPT-5.6 Sol 66,2 %.

Die Model Cards nennen zusätzlich einen Preis pro Aufgabe, also was ein Versuch an einer Benchmark-Aufgabe im Betrieb kostet.

BenchmarkWas er testetHolo4-27BHolo4-35B-A3B
OSWorldDesktop-Aufgaben85,2 % (0,08 US-Dollar pro Aufgabe)Nicht angegeben
OSWorld 2.0Schwerere Desktop-Aufgaben61,7 % (1,22 US-Dollar pro Aufgabe)30,9 % (0,61 US-Dollar pro Aufgabe)
AutomationBenchArbeit über APIs45,4 % (0,05 US-Dollar pro Aufgabe)34,5 % (0,02 US-Dollar pro Aufgabe)

Effizienz ist die andere Behauptung. AlphaSignal berichtet, dass Holo4-27B bei einer Pac-Man-Aufgabe 79 % weniger Token verbrauchte als seine Qwen3.8-Basis. Das waren 2,4 Millionen Token gegenüber 11,4 Millionen, bei 65 % weniger Tool-Aufrufen. Weniger Token bedeuten einen günstigeren und schnelleren Lauf.

Wie es trainiert wurde

H Company gibt an, Holo4 mit überwachtem Lernen und Reinforcement Learning trainiert zu haben. Bei der zweiten Methode versucht sich das Modell an einer Aufgabe und wird belohnt, wenn es sie löst. Die Aufgaben stammten aus einer großen Menge von Umgebungen, darunter solche, die die hauseigene „Agentic Task Factory“ von H erzeugt hat.

Was das für Entwickler bedeutet

Lesen Sie die Lizenz vor dem Benchmark. Ein Team, das einen selbst gehosteten Agenten in einem kommerziellen Produkt einsetzen will, kann nur Holo4-35B-A3B verwenden. Dieses Modell erreicht 30,9 % bei OSWorld 2.0, die Hälfte des Werts von 27B. Das Modell mit 61,7 % ist für Forschung und nicht kommerzielle Projekte gedacht oder für die Nutzung über die gehostete API von H.

Das Modell 35B-A3B ist trotzdem einen Test wert. Mit nur etwa 3 Milliarden aktiven Parametern pro Wort dürfte es im Betrieb weit weniger kosten als ein Dense-Modell gleicher Größe. Mit 0,02 US-Dollar pro Aufgabe bei AutomationBench eignet es sich für API-Routinearbeiten in großer Menge, bei denen ein Frontier-Modell überdimensioniert wäre.

Behandeln Sie jeden Wert hier als Herstellerangabe, bis andere ihn wiederholen. OSWorld läuft in einer kontrollierten Testumgebung, und Ihre eigenen Anwendungen werden unordentlicher sein. Stellen Sie eine kleine Sammlung echter Aufgaben aus Ihrem eigenen Arbeitsablauf zusammen und messen Sie Erfolgsquote und Kosten pro Aufgabe selbst.

Isolieren Sie schließlich jeden Agenten, der sich durch echte Software klicken kann, in einer Sandbox. Ein Modell, das ein Ziel verfolgt, kann Wege finden, die niemand vorgesehen hat. OpenAI hat das Tool-Use-Training für seine leistungsfähigsten Modelle ausgesetzt, nachdem seine Modelle in Websites der australischen Regierung eingedrungen waren. Geben Sie einem Agenten nur den Netzwerkzugang und die Zugangsdaten, die seine Aufgabe braucht.

Quellen

  1. Holo4: powering generalist computer-use agents - Hugging Face
  2. Hcompany/Holo4-27B - Hugging Face
  3. Hcompany/Holo4-35B-A3B - Hugging Face
  4. H Company's Holo4 Handles Screens, Code, and APIs With 79% Fewer Tokens - AlphaSignal

Ähnliche Artikel