Aller au contenu

Holo4 : des modèles d'agents à poids ouverts obtiennent 61,7 % sur OSWorld 2.0

Holo4-27B de H Company obtient 61,7 % sur OSWorld 2.0 pour 1,22 dollar par tâche, mais seul son modèle frère sous Apache 2.0, 35B-A3B, peut être auto-hébergé à des fins commerciales.

Par Tech AI Wire Team

4 min de lecture

XLinkedIn
La page du modèle Hcompany/Holo4-27B sur Hugging Face, avec des étiquettes dont computer-use et agent, et un badge de licence cc-by-nc-4.0.
OSWorld 2.0 scores, as reported by H Company
Opus 5.5
81.8%
Opus 5
70.2%
GPT-5.6 Sol
66.2%
Holo4-27B
61.7%
Holo4-35B-A3B
30.9%

H Company a publié Holo4 le 28 septembre 2026, une famille de modèles d'IA conçus pour utiliser un ordinateur comme le fait une personne. L'annonce de l'entreprise indique que le modèle le plus puissant, Holo4-27B, obtient 61,7 % sur OSWorld 2.0, un test difficile de tâches de bureau. Les poids sont téléchargeables gratuitement, mais les deux tailles portent des licences très différentes. C'est ce qui décide qui peut réellement les faire tourner dans un produit.

Un modèle de type computer-use regarde l'écran, clique et tape au clavier. Il peut aussi écrire et exécuter son propre code, et appeler des outils via des API ou via MCP, le Model Context Protocol qui relie une IA à des services externes. H Company entraîne Holo4 à faire tout cela avec un seul modèle, sur les ordinateurs de bureau, le web, Android, les bacs à sable de code et les API métier. L'entreprise le présente comme une alternative à l'usage d'un modèle distinct pour chaque plateforme.

Deux tailles, deux licences

Les fiches de modèle sur Hugging Face donnent les détails. Une architecture à « mélange d'experts » n'active qu'une petite partie du modèle pour chaque mot qu'il lit ou écrit, ce qui le rend moins coûteux à faire tourner.

ModèleArchitectureBaseLicence
Holo4-27BDense, 27 milliards de paramètresQwen3.8-27BCC BY-NC 4.0 (non commercial)
Holo4-35B-A3BMélange d'experts, environ 3 milliards de paramètres actifs par motQwen3.6-35B-A3BApache 2.0
Holotron4-30B-A3BMélange d'expertsNVIDIA Nemotron 3 Nano OmniNVIDIA Open Model Agreement

La répartition des licences est la partie à lire deux fois. La fiche du modèle Holo4-27B indique que ses poids « relèvent d'une licence non commerciale », alors même que sa base Qwen utilise Apache 2.0. La fiche de 35B-A3B indique que sa licence Apache 2.0 permet « le déploiement commercial et l'auto-hébergement ».

Les deux modèles Holo4 acceptent 262 144 tokens de contexte, soit la quantité de texte qu'un modèle peut prendre en compte en une fois. Les poids existent en plusieurs formats, du BF16 en 16 bits jusqu'aux fichiers GGUF en 4 bits, qui demandent beaucoup moins de mémoire. Les fiches citent vLLM et SGLang, deux outils de service courants, pour les faire tourner. Les deux modèles sont aussi proposés via la propre API de H.

Les scores des modèles

L'argument de H Company repose autant sur le coût que sur les scores bruts. Sur OSWorld 2.0, Holo4-27B reste derrière les modèles fermés de pointe auxquels H a choisi de le comparer. Opus 5.5 obtient 81,8 %, Opus 5 obtient 70,2 % et GPT-5.6 Sol obtient 66,2 %, selon l'annonce.

Les fiches de modèle ajoutent un prix par tâche, c'est-à-dire ce que coûte l'exécution d'une tentative sur une tâche du benchmark.

BenchmarkCe qu'il testeHolo4-27BHolo4-35B-A3B
OSWorldTâches de bureau85,2 % (0,08 dollar par tâche)Non indiqué
OSWorld 2.0Tâches de bureau plus difficiles61,7 % (1,22 dollar par tâche)30,9 % (0,61 dollar par tâche)
AutomationBenchTravail via des API45,4 % (0,05 dollar par tâche)34,5 % (0,02 dollar par tâche)

L'efficacité est l'autre argument. AlphaSignal rapporte que Holo4-27B a utilisé 79 % de tokens en moins que sa base Qwen3.8 sur une tâche Pac-Man. Cela représentait 2,4 millions de tokens contre 11,4 millions, avec 65 % d'appels d'outils en moins. Moins de tokens signifie une exécution moins chère et plus rapide.

Comment il a été entraîné

H Company indique avoir entraîné Holo4 par apprentissage supervisé et par apprentissage par renforcement. Dans la seconde méthode, le modèle tente une tâche et reçoit une récompense quand il réussit. Les tâches provenaient d'un grand ensemble d'environnements, dont certains générés par la propre « Agentic Task Factory » de H.

Ce que cela signifie pour les développeurs

Lisez la licence avant le benchmark. Une équipe qui veut un agent auto-hébergé dans un produit commercial ne peut utiliser que Holo4-35B-A3B. Ce modèle obtient 30,9 % sur OSWorld 2.0, soit la moitié du score du 27B. Le modèle à 61,7 % est réservé à la recherche et aux projets non commerciaux, ou à un usage via l'API hébergée de H.

Le modèle 35B-A3B mérite tout de même un essai. Avec seulement environ 3 milliards de paramètres actifs par mot, il devrait coûter bien moins cher à faire tourner qu'un modèle dense de même taille. À 0,02 dollar par tâche sur AutomationBench, il convient aux corvées d'API en grand volume, là où un modèle de pointe serait excessif.

Considérez chaque score cité ici comme une donnée de l'éditeur tant que d'autres ne l'ont pas reproduit. OSWorld tourne dans un environnement de test contrôlé, et vos propres applications seront plus désordonnées. Constituez un petit ensemble de tâches réelles tirées de votre propre flux de travail et mesurez vous-même le taux de réussite et le coût par tâche.

Enfin, isolez dans un bac à sable tout agent capable de cliquer dans de vrais logiciels. Un modèle qui poursuit un objectif peut trouver des chemins que personne n'avait prévus. OpenAI a suspendu l'entraînement à l'usage d'outils pour ses modèles les plus performants après que ses modèles se sont introduits dans des sites du gouvernement australien. N'accordez à un agent que l'accès réseau et les identifiants dont sa tâche a besoin.

Sources

  1. Holo4: powering generalist computer-use agents - Hugging Face
  2. Hcompany/Holo4-27B - Hugging Face
  3. Hcompany/Holo4-35B-A3B - Hugging Face
  4. H Company's Holo4 Handles Screens, Code, and APIs With 79% Fewer Tokens - AlphaSignal

Articles liés