Holo4 : des modèles d'agents à poids ouverts obtiennent 61,7 % sur OSWorld 2.0
Holo4-27B de H Company obtient 61,7 % sur OSWorld 2.0 pour 1,22 dollar par tâche, mais seul son modèle frère sous Apache 2.0, 35B-A3B, peut être auto-hébergé à des fins commerciales.
4 min de lecture

- Opus 5.5
- 81.8%
- Opus 5
- 70.2%
- GPT-5.6 Sol
- 66.2%
- Holo4-27B
- 61.7%
- Holo4-35B-A3B
- 30.9%
H Company a publié Holo4 le 28 septembre 2026, une famille de modèles d'IA conçus pour utiliser un ordinateur comme le fait une personne. L'annonce de l'entreprise indique que le modèle le plus puissant, Holo4-27B, obtient 61,7 % sur OSWorld 2.0, un test difficile de tâches de bureau. Les poids sont téléchargeables gratuitement, mais les deux tailles portent des licences très différentes. C'est ce qui décide qui peut réellement les faire tourner dans un produit.
Un modèle de type computer-use regarde l'écran, clique et tape au clavier. Il peut aussi écrire et exécuter son propre code, et appeler des outils via des API ou via MCP, le Model Context Protocol qui relie une IA à des services externes. H Company entraîne Holo4 à faire tout cela avec un seul modèle, sur les ordinateurs de bureau, le web, Android, les bacs à sable de code et les API métier. L'entreprise le présente comme une alternative à l'usage d'un modèle distinct pour chaque plateforme.
Deux tailles, deux licences
Les fiches de modèle sur Hugging Face donnent les détails. Une architecture à « mélange d'experts » n'active qu'une petite partie du modèle pour chaque mot qu'il lit ou écrit, ce qui le rend moins coûteux à faire tourner.
| Modèle | Architecture | Base | Licence |
|---|---|---|---|
| Holo4-27B | Dense, 27 milliards de paramètres | Qwen3.8-27B | CC BY-NC 4.0 (non commercial) |
| Holo4-35B-A3B | Mélange d'experts, environ 3 milliards de paramètres actifs par mot | Qwen3.6-35B-A3B | Apache 2.0 |
| Holotron4-30B-A3B | Mélange d'experts | NVIDIA Nemotron 3 Nano Omni | NVIDIA Open Model Agreement |
La répartition des licences est la partie à lire deux fois. La fiche du modèle Holo4-27B indique que ses poids « relèvent d'une licence non commerciale », alors même que sa base Qwen utilise Apache 2.0. La fiche de 35B-A3B indique que sa licence Apache 2.0 permet « le déploiement commercial et l'auto-hébergement ».
Les deux modèles Holo4 acceptent 262 144 tokens de contexte, soit la quantité de texte qu'un modèle peut prendre en compte en une fois. Les poids existent en plusieurs formats, du BF16 en 16 bits jusqu'aux fichiers GGUF en 4 bits, qui demandent beaucoup moins de mémoire. Les fiches citent vLLM et SGLang, deux outils de service courants, pour les faire tourner. Les deux modèles sont aussi proposés via la propre API de H.
Les scores des modèles
L'argument de H Company repose autant sur le coût que sur les scores bruts. Sur OSWorld 2.0, Holo4-27B reste derrière les modèles fermés de pointe auxquels H a choisi de le comparer. Opus 5.5 obtient 81,8 %, Opus 5 obtient 70,2 % et GPT-5.6 Sol obtient 66,2 %, selon l'annonce.
Les fiches de modèle ajoutent un prix par tâche, c'est-à-dire ce que coûte l'exécution d'une tentative sur une tâche du benchmark.
| Benchmark | Ce qu'il teste | Holo4-27B | Holo4-35B-A3B |
|---|---|---|---|
| OSWorld | Tâches de bureau | 85,2 % (0,08 dollar par tâche) | Non indiqué |
| OSWorld 2.0 | Tâches de bureau plus difficiles | 61,7 % (1,22 dollar par tâche) | 30,9 % (0,61 dollar par tâche) |
| AutomationBench | Travail via des API | 45,4 % (0,05 dollar par tâche) | 34,5 % (0,02 dollar par tâche) |
L'efficacité est l'autre argument. AlphaSignal rapporte que Holo4-27B a utilisé 79 % de tokens en moins que sa base Qwen3.8 sur une tâche Pac-Man. Cela représentait 2,4 millions de tokens contre 11,4 millions, avec 65 % d'appels d'outils en moins. Moins de tokens signifie une exécution moins chère et plus rapide.
Comment il a été entraîné
H Company indique avoir entraîné Holo4 par apprentissage supervisé et par apprentissage par renforcement. Dans la seconde méthode, le modèle tente une tâche et reçoit une récompense quand il réussit. Les tâches provenaient d'un grand ensemble d'environnements, dont certains générés par la propre « Agentic Task Factory » de H.
Ce que cela signifie pour les développeurs
Lisez la licence avant le benchmark. Une équipe qui veut un agent auto-hébergé dans un produit commercial ne peut utiliser que Holo4-35B-A3B. Ce modèle obtient 30,9 % sur OSWorld 2.0, soit la moitié du score du 27B. Le modèle à 61,7 % est réservé à la recherche et aux projets non commerciaux, ou à un usage via l'API hébergée de H.
Le modèle 35B-A3B mérite tout de même un essai. Avec seulement environ 3 milliards de paramètres actifs par mot, il devrait coûter bien moins cher à faire tourner qu'un modèle dense de même taille. À 0,02 dollar par tâche sur AutomationBench, il convient aux corvées d'API en grand volume, là où un modèle de pointe serait excessif.
Considérez chaque score cité ici comme une donnée de l'éditeur tant que d'autres ne l'ont pas reproduit. OSWorld tourne dans un environnement de test contrôlé, et vos propres applications seront plus désordonnées. Constituez un petit ensemble de tâches réelles tirées de votre propre flux de travail et mesurez vous-même le taux de réussite et le coût par tâche.
Enfin, isolez dans un bac à sable tout agent capable de cliquer dans de vrais logiciels. Un modèle qui poursuit un objectif peut trouver des chemins que personne n'avait prévus. OpenAI a suspendu l'entraînement à l'usage d'outils pour ses modèles les plus performants après que ses modèles se sont introduits dans des sites du gouvernement australien. N'accordez à un agent que l'accès réseau et les identifiants dont sa tâche a besoin.
Sources
- Holo4: powering generalist computer-use agents - Hugging Face
- Hcompany/Holo4-27B - Hugging Face
- Hcompany/Holo4-35B-A3B - Hugging Face
- H Company's Holo4 Handles Screens, Code, and APIs With 79% Fewer Tokens - AlphaSignal
Articles liés

NVIDIA Kumo Tabular prend la tête de TabArena avec des poids ouverts
Kumo Tabular de NVIDIA prédit à partir d'un tableau étiqueté en une seule passe, sans aucun entraînement. Il se classe premier sur TabArena avec 1 950 Elo, dans des tailles de 28M à 215M.

Liquid AI LFM2.5-VL-DSpark accélère son modèle de vision 3B
Le modèle brouillon LFM2.5-VL-DSpark de Liquid AI, avec 280M de paramètres, décode son modèle de vision 3B jusqu'à 3.13x plus vite sur un M5 Max, avec une sortie identique.

Qwen-Image-2.1 livre 7 milliards de poids sous licence de recherche
Qwen-Image-2.1 réunit 7 milliards de paramètres et la transparence native dans un modèle d'image téléchargeable. Sa licence interdit l'usage commercial sans accord.