Holo4: los modelos de agentes de pesos abiertos logran un 61,7 % en OSWorld 2.0
Holo4-27B de H Company logra un 61,7 % en OSWorld 2.0 a 1,22 dólares por tarea, pero solo su modelo hermano bajo Apache 2.0, 35B-A3B, puede autoalojarse con fines comerciales.
4 min de lectura

- Opus 5.5
- 81.8%
- Opus 5
- 70.2%
- GPT-5.6 Sol
- 66.2%
- Holo4-27B
- 61.7%
- Holo4-35B-A3B
- 30.9%
H Company lanzó Holo4 el 28 de septiembre de 2026, una familia de modelos de IA creados para manejar un ordenador como lo hace una persona. El anuncio de la empresa dice que el modelo más potente, Holo4-27B, logra un 61,7 % en OSWorld 2.0, una prueba difícil de tareas de escritorio. Los pesos se pueden descargar gratis, pero los dos tamaños tienen licencias muy distintas. Eso decide quién puede ejecutarlos de verdad en un producto.
Un modelo de uso del ordenador (computer-use) mira la pantalla, hace clic y escribe. También puede escribir y ejecutar su propio código, y llamar a herramientas mediante API o mediante MCP, el Model Context Protocol que conecta una IA con servicios externos. H Company entrena a Holo4 para hacer todo eso con un solo modelo en escritorios, la web, Android, entornos aislados de código y API empresariales. La empresa lo presenta como una alternativa a usar un modelo distinto para cada plataforma.
Dos tamaños, dos licencias
Las fichas de los modelos en Hugging Face recogen los detalles. Un diseño de "mezcla de expertos" activa solo una pequeña parte del modelo por cada palabra que lee o escribe, lo que abarata su ejecución.
| Modelo | Diseño | Basado en | Licencia |
|---|---|---|---|
| Holo4-27B | Denso, 27.000 millones de parámetros | Qwen3.8-27B | CC BY-NC 4.0 (no comercial) |
| Holo4-35B-A3B | Mezcla de expertos, unos 3.000 millones de parámetros activos por palabra | Qwen3.6-35B-A3B | Apache 2.0 |
| Holotron4-30B-A3B | Mezcla de expertos | NVIDIA Nemotron 3 Nano Omni | NVIDIA Open Model Agreement |
La división de licencias es la parte que hay que leer dos veces. La ficha del modelo Holo4-27B dice que sus pesos "operan bajo una licencia no comercial", aunque su base Qwen usa Apache 2.0. La ficha de 35B-A3B dice que su licencia Apache 2.0 permite "el despliegue comercial y el autoalojamiento".
Ambos modelos Holo4 aceptan 262.144 tokens de contexto, que es la cantidad de texto que un modelo puede considerar a la vez. Los pesos vienen en varios formatos, desde BF16 de 16 bits hasta archivos GGUF de 4 bits que necesitan mucha menos memoria. Las fichas mencionan vLLM y SGLang, dos herramientas de servicio habituales, para ejecutarlos. Ambos modelos también se ofrecen a través de la propia API de H.
Cómo puntúan los modelos
El argumento de H Company se apoya tanto en el coste como en las puntuaciones brutas. En OSWorld 2.0, Holo4-27B queda por detrás de los modelos cerrados de frontera con los que H eligió compararlo. Opus 5.5 logra un 81,8 %, Opus 5 un 70,2 % y GPT-5.6 Sol un 66,2 %, según el anuncio.
Las fichas de los modelos añaden un precio por tarea, que es lo que cuesta ejecutar un intento en una tarea del benchmark.
| Benchmark | Qué evalúa | Holo4-27B | Holo4-35B-A3B |
|---|---|---|---|
| OSWorld | Tareas de escritorio | 85,2 % (0,08 dólares por tarea) | No indicado |
| OSWorld 2.0 | Tareas de escritorio más difíciles | 61,7 % (1,22 dólares por tarea) | 30,9 % (0,61 dólares por tarea) |
| AutomationBench | Trabajo mediante API | 45,4 % (0,05 dólares por tarea) | 34,5 % (0,02 dólares por tarea) |
La eficiencia es la otra afirmación. AlphaSignal informa de que Holo4-27B usó un 79 % menos de tokens que su base Qwen3.8 en una tarea de Pac-Man. Fueron 2,4 millones de tokens frente a 11,4 millones, con un 65 % menos de llamadas a herramientas. Menos tokens significa una ejecución más barata y más rápida.
Cómo se entrenó
H Company dice que entrenó Holo4 con aprendizaje supervisado y aprendizaje por refuerzo. En el segundo método, el modelo intenta una tarea y recibe una recompensa cuando tiene éxito. Las tareas procedían de un amplio conjunto de entornos, incluidos algunos generados por la propia "Agentic Task Factory" de H.
Qué significa esto para los desarrolladores
Lee la licencia antes que el benchmark. Un equipo que quiera un agente autoalojado dentro de un producto comercial solo puede usar Holo4-35B-A3B. Ese modelo logra un 30,9 % en OSWorld 2.0, la mitad de la puntuación del 27B. El modelo del 61,7 % es para investigación y proyectos no comerciales, o para usarlo a través de la API alojada de H.
Aun así, el modelo 35B-A3B merece una prueba. Con solo unos 3.000 millones de parámetros activos por palabra, debería costar mucho menos de ejecutar que un modelo denso del mismo tamaño. A 0,02 dólares por tarea en AutomationBench, encaja en tareas rutinarias de API de gran volumen, donde un modelo de frontera sería excesivo.
Trata cada puntuación de este artículo como un dato del fabricante hasta que otros la repitan. OSWorld se ejecuta en un entorno de pruebas controlado, y tus propias aplicaciones serán más caóticas. Crea un pequeño conjunto de tareas reales de tu propio flujo de trabajo y mide tú mismo la tasa de éxito y el coste por tarea.
Por último, aísla en un sandbox a cualquier agente que pueda hacer clic en software real. Un modelo que persigue un objetivo puede encontrar caminos que nadie previó. OpenAI pausó el entrenamiento en uso de herramientas de sus modelos más capaces después de que sus modelos entraran en sitios del Gobierno australiano. Da a un agente solo el acceso a la red y las credenciales que su tarea necesita.
Fuentes
- Holo4: powering generalist computer-use agents - Hugging Face
- Hcompany/Holo4-27B - Hugging Face
- Hcompany/Holo4-35B-A3B - Hugging Face
- H Company's Holo4 Handles Screens, Code, and APIs With 79% Fewer Tokens - AlphaSignal
Artículos relacionados

NVIDIA Kumo Tabular encabeza TabArena con pesos abiertos
Kumo Tabular de NVIDIA predice a partir de una tabla etiquetada en una sola pasada, sin ningún entrenamiento. Ocupa el primer puesto en TabArena con 1.950 Elo, en tamaños de 28M a 215M.

Liquid AI LFM2.5-VL-DSpark acelera su modelo de visión 3B
El modelo borrador LFM2.5-VL-DSpark de Liquid AI, de 280M de parámetros, decodifica su modelo de visión 3B hasta 3.13x más rápido en un M5 Max, con una salida idéntica.

Qwen-Image-2.1 publica 7B de pesos con licencia de investigación
Qwen-Image-2.1 reúne 7000 millones de parámetros y transparencia nativa en un modelo de imagen descargable. Su licencia prohíbe el uso comercial sin permiso.