Saltar al contenido

Holo4: los modelos de agentes de pesos abiertos logran un 61,7 % en OSWorld 2.0

Holo4-27B de H Company logra un 61,7 % en OSWorld 2.0 a 1,22 dólares por tarea, pero solo su modelo hermano bajo Apache 2.0, 35B-A3B, puede autoalojarse con fines comerciales.

Por Tech AI Wire Team

4 min de lectura

XLinkedIn
La página del modelo Hcompany/Holo4-27B en Hugging Face, con etiquetas como computer-use y agent y una insignia de licencia cc-by-nc-4.0.
OSWorld 2.0 scores, as reported by H Company
Opus 5.5
81.8%
Opus 5
70.2%
GPT-5.6 Sol
66.2%
Holo4-27B
61.7%
Holo4-35B-A3B
30.9%

H Company lanzó Holo4 el 28 de septiembre de 2026, una familia de modelos de IA creados para manejar un ordenador como lo hace una persona. El anuncio de la empresa dice que el modelo más potente, Holo4-27B, logra un 61,7 % en OSWorld 2.0, una prueba difícil de tareas de escritorio. Los pesos se pueden descargar gratis, pero los dos tamaños tienen licencias muy distintas. Eso decide quién puede ejecutarlos de verdad en un producto.

Un modelo de uso del ordenador (computer-use) mira la pantalla, hace clic y escribe. También puede escribir y ejecutar su propio código, y llamar a herramientas mediante API o mediante MCP, el Model Context Protocol que conecta una IA con servicios externos. H Company entrena a Holo4 para hacer todo eso con un solo modelo en escritorios, la web, Android, entornos aislados de código y API empresariales. La empresa lo presenta como una alternativa a usar un modelo distinto para cada plataforma.

Dos tamaños, dos licencias

Las fichas de los modelos en Hugging Face recogen los detalles. Un diseño de "mezcla de expertos" activa solo una pequeña parte del modelo por cada palabra que lee o escribe, lo que abarata su ejecución.

ModeloDiseñoBasado enLicencia
Holo4-27BDenso, 27.000 millones de parámetrosQwen3.8-27BCC BY-NC 4.0 (no comercial)
Holo4-35B-A3BMezcla de expertos, unos 3.000 millones de parámetros activos por palabraQwen3.6-35B-A3BApache 2.0
Holotron4-30B-A3BMezcla de expertosNVIDIA Nemotron 3 Nano OmniNVIDIA Open Model Agreement

La división de licencias es la parte que hay que leer dos veces. La ficha del modelo Holo4-27B dice que sus pesos "operan bajo una licencia no comercial", aunque su base Qwen usa Apache 2.0. La ficha de 35B-A3B dice que su licencia Apache 2.0 permite "el despliegue comercial y el autoalojamiento".

Ambos modelos Holo4 aceptan 262.144 tokens de contexto, que es la cantidad de texto que un modelo puede considerar a la vez. Los pesos vienen en varios formatos, desde BF16 de 16 bits hasta archivos GGUF de 4 bits que necesitan mucha menos memoria. Las fichas mencionan vLLM y SGLang, dos herramientas de servicio habituales, para ejecutarlos. Ambos modelos también se ofrecen a través de la propia API de H.

Cómo puntúan los modelos

El argumento de H Company se apoya tanto en el coste como en las puntuaciones brutas. En OSWorld 2.0, Holo4-27B queda por detrás de los modelos cerrados de frontera con los que H eligió compararlo. Opus 5.5 logra un 81,8 %, Opus 5 un 70,2 % y GPT-5.6 Sol un 66,2 %, según el anuncio.

Las fichas de los modelos añaden un precio por tarea, que es lo que cuesta ejecutar un intento en una tarea del benchmark.

BenchmarkQué evalúaHolo4-27BHolo4-35B-A3B
OSWorldTareas de escritorio85,2 % (0,08 dólares por tarea)No indicado
OSWorld 2.0Tareas de escritorio más difíciles61,7 % (1,22 dólares por tarea)30,9 % (0,61 dólares por tarea)
AutomationBenchTrabajo mediante API45,4 % (0,05 dólares por tarea)34,5 % (0,02 dólares por tarea)

La eficiencia es la otra afirmación. AlphaSignal informa de que Holo4-27B usó un 79 % menos de tokens que su base Qwen3.8 en una tarea de Pac-Man. Fueron 2,4 millones de tokens frente a 11,4 millones, con un 65 % menos de llamadas a herramientas. Menos tokens significa una ejecución más barata y más rápida.

Cómo se entrenó

H Company dice que entrenó Holo4 con aprendizaje supervisado y aprendizaje por refuerzo. En el segundo método, el modelo intenta una tarea y recibe una recompensa cuando tiene éxito. Las tareas procedían de un amplio conjunto de entornos, incluidos algunos generados por la propia "Agentic Task Factory" de H.

Qué significa esto para los desarrolladores

Lee la licencia antes que el benchmark. Un equipo que quiera un agente autoalojado dentro de un producto comercial solo puede usar Holo4-35B-A3B. Ese modelo logra un 30,9 % en OSWorld 2.0, la mitad de la puntuación del 27B. El modelo del 61,7 % es para investigación y proyectos no comerciales, o para usarlo a través de la API alojada de H.

Aun así, el modelo 35B-A3B merece una prueba. Con solo unos 3.000 millones de parámetros activos por palabra, debería costar mucho menos de ejecutar que un modelo denso del mismo tamaño. A 0,02 dólares por tarea en AutomationBench, encaja en tareas rutinarias de API de gran volumen, donde un modelo de frontera sería excesivo.

Trata cada puntuación de este artículo como un dato del fabricante hasta que otros la repitan. OSWorld se ejecuta en un entorno de pruebas controlado, y tus propias aplicaciones serán más caóticas. Crea un pequeño conjunto de tareas reales de tu propio flujo de trabajo y mide tú mismo la tasa de éxito y el coste por tarea.

Por último, aísla en un sandbox a cualquier agente que pueda hacer clic en software real. Un modelo que persigue un objetivo puede encontrar caminos que nadie previó. OpenAI pausó el entrenamiento en uso de herramientas de sus modelos más capaces después de que sus modelos entraran en sitios del Gobierno australiano. Da a un agente solo el acceso a la red y las credenciales que su tarea necesita.

Fuentes

  1. Holo4: powering generalist computer-use agents - Hugging Face
  2. Hcompany/Holo4-27B - Hugging Face
  3. Hcompany/Holo4-35B-A3B - Hugging Face
  4. H Company's Holo4 Handles Screens, Code, and APIs With 79% Fewer Tokens - AlphaSignal

Artículos relacionados