Saltar al contenido

La Agents API de OpenAI añade uso del ordenador en un navegador alojado

La Agents API de OpenAI, en beta pública desde el 10 de septiembre, sumó uso del ordenador en el DevDay del 29 de septiembre de 2026: los agentes manejan un navegador alojado por OpenAI.

Por Tech AI Wire Team

3 min de lectura

XLinkedIn
OpenAI's Agents documentation page, with a table comparing the Agents API, the Agents SDK and the Responses API as starting points for building agents.

OpenAI añadió el uso del ordenador (computer use) a su Agents API en el DevDay del 29 de septiembre de 2026. Los agentes creados sobre este servicio gestionado ya pueden manejar sitios web y aplicaciones a través de un navegador que aloja OpenAI. Pero las partes difíciles siguen en manos de los desarrolladores: iniciar sesión y decidir qué sitios puede tocar un agente.

La Agents API en sí no es del todo nueva. Entró en beta pública el 10 de septiembre de 2026, según OpenTools, y el DevDay le añadió el navegador. El resumen de la keynote de RuntimeWire dice que sigue en beta pública. El uso del ordenador llegó el mismo día que GPT-6.1 Sol, el nuevo modelo más barato de OpenAI.

Qué hace la Agents API

La Agents API es un entorno de ejecución de agentes alojado. Hace funcionar el bucle que envía trabajo a un modelo, llama a herramientas y registra el avance. La guía de Agents de OpenAI dice que se basa en el arnés de Codex, la misma maquinaria que hay detrás del agente de programación de OpenAI. OpenAI se encarga de las sesiones, la orquestación, la compactación del contexto y la recuperación.

Compactar el contexto significa reducir un historial largo para que quepa en lo que el modelo puede leer de una vez. Recuperar significa retomar una tarea después de un fallo. La guía resume el caso de uso como "tareas largas en las que OpenAI gestiona el agente y guarda su progreso".

Los desarrolladores aportan las herramientas y eligen el entorno de ejecución. El entorno admite servidores MCP, una forma estándar de conectar servicios externos a un modelo de IA. También admite llamadas a funciones, herramientas alojadas, llamadas a herramientas escritas en JavaScript y Skills, que son conjuntos de instrucciones reutilizables. RuntimeWire añade que los agentes pueden pasar trabajo a otros agentes, llamados subagentes.

Tres formas de crear un agente

La guía de OpenAI compara la Agents API con dos opciones que ya ofrecía.

OpciónDónde corre el bucle del agenteQuién guarda el estado
Agents APIEl arnés de Codex gestionado por OpenAIOpenAI guarda los ajustes y el historial de turnos de cada sesión
Agents SDKDentro de tu propia aplicaciónTú controlas "el despliegue, el almacenamiento, las aprobaciones y la integración con el entorno de ejecución"
Responses APITu código llama al modelo directamenteTú gestionas el historial o usas Conversations

La guía advierte de que no se mezclan automáticamente. "Una sesión de la Agents API, una sesión del SDK, una conversación de Responses y un sandbox son recursos distintos", dice.

Cómo funciona el uso del ordenador

El uso del ordenador permite a un agente mirar una pantalla y actuar sobre ella. Con la nueva función, los agentes navegan por sitios web y manejan aplicaciones a través de un navegador alojado por OpenAI, informa RuntimeWire. Los desarrolladores pueden "seguir los eventos de la sesión mientras el agente observa la interfaz".

OpenTools subraya lo que el navegador no hace por ti. La aplicación del desarrollador debe encargarse del inicio de sesión y "decidir qué peticiones a sitios permitirá la aplicación". Los desarrolladores también tienen que revisar los resultados del agente, repasar su actividad en el navegador y borrar las sesiones al terminar el trabajo.

RuntimeWire sitúa el uso del ordenador en ChatGPT Work y Codex para los planes Pro 500 y Enterprise. OpenTools advierte de que esas etiquetas de plan "no deben leerse como una tarifa de la API". La guía de Agents de OpenAI no indica precios por sesión, qué modelos usa el entorno ni cuánto dura una sesión.

Qué significa esto para los desarrolladores

Elige la opción según quién deba ser dueño del bucle. Si ya tienes tu propio bucle sobre la Responses API, la Agents API cambia control por menos código. La decisión es real para los equipos que se pasan a GPT-6.1 Sol, cuyas llamadas a herramientas funcionan a través de la Responses API y no de Chat Completions.

Trata el navegador alojado como si le dieras tu portátil a un desconocido. Dale al agente sus propias cuentas con los permisos mínimos que funcionen. Mantén una lista escrita de los sitios que puede visitar y hazla cumplir en tu código. OpenAI lo aprendió por las malas cuando sus modelos de investigación usaron credenciales que encontraron en sitios del gobierno australiano.

Presupuesta con cuidado mientras el producto esté en beta. La guía de Agents de OpenAI no da precios por sesión, así que haz un piloto pequeño y medido antes de prometerle nada a un cliente. Cuenta con que los nombres y los límites cambien antes del lanzamiento general.

Planifica las migraciones como trabajo real. Una sesión de la Agents API es un recurso distinto de una sesión del SDK o de una conversación de Responses. Mover un agente entre ellas implica mover su estado por tu cuenta.

Crea tus herramientas como servidores MCP. El mismo servidor puede respaldar un agente de la Agents API y un plugin de ChatGPT. La Agents API se conecta a servidores MCP, y los plugins se construyen sobre ellos. Un solo servidor que funcione en ambos sitios es menos código que mantener.

Fuentes

  1. Agents - OpenAI API Docs
  2. Everything OpenAI announced at the DevDay 2026 keynote - RuntimeWire
  3. OpenAI adds computer use to Agents API; developers still control website access - OpenTools

Artículos relacionados