Aller au contenu

L'Agents API d'OpenAI ajoute l'usage d'ordinateur dans un navigateur hébergé

L'Agents API d'OpenAI, en bêta publique depuis le 10 septembre, a gagné l'usage d'ordinateur au DevDay du 29 septembre 2026 : les agents pilotent un navigateur hébergé par OpenAI.

Par Tech AI Wire Team

3 min de lecture

XLinkedIn
OpenAI's Agents documentation page, with a table comparing the Agents API, the Agents SDK and the Responses API as starting points for building agents.

OpenAI a ajouté l'usage d'ordinateur (computer use) à son Agents API lors du DevDay du 29 septembre 2026. Les agents construits sur ce service géré peuvent désormais utiliser des sites web et des applications via un navigateur hébergé par OpenAI. Les parties difficiles restent cependant chez les développeurs : la connexion aux comptes, et le choix des sites qu'un agent a le droit de toucher.

L'Agents API elle-même n'est pas toute neuve. Elle est entrée en bêta publique le 10 septembre 2026, rapporte OpenTools, et le DevDay y a ajouté le navigateur. Le résumé de la keynote par RuntimeWire indique qu'elle est toujours en bêta publique. L'usage d'ordinateur est arrivé le même jour que GPT-6.1 Sol, le nouveau modèle moins cher d'OpenAI.

Ce que fait l'Agents API

L'Agents API est un environnement d'exécution d'agents hébergé. Elle fait tourner la boucle qui envoie le travail à un modèle, appelle les outils et suit l'avancement. Le guide Agents d'OpenAI indique qu'elle repose sur le harnais Codex, la même mécanique que celle de l'agent de programmation d'OpenAI. OpenAI gère les sessions, l'orchestration, la compaction du contexte et la reprise.

La compaction du contexte consiste à réduire un long historique pour qu'il tienne dans ce que le modèle peut lire d'un coup. La reprise consiste à relancer une tâche après un échec. Le guide résume l'usage visé : « des tâches longues où OpenAI gère l'agent et enregistre sa progression ».

Les développeurs fournissent les outils et choisissent l'environnement d'exécution. L'environnement prend en charge les serveurs MCP, une manière standard de brancher des services extérieurs sur un modèle d'IA. Il prend aussi en charge l'appel de fonctions, les outils hébergés, les appels d'outils écrits en JavaScript et les Skills, des ensembles d'instructions réutilisables. RuntimeWire ajoute que les agents peuvent confier du travail à d'autres agents, appelés sous-agents.

Trois façons de construire un agent

Le guide d'OpenAI compare l'Agents API à deux options que l'entreprise proposait déjà.

OptionOù tourne la boucle de l'agentQui garde l'état
Agents APILe harnais Codex géré par OpenAIOpenAI enregistre les réglages et l'historique des tours de chaque session
Agents SDKDans votre propre applicationVous contrôlez « le déploiement, le stockage, les approbations et l'intégration à l'exécution »
Responses APIVotre code appelle le modèle directementVous gérez l'historique vous-même ou utilisez Conversations

Le guide prévient que ces options ne se mélangent pas automatiquement. « Une session de l'Agents API, une session du SDK, une conversation Responses et un bac à sable sont des ressources différentes », précise-t-il.

Comment fonctionne l'usage d'ordinateur

L'usage d'ordinateur permet à un agent de regarder un écran et d'agir dessus. Avec la nouvelle fonction, les agents naviguent sur des sites web et utilisent des applications via un navigateur hébergé par OpenAI, rapporte RuntimeWire. Les développeurs peuvent « suivre les événements de la session pendant que l'agent observe l'interface ».

OpenTools souligne ce que le navigateur ne fait pas à votre place. L'application du développeur doit gérer la connexion et « décider quelles requêtes vers des sites l'application autorisera ». Les développeurs doivent aussi vérifier les résultats de l'agent, examiner son activité dans le navigateur et supprimer les sessions une fois le travail terminé.

RuntimeWire indique que l'usage d'ordinateur est proposé pour ChatGPT Work et Codex dans les offres Pro 500 et Enterprise. OpenTools avertit que ces libellés d'offres « ne doivent pas être lus comme une grille tarifaire de l'API ». Le guide Agents d'OpenAI ne donne ni prix par session, ni les modèles utilisés par l'environnement, ni la durée de vie d'une session.

Ce que cela signifie pour les développeurs

Choisissez l'option selon qui doit posséder la boucle. Si vous faites déjà tourner votre propre boucle sur la Responses API, l'Agents API échange du contrôle contre moins de code. La question se pose concrètement pour les équipes qui passent à GPT-6.1 Sol, dont les appels d'outils passent par la Responses API plutôt que par Chat Completions.

Traitez le navigateur hébergé comme si vous confiiez votre portable à un inconnu. Donnez à l'agent ses propres comptes, avec les droits les plus réduits qui fonctionnent. Tenez une liste écrite des sites qu'il peut visiter, et faites respecter cette liste dans votre code. OpenAI l'a appris à ses dépens quand ses modèles de recherche ont utilisé des identifiants trouvés sur des sites du gouvernement australien.

Budgétez prudemment tant que le produit est en bêta. Le guide Agents d'OpenAI ne donne pas de prix par session, alors lancez un petit pilote mesuré avant de promettre quoi que ce soit à un client. Attendez-vous à ce que les noms et les limites changent avant la version finale.

Planifiez les migrations comme un vrai chantier. Une session de l'Agents API est une ressource différente d'une session du SDK ou d'une conversation Responses. Déplacer un agent de l'une à l'autre implique de déplacer son état vous-même.

Construisez vos outils sous forme de serveurs MCP. Le même serveur peut alimenter un agent de l'Agents API et un plugin ChatGPT. L'Agents API se connecte aux serveurs MCP, et les plugins reposent sur eux. Un seul serveur qui fonctionne des deux côtés, c'est moins de code à maintenir.

Sources

  1. Agents - OpenAI API Docs
  2. Everything OpenAI announced at the DevDay 2026 keynote - RuntimeWire
  3. OpenAI adds computer use to Agents API; developers still control website access - OpenTools

Articles liés