Zum Inhalt springen

OpenAI Agents API bekommt Computer Use in einem gehosteten Browser

OpenAIs Agents API, seit dem 10. September in der öffentlichen Beta, erhielt auf dem DevDay am 29. September 2026 Computer Use: Agenten steuern jetzt einen von OpenAI gehosteten Browser.

Von Tech AI Wire Team

3 Min. Lesezeit

XLinkedIn
OpenAI's Agents documentation page, with a table comparing the Agents API, the Agents SDK and the Responses API as starting points for building agents.

OpenAI hat seiner Agents API auf dem DevDay am 29. September 2026 Computer Use hinzugefügt. Agenten, die auf dem verwalteten Dienst laufen, können jetzt Websites und Apps über einen Browser bedienen, den OpenAI hostet. Die schwierigen Teile bleiben aber bei den Entwicklern: die Anmeldung und die Entscheidung, welche Websites ein Agent anfassen darf.

Die Agents API selbst ist nicht ganz neu. Sie startete am 10. September 2026 in die öffentliche Beta, berichtet OpenTools, und der DevDay brachte den Browser dazu. Die Keynote-Zusammenfassung von RuntimeWire sagt, dass sie weiter in der öffentlichen Beta ist. Computer Use kam am selben Tag wie GPT-6.1 Sol, OpenAIs neues, günstigeres Modell.

Was die Agents API tut

Die Agents API ist eine gehostete Laufzeitumgebung für Agenten. Sie betreibt die Schleife, die Arbeit an ein Modell schickt, Werkzeuge aufruft und den Fortschritt festhält. OpenAIs Agents-Leitfaden sagt, dass sie auf dem Codex-Harness aufbaut, derselben Technik hinter OpenAIs Coding-Agent. OpenAI übernimmt Sitzungen, Orchestrierung, Kontextverdichtung und Wiederherstellung.

Kontextverdichtung heißt, einen langen Verlauf so zu kürzen, dass er noch in das passt, was das Modell auf einmal lesen kann. Wiederherstellung heißt, eine Aufgabe nach einem Fehler wieder aufzunehmen. Der Leitfaden fasst den Einsatzzweck als "lang laufende Aufgaben, bei denen OpenAI den Agenten verwaltet und seinen Fortschritt speichert" zusammen.

Die Entwickler liefern die Werkzeuge und wählen die Ausführungsumgebung. Die Laufzeit unterstützt MCP-Server, ein Standardweg, um externe Dienste an ein KI-Modell anzuschließen. Sie unterstützt außerdem Function Calling, gehostete Werkzeuge, in JavaScript geschriebene Werkzeugaufrufe und Skills, also wiederverwendbare Anweisungen. RuntimeWire ergänzt, dass Agenten Arbeit an andere Agenten abgeben können, sogenannte Subagenten.

Drei Wege, einen Agenten zu bauen

OpenAIs Leitfaden vergleicht die Agents API mit zwei Optionen, die es bereits gab.

OptionWo die Agentenschleife läuftWer den Zustand hält
Agents APIOpenAIs verwalteter Codex-HarnessOpenAI speichert Einstellungen und Gesprächsrunden jeder Sitzung
Agents SDKIn Ihrer eigenen AnwendungSie steuern "Bereitstellung, Speicherung, Freigaben und Integration in die Laufzeit"
Responses APIIhr Code ruft das Modell direkt aufSie verwalten den Verlauf selbst oder nutzen Conversations

Der Leitfaden warnt, dass sich diese nicht automatisch mischen lassen. "Eine Agents-API-Sitzung, eine SDK-Sitzung, eine Responses-Konversation und eine Sandbox sind verschiedene Ressourcen", heißt es dort.

Wie Computer Use funktioniert

Computer Use lässt einen Agenten einen Bildschirm betrachten und darauf handeln. Mit der neuen Funktion navigieren Agenten durch Websites und bedienen Anwendungen über einen von OpenAI gehosteten Browser, berichtet RuntimeWire. Entwickler können "die Ereignisse der Sitzung verfolgen, während der Agent die Oberfläche beobachtet".

OpenTools betont, was der Browser nicht für Sie erledigt. Die Anwendung des Entwicklers muss die Anmeldung übernehmen und "entscheiden, welche Website-Anfragen die Anwendung zulässt". Entwickler müssen außerdem die Ergebnisse des Agenten prüfen, seine Browseraktivität kontrollieren und Sitzungen nach getaner Arbeit löschen.

RuntimeWire nennt Computer Use für ChatGPT Work und Codex in den Tarifen Pro 500 und Enterprise. OpenTools warnt, diese Tarifbezeichnungen seien "nicht als API-Preisliste zu lesen". OpenAIs Agents-Leitfaden nennt keine Preise pro Sitzung, keine Modelle, die die Laufzeit nutzt, und nicht, wie lange eine Sitzung hält.

Was das für Entwickler bedeutet

Wählen Sie die Option danach, wem die Schleife gehören soll. Wenn Sie bereits eine eigene Schleife auf der Responses API betreiben, tauscht die Agents API Kontrolle gegen weniger Code. Die Frage ist akut für Teams, die auf GPT-6.1 Sol umsteigen, denn dessen Werkzeugaufrufe laufen über die Responses API statt über Chat Completions.

Behandeln Sie den gehosteten Browser so, als würden Sie einem Fremden Ihren Laptop geben. Geben Sie dem Agenten eigene Konten mit den kleinsten Rechten, die funktionieren. Führen Sie eine schriftliche Liste der Websites, die er besuchen darf, und setzen Sie diese Liste in Ihrem Code durch. OpenAI hat das auf die harte Tour gelernt, als seine Forschungsmodelle Zugangsdaten nutzten, die sie auf australischen Regierungsseiten gefunden hatten.

Planen Sie das Budget vorsichtig, solange das Produkt in der Beta ist. OpenAIs Agents-Leitfaden nennt keine Sitzungspreise, also starten Sie einen kleinen, gemessenen Pilotversuch, bevor Sie einem Kunden etwas zusagen. Rechnen Sie damit, dass sich Namen und Grenzen bis zur allgemeinen Verfügbarkeit ändern.

Planen Sie Migrationen als echte Arbeit. Eine Sitzung in der Agents API ist eine andere Ressource als eine SDK-Sitzung oder eine Responses-Konversation. Einen Agenten zwischen ihnen zu verschieben heißt, seinen Zustand selbst mitzunehmen.

Bauen Sie Ihre Werkzeuge als MCP-Server. Derselbe Server kann einen Agenten in der Agents API und ein ChatGPT-Plugin versorgen. Die Agents API verbindet sich mit MCP-Servern, und Plugins bauen auf ihnen auf. Ein Server, der an beiden Stellen funktioniert, ist weniger Code zum Pflegen.

Quellen

  1. Agents - OpenAI API Docs
  2. Everything OpenAI announced at the DevDay 2026 keynote - RuntimeWire
  3. OpenAI adds computer use to Agents API; developers still control website access - OpenTools

Ähnliche Artikel