GPT-6 Astra ist auf Bedrock und in Copilot allgemein verfügbar
GPT-6 Astra ist auf Amazon Bedrock für 10 Dollar pro Million Eingabe-Tokens allgemein verfügbar, und in GitHub Copilot für die Pläne Pro+, Max, Business und Enterprise.
3 Min. Lesezeit

Die Zahlen
- standard price per million input / output tokens, short context
- $10 / $50
- per million cached input tokens, short context
- $1
- input tokens of context on Amazon Bedrock
- 1M
OpenAIs GPT-6 Astra ist jetzt auch außerhalb der eigenen Produkte von OpenAI allgemein verfügbar. Am 4. September 2026 machte GitHub es in Copilot allgemein verfügbar, und am 8. September 2026 machte AWS es auf Amazon Bedrock allgemein verfügbar. Auf Bedrock akzeptiert es ein Kontextfenster von bis zu 1 Million Eingabe-Tokens.
Für Entwickler zählt vor allem die Rechnung, und OpenAIs Preisgestaltung ist komplizierter als ein einzelner Tarif.
Was es kostet
OpenAIs Preisdokumentation teilt GPT-6 Astra gleich zweifach auf. Die Preise ändern sich mit der Länge Ihres Kontexts, und noch einmal damit, ob Sie den Standard- oder den Fast-Modus wählen. Alle Angaben gelten pro Million Tokens.
| Modus und Kontext | Eingabe | Eingabe aus dem Cache | Ausgabe |
|---|---|---|---|
| Standard, kurzer Kontext | $10.00 | $1.00 | $50.00 |
| Standard, langer Kontext | $20.00 | $2.00 | $75.00 |
| Fast-Modus, kurzer Kontext | $20.00 | - | $100.00 |
| Fast-Modus, langer Kontext | $40.00 | - | $150.00 |
Zwei Details sind leicht zu übersehen und teuer, wenn man sie spät entdeckt.
Der Fast-Modus verdoppelt gegenüber Standard den Eingabepreis und verdoppelt den Ausgabepreis. Er ist außerdem nicht überall verfügbar: OpenAIs Dokumentation hält fest: „Der Fast-Modus ist für GPT-6 Astra mit EU-Datenresidenz nicht verfügbar. Verwenden Sie für diese Anfragen die Standard-Verarbeitung.“
Unabhängig davon kosten Modelle, die nach dem 5. März 2026 veröffentlicht wurden, 10 % mehr, wenn sie über regionale Endpunkte aufgerufen werden. GPT-6 Astra fällt in dieses Zeitfenster, eine regionale Bereitstellung kostet also mehr, als die Tabelle oben angibt.
Die echten Einsparungen liegen bei der Eingabe aus dem Cache. Mit 1,00 Dollar gegenüber 10,00 Dollar kostet ein Cache-Treffer bei kurzem Kontext ein Zehntel eines frischen Lesevorgangs. Dieses Muster ist inzwischen Standard bei den Frontier-Anbietern, und Anthropic hat denselben Hebel bewegt, als Claude Fable 5.1 die Cache-Lesepreise um 75 % senkte und die Token-Preise dabei unverändert ließ.
Wo Sie es bekommen
| Plattform | Details |
|---|---|
| Amazon Bedrock | Allgemein verfügbar seit dem 8. September 2026. Bis zu 1M Eingabe-Tokens. ChatGPT Work und Codex lassen sich so konfigurieren, dass sie es hier nutzen |
| GitHub Copilot | Allgemein verfügbar seit dem 4. September 2026, über die Modellauswahl |
| Copilot-Pläne | Pro+, Max, Business und Enterprise |
| Copilot-Oberflächen | VS Code, Visual Studio, Copilot CLI, der Coding-Agent, die Copilot-App, github.com, GitHub Mobile, JetBrains-IDEs, Xcode und Eclipse |
GitHub beschreibt die Einführung in Copilot als schrittweise, das Modell erscheint also möglicherweise nicht schon am ersten Tag in Ihrer Modellauswahl. Business- und Enterprise-Administratoren steuern den Zugriff über Modellrichtlinien. Das heißt, ein einzelner Entwickler in einem Firmenplan wartet womöglich auf einen Admin und nicht auf GitHub.
GitHub erklärt außerdem, die Nutzung in Copilot werde als „nutzungsbasierte Abrechnung zu OpenAIs Anbieter-Listenpreisen“ verrechnet. Die Sätze in der Tabelle oben sind die Sätze, die Sie dort zahlen, kein separater Copilot-Tarif.
AWS verweist für die Verfügbarkeit nach Regionen auf die Bedrock-Dokumentation, statt die Regionen in der Ankündigung aufzuzählen, und keine der beiden Ankündigungen nennt Rate-Limits.
Was das für Entwickler bedeutet
Rechnen Sie Ihre eigene Arbeitslast durch, bevor Sie etwas umstellen. Die vierfache Aufteilung nach Kontextlänge und Modus bedeutet, dass ein einzelner Schlagzeilenpreis sehr wenig aussagt. Bei der Ausgabe kostet ein Fast-Modus-Aufruf mit langem Kontext dreimal so viel wie der Standard-Satz bei kurzem Kontext.
Prüfen Sie, ob Sie tatsächlich im kurzen Kontext liegen. OpenAIs Dokumentation bepreist kurzen und langen Kontext unterschiedlich, aber die Ankündigungen sagen nicht, wo die Grenze verläuft. Wenn Ihre Prompts nahe an einer Schwelle liegen, die Sie nicht sehen können, kann sich Ihr Preis pro Aufruf ändern, ohne dass sich Ihr Code ändert. Das lohnt sich an echtem Traffic zu messen, bevor Sie ein Budget festlegen.
Wenn Sie in der EU sind, planen Sie um den Fast-Modus herum statt mit ihm. Die EU-Datenresidenz schließt ihn vollständig aus, und ein regionaler Endpunkt legt noch 10 % obendrauf. Eine Architektur, die den Fast-Modus voraussetzt, überlebt keine Compliance-Prüfung, die Datenresidenz verlangt.
Der Rat zum Caching ist der unspektakulärste und der wertvollste. Bauen Sie Prompts so auf, dass der stabile Teil vorn steht und zwischen den Aufrufen Byte für Byte identisch bleibt, denn genau das macht einen Cache-Treffer möglich. Bei einem Zehntel des Eingabepreises ist es mehr wert, das richtig zu machen, als die meisten Modellentscheidungen.
Ein Vorbehalt zur Leistungsfähigkeit. Astras veröffentlichte Benchmark-Ergebnisse haben je nach Testmethode stark geschwankt, darunter eine Lücke von 37 Punkten auf ARC-AGI-3, die auf den Test-Harness zurückging. Die allgemeine Verfügbarkeit ändert, was Sie kaufen können, nicht, was es kann. Führen Sie Ihre eigene Evaluation an Ihren eigenen Aufgaben durch, bevor Sie Produktionsverkehr umleiten.
Quellen
- OpenAI GPT-6 Astra is now generally available on Amazon Bedrock - AWS
- GPT-6 Astra is generally available in GitHub Copilot - GitHub Changelog
- OpenAI API pricing - OpenAI
Ähnliche Artikel

TypeSafes Jev liefert typisierte Entscheidungen, nicht Text
Jev antwortet in 70 bis 500 Millisekunden und kostet 0,042 Dollar pro Million Eingabe-Token, Ausgabe gratis. Text erzeugen kann es überhaupt nicht.

DeepSeek warnt Entwickler vor einer deutlichen API-Preiserhöhung
DeepSeek warnte Entwickler am 6. August, dass die API-Preise bald 'deutlich' steigen - ohne Zahlen oder Termine, während V4-Flash das günstigste namhafte Modell im Betrieb ist.

Claude Fable 5.1 senkt Cache-Lesekosten um 75%, Tokenpreise bleiben
Anthropics Fable 5.1 hält Ein- und Ausgabepreise bei 10 und 50 Dollar je Million Token und senkt Cache-Lesevorgänge von 1,00 auf 0,25 Dollar. Mythos 5.1 bleibt auf Einladung.