Opus 5.5 und GPT-6 Sol senken die Kosten für Agenten
Zwei Preissenkungen haben Agenten-Betreiber innerhalb einer Woche erreicht. OpenAI brachte GPT-6 Sol und Luna am 16. September heraus, zu API-Preisen auf halbem Niveau der GPT-5.6-Aktionspreise, und Anthropic folgte am 22. September mit Claude Opus 5.5, dessen Cache-Lesezugriffe 0,20 $ pro Million Tokens kosten, 60 % unter Opus 5. Für Agenten entscheidet die Cache-Zeile den Großteil der Rechnung.
Warum dominiert der Cache die Rechnung eines Agenten?#
Jede Runde einer Agenten-Schleife schickt denselben wachsenden Kontext zurück ans Modell: den Systemprompt, die Tool-Schemas, das Transkript bis hierher, die Seiten, die ein Fetch-Tool bereits gelesen hat. Nur die neuesten Tokens sind frischer Input. Alles andere ist ein Cache-Lesezugriff, zu einem Bruchteil des Input-Preises abgerechnet, weil der Anbieter die Daten noch im Speicher hält. Anthropic schreibt die Folge direkt in die Ankündigung: Cache-Lesezugriffe „make up the majority of agentic and coding work costs“ (Anthropic).
Listenpreise machen die Rechnung konkret. Eine Session mit 100.000 Tokens stabilem Kontext, die danach 40 Runden läuft, zahlt diesen Kontext 39-mal erneut als Cache-Lesezugriffe: 39-mal 0,05 $ auf Opus 5 ergibt 1,95 $, 39-mal 0,02 $ auf Opus 5.5 ergibt 0,78 $, ohne den einzelnen Cache-Schreibvorgang und ohne die Ausgabe-Tokens. Die Session ist dieselbe. Die größte Position der Rechnung sinkt um 60 %. Genau diese Arithmetik steckt hinter beiden Ankündigungen, und deshalb schaut ein Agent, der Seiten abruft, etwa über searxng-mcp-server, besser auf die Cache-Zeile als auf den Input-Preis der Schlagzeile.
OpenAI hat dieselbe Position gesenkt und Werkzeug drumherum gebaut. Cache-Lesezugriffe erhalten jetzt „discounts of 90%“ (OpenAI), ein Prompt Caching Dashboard zeigt, warum ein Request den Cache verfehlt hat, und Änderungen am Reasoning-Aufwand oder an der Tool-Liste brechen den Cache nicht mehr. GitHub meldet im Post, dass diese Verbesserungen den Anteil der Prompt-Tokens, die frisch verarbeitet werden mussten, über Milliarden von Requests hinweg um mehr als 50 % gesenkt haben.
Was beide Anbieter gesenkt haben, und wann#
Die Daten interessieren jeden, der verfolgt, wer zuerst gezogen hat. OpenAI kündigte Sol und Luna am 16. September an und setzte beide auf die Hälfte ihrer GPT-5.6-Aktionspreise. Anthropic folgte sechs Tage später, am 22. September, mit Input und Output 20 % unter Opus 5 und Cache-Schreibvorgängen von 6,25 $ auf 5 $ pro Million. Ausgabe läuft zudem mehr als 30 % schneller, und ein Fast Mode mit bis zu 2,5-facher Geschwindigkeit kostet 8 $ pro Million Eingabe und 40 $ pro Million Ausgabe in Claude Code und auf der Claude Platform.
Listenpreise, pro Million Tokens:
| Modell | Input | Output | Cache-Lesezugriffe |
|---|---|---|---|
| Claude Opus 5 | 5 $ | 25 $ | 0,50 $ |
| Claude Opus 5.5 | 4 $ | 20 $ | 0,20 $ |
| GPT-6 Sol | 2 $ | 10 $ | 90 % Rabatt auf Input |
| GPT-6 Luna | 0,10 $ | 0,50 $ | 90 % Rabatt auf Input |
Der API-Name lautet claude-opus-5-5, erreichbar über die Claude Platform sowie AWS, Google Cloud und Azure (OfficeChai); OpenAI betreibt gpt-6-sol und gpt-6-luna, beide in ChatGPT Work und Codex, Luna zusätzlich für Free und Go in der Desktop-App. Sonnet 5.5 und Haiku 5.5 folgen in den kommenden Wochen (TechCrunch). Anthropic erhöht zugleich die Fünf-Stunden-Limits auf Pro, Max, Team und den Enterprise-Plänen mit Sitzlizenz und führt ein Limit-Reset ein, das Abonnenten speichern und nach Bedarf einsetzen können.
Wie stark die Kosten pro Task fielen#
Beide Anbieter veröffentlichen inzwischen Kosten pro erledigtem Task, und die sind stärker gefallen als jeder Tokenpreis. Opus 5.5 schlägt GPT-6 Astra auf FrontierCode bei Standard-Aufwand mit rund 20 % der Kosten pro Task, nach Anthropics eigenen Charts, und ein Tester auditierte eine 200.000-Zeilen-Codebasis in unter drei Stunden, wo Opus 5 über 20 Stunden und 2,5-mal so viele Tokens brauchte. OpenAI wiederum: GPT-6 Sol erreicht auf Agents' Last Exam mit maximalem Aufwand 56,4 %, über der Bestmarke von Opus 5, bei 60 % niedrigeren Kosten, und liegt auf DeepSWE v1.1 mit 68,8 % rund 1,1 Punkte unter den 69,9 % von Claude Fable 5, bei etwa 80 % niedrigeren Kosten pro Task. Ein niedrigerer Tokenpreis und weniger Tokens pro Task multiplizieren sich.
Die internen Zahlen von OpenAI erklären die Dringlichkeit. Der Median-Forscher im Rollout verbraucht über 600 $ täglich an Tokens zu API-Preisen, und das 90. Perzentil liegt über 7.000 $. Auf diesem Niveau ist eine Preissenkung um die Hälfte ein Argument im Stellenplan, und der Post positioniert Sol und Luna deshalb für „everyday work“, während GPT-6 Astra an der Frontier bleibt.
Das Kleingedruckte unter den Benchmark-Charts#
Jede Chart in beiden Posts stammt vom Anbieter, dessen Modell gewonnen hat, und beide Posts räumen in Fußnoten Grenzen ein. Anthropic hat Opus 5.5 mit aktiven Produktions-Safeguards evaluiert. Wenn diese griffen, wurden „cybersecurity tasks were completed by Claude Opus 4.8, and biology and frontier LLM development tasks were completed by Claude Opus 5“, was laut Post „likely reduces Claude Opus 5.5's performance on these benchmarks“. Derselbe Post warnt, dass „benchmark margins have become a less reliable guide to real-world differences“. Wer Security-Tooling auf Claude baut, sollte die Umleitung zur Kenntnis nehmen: Den größten Teil der Cybersecurity-Arbeit an Opus 5.5 beantwortet Opus 4.8, und ein Cyber Verification Program für verifizierte Praktiker öffnet in den kommenden Wochen.
AutomationBench taucht in beiden Posts mit unterschiedlichen Protagonisten auf. Anthropics Tabelle, aus Zapier-Läufen ohne Fallback-Modelle, setzt GPT-6 Astra auf 41,4 % und Opus 5.5 auf 40,0 %, ein Vorsprung für OpenAI. OpenAIs eigener AutomationBench-Abschnitt zeigt Sol auf xhigh gegen Claude Opus 5 bei 9 % der Kosten pro Task, plus eine Fußnote, dass der Fable-5.1-Vergleich die Kosten dieses Modells zu niedrig ausweist, weil Opus-5-Fallbacks auf rund 40 % der Tasks entfallen. Dieselbe Bench, andere Gewinner, je nachdem, wessen Chart du aufschlägst.
Was der Support-Agent auf dieser Seite davon hat#
Der Support-Agent auf dieser Seite sitzt am günstigen Ende dieses Marktes: gpt-5-nano für 0,05 $ pro Million Eingabe und 0,40 $ pro Million Ausgabe, etwa 0,0002 $ pro Antwort bei rund 1.300 Eingabe- und 270 Ausgabe-Tokens (Support-Agent). Der Umstieg auf Opus 5.5 würde die Kosten pro Antwort vervielfachen, ohne dass Besucher etwas merken, also liegen die interessanten Hebel woanders. Cache-Disziplin ist einer: Systemprompt und Tool-Schemas bilden einen stabilen Präfix, und die Obergrenze von drei Tool-Runden deckelt den Worst Case (Case Study). Latenz ist der andere. Support ist ein Wartekunden-Problem, heute 5 bis 8 Sekunden, und ein 2,5-facher Fast Mode auf der mittleren Stufe betrifft genau dieses Problem.
Für die nächste Eval-Runde stehen drei Änderungen an: die Gesprächs-Fixtures gegen Sonnet 5.5 laufen lassen, sobald es erscheint, Kosten pro beantwortetem Gespräch protokollieren statt pro Token, und den Skript-Fallback am Budget-Schalter verdrahtet lassen.
Eine Checkliste für Montag#
Vier Prüfungen, bevor jemand Produktions-Traffic umleitet:
- Lies zuerst das Cache-Dashboard: zeigt es Misses, subventionieren die neuen Preise einen kaputten Präfix. Ein stabiler Systemprompt und eine stabile Tool-Reihenfolge sind die Reparatur, und beide Anbieter zeigen die Zahlen jetzt an.
- Evaluiere auf eigenen Tasks: fahre die Fixtures, die du bereits hast, protokolliere Kosten pro erledigtem Task und behandle beide Anbieter-Charts als eine von mehreren Eingaben. Beide Posts räumen ein, dass die Abstände an der Spitze unzuverlässig sind.
- Trenne die Stufen: schmale, hochvolumige Arbeit gehört auf Luna-Klasse-Preise, lange Agenten-Schleifen, die mit weniger Tokens fertig werden, sind das Feld, in dem Opus-5.5-Klasse-Ökonomie zahlt.
- Lies die Safeguard-Notizen: arbeitet dein Agent in Security oder Biologie, antwortet im Zweifel eine Stufe unter der Konfiguration, und dieser Unterschied gehört in die Audit-Dokumentation.
Der Re-Run selbst dauert einen Nachmittag, und die Zahlen landen in derselben Trace-Ansicht, in die der Agent bereits schreibt.
OpenAI war diese Woche noch nicht fertig: GPT-6 Cyber, ein Modell mit Security-Fokus, wird in wenigen Tagen gezeigt. Ich habe aufgeschrieben, was das für Entwickler bedeutet, die Agenten betreiben.