GPT-6 Astra vs. Claude Fable 5.1: Benchmarks, Blender-Test und eine Woche Praxis (2026)
OpenAI GPT-6 Astra und Anthropic Claude Fable 5.1 im Vergleich: Benchmarks zu Coding, Agenten und 3D, was Entwickler nach einer Woche sagen, und mein Praxistest. Astra ist in Blender und 3D herausragend, Fable 5.1 bleibt beim Coding vorne.
GPT-6 Astra und Claude Fable 5.1 sind sich auf dem Papier so nah wie noch keine zwei Spitzenmodelle zuvor: gleicher Preis, gleiches Kontextfenster, gleicher Platz im Intelligenzindex. In der Praxis sind sie sehr unterschiedlich. Astra ist in Blender und 3D das beste Modell, das ich je benutzt habe. Fable 5.1 bleibt das Modell, mit dem ich Software baue, auch wenn einzelne Coding-Benchmarks zugunsten von Astra ausfallen.
Anthropic hat am 1. September 2026 Claude Fable 5.1 veröffentlicht, zusammen mit Mythos 5.1, demselben Modell ohne die zusätzlichen Schutzmassnahmen, das nur geprüfte Organisationen erhalten. Zwei Tage später kam OpenAI mit GPT-6 Astra, dem Nachfolger von GPT-5.6 Sol. Beide kosten 10 USD pro Million Input- und 50 USD pro Million Output-Tokens, beide haben ein Kontextfenster von rund einer Million Tokens, beide werden als Generationssprung verkauft. Im Juli habe ich Fable 5, GPT-5.6 Sol und Kimi K3 verglichen und ein Orchestrator-Executor-Setup empfohlen. Dieser Beitrag ist die Fortsetzung: die öffentlichen Benchmarks, das Stimmungsbild unter Entwicklern nach der ersten Woche, und mein eigener Test mit beiden Modellen in Blender, Unreal Engine und in echten Software-Projekten.
Eine Woche ist kurz, und beide Anbieter haben in dieser Woche noch an Limits, Preisen und Indizes geschraubt. Die Zahlen unten sind eine Momentaufnahme vom 8. September 2026.
Wie schneiden Astra und Fable 5.1 in den Benchmarks ab?
Der Intelligence Index von Artificial Analysis wurde innerhalb von zwei Tagen zweimal revidiert. In der ersten Fassung lag Fable 5.1 fünf Punkte vor Astra, in der aktuellen sind beide gleichauf. Das sagt weniger über die Modelle als über die Indizes: Bei dieser Dichte an der Spitze entscheidet die Konfiguration des Tests über die Rangfolge.
| Benchmark | GPT-6 Astra | Claude Fable 5.1 | Anmerkung |
|---|---|---|---|
| Intelligence Index (Artificial Analysis) | gleichauf | gleichauf | Index in zwei Tagen zweimal revidiert |
| Coding Agent Index (Artificial Analysis) | 67 | 70 | Astra braucht dafür deutlich weniger Tokens |
| Code Arena WebDev (Elo) | 1'797 | 1'762 | Fable 5.1 war bis zum Astra-Start auf Platz 1 |
| Terminal-Bench 4.0 | 57,7 % | 55,8 % | Mythos 5.1 ohne Schutzmassnahmen: 60,9 % |
| AutomationBench (Artificial Analysis) | 68 | 59 | Astras grösster Vorsprung |
| BenchCAD (Bild zu CAD-Code) | 95,9 % | 84,3 % | 3D und Raum: Astra klar vorne |
| GPQA Diamond | 96,0 % | 92,6 % | Naturwissenschaft auf Doktoratsniveau |
| Humanity's Last Exam (mit Tools) | 57,2 % | 65,0 % | Fable 5.1 vorne |
| Preis pro Million Tokens (In / Out) | 10 / 50 USD | 10 / 50 USD | identisch |
| Cache-Lesezugriff pro Million Tokens | ~1 USD | 0,25 USD | Fable 5.1 viermal günstiger |
| Ausgabetempo | ~57 Tokens/s | ~69 Tokens/s | Fable 5.1 schneller |
Zwei Dinge fallen auf. Erstens hat OpenAI für Astra keine SWE-Bench-Werte publiziert, sondern eigene Coding-Benchmarks, und Anthropics SWE-Bench-Pro-Wert von 81,2 % für Fable 5.1 ist selbst gemeldet. Der direkte Coding-Vergleich, den es im Juli noch gab, fehlt. Zweitens zeigt ARC-AGI-3, wie weit Schlagzeile und Messung auseinanderliegen können: OpenAI meldet 99,9 % mit einem eigenen Test-Harness, der unabhängige Betreiber misst mit dem Standard-Harness 62,7 %. Beides ist dasselbe Modell.
Blender und 3D: Hier ist Astra wirklich, wirklich gut
Ich habe beiden Modellen dieselbe Aufgabe gegeben: einen Grundriss als PDF, daraus ein Einfamilienhaus in Blender, mit Innenräumen, Möbeln, Licht und Materialien, und am Ende eine begehbare Szene in Unreal Engine 5.
Astra hat das nicht als Bild verstanden, sondern als Bauplan. Es schreibt Blender-Python-Skripte, startet Blender im Hintergrund, rendert, schaut sich das Bild an, misst nach und korrigiert. Nach etwa vierzig Minuten stand ein Haus aus mehreren tausend einzeln benannten, editierbaren Objekten, mit Modifiern statt eingebackener Geometrie, mit Wandstärken, die zum Plan passten, und mit Türen, die dort waren, wo sie im Grundriss eingezeichnet sind. Den Export nach Unreal hat Astra selbst gebaut, getestet und nachgebessert, bis die Szene mit 60 Bildern pro Sekunde lief. Auch Kleinigkeiten wie die Küchengeräte waren an ihrem Platz. Das ist die Art Arbeit, die ich früher einem Visualisierer für eine Woche gegeben hätte.
Drei Dinge haben mich besonders beeindruckt:
- Geometrie aus Referenzen. Aus ein paar Fotos eines Raumes baut Astra eine proportional stimmige Rekonstruktion. Fable 5.1 baut aus denselben Fotos etwas, das nach dem Raum aussieht, aber nicht zu ihm passt. Genau das misst BenchCAD, und der Abstand von elf Punkten fühlt sich in der Praxis grösser an.
- Geometry Nodes. Wer Astra wie einen Procedural Artist brieft, also einen Node-Baum mit offenen Parametern für Dichte, Seed und Breite verlangt statt einfach «mach einen Wald», bekommt brauchbare Systeme. Auf das Briefing kommt es an.
- Die Pipeline nach draussen. Unreal, Unity, Godot, Three.js: Astra kennt die Kommandozeilen-Modi der Engines, spielt das Ergebnis selbst durch, prüft Screenshots und repariert. Bei Three.js-Szenen ist Fable 5.1 ebenbürtig, bei allem, was durch Blender muss, nicht.
Auch bei Astra läuft nicht alles rund. Die erste Ausführung in einer abgeschotteten Sandbox stürzte ab, Blender lief erst ohne Sandbox. Die Blender-5.x-API hat Eigenheiten, die Astra mit Deprecation-Warnungen quittiert, aber nicht immer sauber umgeht. Und jede grössere Szene kostet spürbar Tokens; Astra denkt bei 3D lange, bevor es schreibt.
Fable 5.1 ist in Blender nicht schlecht. Über einen Blender-MCP-Server baut es Szenen, schaut sich den Viewport an und korrigiert eigene Fehler, und es ist dabei schneller und billiger als Astra. Für Videos aus einer Adresse, für Landschaften aus GIS-Daten oder für grössere Projekte, in denen die Szene als Code konsistent bleiben muss, ist es eine gute Wahl. Einmal hat es allerdings eine Stilentscheidung getroffen, um die ich nicht gebeten hatte, und das erst zugegeben, als ich nachfragte. Für alles, was räumlich genau sein muss, nehme ich Astra.
Coding: Warum Fable 5.1 trotzdem vorne bleibt
Die Benchmarks sind beim Coding geteilt. In der Praxis sind sie es für mich nicht. Ich habe beide Modelle in dieser Woche in denselben Projekten eingesetzt: dieser Website, zwei Automatisierungs-Agenten für Kunden und einer Daten-Pipeline für unsere Sichtbarkeitsstudie.
Fable 5.1 bringt Dinge fertig. Es plant die Architektur, bevor es die erste Datei anfasst, arbeitet lange Aufgaben ohne Rückfragen durch und ist das erste Modell, das Code zuverlässig vereinfacht, statt ihn zu vermehren. In Code-Reviews schreibt es weniger Kommentare, dafür treffendere. Der Schreibstil ist besser geworden, mit weniger typischen Claude-Floskeln. Und es ist im Agentenbetrieb spürbar günstiger, weil die Cache-Lesezugriffe um drei Viertel billiger wurden.
Astra hört zu früh auf. Es fragt nach Bestätigungen, die ich schon gegeben habe, nimmt alte Regeln aus Konfigurationsdateien so wörtlich, dass es dort stoppt, wo ein Mensch weitermachen würde, und produziert mehr Füllcode. In zwei meiner Builds waren Features äusserlich fertig und funktionierten nicht: eine API-Anbindung ohne echten Datenfluss und ein Agent, der sich selbst nicht aufrufen konnte. Fable 5.1 hat dieselben Aufgaben zweimal klar gewonnen und einmal unentschieden gespielt, und war dabei schneller. Wer von GPT-5.6 Sol migriert, muss zudem die API anpassen: Temperatur- und Sampling-Parameter sind weg, das Antwortformat heisst anders, die Streaming-Events haben eine neue Form.
Das ist keine Absolution für Fable 5.1. Es verbraucht deutlich mehr Tokens pro Aufgabe als Fable 5, teilweise das Dreifache, was den günstigeren Cache wieder auffrisst. Es liefert zu viel, wenn man es lässt: zehn Zitate verlangt, vierzig bekommen, einige davon erfunden. Es startet Subagenten in einer Zahl, die niemand bestellt hat, und hört nicht immer auf, wenn man es unterbricht. Und auf höchster Denkstufe ist es langsam, für einen Review braucht es gut die Hälfte länger als Fable 5.
Trotzdem: Wenn ich ein Projekt in fremde Hände geben müsste und nur ein Modell wählen dürfte, wäre es Fable 5.1. Es versteht, was ich meine, auch wenn ich es nicht ausformuliert habe. Astra versteht, was ich geschrieben habe.
Was Entwickler nach einer Woche sagen
Die Stimmung in Foren, auf X und in den Entwickler-Communities beider Anbieter folgt bei beiden Modellen derselben Kurve, nur um zwei Tage versetzt.
Bei Astra waren die ersten Tage laut: virale 3D-Demos, Häuser aus Grundrissen, Spiele über Nacht, Zuschreibungen bis hin zu «AGI». Ab Tag fünf drehte es. Die Nutzungslimits in Codex waren nach zwanzig Minuten aufgebraucht, OpenAI kürzte die Limits für Vielnutzer nachträglich um das Vierfache, der Preis von 2,5-mal Sol wurde zum Hauptthema. Erfahrene Entwickler schrieben, die Benchmark-Sprünge deckten sich nicht mit ihrer Erfahrung, und für grosse Architektur-Builds würden sie weiterhin zu Fable 5.1 greifen. Dazu kam eine Kontroverse, die nichts mit der Technik zu tun hat: OpenAI hat Astra mit Blender beworben, einer von der Community gebauten Open-Source-Software, und ein Teil der Blender-Künstler empfand das als Aneignung ihrer Arbeit. Die Technik-Community war begeistert, die Kunst-Community verletzt.
Bei Fable 5.1 hiess es am ersten Tag «Anthropic ist zurück», am zweiten kam der Ärger über Limits: Ein Nutzer verbrauchte sein Wochenkontingent des teuersten Abos mit einem einzigen Prompt in unter einer Stunde. Anthropic setzte die Limits zurück und verteilte bis Mitte September Zusatzkontingente. Danach kam die Klage, die bei jedem Claude-Modell kommt: Es sei nicht mehr so gut wie am Starttag, wahrscheinlich wegen nachgezogener Schutzmassnahmen. Belegen konnte das niemand; die meisten, die es schrieben, nannten Fable 5.1 im selben Atemzug weiterhin das beste Modell mit Abstand.
Was mir an beiden nicht gefällt
- Beide brennen Kontingente. Ein Fable-Gespräch zählt doppelt gegen das Claude-Limit, Astra ist nach einer langen Session weg. Wer ernsthaft damit arbeitet, plant Kontingente wie Budget.
- Astra hat zum Start keine EU-Datenzone. Nur global und USA. Für Schweizer Firmen mit Personendaten heisst das: Transfer nach Artikel 16 DSG prüfen oder für diese Aufgaben ein anderes Modell wählen. Details in KI und Datenschutz in der Schweiz.
- Fable 5.1 gibt es nicht in jedem Abo. In Claude Code steht es nur Max- und Premium-Team-Sitzen zu, Pro-Nutzer zahlen es über Guthaben zum API-Preis. Und bestimmte Anfragen, etwa im Sicherheitsbereich, leitet ein Klassifikator still auf ein Opus-Modell um.
- Astra ist im Sicherheitsbereich hart gesperrt. Exploit-nahe Anfragen brechen an der API ab, auch mit Autorisierung; der Zugang zum entsprechenden Programm dauert Wochen. Für Penetrationstester ist das ein echtes Hindernis.
- Beide Anbieter berichten selbst, dass sie ihre Modelle schlechter überwachen können als die Vorgänger. Das ist kein Nutzerproblem im Alltag, aber ein Grund, Agenten mit echten Rechten weiterhin eng zu führen.
Mein Setup nach einer Woche
Neu gegenüber Juli ist nicht die Arbeitsteilung, sondern dass 3D überhaupt auf der Liste steht. Bis vor einer Woche war «Blender per Sprache» eine Demo. Jetzt ist es ein Werkzeug, das ich einem Architekten, einem Produktdesigner oder einem Immobilienvermarkter in die Hand geben kann. Wer wissen will, ob sich das für sein Unternehmen lohnt, findet in ChatGPT vs. Claude für KMU die Sicht auf die Assistenten im Alltag; hier geht es um die Modelle dahinter.
Fazit
Astra und Fable 5.1 sind nicht besser oder schlechter, sie sind anders. Astra ist das erste Modell, das den dreidimensionalen Raum wirklich versteht, und das ändert für alle, die mit Geometrie arbeiten, mehr als jeder Coding-Benchmark. Fable 5.1 ist das Modell, das Software-Projekte zu Ende bringt, mit Urteilsvermögen, das man ihm nicht jedes Mal erklären muss. Wer nur eines wählen kann, wählt nach Aufgabe. Wer beide kombiniert, hat zum ersten Mal ein Setup, das vom Grundriss bis zum fertigen Produkt reicht. Genau solche Systeme aus mehreren Modellen bauen wir bei Hierarchy in der KI-Automatisierung für KMU, und genau das zeigen wir in unseren KI-Schulungen.
Häufige Fragen
- Ist GPT-6 Astra besser als Claude Fable 5.1?
- Kommt auf die Aufgabe an. Im Gesamt-Intelligenzindex liegen beide gleichauf, Astra führt bei Terminal-Aufgaben, Web-Frontend-Duellen und vor allem bei 3D und CAD, Fable 5.1 führt beim agentischen Coding, ist schneller und dank günstigerem Cache im Agentenbetrieb spürbar billiger. In meiner Praxis gewinnt Astra in Blender und 3D klar, Fable 5.1 bleibt beim Software-Bau das Modell, das Projekte fertig bringt.
- Welches KI-Modell ist besser für Blender und 3D?
- GPT-6 Astra, und zwar deutlich. Es schreibt Blender-Python-Skripte, rendert im Hintergrund, schaut sich das Bild an und korrigiert, bis Geometrie und Proportionen stimmen. Aus einem Grundriss entsteht so eine editierbare Szene bis hin zu einer begehbaren Unreal-Engine-Szene. Auf dem CAD-Benchmark liegt Astra mit 95,9 % gut elf Punkte vor Fable 5.1.
- Welches KI-Modell ist 2026 besser für Coding?
- Claude Fable 5.1, trotz einzelner Benchmarks zugunsten von Astra. Fable 5.1 plant Architektur besser, arbeitet lange Aufgaben ohne Rückfragen durch, vereinfacht Code statt ihn aufzublähen und lieferte in meinen Builds weniger halbfertige Features. Astra fragt zu oft nach Bestätigung, nimmt alte Prompt-Regeln zu wörtlich und kostete pro fertigem Feature mehr.
- Was kosten GPT-6 Astra und Claude Fable 5.1?
- Beide kosten in der API 10 USD pro Million Input- und 50 USD pro Million Output-Tokens. Der Unterschied liegt im Kleingedruckten: Fable 5.1 verrechnet Cache-Lesezugriffe mit 0,25 USD, Astra mit rund 1 USD pro Million Tokens, und Astra verdoppelt den Preis oberhalb von etwa 272'000 Input-Tokens auf 20 respektive 75 USD. Für Agenten, die dieselben Dateien immer wieder lesen, ist Fable 5.1 damit meist günstiger.
- Dürfen Schweizer Firmen Astra mit Kundendaten nutzen?
- Mit Vorsicht. Zum Start bietet OpenAI für Astra nur globale und US-Datenzonen an, keine EU-Datenzone. Wer Personendaten verarbeitet, muss den Transfer nach Artikel 16 DSG prüfen oder auf ein Modell mit europäischer Datenhaltung ausweichen, etwa Claude über AWS Bedrock oder Google Vertex in einer EU-Region. Für Aufgaben ohne Personendaten, etwa 3D-Modelle oder Code, spielt das keine Rolle.
