• 7 Min. Lesezeit

GPT-6 Astra: Sieben Tipps aus dem Netz im Praxis-Check

GPT-6 Astra: Sieben populäre Tipps zu Desktop-App, Reasoning-Stufen, AGENTS.md und Remote-Modus, geprüft an OpenAIs Doku und unabhängigen Benchmarks.

Titelbild zu „GPT-6 Astra: Sieben Tipps aus dem Netz im Praxis-Check“

OpenAI hat GPT-6 Astra am 3. September 2026 veröffentlicht. Drei Tage später schrieb Nvidia-Chef Jensen Huang auf X, AGI sei angekommen, und gratulierte dem OpenAI-Team. Seitdem kursieren Bedienungstipps, die versprechen, das Modell erst mit der richtigen Arbeitsweise voll zu erleben. Sieben davon, die in Videos und Threads immer wieder auftauchen, werden hier geprüft. Jeder Tipp wird an OpenAIs eigener Dokumentation und an unabhängigen Benchmarks geprüft. Fünf halten, einer widerspricht der Doku, einer ist Geschmackssache.

Was GPT-6 Astra ist

Astra ist OpenAIs neues Flaggschiff für lange, mehrstufige Aufgaben: Programmierung, Browser- und Computersteuerung, Analysen, Dokumente. Der Rollout begann mit ausgewählten Organisationen; Plus-, Pro-, Business- und Enterprise-Pläne folgen schrittweise. Für Plus-Konten ist Astra laut Hilfe-Center nur in ChatGPT Work und Codex enthalten, im normalen Chat bleibt GPT-5.6 Sol. Pro-Konten bekommen zusätzlich GPT-6 Pro im Chat, mit 50 Nachrichten pro Woche im 100-Dollar-Plan und 200 im 200-Dollar-Plan. Enterprise-Administratoren müssen Astra für ihren Workspace freischalten; beim Start ist es deaktiviert.

In der API kostet Astra 10 Dollar pro Million Eingabe-Tokens und 50 Dollar pro Million Ausgabe-Tokens, das 2,5-Fache von GPT-5.6 Sol. Das Kontextfenster liegt bei 1,05 Millionen Tokens. Der Parameter reasoning.effort kennt die Stufen low, medium, high, xhigh und max; die Stufe none gibt es nicht mehr.

Zur AGI-Frage hilft ein Blick auf unabhängige Daten. Artificial Analysis misst Astra im Intelligence Index bei 61 Punkten, gleichauf mit GPT-5.6 Sol und fünf Punkte hinter Claude Fable 5.1. Im Coding Agent Index erreicht Astra 67 und liegt damit auf Höhe von Claude Opus 5 und Fable 5, bei etwa einem Drittel der Tokens von Sol. Die Verbesserung liegt in Token-Effizienz und Agentenbetrieb; der Intelligence Index bewegt sich nicht. OpenAI selbst schreibt in der Ankündigung, dass sich Astras schriftliches Reasoning schwerer überwachen lässt als das von Sol. Präsident Greg Brockman sagte, das Modell könne AGI darstellen. Beide Aussagen gehören zusammen gelesen.

Die sieben Tipps im Check

1. Desktop-App statt CLI, damit Computer Use greift

Stimmt. Computer Use läuft ausschließlich in der ChatGPT-Desktop-App auf macOS und Windows, die CLI hat diese Funktion nicht. Das Modell sieht den Bildschirm, klickt und tippt in Anwendungen, jeweils nach Freigabe pro App. Terminal-Programme und Administratorrechte sind ausgenommen. Unter Windows läuft die Steuerung im Vordergrund und belegt Maus und Tastatur; macOS erlaubt auf Wunsch den Betrieb hinter gesperrtem Bildschirm.

Für Unternehmen ist die Freigabe pro App der wichtige Punkt. Die Allowlist lässt sich in den Einstellungen pflegen. OpenAI beziffert die Beschleunigung durch das neue Codex-Harness auf Faktor 1,9 gegenüber Sol auf dem Mind2Web-Benchmark. Ob das eine Lizenz für eine Fachabteilung rechtfertigt, entscheidet sich an den Prozessen; OpenAI nennt Formulare, CRM-Pflege, Kalender und QA im Browser als Beispiele.

2. Low für die Ausführung, High für die Planung

Stimmt, und OpenAI empfiehlt es selbst. Die Modell-Guidance rät, bei bisherigem Einsatz von none oder minimal mit low zu starten und die Ergebnisse zu vergleichen. Die Benchmarks stützen das: Auf Terminal-Bench Science erreicht Astra in einer günstigeren Einstellung 61,1 Prozent, Sols bestes Ergebnis liegt bei 22,4 Prozent. Auf GPQA Diamond schlägt Astra auf niedrigerer Stufe Sols Bestwert knapp, bei rund 37 Prozent geringeren geschätzten API-Kosten.

Die Kehrseite: Reasoning-Tokens werden als Ausgabe abgerechnet, also zu 50 Dollar pro Million. Im Abo verbraucht Astra das Kontingent schneller als Sol, so steht es im Hilfe-Center. Wer high, xhigh oder max für Planung und die Suche nach blinden Flecken reserviert und Routine auf low fährt, arbeitet mit dem Modell so, wie es gebaut ist.

3. AGENTS.md und Skills löschen

Hier widerspricht die Dokumentation. OpenAI schreibt, Astra reagiere empfindlicher auf Anweisungen in Skills und Dateien wie AGENTS.md als frühere Modelle, und empfiehlt dringend ein Audit dieser Dateien. Unklare oder widersprüchliche Anweisungen können dazu führen, dass das Modell die Arbeit blockiert oder einer Regel folgt, die niemand erwartet hat.

Richtig am Tipp ist die Beobachtung, dass viele Regeln Notbehelfe für Schwächen älterer Modelle waren und jetzt vor allem Kontext kosten. Die Konsequenz heißt ausmisten. Anweisungen zu Coding-Konventionen, Sicherheitsgrenzen, Freigabeprozessen und Teamstandards bleiben, weil das Modell sie jetzt tatsächlich befolgt. Anweisungen, die dem Modell erklären, wie es Werkzeuge findet oder Fehler vermeidet, die es längst nicht mehr macht, fliegen raus. OpenAI legt in der Guidance außerdem fest, dass Nutzeranweisungen Vorrang vor Skill-Anweisungen haben. Konflikte zwischen beiden sind die häufigste Ursache für unerwartetes Verhalten.

4. 3D-Modellierung und Spiele bauen

Die Fähigkeit ist belegt. Auf BenchCAD, das 3D-Objekte aus Renderings per CAD-Code rekonstruiert, erreicht Astra 95,9 Prozent geometrische Überlappung gegenüber 83,3 Prozent für Sol. OpenAI zeigt ein Haus, das in Blender modelliert und als begehbare Szene nach Unreal Engine 5 überführt wird, sowie ein Leiterplatten-Layout in KiCad. Der empfohlene Ablauf, Konzeptbild per Bildgenerierung, Modell in Blender, Zusammenbau in Unity, entspricht OpenAIs eigenen Beispielen.

Für den Mittelstand ist die Spieleentwicklung Nebensache. Interessant ist die Übertragung auf Konstruktion und Elektronik: Modelle, die CAD-Software direkt bedienen, verändern Angebots- und Entwicklungszyklen. Eine Bewertung dafür braucht eigene Testfälle mit echten Bauteilen und Zeichnungsstandards, keine Demo-Videos.

5. Ein „Second Brain“ als Gedächtnis

Der Tipp beschreibt einen Ablauf: Planung auf high, jede Idee als Ticket in Notion oder Linear, danach Abarbeitung auf low in einer Schleife. Das funktioniert, weil das Ticket-System den teuren Planungskontext speichert und die günstige Ausführung ihn nur noch liest.

Teure Planung, günstige AusführungPlanungEffort high / xhighBlind-Spot-FragenTicketsLinear, Notion, JiraGedächtnis mit PrüfpfadAusführungEffort lowSchleife über alle TicketsReviewMensch gibt freiAuto-Review aktivoffene Punkte zurück in die Planung
Planung auf hoher Stufe, Ablage im Ticket-System, Ausführung auf niedriger Stufe

OpenAI hat mit Astra eine verwandte Funktion in Codex eingebaut: Notizen über Kontextfenster hinweg statt wiederholter Kompaktierung, frühere Fenster bleiben durchsuchbar. Sie ist experimentell und wird in der config.toml aktiviert. Für Teams bleibt das Ticket-System die bessere Ablage, weil Jira oder Linear ohnehin da sind, Reviews erzwingen und einen Prüfpfad hinterlassen, den ein Kontextfenster nicht bietet.

6. Ein dedizierter Rechner per Remote

Stimmt in der Mechanik. Remote Connections verbinden ein Telefon oder einen zweiten Rechner mit einem Host, auf dem die Desktop-App läuft, wach, online und mit demselben Konto angemeldet. Eingerichtet wird das unter Settings > Connections > Control this Mac or PC per QR-Code. Der Host liefert die Umgebung: Repository, Shell, MCP-Server, Zugangsdaten. Der Grund für den Tipp ist real. Astra testet gründlich und belegt dabei den Rechner; OpenAI rät in der Guidance, Tests nur bei neuen Änderungen oder Fehlern erneut laufen zu lassen, weil das Modell sonst weitertestet.

Für Unternehmen ist der Tipp eine IT-Frage. Ein dauerhaft eingeschalteter Rechner mit Repo-Zugang, Credentials und MCP-Servern, gesteuert vom Telefon, ist ein Agenten-Host und gehört unter Verwaltung: eigenes Konto, begrenzte Rechte, Auto-Review aktiv, Workspace-Rollen für Work Local und Work Cloud gesetzt. Als privater Mac Studio unter dem Schreibtisch ist derselbe Aufbau ein Sicherheitsrisiko.

7. Fragen stellen statt Prompts schreiben

Der Tipp passt zum Modell. Astra füllt Routinelücken selbst und fragt nur, wenn die Antwort das Ergebnis ändern würde; in Codex fragt es asynchron und arbeitet weiter, solange nichts von der Antwort abhängt. „Was sind die blinden Flecken?“ und „Welcher Schritt hat gerade den größten Hebel?“ sind brauchbare Prompts für die hohen Reasoning-Stufen. OpenAI beschreibt aber auch die Gegenrichtung: Bei Handlungsaufträgen soll das Modell angewiesen werden zu handeln, sonst fragt es öfter nach als nötig. Die Empfehlung, 95 Prozent aller Prompts als Fragen zu formulieren, ist eine persönliche Vorliebe.

Low-Poly-Diorama: dauerhaft aktiver Agenten-Host im Serverraum, IT-Mitarbeiter mit Key Card, drei Geräte greifen remote zu

Was für Teams daraus folgt

  • Effort-Policy pro Aufgabentyp festlegen: Planung, Architektur und Risikoanalyse auf high oder xhigh; Umsetzung, Tests und Formatierung auf low. Business- und Enterprise-Workspaces können Startmodell und Reasoning-Stufe in den Workspace-Einstellungen vorgeben.
  • AGENTS.md und Skills auditieren: jede Regel entweder als Teamstandard begründen oder streichen. Widersprüche zwischen Dateien beseitigen.
  • Ticket-System als Gedächtnis nutzen: Planungsergebnisse landen dort, nicht im Chatverlauf.
  • Agenten-Hosts unter IT-Verwaltung stellen, bevor jemand den Remote-Modus privat einrichtet.
  • Kontingent einplanen: Plus-Konten bekommen begrenzte Astra-Nutzung, Pro-Konten Wochenlimits im Chat.

Grenzen und offene Punkte

Der Rollout ist unfertig; Sam Altman nannte ihn am 4. September „messy“. Welche Konten wann Astra sehen, unterscheidet sich zwischen Chat, Work und Codex. Die Benchmarks stammen fast alle von OpenAI selbst und wurden auf der jeweils besten Effort-Stufe gemessen; die unabhängige Messung zeigt ein nüchterneres Bild. Der Cyber-Bereich ist eingeschränkt: Das öffentliche Modell verweigert Aufgaben wie Proof-of-Concept-Exploits, weniger restriktive Varianten gibt es über das Daybreak-Programm. Und die Überwachbarkeit des Reasonings ist laut OpenAI gesunken, was bei einem Modell, das den Rechner selbst bedient, mehr Gewicht hat als bei einem Chatbot.