Gemini 4 Argon im Faktencheck: Frontier-Sprung oder Benchmark-Maxxing?
Gemini 4 Argon im Faktencheck: Herstellerbenchmarks, unabhängige Evals, 1M Output-Tokens und Taskkosten zeigen Fortschritt, aber keinen universellen Modellsieg.
Kurzfassung
Gemini 4 Argon ist ein messbarer Fortschritt, aber kein universeller Sieger. Das Modell erreicht 53 Punkte im Artificial Analysis Intelligence Index, 68,90 Prozent im Vals Index und teilt sich bei CWE-bench programmatic pass@1 mit 68 Prozent die Führung. Gleichzeitig liegt es in mehreren Coding-Evals hinter GPT-6 Astra oder Claude Opus 5.5 und verbraucht bei Artificial Analysis im Mittel rund 62.000 Output-Tokens pro Aufgabe. Der günstige Eindruck hängt deshalb stark am Einführungspreis, am jeweiligen Agenten-Harness und am Testbudget.
Gemini 4 Argon wurde am 30. September 2026 von Google DeepMind angekündigt. Google spricht von Frontier-Leistung bei Softwareentwicklung, Wissensarbeit und defensiver Cybersicherheit. Die veröffentlichten Ergebnisse stützen einen Teil dieser Aussage. Sie belegen aber weder eine durchgängige Coding-Führung noch automatisch bessere Produktivität im Unternehmensalltag.
Dieser Faktencheck ist eine Momentaufnahme zum 1. Oktober 2026. Ich habe keine eigene Argon-Testreihe durchgeführt. Die Bewertung trennt daher Herstellerwerte, unabhängig erhobene Evals und die jeweils verwendeten Systeme, Grader sowie Budgets.
Was ist Gemini 4 Argon?
Gemini 4 Argon ist Googles proprietäres Frontier-Modell für lange, komplexe Arbeitsabläufe. Im Vordergrund stehen agentische Softwareentwicklung, Wissensarbeit, multimodale Aufgaben und Cyberabwehr. Die Gewichte sind laut der unabhängigen Modellübersicht von Vals AI nicht offen verfügbar.
Artificial Analysis und die Modellübersicht von Vals AI nennen ein Input-Kontextfenster von einer Million Tokens. Google kündigt separat ein Output-Limit von bis zu einer Million Tokens statt bisher 64.000 an. Artificial Analysis testete dafür Long Decode Continuation: Lange Ausgaben werden pausiert und über Folgeaufrufe fortgesetzt. Eine Million Output-Tokens bedeutet deshalb nicht zwingend eine einzelne, ununterbrochene API-Antwort.
Wer hat tatsächlich Zugang?
Zum Stichtag rollt Google Argon zunächst an ausgewählte vertrauenswürdige Cyberverteidiger im Fairwind Program aus. Eine breitere Verfügbarkeit ist angekündigt und soll mit zahlenden API-Kunden sowie Google-AI-Ultra-Abonnenten beginnen. Ein konkretes Datum nennt Google nicht.
Das ist für die Bewertung entscheidend: Externe Benchmark-Betreiber konnten das Modell evaluieren, während ein allgemein verfügbarer Produktionszugang noch fehlte. Eine veröffentlichte Eval ist kein Beleg dafür, dass Unternehmen dieselbe Konfiguration, dieselben Limits oder denselben Durchsatz bereits kaufen können.
| Kerndatum | Stand zum 1. Oktober 2026 |
|---|---|
| Hersteller | Google DeepMind |
| Modellart | Proprietär, Gewichte nicht öffentlich |
| Kontextfenster | 1 Million Tokens |
| Angekündigter maximaler Output | 1 Million Tokens, zuvor 64.000 |
| Einführungspreis | 2 US-Dollar Input und 10 US-Dollar Output je 1 Million Tokens |
| Regulärer Preis | 4 US-Dollar Input und 20 US-Dollar Output je 1 Million Tokens |
| Cached Input | 95 Prozent Rabatt auf den Inputpreis |
| Allgemeiner Zugang | Noch nicht bestätigt; breiterer Rollout ohne Termin angekündigt |
In der am 1. Oktober 2026 geprüften Model-Card-Übersicht war Argon noch nicht aufgeführt. Das ist ein Befund zum damaligen Katalog, kein Beweis dafür, dass Google an anderer Stelle keinerlei Sicherheits- oder Evaluationsinformationen veröffentlicht hat. Eine separate Methodikseite und ausführliche Launchinformationen existieren bereits.
Wie stark sind Googles eigene Benchmark-Ergebnisse?
Googles Tabelle zeigt echte Stärken, besonders bei DeepSWE, AutomationBench und LVBench. Sie enthält zugleich klare Gegenbeispiele gegen die These einer universellen Führung: Bei FrontierSWE v2 und Terminal-Bench 4.0 liegt Argon hinter mehreren Konkurrenten.
| Benchmark | Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 | Einordnung |
|---|---|---|---|---|---|
| DeepSWE v1.1 | 77,9 % | 74,1 % | 67,4 % | 74,2 % | Argon von Google mit mini-swe Harness berechnet; Rivalenwerte aus Leaderboard beziehungsweise System Cards |
| FrontierSWE v2 | 55,0 % | 65,5 % | 56,3 % | 62,3 % | Betreiberwerte; Argon führt nicht |
| Terminal-Bench 4.0 | 57,4 % | 58,2 % | 57,9 % | 66,4 % | Argon von Google berechnet, Rivalen aus dem öffentlichen Leaderboard |
| AutomationBench | 51,3 % | 41,4 % | 31,4 % | 42,5 % | Privates Zapier-Set; nicht mit AutomationBench-AA gleichsetzen |
| LVBench | 91,7 % | 87,5 % | 79,7 % | 83,7 % | Alle Werte von Google berechnet, aber mit unterschiedlichen Bildbudgets |
Die Prozentwerte stehen in einer gemeinsamen Präsentation, stammen jedoch nicht aus einem vollständig einheitlichen Messlauf. Googles Methodikdokument unterscheidet selbst berechnete Resultate von Betreiberwerten und Herstellerangaben. Für Argon lief DeepSWE beispielsweise im mini-swe Harness, Terminal-Bench wurde ebenfalls von Google berechnet. FrontierSWE stammt dagegen vom Proximal-Leaderboard.
Google dokumentiert grundsätzlich pass@1, sofern nicht anders angegeben, und normalerweise die höchste verfügbare Thinking-Stufe. In Single-attempt-Settings gibt es laut Methodik weder Majority Voting noch paralleles Test-Time-Compute. Bei kleineren Benchmarks mittelt Google mehrere Trials, um die Varianz zu reduzieren. Die höchste Reasoning-Stufe ist für sich kein Manipulationssignal, solange sie auch bei den Vergleichsmodellen als leistungsstärkste veröffentlichte Konfiguration angesetzt wird. Die jeweils höchste beziehungsweise beste veröffentlichte Reasoning-Konfiguration bedeutet allerdings weder gleiches Compute noch gleiche Token-, Zeit- oder Kostenbudgets.
Was zeigen unabhängige Evaluationen?
Artificial Analysis: Spitzengruppe statt Gesamtsieg
Gemini 4 Argon erreicht mit hohem Reasoning 53 Punkte im Artificial Analysis Intelligence Index. GPT-6 Astra kommt in der maximalen Konfiguration ebenfalls auf 53 Punkte. Die Vergleichsseiten weisen für Claude Opus 5.5 maximal mit Default Fallback 58 Punkte und für Claude Sonnet 5.5 maximal mit Default Fallback 56 Punkte aus.
Die Claude-Werte beschreiben die veröffentlichten Konfigurationen mit Adaptive Reasoning, Max Effort und Default Fallback, nicht garantiert modellreine Läufe. Ein Vergleich mit Argon high beziehungsweise Astra max ist damit kein Gleichbedingungenvergleich bei identischem Compute.
| Artificial-Analysis-Messung | Argon high | Vergleich | Aussage |
|---|---|---|---|
| Intelligence Index | 53 Punkte | Astra max: 53 | Argon gehört zur Spitzengruppe, führt aber nicht allein |
| AutomationBench-AA | 78 % | Sonnet 5.5 max mit Default Fallback: 71 % | Starkes Agentensignal, aber anderer Test als Googles AutomationBench |
| Terminal-Bench 4 | 57 % | Astra max: 59 %, Opus 5.5 max mit Default Fallback: 60 %, Sonnet 5.5 max mit Default Fallback: 64 % | Keine Coding-Führung |
| AA-Omniscience | 15 % Halluzinationsrate, 50 % Accuracy, Index 42 | Astra max: 51 %, 63 %, 43 | Weniger falsches Raten, aber auch weniger richtige Antworten |
Der Intelligence Index ist keine Prozentquote richtiger Antworten. Laut Methodik von Artificial Analysis handelt es sich um eine gewichtete, überwiegend englischsprachige textbasierte Suite. Daraus folgt keine belegte Universalqualität für Deutsch, multimodale Produktionsabläufe oder deutsches Recht.
Auch die beiden AutomationBench-Werte sind nicht als Entwicklung von 51,3 auf 78 Prozent lesbar. Google verwendet das private Set des Zapier-Leaderboards, während Artificial Analysis eine eigene AutomationBench-AA-Umsetzung bewertet. Harness und Grading unterscheiden sich.
Vals Index: knappe Führung mit anderem Fokus
Im Vals Index v2.1 erreicht Argon im Live-Snapshot vom 1. Oktober 2026 68,90 Prozent mit einem ausgewiesenen Standardfehler von 0,97 Prozentpunkten. Claude Sonnet 5.5 folgt mit 67,04 Prozent und 0,92 Prozentpunkten Standardfehler, Claude Opus 5.5 mit 66,97 Prozent und 0,89 Prozentpunkten. Ein Standardfehler ist kein 95-Prozent-Konfidenzintervall. Diese Momentaufnahme zeigt die veröffentlichte Indexrangfolge, belegt aber keinen robusten Allround-Sieg.
| Systemwert im Vals Index v2.1 | Accuracy ± Standardfehler (Prozentpunkte) | Cost/Test | Wichtige Grenze |
|---|---|---|---|
| Gemini 4 Argon | 68,90 % ± 0,97 | 15,68 US-Dollar | Reasoning high, Preisbasis 4/20 US-Dollar |
| Claude Sonnet 5.5 | 67,04 % ± 0,92 | 21,34 US-Dollar | Enthält bei einigen Komponenten Fallbacks nach Provider-Ablehnung |
| Claude Opus 5.5 | 66,97 % ± 0,89 | 32,14 US-Dollar | Ebenfalls Servicewert mit möglichen Fallbacks |
Vals gewichtet Aufgaben aus Finanzen, Coding, Recht und Steuern nach ihrem Anteil am US-Bruttoinlandsprodukt. Der Index misst damit modellgestützte Aufgaben in einer US-GDP-gewichteten Benchmark-Suite, nicht direkt die Produktivität einer Firma und nicht die Struktur der deutschen oder europäischen Wirtschaft.
Bei Sonnet, Opus und Fable dokumentiert Vals zudem modellfremde Fallbacks nach Provider-Ablehnungen. Werden diese Fälle als Fehler gezählt, sinken die Werte auf 65,85, 65,05 und 64,59 Prozent. Das unterstreicht ein grundsätzliches Problem: Gemessen wird häufig das bereitgestellte System aus Modell, Providerregeln und Fallbacks, nicht nur ein isoliertes Modellgewicht.
CWE-bench: Der Harness verändert das Ergebnis
CWE-bench v1 prüft defensive Sicherheitsarbeit an 120 privaten Held-out-Aufgaben mit vier Rollouts pro Task, hohem Reasoning und einer Stunde je Rollout. Die vier Versuche dienen zur Schätzung von pass@1; der Wert ist nicht mit pass@4 gleichzusetzen, also dem Erfolg mit bis zu vier Versuchen pro Aufgabe. Die private Auswahl reduziert das Kontaminationsrisiko, schließt gezieltes Training oder Memorisation aber nicht logisch aus.
| Modell / Harness | Programmatic pass@1 | Judge panel pass@1 | Durchschnittskosten pro Rollout |
|---|---|---|---|
| Gemini 4 Argon / Antigravity | 68 % | 62 % | 6,63 US-Dollar |
| GPT-6 Astra / Codex | 68 % | 66 % | 2,85 US-Dollar |
| Grok 4.7 / opencode | 68 % | 64 % | 2,75 US-Dollar |
| Claude Opus 5.5 / Claude Code | 67 % | 67 % | 0,79 US-Dollar |
Der programmatic Grader prüft unter anderem, ob ein Exploit blockiert wird und bestehende Tests weiterhin funktionieren. Das Judge Panel lässt drei Modellrichter den Patch anhand einer Checkliste bewerten. Argon teilt nur beim programmatic pass@1 die Führung; im Judge Panel liegt es zurück.
Das ist kein Beleg für Reward Hacking. Es zeigt lediglich, dass verschiedene Bewertungswege zu verschiedenen Rangfolgen führen. Zusätzlich unterscheiden sich die Agenten-Systeme: Antigravity, Codex, opencode und Claude Code liefern unterschiedliche Werkzeuge, Prompts und Laufzeitlogik. Warum der Agenten-Harness den Modellwert überlagern kann, ist deshalb für Beschaffungsentscheidungen wichtiger als ein einzelner Spitzenwert.
Ist das Benchmark-Maxxing?
Mit Benchmark-Maxxing meine ich hier nicht Betrug oder nachgewiesene Datenkontamination, sondern die gezielte Optimierung einer möglichst guten Benchmarkdarstellung durch Testauswahl, Konfiguration, Budgets und Auswahlregeln. Bei Argon sind Unterschiede in diesen Versuchsaufbauten dokumentiert. Sie beeinflussen die Vergleichbarkeit, belegen aber für sich weder eine solche Optimierungsabsicht noch benchmarkgezieltes Training oder Täuschung.
| Methodischer Faktor | Dokumentierter Aufbau | Konsequenz |
|---|---|---|
| OSWorld 2.0 | Offline-Teilmenge, Partial Score; bester Wert aus drei Runs mit je einem Versuch | Bestwert-Auswahl statt Mittelwert; nicht direkt mit einem durchschnittlichen Einzellauf oder dem kombinierten Online-/Offline-Score anderer Modelle gleichzusetzen |
| Terminal-Bench Science 0.1 | Sechsfaches Verifier-Timeout | Verhindert Verifikationsabbrüche; belegt kein sechsfaches Denkbudget |
| LVBench | Gemini: 1 FPS; Astra: 800 Frames; Fable: 300; Opus: 600, laut Google wegen API-Limits | Relevanter Servicevergleich, aber keine isolierte Modellmessung bei identischem Input |
| Thinking-Stufe | Jeweils leistungsstärkste verfügbare Reasoning-Konfiguration | Hohe Leistung, aber potenziell höhere Kosten und Latenz |
| Benchmark-Herkunft | Selbst berechnete Werte neben Leaderboard- und Anbieterwerten | Gemeinsame Tabelle ist keine identische Neuvermessung aller Modelle |
Besonders wichtig ist die Unterscheidung zwischen Verifier-Timeout und Modellbudget. Das sechsfache Timeout betrifft die Ergebnisprüfung. Daraus folgt weder, dass Argon sechsmal länger denken durfte, noch dass Konkurrenten im konkreten Lauf an Timeouts scheiterten.
Die Gegenposition ist ebenfalls stark: Vals, Artificial Analysis und CWE-bench liefern externe Messungen, die Argons Fortschritt grundsätzlich bestätigen. Private Held-out-Sets bei CWE-bench und Zapier erschweren eine direkte Optimierung auf öffentlich sichtbare Aufgaben. Der richtige Schluss lautet daher nicht „nur Benchmark-Maxxing“, sondern „gute Fähigkeiten mit stark konfigurationsabhängiger Rangfolge“. Wie begrenzt Benchmarks auf andere Aufgaben übertragbar sind, zeigt auch mein Artikel zum ARC-AGI-3-Benchmark.
Halluziniert Argon wirklich weniger?
Auf AA-Omniscience weist Artificial Analysis für Argon eine benchmarkdefinierte Halluzinationsrate von 15 Prozent, eine Accuracy von 50 Prozent und einen Gesamtindex von 42 aus. GPT-6 Astra max kommt dort auf 51 Prozent Halluzinationsrate, 63 Prozent Accuracy und einen Index von 43.
Die Paper-Definition von AA-Omniscience berechnet die Halluzinationsrate als falsche Antworten geteilt durch die Summe aus teilweise richtigen, falschen und nicht beantworteten Fällen. Vollständig richtige Antworten stehen nicht in diesem Nenner. Die 15 Prozent sind deshalb weder der Falschantwortanteil an sämtlichen Fragen noch der Falschantwortanteil an allen abgegebenen Antworten.
Das Muster ist interessant: Argon scheint bei Unsicherheit häufiger keine Antwort zu geben, statt falsch zu raten. Eine niedrige Halluzinationsrate geht hier aber nicht mit der höchsten Zahl korrekter Antworten einher. Die Aussage „85 Prozent verlässlich“ wäre falsch, weil sie Abstention, Accuracy und den spezifischen Benchmark-Nenner ignoriert.
Artificial Analysis formuliert den Rekord außerdem enger: Argon hat die niedrigste Halluzinationsrate unter Modellen mit mindestens 45 Punkten im Intelligence Index, nicht unter sämtlichen getesteten Modellen. Für reale Wissensarbeit musst du deshalb neben Falschantworten auch unbeantwortete Aufgaben, Quellenqualität und Korrekturrunden messen.
Warum der Einführungspreis die Kosten verzerrt
Der Tokenpreis wirkt zum Start aggressiv: 2 US-Dollar pro Million Input-Tokens und 10 US-Dollar pro Million Output-Tokens. Nach der Einführungsphase nennt Google in der Fußnote seiner Launchankündigung 4 beziehungsweise 20 US-Dollar. Ein Enddatum nennt die Launchquelle nicht.
Artificial Analysis berechnet für Argon high beim Einführungspreis 1,99 US-Dollar je gewichteter Intelligence-Index-Aufgabe. Beim regulären Tarif wären es rechnerisch 3,98 US-Dollar. GPT-6 Astra max liegt im selben Vergleich bei 3,26 US-Dollar.
Die Effizienz kommt nicht aus einem kleineren Tokenverbrauch. Argon erzeugte bei Artificial Analysis im Mittel rund 62.000 Output-Tokens pro gewichteter Aufgabe, Astra rund 27.000. Die Output-Tokens schließen hier Reasoning-Tokens ein und sind nicht nur die sichtbare finale Antwort. Argons Kostenvorteil ist damit vor allem ein Preiseffekt. Aus der Tokenmenge allein lässt sich keine konkrete Latenz ableiten; auf den geprüften AA-Vergleichsseiten waren für Argon zum Stichtag keine Speed- und Latenzwerte ausgewiesen.
Der Vals-Wert von 15,68 US-Dollar Cost/Test widerspricht den 1,99 US-Dollar nicht. Vals verwendet eine andere Suite, eine andere Kostenmetrik und die reguläre Preisbasis von 4/20 US-Dollar. Bei CWE-bench kostete ein Argon-Rollout im Mittel 6,63 US-Dollar. Dort wurde Cached Input mit 0,20 US-Dollar pro Million Tokens kalkuliert, während 95 Prozent Rabatt auf den Einführungspreis rechnerisch 0,10 US-Dollar ergeben. Die Kosten bleiben innerhalb des jeweiligen Messlaufs aussagekräftig, dürfen aber ohne Abgleich von Suite, Konfiguration und Preisannahmen nicht zu einer allgemeinen, anbieterübergreifenden Kostenrangliste zusammengezogen werden.
Für Unternehmen zählt deshalb nicht der Preis pro Million Tokens, sondern der Preis pro erfolgreich erledigter Aufgabe. Dazu gehören Wiederholungen, Toolaufrufe, Fehlversuche, menschliche Prüfung, Latenz und Ablehnungen.
Welche Einschränkungen bleiben?
Noch kein allgemein reproduzierbarer Produkttest
Der öffentliche Zugang war am Stichtag eingeschränkt. Ich habe keinen eigenen Workflow mit Argon getestet und erfinde deshalb weder eine API-Modell-ID noch einen Quickstart. Herstellerberichte über interne Code-Migrationen, Speicheroptimierungen und gefundene Schwachstellen sind interessante Praxissignale, aber keine unabhängigen Replikationen.
Das gilt auch für Wiz: Google berichtet, Argon habe in Healthcare-Software eine kritische Schwachstelle gefunden, und nennt Wiz als frühen Nutzer. Google hat die Übernahme von Wiz am 11. März 2026 abgeschlossen. Der berichtete Einsatz ist deshalb keine unabhängige Zweitbestätigung.
Eine Million Output-Tokens sind nicht automatisch produktiv
Vals weist für seine Evaluation 262.144 maximale Output-Tokens und Reasoning Effort high aus. Das widerlegt Googles angekündigtes Limit von einer Million Tokens nicht. Es beschreibt die Vals-Konfiguration.
Sehr lange Ausgaben können nützlich sein, erhöhen aber Kosten, Prüfaufwand und Fehlerrisiko. Entscheidend ist nicht, ob ein Modell eine Million Tokens erzeugen kann, sondern ob es eine Aufgabe mit minimalem Ressourcenverbrauch korrekt abschließt.
Sicherheitsmaßnahmen sind keine Sicherheitsgarantie
Google dokumentiert Monitoring, Red Teaming, Schutz gegen indirekte Prompt Injections und gehärtete Sandboxen. Die Formulierung „ohne Cyber-Guardrails“ gilt laut Launchankündigung für vertrauenswürdige Cyberverteidiger und interne Teams, nicht für alle Nutzer und nicht für den Verzicht auf sämtliche Schutzmechanismen.
Deutsche Unternehmen brauchen eigene Nachweise
Überwiegend englische Evals und eine US-GDP-Gewichtung belegen keine Qualität für deutsche Fachsprache, deutsches Recht oder DACH-Geschäftsprozesse. Vor einem Einsatz musst du beim konkreten Produktzugang Aufbewahrung, Training mit Kundendaten, Datenregion, Unterauftragsverarbeiter und Löschkonzept prüfen. Die Fairwind-FAQ nennt ausdrücklich Zero Data Retention für Gemini 4 Argon, wenn es direkt als Managed Model auf Gemini Enterprise genutzt wird. Das ist keine pauschale Zusage für jeden Argon-Zugang: Die zugehörige Cloud-Dokumentation verlangt konkrete Einstellungen und gegebenenfalls Ausnahmen vom Abuse-Monitoring; für bestimmte Advanced-AI-Features kann Zero Data Retention nicht möglich sein. CodeMender speichert während laufender Scans dagegen Sessionzustand einschließlich Codeausschnitten und Diffs bis zu sieben Tage. Ein Argon-spezifischer Nachweis für EU-Hosting oder DSGVO-Konformität ergibt sich daraus nicht.
Wie solltest du Argon selbst evaluieren?
Ein sinnvoller interner Test braucht keine große öffentliche Rangliste. Er braucht Aufgaben, die deine tatsächliche Arbeit abbilden.
- Wähle repräsentative Aufgaben aus Coding, Recherche oder Agenten-Workflows, einschließlich schwieriger Fehlerfälle.
- Nutze für alle Modelle denselben Harness, dieselben Tools, dieselben Systemprompts und dieselben Zeitlimits.
- Setze ein realistisches Kosten- und Tokenbudget, statt automatisch die maximale Thinking-Stufe freizugeben.
- Kombiniere automatische Tests mit manueller Bewertung durch Fachleute. Bei Code gehören Regressionstests und Sicherheitsprüfungen dazu.
- Miss Erfolgsquote, Gesamtkosten pro Erfolg, Latenz, Ablehnungen, Korrekturschleifen und menschlichen Prüfaufwand getrennt.
- Wiederhole Aufgaben mehrfach und dokumentiere Varianz. Ein bester Lauf ist kein belastbarer Produktionswert.
Erst dieser Test beantwortet, ob Argon dein bestehendes Modell ersetzt. Öffentliche Benchmarks helfen bei der Shortlist, nicht bei der finalen Beschaffung.
FAQ: Häufig gestellte Fragen zu Gemini 4 Argon
Ist Gemini 4 Argon bereits allgemein verfügbar?
Nein. Google rollte das Modell zum 30. September 2026 zunächst an ausgewählte Cyberverteidiger aus. Der breitere Start für zahlende API-Kunden und Google AI Ultra ist angekündigt, aber ohne bestätigten Termin.
Ist Gemini 4 Argon das beste Coding-Modell?
Nein. In Googles veröffentlichtem Vergleich führt Argon bei DeepSWE v1.1 mit 77,9 Prozent, liegt aber bei FrontierSWE v2 und Terminal-Bench 4.0 hinter mehreren Konkurrenten. Das Ergebnis hängt deutlich vom Harness und vom Aufgabentyp ab.
Was bedeutet der 68-Prozent-Wert bei CWE-bench?
Argon erreicht 68 Prozent programmatic pass@1 auf 120 privaten Cybersecurity-Aufgaben und teilt sich dort die Führung. Der Wert wird aus vier Rollouts pro Aufgabe geschätzt und ist kein pass@4. Der separate Judge-panel pass@1 beträgt 62 Prozent; außerdem wurde Argon im Antigravity-Harness getestet. Der Abstand zwischen den Gradern belegt für sich kein Reward Hacking.
Beweisen die Methodikunterschiede Benchmark-Maxxing?
Nein. Die Quellen dokumentieren unterschiedliche Messprotokolle, etwa den besten Wert aus drei OSWorld-Runs und ungleiche LVBench-Bildbudgets. Daraus folgt eingeschränkte Vergleichbarkeit, aber kein Nachweis für gezielte Benchmarkoptimierung, Betrug oder Datenkontamination. Unabhängige Evals bestätigen zugleich relevante Fähigkeiten.
Halluziniert Argon nur in 15 Prozent der Fälle?
Nein, nicht bezogen auf alle Fälle. Die 15 Prozent gelten nur nach der Definition von AA-Omniscience: falsche Antworten geteilt durch teilweise richtige, falsche und nicht beantwortete Fälle. Vollständig richtige Antworten sind nicht im Nenner. Daneben erreicht Argon laut Artificial Analysis 50 Prozent Accuracy über alle Fragen. Die niedrige Halluzinationsrate beschreibt den Umgang mit nicht vollständig korrekt beantworteten Fragen, keine allgemeine Zuverlässigkeitsquote.
Wie teuer ist Gemini 4 Argon?
Google kündigt 2/10 US-Dollar je Million Input-/Output-Tokens als Einführungspreis an. Regulär nennt Google in derselben Launchankündigung 4/20 US-Dollar; das Ende des Rabatts war zum Stichtag nicht bestätigt.
Kann Argon wirklich eine Million Output-Tokens erzeugen?
Google kündigt bis zu eine Million Output-Tokens an. Artificial Analysis testete dafür Long Decode Continuation über Folgeaufrufe. Vals evaluierte dagegen mit einem Limit von 262.144 Output-Tokens.
Sollten deutsche Unternehmen Argon sofort einsetzen?
Nein, nicht allein auf Basis der Launchbenchmarks. Argon gehört auf die Shortlist, sobald ein passender Zugang verfügbar ist. Vor dem Produktionseinsatz sind eigene deutschsprachige Tests sowie eine Prüfung von Datenregion, Retention, Training und Vertragsbedingungen notwendig.


Fazit
Gemini 4 Argon zeigt einen glaubwürdigen Frontier-Sprung bei Wissensarbeit, agentischen Aufgaben und dem Umgang mit Unsicherheit, aber keine universelle Modell- oder Coding-Führung. Die unabhängigen Ergebnisse rechtfertigen einen Platz auf der Shortlist; ein pauschaler Austausch bestehender Produktionsmodelle wäre wegen des eingeschränkten Zugangs, der Harness-Effekte und der noch nicht im eigenen Workflow belegten Wirtschaftlichkeit verfrüht. Für die Einordnung helfen außerdem meine Analysen dazu, warum der Agenten-Harness das Modell überlagern kann, und wie Benchmarkmethodik die Aussagekraft begrenzt.
Quellen
Primärquellen und Herstellerangaben
- Google: Introducing Gemini 4 Argon, 30. September 2026
- Google DeepMind: Gemini 4 Argon Model Evaluation
- Google DeepMind: Gemini-Modellübersicht und Ergebnistabelle
- Google DeepMind: Model-Card-Übersicht, geprüft am 1. Oktober 2026
- Google DeepMind: Fairwind Program und Zero Data Retention
- Google Cloud: Gemini Enterprise Agent Platform und Zero Data Retention
- Google: Abschluss der Wiz-Übernahme, 11. März 2026
Unabhängige Evaluationen und Methodik
- Artificial Analysis: Gemini 4 Argon Launchanalyse
- Artificial Analysis: Methodik des Intelligence Index
- Artificial Analysis: Allgemeine Methodik
- Artificial Analysis: Argon im Vergleich mit GPT-6 Astra
- Artificial Analysis: Argon im Vergleich mit Claude Opus 5.5
- Artificial Analysis: Argon im Vergleich mit Claude Sonnet 5.5
- Vals AI: Gemini 4 Argon Modellseite
- Vals AI: Vals Index v2.1
- CWE-bench v1: Leaderboard und Methodik
- AA-Omniscience: Evaluating Cross-Domain Knowledge Reliability in Large Language Models