- Beginn
- 30. Sept. 202690 % SICHERHEITlaut der Quelle
Gemini 4 Argon angekündigt
Automatisch aus dem Original übersetzt
Originaltitel: Gemini 4 Argon Announced
- Google kündigte Gemini 4 Argon am 30. September 2026 an und nannte es sein „neues Spitzenmodell“ für reale Softwareentwicklung, Wissensarbeit in Unternehmen wie Recht und Finanzen sowie Cybersicherheit[1]
- Es wird zunächst über das Fairwind Program an einen Kreis vertrauenswürdiger Cyberabwehrer ausgerollt, und Google beteiligt sich am freiwilligen Verfahren der US-Regierung für den Modellzugang vor der Veröffentlichung, während der Zugang schrittweise ausgeweitet wird[1]
- Google will es Entwicklern, Unternehmen und Verbrauchern „so bald wie möglich“ zur Verfügung stellen, beginnend mit zahlenden API-Kunden und Abonnenten von Google AI Ultra; die breite Veröffentlichung steht also noch aus[1]
- Intern treibt es bereits Googles Arbeitsabläufe an: Agenten gaben über 300 TiB Speicher in Rechenzentren frei, schlugen eine Quanten-Subroutine-Baseline um 40% und halfen bei der Migration von C/C++ nach Rust mit bis zu 800K+ Zeilen für den Zircon-Kernel des Betriebssystems Fuchsia[1]
- In einer Demonstration zur Cyberabwehr fand es eine kritische Schwachstelle in weltweit in Krankenhäusern eingesetzter Gesundheitssoftware, die frühere Spitzenmodelle übersehen hatten[1]
Wichtige Merkmale
- Das Ausgabelimit wurde von 64K auf 1 Million Token erweitert, sodass das Modell in einem Durchlauf über Hunderttausende Token hinweg Schlüsse ziehen kann[1]
- Einführungspreis von $2 pro Million Eingabe-Token und $10 pro Million Ausgabe-Token, wobei zwischengespeicherte Eingabe 95% günstiger ist; danach $4 und $20 pro Million[1]
- Neuer Bestwert bei DeepSWE v1.1 mit 77.9% (GPT-6 Astra 74.1%, Claude Opus 5.5 74.2%) sowie Platz eins bei AutomationBench mit 51.3% und beim Vals Index mit 68.9%[1][2]
- LVBench zum Verständnis langer Videos 91.7%, Vals Finance Agent v2 65.4% und Harveys Legal Agent Benchmark 19.6%[1][2]
- CWE-bench v1 zur Behebung von Schwachstellen 68.0%, geteilter erster Platz; Google gibt es ohne Cyber-Schutzmaßnahmen an vertrauenswürdige Verteidiger und die eigenen Teams heraus[1][2]
- Schutzmaßnahmen: Ablehnung schädlicher Anfragen bei erhaltener legitimer Dual-Use-Wissenschaft, Höchstwert im Benchmark von Gray Swan zu indirekter Prompt-Injection, Überwachung von Gedankenkette und Aktionen, die Ausführungen außerhalb der Grenzen stoppt, sowie gehärtete Sandboxes[1][2]
Benchmarks[2]
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (Wissensarbeit) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (Wissensarbeit, Score) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (Wissensarbeit) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark (Wissensarbeit) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (Agentisches Programmieren) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (Agentisches Programmieren) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (Agentisches Programmieren) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (Agentisches Programmieren) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (ML-Engineering) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (Naturwissenschaft und Mathematik) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (Naturwissenschaft und Mathematik) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (Naturwissenschaft und Mathematik) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks (Langer Kontext, bis 128k, BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (Langer Kontext, 256k bis 1M, BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam (Computernutzung, Erfolgsquote) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (Computernutzung, Offline-Teilmenge, Teilpunktzahl) | 69.2% | 72.6% | — | — |
| Chartography (Multimodales Verstehen) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (Multimodales Verstehen) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (Cybersicherheit) | 68.0% | 68.0% | 58.0% | 67.0% |
Belege 287 % SICHERHEITGesamtvertrauen: 87%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 2 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· Gepostet am 30. Sept. 2026· Beginn 30. Sept. 2026 ✓· 50 % der Wertung
Googles Beitrag „Gemini 4 Argon: our next era of frontier intelligence“ datiert vom 30. September 2026 und erklärt: „Today, we're announcing our new frontier model, Gemini 4 Argon, which is rolling out to a set of trusted cyber defenders“ (heute kündigen wir unser neues Spitzenmodell Gemini 4 Argon an, das an einen Kreis vertrauenswürdiger Cyberabwehrer ausgerollt wird); die breite Verfügbarkeit für Entwickler, Unternehmen und Verbraucher folgt „as soon as possible“ (so bald wie möglich; siehe den geschätzten Pin 4810).
- [2]85%Gemini - Google DeepMinddeepmind.google· Hinzugefügt am 30. Sept. 2026· Beginn 30. Sept. 2026· 50 % der Wertung
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.