- Beginn
- 19. Feb. 202690 % SICHERHEITlaut der Quelle
Gemini 3.1 Pro veröffentlicht
Automatisch aus dem Original übersetzt
Originaltitel: Gemini 3.1 Pro Released
- Google veröffentlichte Gemini 3.1 Pro am 19. Februar 2026 als Vorschau, drei Monate nach Gemini 3 Pro, und beschrieb es als die verbesserte Kernintelligenz hinter jüngsten Durchbrüchen in Wissenschaft und Forschung[1]
- Es sei „eine klügere, leistungsfähigere Grundlage für die Lösung komplexer Probleme“, mit verifizierten 77.1% bei ARC-AGI-2, das völlig neue Logikmuster testet[1]
- Google beließ es in der Vorschau, um die Neuerungen zu validieren und agentische Workflows zu verbessern, bevor es „bald“ allgemein verfügbar wird[1]
Wichtige Merkmale
- In der Gemini-App mit höheren Limits für die Tarife Google AI Pro und Ultra verfügbar, in NotebookLM nur für Pro- und Ultra-Nutzer[1]
- Entwickler und Unternehmen erhalten es als Vorschau über die Gemini API in AI Studio, Antigravity und Vertex AI sowie in Gemini Enterprise[1]
- In Googles Demo programmiert es einen interaktiven 3D-Starenschwarm, der sich per Handtracking steuern lässt und eine generative Musikspur abspielt[1]
Benchmarks[3]
| Benchmark | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam (Akademisches Reasoning (Gesamtset, Text + MM), ohne Werkzeuge) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam (Akademisches Reasoning (Gesamtset, Text + MM), Suche (Blocklist) + Code) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2 (Abstrakte Denkrätsel, von ARC Prize verifiziert) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond (Naturwissenschaftliches Wissen, ohne Werkzeuge) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0 (Agentisches Programmieren im Terminal, Terminus-2-Harness) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0 (Agentisches Programmieren im Terminal, bester anderer selbst gemeldeter Harness) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified (Agentisches Programmieren, ein Versuch) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public) (Vielfältige agentische Programmieraufgaben, ein Versuch) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro (Wettbewerbsaufgaben von Codeforces, ICPC und IOI, Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode (Wissenschaftliche Forschungsprogrammierung) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents (Berufliche Aufgaben mit langem Horizont) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo (Expertenaufgaben) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench (Agentische Aufgaben und Werkzeugnutzung, Retail) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench (Agentische Aufgaben und Werkzeugnutzung, Telecom) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas (Mehrstufige Workflows mit MCP) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp (Agentische Suche, Suche + Python + Browser) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro (Multimodales Verstehen und Reasoning, ohne Werkzeuge) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU (Mehrsprachige Fragen und Antworten) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle) (Leistung bei langem Kontext, 128k (Durchschnitt)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle) (Leistung bei langem Kontext, 1M (punktweise)) | 26.3% | 26.3% | — | — | — | — |
Belege 385 % SICHERHEITGesamtvertrauen: 85%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 3 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-problog.google· Gepostet am 30. Sept. 2026· Beginn 19. Feb. 2026 ✓· 41 % der Wertung
Googles Beitrag „Gemini 3.1 Pro: A smarter model for your most complex tasks“ datiert vom 19. Februar 2026 und erklärt, es werde an diesem Tag für Entwickler, Unternehmen und Verbraucher ausgerollt.
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· Hinzugefügt am 30. Sept. 2026· 41 % der Wertung
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
- [3]95%Gemini 3.1 Pro - Model Carddeepmind.google· Veröffentlicht am 19. Feb. 2026· 17 % der Wertung
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.