Originaltitel: Gemini 3.5 Flash Released
| Benchmark | Gemini 3.5 Flash | Gemini 3 Flash | Gemini 3.1 Pro | Claude Sonnet 4.6 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|---|---|---|
| Terminal-bench 2.1 (Agentisches Programmieren im Terminal, Terminus-2-Harness) | 76.2% | 58.0% | 70.3% | — | 66.1% | 78.2% |
| SWE-Bench Pro (Public) (Vielfältige agentische Programmieraufgaben, ein Versuch) | 55.1% | 49.6% | 54.2% | — | 64.3% | 58.6% |
| MCP Atlas (Mehrstufige Workflows mit MCP) | 83.6% | 62.0% | 78.2% | 69.5% | 79.1% | 75.3% |
| Toolathlon (Allgemeine Werkzeugnutzung in der Praxis) | 56.5% | 49.4% | — | — | — | 55.6% |
| OSWorld-Verified (Agentische Computernutzung) | 78.4% | 65.1% | 76.2% | 72.5% | 78.0% | 78.7% |
| Finance Agent v2 (Finanzanalyse und Entscheidungsfindung) | 57.9% | 42.6% | 43.0% | 51.0% | 51.5% | 51.8% |
| GDPval-AA (Wirtschaftlich wertvolle Wissensarbeit, Elo) | 1656 | 1204 | 1314 | 1676 | 1753 | 1769 |
| CharXiv Reasoning (Informationssynthese aus komplexen Diagrammen, ohne Werkzeuge) | 84.2% | 80.3% | 83.3% | 72.4% | 82.1% | 84.1% |
| MMMU-Pro (Multimodales Verstehen und Reasoning, ohne Werkzeuge) | 83.6% | 81.2% | 80.5% | 74.5% | 75.2% | 81.2% |
| Blueprint-Bench 2 (Agentisches räumliches Denken, normalisierter Score) | 33.6% | 0.0% | 26.5% | 6.7% | 24.5% | 36.2% |
| MRCR v2 (8-needle) (Leistung bei langem Kontext, 128k (Durchschnitt)) | 77.3% | 67.2% | 84.9% | 84.9% | 59.3% | 94.8% |
| MRCR v2 (8-needle) (Leistung bei langem Kontext, 1M (punktweise)) | 26.6% | 22.1% | 26.3% | — | — | — |
| Humanity’s Last Exam (Akademisches Reasoning (Gesamtset, Text + MM)) | 40.2% | 33.7% | 44.4% | 33.2% | 46.9% | 41.4% |
| ARC-AGI-2 (Abstrakte Denkrätsel) | 72.1% | 33.6% | 77.1% | 58.3% | 75.8% | 84.6% |
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
TechCrunch berichtet, Google habe Gemini 3.5 Flash am Dienstag, dem 19. Mai 2026, auf seiner jährlichen Entwicklerkonferenz I/O gestartet; die Modellkarte von Google DeepMind[3] für 3.5 Flash erschien am selben Tag.
The Wikipedia article lists Gemini 3.5 Flash as released on 19 May 2026, based on Gemini 3 Flash.
DeepMind's model card, published 19 May 2026, gives the benchmark results against Gemini 3 Flash, 3.1 Pro, Claude Sonnet 4.6, Claude Opus 4.7 and GPT-5.5.
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.