- 開始
- 2026年5月19日確度 95%出典:deepmind.google
「Gemini 3.5 Flash」リリース
原文から自動翻訳されています
元のタイトル: Gemini 3.5 Flash Released
Googleは「Google I/O 2026」で「Gemini 3.5 Flash」を発表した。コーディングと自律型エージェントで過去最強のモデルで、ほぼすべてのベンチマークでGemini 3.1 Proを上回るとしている。
- Googleは2026年5月19日、Google I/Oで「Gemini 3.5 Flash」を発表した。コーディングと自律型エージェントで過去最強のモデルだという[1]
- コライ・カブクオグル氏は「最新のフロンティアモデルである3.1 Proを、ほぼすべてのベンチマークで上回る」と述べ、他のフロンティアモデルの4倍高速で、最適化版なら同じ品質で12倍高速だと説明した[1]
- Google Antigravityと共同開発され、デモではエージェントが生成されてオペレーティングシステムを一から構築した。Googleは同日、スタンドアロンのデスクトップアプリ「Antigravity 2.0」も公開した[1]
- Googleは、近く登場する3.5 Proが「オーケストレーター」としてFlashをサブエージェントに使うと説明し、3.5ではサイバーとCBRNに関する安全対策も強化したと述べた[1]
主な特徴
- Terminal-bench 2.1で76.2%(3 Flashは58.0%)、SWE-Bench Proで55.1%、コンピューター操作のOSWorld-Verifiedで78.4%[3]
- MCP Atlas 83.6%、ナレッジワークのGDPval-AA 1656 Elo、CharXiv Reasoning 84.2%、ARC-AGI-2 72.1%[3]
- 数時間にわたり自律的に動作でき、判断の分岐点では一時停止して入力を求める[1]
ベンチマーク[3]
| ベンチマーク | Gemini 3.5 Flash | Gemini 3 Flash | Gemini 3.1 Pro | Claude Sonnet 4.6 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|---|---|---|
| Terminal-bench 2.1(エージェント型ターミナルコーディング、Terminus-2ハーネス) | 76.2% | 58.0% | 70.3% | — | 66.1% | 78.2% |
| SWE-Bench Pro (Public)(多様なエージェント型コーディングタスク、1回の試行) | 55.1% | 49.6% | 54.2% | — | 64.3% | 58.6% |
| MCP Atlas(MCPを使った複数ステップのワークフロー) | 83.6% | 62.0% | 78.2% | 69.5% | 79.1% | 75.3% |
| Toolathlon(実世界の汎用ツール利用) | 56.5% | 49.4% | — | — | — | 55.6% |
| OSWorld-Verified(エージェント型コンピューター操作) | 78.4% | 65.1% | 76.2% | 72.5% | 78.0% | 78.7% |
| Finance Agent v2(財務分析と意思決定) | 57.9% | 42.6% | 43.0% | 51.0% | 51.5% | 51.8% |
| GDPval-AA(経済的価値のあるナレッジワーク、Elo) | 1656 | 1204 | 1314 | 1676 | 1753 | 1769 |
| CharXiv Reasoning(複雑なグラフからの情報統合、ツールなし) | 84.2% | 80.3% | 83.3% | 72.4% | 82.1% | 84.1% |
| MMMU-Pro(マルチモーダルの理解と推論、ツールなし) | 83.6% | 81.2% | 80.5% | 74.5% | 75.2% | 81.2% |
| Blueprint-Bench 2(エージェント型空間推論、正規化スコア) | 33.6% | 0.0% | 26.5% | 6.7% | 24.5% | 36.2% |
| MRCR v2 (8-needle)(長いコンテキストでの性能、128k(平均)) | 77.3% | 67.2% | 84.9% | 84.9% | 59.3% | 94.8% |
| MRCR v2 (8-needle)(長いコンテキストでの性能、1M(ポイントワイズ)) | 26.6% | 22.1% | 26.3% | — | — | — |
| Humanity’s Last Exam(学術的推論、全問題セット、テキスト+マルチモーダル) | 40.2% | 33.7% | 44.4% | 33.2% | 46.9% | 41.4% |
| ARC-AGI-2(抽象推論パズル) | 72.1% | 33.6% | 77.1% | 58.3% | 75.8% | 84.6% |
参考資料 3確度 85%総合信頼度: 85%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 3 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%techcrunch.com/2026/05/19/with-gemini-3-5-flash-google-bets-its-next-ai-wave-on-agents-not-chatbotstechcrunch.com· 投稿 2026年9月30日· 開始 2026年5月19日· スコアの 39%
TechCrunchは、Googleが2026年5月19日火曜日、年次開発者会議I/OでGemini 3.5 Flashを発表したと報じている。Google DeepMind[3]の3.5 Flashのモデルカードも同日に公開された。
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· 追加 2026年9月30日· スコアの 39%
The Wikipedia article lists Gemini 3.5 Flash as released on 19 May 2026, based on Gemini 3 Flash.
- [3]95%Gemini 3.5 Flash - Model Carddeepmind.google· 公開 2026年5月19日· 開始 2026年5月19日 ✓· スコアの 23%
DeepMind's model card, published 19 May 2026, gives the benchmark results against Gemini 3 Flash, 3.1 Pro, Claude Sonnet 4.6, Claude Opus 4.7 and GPT-5.5.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。