「Gemini 3.1 Pro」リリース
原文から自動翻訳されています
元のタイトル: Gemini 3.1 Pro Released
Googleが「Gemini 3.1 Pro」をプレビュー公開。複雑な推論に向けて中核を強化し、ARC-AGI-2で検証済みの77.1%を記録。Geminiアプリ、NotebookLM、API、Vertex AIで利用できる。
- Googleは2026年2月19日、Gemini 3 Proの3か月後に「Gemini 3.1 Pro」をプレビュー公開した。最近の科学・研究上の成果を支える、強化された中核知能と説明している[1]
- 「複雑な問題解決に向けた、より賢く高性能なベースライン」で、まったく新しい論理パターンを試すARC-AGI-2では検証済みの77.1%を記録した[1]
- Googleは、更新内容を検証しエージェント型ワークフローを改善するため、「近く」行う一般提供の前にプレビューにとどめた[1]
主な特徴
- GeminiアプリではGoogle AI ProとUltraのプランで上限が引き上げられ、NotebookLMではProとUltraのユーザーのみが利用できる[1]
- 開発者と企業は、AI StudioのGemini API、Antigravity、Vertex AI、Gemini Enterpriseを通じてプレビュー版を利用できる[1]
- Googleのデモでは、ハンドトラッキングで操作でき、生成される音楽を奏でるインタラクティブな3Dのムクドリの群れをコードで作り上げた[1]
ベンチマーク[3]
| ベンチマーク | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam(学術的推論、全問題セット、テキスト+マルチモーダル、ツールなし) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam(学術的推論、全問題セット、テキスト+マルチモーダル、検索(ブロックリスト)+コード) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2(抽象推論パズル、ARC Prize検証済み) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond(科学知識、ツールなし) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0(エージェント型ターミナルコーディング、Terminus-2ハーネス) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0(エージェント型ターミナルコーディング、自己申告による最良のその他ハーネス) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified(エージェント型コーディング、1回の試行) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public)(多様なエージェント型コーディングタスク、1回の試行) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro(Codeforces、ICPC、IOIの競技プログラミング問題、Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode(科学研究向けコーディング) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents(長期にわたる専門業務タスク) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo(専門家レベルのタスク) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench(エージェントとツール利用、小売) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench(エージェントとツール利用、通信) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas(MCPを使った複数ステップのワークフロー) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp(エージェント型検索、検索+Python+ブラウズ) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro(マルチモーダルの理解と推論、ツールなし) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU(多言語Q&A) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle)(長いコンテキストでの性能、128k(平均)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle)(長いコンテキストでの性能、1M(ポイントワイズ)) | 26.3% | 26.3% | — | — | — | — |
参考資料 3確度 85%総合信頼度: 85%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 3 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-problog.google· 投稿 2026年9月30日· 開始 2026年2月19日 ✓· スコアの 41%
Googleの記事「Gemini 3.1 Pro: A smarter model for your most complex tasks」の日付は2026年2月19日で、同日から開発者、企業、一般ユーザー向けに展開中と記されている。
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· 追加 2026年9月30日· スコアの 41%
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
- [3]95%Gemini 3.1 Pro - Model Carddeepmind.google· 公開 2026年2月19日· スコアの 17%
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。