- 开始
- 2026年2月19日可信度 90%来自来源
Gemini 3.1 Pro 发布
由原文自动翻译
原标题: Gemini 3.1 Pro Released
谷歌发布Gemini 3.1 Pro预览版,这是面向复杂推理的升级核心模型,在ARC-AGI-2上取得经验证的77.1%,并登陆Gemini应用、NotebookLM、API和Vertex AI。
- 谷歌于2026年2月19日发布Gemini 3.1 Pro预览版,距Gemini 3 Pro三个月,称其是近期科学与研究突破背后的升级版核心智能[1]
- 它是“解决复杂问题的更聪明、更强大的基础”,在考察全新逻辑模式的ARC-AGI-2上取得经验证的77.1%[1]
- 谷歌让它保持预览状态,以验证更新并改进智能体工作流,之后将“很快”全面可用[1]
主要特性
- Gemini应用中Google AI Pro和Ultra套餐享有更高额度,NotebookLM仅向Pro和Ultra用户开放[1]
- 开发者和企业可通过AI Studio、Antigravity和Vertex AI中的Gemini API以及Gemini Enterprise使用预览版[1]
- 谷歌的演示让它编写了一个交互式3D椋鸟群飞程序,用户可通过手部追踪操控,并播放生成式配乐[1]
基准测试[3]
| 基准测试 | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam(学术推理,完整集,文本+多模态,不使用工具) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam(学术推理,完整集,文本+多模态,搜索(屏蔽名单)+代码) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2(抽象推理谜题,ARC Prize验证) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond(科学知识,不使用工具) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0(智能体终端编程,Terminus-2框架) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0(智能体终端编程,其他自报最佳框架) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified(智能体编程,单次尝试) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public)(多样化智能体编程任务,单次尝试) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro(来自Codeforces、ICPC和IOI的竞赛编程题,Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode(科研编程) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents(长周期专业任务) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo(专家任务) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench(智能体与工具使用,零售) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench(智能体与工具使用,电信) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas(使用MCP的多步骤工作流) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp(智能体搜索,搜索+Python+浏览) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro(多模态理解与推理,不使用工具) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU(多语言问答) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle)(长上下文表现,128k(平均)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle)(长上下文表现,1M(逐点)) | 26.3% | 26.3% | — | — | — | — |
参考资料 3可信度 85%总体可信度: 85%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 3 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-problog.google· 发布于 2026年9月30日· 开始 2026年2月19日 ✓· 占评分 41%
谷歌文章《Gemini 3.1 Pro: A smarter model for your most complex tasks》日期为2026年2月19日,并称当天起向开发者、企业和消费者推送。
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· 添加于 2026年9月30日· 占评分 41%
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
- [3]95%Gemini 3.1 Pro - Model Carddeepmind.google· 发表于 2026年2月19日· 占评分 17%
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。