- 开始
- 2026年5月19日可信度 95%来自deepmind.google
Gemini 3.5 Flash 发布
由原文自动翻译
原标题: Gemini 3.5 Flash Released
谷歌在2026年I/O大会上发布Gemini 3.5 Flash,称其是迄今最强的编程和自主智能体模型,在几乎所有基准上都超过Gemini 3.1 Pro。
- 谷歌于2026年5月19日在I/O大会上发布Gemini 3.5 Flash,称其是迄今最强的编程和自主智能体模型[1]
- 科赖·卡武克乔卢表示,它“在几乎所有基准上都超过了我们最新的前沿模型3.1 Pro”,速度比其他前沿模型快4倍,优化版在质量相同的情况下快12倍[1]
- 它与Google Antigravity共同开发;在演示中,多个智能体被派生出来,从零开始构建了一个完整的操作系统;谷歌同日还发布了独立桌面应用Antigravity 2.0[1]
- 谷歌称,即将推出的3.5 Pro将担任“编排者”,由Flash担任子智能体,并表示3.5强化了网络安全和化学、生物、放射、核(CBRN)防护[1]
主要特性
- Terminal-bench 2.1得分76.2%(3 Flash为58.0%),SWE-Bench Pro得分55.1%,用于计算机操作的OSWorld-Verified得分78.4%[3]
- MCP Atlas得分83.6%,知识工作基准GDPval-AA为1656 Elo,CharXiv Reasoning得分84.2%,ARC-AGI-2得分72.1%[3]
- 可自主运行数小时,在需要决策时暂停并请求用户输入[1]
基准测试[3]
| 基准测试 | Gemini 3.5 Flash | Gemini 3 Flash | Gemini 3.1 Pro | Claude Sonnet 4.6 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|---|---|---|
| Terminal-bench 2.1(智能体终端编程,Terminus-2框架) | 76.2% | 58.0% | 70.3% | — | 66.1% | 78.2% |
| SWE-Bench Pro (Public)(多样化智能体编程任务,单次尝试) | 55.1% | 49.6% | 54.2% | — | 64.3% | 58.6% |
| MCP Atlas(使用MCP的多步骤工作流) | 83.6% | 62.0% | 78.2% | 69.5% | 79.1% | 75.3% |
| Toolathlon(真实世界通用工具使用) | 56.5% | 49.4% | — | — | — | 55.6% |
| OSWorld-Verified(智能体计算机操作) | 78.4% | 65.1% | 76.2% | 72.5% | 78.0% | 78.7% |
| Finance Agent v2(财务分析与决策) | 57.9% | 42.6% | 43.0% | 51.0% | 51.5% | 51.8% |
| GDPval-AA(具有经济价值的知识工作,Elo) | 1656 | 1204 | 1314 | 1676 | 1753 | 1769 |
| CharXiv Reasoning(复杂图表的信息综合,不使用工具) | 84.2% | 80.3% | 83.3% | 72.4% | 82.1% | 84.1% |
| MMMU-Pro(多模态理解与推理,不使用工具) | 83.6% | 81.2% | 80.5% | 74.5% | 75.2% | 81.2% |
| Blueprint-Bench 2(智能体空间推理,归一化得分) | 33.6% | 0.0% | 26.5% | 6.7% | 24.5% | 36.2% |
| MRCR v2 (8-needle)(长上下文表现,128k(平均)) | 77.3% | 67.2% | 84.9% | 84.9% | 59.3% | 94.8% |
| MRCR v2 (8-needle)(长上下文表现,1M(逐点)) | 26.6% | 22.1% | 26.3% | — | — | — |
| Humanity’s Last Exam(学术推理,完整集,文本+多模态) | 40.2% | 33.7% | 44.4% | 33.2% | 46.9% | 41.4% |
| ARC-AGI-2(抽象推理谜题) | 72.1% | 33.6% | 77.1% | 58.3% | 75.8% | 84.6% |
参考资料 3可信度 85%总体可信度: 85%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 3 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%techcrunch.com/2026/05/19/with-gemini-3-5-flash-google-bets-its-next-ai-wave-on-agents-not-chatbotstechcrunch.com· 发布于 2026年9月30日· 开始 2026年5月19日· 占评分 39%
TechCrunch报道称,谷歌于2026年5月19日星期二在年度I/O开发者大会上发布Gemini 3.5 Flash;谷歌DeepMind[3]同日发布了3.5 Flash的模型卡。
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· 添加于 2026年9月30日· 占评分 39%
The Wikipedia article lists Gemini 3.5 Flash as released on 19 May 2026, based on Gemini 3 Flash.
- [3]95%Gemini 3.5 Flash - Model Carddeepmind.google· 发表于 2026年5月19日· 开始 2026年5月19日 ✓· 占评分 23%
DeepMind's model card, published 19 May 2026, gives the benchmark results against Gemini 3 Flash, 3.1 Pro, Claude Sonnet 4.6, Claude Opus 4.7 and GPT-5.5.
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。