- 开始
- 2026年8月13日可信度 95%来自deepmind.google
Gemini 3.7 Flash 发布
由原文自动翻译
原标题: Gemini 3.7 Flash Released
谷歌在3.6 Flash发布三周后推出Gemini 3.7 Flash,价格减半:截至2026年底,每百万输入token 0.75美元、每百万输出token 3.75美元,DeepSWE得分从49.0%升至65.3%。
- 谷歌于2026年8月13日发布Gemini 3.7 Flash,距3.6 Flash仅三周,称其是“开发者反馈和算法创新的直接成果”[1]
- 它在调试和问题解决方面较3.6 Flash有“显著提升”,DeepSWE v1.1从49.0%升至65.3%,FrontierCode 1.1 Main从34.4%升至43.6%[1]
- 在Gemini应用中,它率先面向AI Pro和Ultra订阅用户在Spark中推出[1]
主要特性
- 截至2026年底的推广价为每百万输入token 0.75美元、每百万输出token 3.75美元,是3.6 Flash发布时价格的一半[1][2]
- WebDev Arena Elo为1588(3.6 Flash为1538);GDP.pdf文档理解34.0%对22.0%;AutomationBench 30.4%对17.0%[1]
- Terminal-bench 2.1得分85.8%,OSWorld-2.0得分47.9%,Artificial Analysis智能指数为56[2]
- 更新了针对化学、生物、放射、核滥用和网络攻击的防护措施[1]
基准测试[2]
| 基准测试 | Gemini 3.7 Flash | Gemini 3.6 Flash | Claude Sonnet 5 | GPT-5.6 Terra | Muse Spark 1.2 |
|---|---|---|---|---|---|
| 输入价格(美元/百万token) | $0.75* | $0.75* | $2.00 | $2.00 | $1.25 |
| 输出价格(美元/百万token) | $3.75* | $3.75* | $10.00 | $12.00 | $4.25 |
| Artificial Analysis Intelligence Index(综合模型智能) | 56 | 52 | 55 | 57 | 57 |
| FrontierCode 1.1 Main(生产级代码质量,得分) | 43.6% | 34.4% | 42.7% | 41.3% | — |
| DeepSWE v1.1(长周期软件工程) | 65.3% | 48.6% | 53.8% | 69.6% | 54.9% |
| Code Arena(网页开发,Elo) | 1588 | 1538 | 1541 | 1523 | 1535 |
| Terminal-bench 2.1(智能体终端编程) | 85.8% | 78.0% | 80.4% | 87.4% | 82.9% |
| Terminal-bench 3.0(通用智能体能力) | 14.9% | 5.4% | 14.6% | 20.8% | — |
| AutomationBench(企业工作流自动化,私有测试集) | 30.4% | 17.0% | 10.7% | 23.6% | — |
| GDPVal-AA v2(知识工作,Elo) | 1525 | 1422 | 1598 | 1578 | 1628 |
| Harvey LAB-AA(复杂法律工作流) | 90.7% | 85.1% | 90.1% | 85.2% | — |
| GDP.pdf(专家级PDF文档理解) | 34.0% | 22.0% | 28.0% | 24.7% | 16.0% |
| CharXiv Reasoning(复杂图表的信息综合,不使用工具) | 84.5% | 85.2% | 77.0% | 85.9% | — |
| CharXiv Reasoning(复杂图表的信息综合,使用工具) | 88.7% | 89.4% | 88.3% | — | — |
| LVBench(长视频理解) | 85.4% | 84.2% | 68.5% | 78.9% | — |
| GDM-MRCR v2 (8-needle)(长上下文表现,128k(平均)) | 97.0% | 91.8% | 81.5% | 93.5% | — |
| OSWorld-2.0(智能体计算机操作) | 47.9% | 33.8% | — | 50.2% | — |
| Agent's Last Exam(多模态桌面和操作系统智能体任务,通过率) | 26.3% | 24.2% | 33.3% | 28.0% | — |
| HLE-Verified(多学科专家推理) | 53.6% | 51.2% | 31.0% | 51.1% | — |
| BioMysteryBench(生物信息学研究推理,人类可解) | 87.1% | 80.6% | 87.5% | 83.8% | — |
| BioMysteryBench(生物信息学研究推理,人类难解) | 43.5% | 41.2% | 34.1% | 49.4% | — |
| LABBench2(生物学真实科研任务) | 82.1% | 76.1% | 80.1% | 81.2% | — |
参考资料 2可信度 92%总体可信度: 92%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 2 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%9to5google.com/2026/08/13/gemini-3-7-flash-launch9to5google.com· 发布于 2026年9月30日· 开始 2026年8月13日· 占评分 55%
9to5Google的发布报道日期为2026年8月13日,称谷歌“今天宣布了Gemini 3.7 Flash”;DeepMind[2]的模型卡于2026年8月13日发布。
- [2]95%Gemini 3.7 Flash - Model Carddeepmind.google· 发表于 2026年8月13日· 开始 2026年8月13日 ✓· 占评分 45%
DeepMind's model card, published 13 August 2026, lists the introductory prices and a benchmark table against 3.6 Flash, Claude Sonnet 5, GPT-5.6 Terra and Muse Spark 1.2.
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。