- 开始
- 2026年9月30日可信度 90%来自来源
Gemini 4 Argon 发布
由原文自动翻译
原标题: Gemini 4 Argon Announced
谷歌宣布推出面向真实世界编程、企业知识工作和网络防御的新一代前沿模型Gemini 4 Argon,首先通过Fairwind计划向受信任的网络防御人员开放,之后再广泛发布,定价为每百万输入token 2美元、每百万输出token 10美元。
- 谷歌于2026年9月30日宣布推出Gemini 4 Argon,称其为“新一代前沿模型”,面向真实世界的软件工程、法律和金融等企业知识工作,以及网络安全防御[1]
- 该模型首先通过Fairwind计划向一批受信任的网络防御人员开放;谷歌正参与美国政府的自愿性发布前模型访问流程,并逐步扩大开放范围[1]
- 谷歌将“尽快”向开发者、企业和消费者开放,首先面向付费API客户和Google AI Ultra订阅用户,因此广泛发布仍待确定[1]
- 它已在谷歌内部驱动各类工作流:智能体在各数据中心释放了超过300 TiB内存,比量子子程序基线高出40%,并协助为Fuchsia操作系统的Zircon内核迁移了多达80万行以上的C/C++代码到Rust[1]
- 在网络防御演示中,它发现了全球医院使用的医疗软件中一个此前的前沿模型未能发现的严重漏洞[1]
主要特性
- 输出上限从6.4万扩大到100万token,使模型能在一条推理轨迹中思考数十万token[1]
- 推广价为每百万输入token 2美元、每百万输出token 10美元,缓存输入便宜95%;此后为每百万4美元和20美元[1]
- 在DeepSWE v1.1上以77.9%刷新最佳成绩(GPT-6 Astra为74.1%,Claude Opus 5.5为74.2%),并在AutomationBench(51.3%)和Vals Index(68.9%)上排名第一[1][2]
- LVBench长视频理解91.7%,Vals Finance Agent v2为65.4%,Harvey法律智能体基准为19.6%[1][2]
- CWE-bench v1漏洞修复得分68.0%,并列第一;谷歌向受信任的防御人员和自家团队提供不带网络安全护栏的版本[1][2]
- 安全防护:拒绝有害请求,同时保留合理的两用科学内容;在Gray Swan间接提示注入基准上得分最高;具备思维链和行动监控,可中止越界执行;并采用加固的沙箱[1][2]
基准测试[2]
| 基准测试 | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index(知识工作) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench(知识工作,得分) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2(知识工作) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark(知识工作) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1(智能体编程) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2(智能体编程) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench(智能体编程) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0(智能体编程) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench(机器学习工程) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1(科学与数学) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2(科学与数学) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench(科学与数学) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks(长上下文,最高128k,BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks(长上下文,256k至1M,BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam(计算机操作,通过率) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0(计算机操作,离线子集部分得分) | 69.2% | 72.6% | — | — |
| Chartography(多模态理解) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench(多模态理解) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1(网络安全) | 68.0% | 68.0% | 58.0% | 67.0% |
参考资料 2可信度 87%总体可信度: 87%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 2 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· 发布于 2026年9月30日· 开始 2026年9月30日 ✓· 占评分 50%
谷歌文章《Gemini 4 Argon: our next era of frontier intelligence》日期为2026年9月30日,并称“今天,我们宣布推出新一代前沿模型Gemini 4 Argon,它正向一批受信任的网络防御人员推出”;面向开发者、企业和消费者的广泛开放将“尽快”跟进(参见预估pin 4810)。
- [2]85%Gemini - Google DeepMinddeepmind.google· 添加于 2026年9月30日· 开始 2026年9月30日· 占评分 50%
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。