- 开始
- 2025年9月29日可信度 90%来自来源
Claude Sonnet 4.5 发布
由原文自动翻译
原标题: Claude Sonnet 4.5 Released
- Anthropic 称其“是全球最佳编程模型。是构建复杂智能体的最强模型。是使用计算机能力最强的模型”[1][4]
- 作为 claude-sonnet-4-5,“今天已在各处可用”,登陆 Claude API 和 Claude 应用;Mike Krieger 表示它将成为默认模型,并推荐用于“几乎所有用例”[1][5]
- 该模型随附 Claude Code 检查点(checkpoints)和原生 VS Code 扩展、一项上下文编辑功能和 API 上的记忆工具、Claude 应用中的代码执行和文件创建功能,以及 Claude Agent SDK——即 Claude Code 背后的基础架构[1][4]
- “这是我们迄今发布过的最为对齐的前沿模型”,阿谀奉承和欺骗行为的比率更低,按照 AI 安全等级 3(ASL-3)保护措施发布[1][3][4]
- 该模型在 Claude Opus 4.1 发布不到两个月后问世,当时 Anthropic 的估值为 1830 亿美元[4][5]
值得关注的功能
- 每百万输入 token 3 美元、每百万输出 token 15 美元,与 Sonnet 4 相同;20 万 token 的上下文窗口,最多 64K 输出 token,知识截止日期为 2025 年 1 月(可靠)[1][2]
- SWE-bench Verified 得分 77.2%,以 10 次试验平均、不使用测试时计算;配合并行测试时计算可达 82.0%[1]
- 在 OSWorld 计算机操作测试中以 61.4% 的成绩领先,而四个月前 Sonnet 4 曾以 42.2% 领先[1]
- Anthropic 观察到它在复杂多步骤任务上能保持专注超过 30 个小时;CNBC 指出 Opus 4 能持续工作七个小时[1][5]
- 在金融、法律、医学和 STEM 领域,专家发现其领域知识和推理能力远超旧模型,包括 Opus 4.1[1]
基准测试[1]
| 基准测试 | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| 智能体编程(SWE-bench Verified) | 77.2% / 配合并行测试时计算达 82.0% | 74.5% / 配合并行测试时计算达 79.4% | 72.7% / 配合并行测试时计算达 80.2% | 72.8%(GPT-5)/ 74.5%(GPT-5-Codex) | 67.2% |
| 智能体终端编程(Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| 智能体工具使用(τ2-bench),零售 | 86.2% | 86.8% | 83.8% | 81.1% | — |
| 智能体工具使用(τ2-bench),航空 | 70.0% | 63.0% | 63.0% | 62.6% | — |
| 智能体工具使用(τ2-bench),电信 | 98.0% | 71.5% | 49.6% | 96.7% | — |
| 计算机操作(OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| 高中数学竞赛(AIME 2025) | 100%(python)/ 87.0%(不使用工具) | 78.0% | 70.5% | 99.6%(python)/ 94.6%(不使用工具) | 88.0% |
| 研究生水平推理(GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| 多语言问答(MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| 视觉推理(MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| 金融分析(Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
参考资料 5可信度 89%总体可信度: 89%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 5 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· 发布于 2026年9月28日· 开始 2025年9月29日 ✓· 占评分 29%
该文章标注日期为“2025 年 9 月 29 日”,并写道“Claude[2] Sonnet 4.5 今天已在各处可用”;文档中的模型页面标注“发布日期:2025 年 9 月 29 日”,TechCrunch[4] 报道该发布“于周一”进行。
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· 添加于 2026年9月28日· 占评分 29%
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· 添加于 2026年9月28日· 占评分 29%
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· 发表于 2025年9月29日· 开始 2025年9月29日· 占评分 7%
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· 发表于 2025年9月29日· 开始 2025年9月29日· 占评分 7%
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。