- 开始
- 2025年2月24日可信度 90%来自来源
Claude 3.7 Sonnet 发布
由原文自动翻译
原标题: Claude 3.7 Sonnet Released
- Anthropic 称 Claude 3.7 Sonnet 是“我们迄今最智能的模型,也是市场上首款混合推理模型”:同一个模型既能给出近乎即时的回答,也能进行“对用户可见的扩展、逐步思考”[1][4]
- 该模型面向所有 Claude 套餐——免费版、Pro、Team 和 Enterprise——以及 Claude 开发者平台、Amazon Bedrock 和 Google Cloud 的 Vertex AI 推出;除免费版外,扩展思考功能在所有平台上均可使用[1][4]
- Anthropic 首款智能体编程工具 Claude Code 与其同期发布,作为一个从终端运行的有限研究预览版,GitHub 集成也扩展到所有 Claude 套餐[1]
- 相较前代模型,其不必要的拒绝率降低了 45%,并按照 ASL-2 标准发布[1][2]
- 版本号从 3.5 跳到了 3.7,2025 年 2 月,Claude 3.7 Sonnet 开始在 Twitch 上直播游玩《精灵宝可梦:红》[3][4]
值得关注的功能
- 两种模式下均为每百万输入 token 3 美元、每百万输出 token 15 美元,思考所用的 token 也计入其中[1][4]
- API 用户可设置任意大小的思考预算,最高可达 12.8 万 token 的输出上限,以速度和成本换取质量[1]
- Anthropic 的图表显示,SWE-bench Verified 得分 62.3%(配合定制脚手架可达 70.3%),而升级版 3.5 Sonnet 为 49.0%;TAU-bench 得分为零售场景 81.2%、航空场景 58.4%[1]
- Anthropic 表示,该模型减少了对数学和编程竞赛的优化,转而更多针对实际业务任务进行优化[1]
- 在标准模式下,它是升级版的 Claude 3.5 Sonnet;在扩展思考模式下,它会先思考再回答,这有助于数学、物理、指令遵循和编程任务[1]
基准测试[1]
| 基准测试 | Claude 3.7 Sonnet(64K 扩展思考) | Claude 3.7 Sonnet(无扩展思考) | Claude 3.5 Sonnet(新版) | OpenAI o1¹ | OpenAI o3-mini¹(高强度) | DeepSeek R1(32K 扩展思考) | Grok 3 Beta(扩展思考) |
|---|---|---|---|---|---|---|---|
| 研究生水平推理(GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| 智能体编程(SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| 智能体工具使用(TAU-bench),零售 | — | 81.2% | 71.5% | 73.5% | — | — | — |
| 智能体工具使用(TAU-bench),航空 | — | 58.4% | 48.8% | 54.2% | — | — | — |
| 多语言问答(MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| 视觉推理(MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| 指令遵循(IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| 数学问题求解(MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| 高中数学竞赛(AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
在若干次试验(AIME 和 SWE-bench Verified 最多 16 次)上平均得出的 pass@1;第二个数字得益于并行测试时计算。¹ o1 的 TAU-bench 成绩由 OpenAI 公布后又被删除;TAU-bench 成绩可能不具可比性。² 62.3% 是在配合 bash/编辑器工具及一项“思考工具”的情况下,针对 500 个问题得出的 pass@1;70.3% 使用内部评分和在缩减子集上的定制脚手架;DeepSeek R1 使用 Agentless 框架。³ Claude 3.7 Sonnet 较高的 GPQA 和 AIME 2024 成绩使用了内部评分与并行测试时计算;o1 和 Grok 3 的成绩则使用了 64 个样本的多数投票法。
参考资料 4可信度 85%总体可信度: 85%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 4 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· 发布于 2026年9月28日· 开始 2025年2月24日 ✓· 占评分 32%
该文章标注日期为“2025 年 2 月 24 日”:“今天,我们宣布推出 Claude 3.7 Sonnet”,并且它“现已在所有 Claude 套餐中可用”;TechCrunch[4] 称该模型“正于周一向所有用户和开发者推出”(2 月 24 日)。
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· 添加于 2026年9月28日· 占评分 32%
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· 添加于 2026年9月28日· 占评分 32%
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· 发表于 2025年2月24日· 开始 2025年2月24日· 占评分 3%
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。