- 開始
- 2025年2月24日確度 90%出典:出典
Claude 3.7 Sonnetがリリース
原文から自動翻訳されています
元のタイトル: Claude 3.7 Sonnet Released
- Anthropicは、Claude 3.7 Sonnetを「これまでで最も知能が高く、市場初のハイブリッド推論モデル」と呼んだ。1つのモデルでほぼ即時の回答と、「ユーザーに可視化された、拡張された段階的思考」を切り替えられる。[1][4]
- Free、Pro、Team、Enterpriseの全Claudeプラン、およびClaude Developer Platform、Amazon Bedrock、Google Cloud Vertex AIに展開された。拡張思考は無料プランを除く全ての環境で利用できる。[1][4]
- Anthropic初のエージェント型コーディングツールであるClaude Codeが、ターミナルから動作する限定的なリサーチプレビューとして同時に発表され、GitHub統合が全Claudeプランに追加された。[1]
- 前世代モデルに比べ不要な拒否を45%削減し、ASL-2基準の下でリリースされた。[1][2]
- バージョン番号は3.5から3.7へと飛び、2025年2月にはClaude 3.7 SonnetがTwitchでポケモン赤のライブプレイを開始した。[3][4]
注目の機能
- 両モード共通で入力100万トークンあたり3ドル、出力100万トークンあたり15ドル(思考用トークンを含む)。[1][4]
- APIユーザーは、出力上限128Kトークンまでの任意の思考予算を設定でき、速度とコストを品質と引き換えにできる。[1]
- Anthropicの図表によれば、SWE-bench Verifiedで62.3%(カスタムスキャフォールドを使うと70.3%)と、アップグレード版3.5 Sonnetの49.0%に対する数値。TAU-benchでは小売81.2%、航空58.4%。[1]
- Anthropicによれば、数学やコーディングコンテストへの最適化は控えめにし、実務のビジネスタスクへの最適化に重点を置いたという。[1]
- 標準モードではアップグレード版Claude 3.5 Sonnetとして動作し、拡張思考モードでは回答前に検討を行い、これが数学、物理、指示追従、コーディングに役立つ。[1]
ベンチマーク[1]
| ベンチマーク | Claude 3.7 Sonnet (64K extended thinking) | Claude 3.7 Sonnet (no extended thinking) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K extended thinking) | Grok 3 Beta (extended thinking) |
|---|---|---|---|---|---|---|---|
| 大学院レベルの推論 (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| エージェント型コーディング (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| エージェント型ツール利用 (TAU-bench)、小売 | — | 81.2% | 71.5% | 73.5% | — | — | — |
| エージェント型ツール利用 (TAU-bench)、航空 | — | 58.4% | 48.8% | 54.2% | — | — | — |
| 多言語問答 (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| 視覚的推論 (MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| 指示追従 (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| 数学の問題解決 (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| 高校数学コンテスト (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
pass@1は複数回の試行の平均(AIMEとSWE-bench Verifiedは最大16回)。2つ目の数値は並列テスト時計算による向上を反映している。¹ o1のTAU-bench結果はOpenAIによって報告された後に削除されており、TAU-benchの結果は比較できない可能性がある。² 62.3%はbash/エディタツールと「思考ツール」を用いた500問におけるpass@1であり、70.3%は内部の採点と、縮小したサブセットにおけるカスタムスキャフォールドを用いたもの。DeepSeek R1はAgentlessフレームワークを使用。³ Claude 3.7 Sonnetの高いGPQAおよびAIME 2024のスコアは、並列テスト時計算を用いた内部採点によるもの。o1とGrok 3のスコアは64サンプルの多数決による。
参考資料 4確度 85%総合信頼度: 85%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 4 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· 投稿 2026年9月28日· 開始 2025年2月24日 ✓· スコアの 32%
この投稿には日付が「Feb 24, 2025」と記載され、「本日、Claude 3.7 Sonnetを発表します」「現在、全Claudeプランで利用可能です」とある。TechCrunch[4]は「月曜日(2月24日)に全ユーザーおよび開発者に展開されている」と報じている。
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· 追加 2026年9月28日· スコアの 32%
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· 追加 2026年9月28日· スコアの 32%
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· 公開 2025年2月24日· 開始 2025年2月24日· スコアの 3%
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。