- 開始
- 2025年9月29日確度 90%出典:出典
Claude Sonnet 4.5がリリース
原文から自動翻訳されています
元のタイトル: Claude Sonnet 4.5 Released
- Anthropicはこれを「世界最高のコーディングモデル。複雑なエージェントを構築するための最も強力なモデル。コンピュータ操作において最高のモデル」と呼んだ。[1][4]
- Claude APIおよびClaudeアプリでclaude-sonnet-4-5として「本日よりどこでも利用可能」となった。マイク・クリーガーは、これがデフォルトモデルとなり「基本的にすべての用途」で推奨されると述べた。[1][5]
- Claude CodeのチェックポイントとネイティブのVS Code拡張機能、APIのコンテキスト編集機能とメモリツール、Claudeアプリでのコード実行とファイル作成機能、そしてClaude Codeを支える基盤であるClaude Agent SDKと共に提供された。[1][4]
- 「これは、当社がこれまでにリリースした中で最もアライメントの取れたフロンティアモデルです」とされ、おもねりや欺瞞の頻度が低く、AIセーフティレベル3(ASL-3)保護の下でリリースされた。[1][3][4]
- Claude Opus 4.1から2か月足らずで登場し、この時点でAnthropicの企業価値は1830億ドルとされていた。[4][5]
注目の機能
- 価格はSonnet 4と同じ、入力100万トークンあたり3ドル、出力100万トークンあたり15ドル。コンテキストウィンドウは200Kトークン、最大出力トークンは64,000、知識のカットオフは信頼できる情報として2025年1月まで。[1][2]
- SWE-bench Verifiedで77.2%(テスト時計算なし、10回の試行の平均)、並列テスト時計算を使うと82.0%。[1]
- OSWorldのコンピュータ操作で61.4%を記録して首位に立ち、4か月前にはSonnet 4が42.2%で首位だった。[1]
- Anthropicは、複雑な複数ステップのタスクにおいて30時間以上集中を維持したと観測している。CNBCは、Opus 4は7時間だったと指摘している。[1][5]
- 金融、法律、医療、STEM分野の専門家は、その専門知識と推論能力がOpus 4.1を含む旧モデルを大きく上回ると評価した。[1]
ベンチマーク[1]
| ベンチマーク | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| エージェント型コーディング (SWE-bench Verified) | 77.2% / 82.0% with parallel test-time compute | 74.5% / 79.4% with parallel test-time compute | 72.7% / 80.2% with parallel test-time compute | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| エージェント型ターミナルコーディング (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| エージェント型ツール利用 (τ2-bench)、小売 | 86.2% | 86.8% | 83.8% | 81.1% | — |
| エージェント型ツール利用 (τ2-bench)、航空 | 70.0% | 63.0% | 63.0% | 62.6% | — |
| エージェント型ツール利用 (τ2-bench)、通信 | 98.0% | 71.5% | 49.6% | 96.7% | — |
| コンピュータ操作 (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| 高校数学コンテスト (AIME 2025) | 100% (python) / 87.0% (ツールなし) | 78.0% | 70.5% | 99.6% (python) / 94.6% (ツールなし) | 88.0% |
| 大学院レベルの推論 (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| 多言語問答 (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| 視覚的推論 (MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| 財務分析 (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
参考資料 5確度 89%総合信頼度: 89%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 5 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· 投稿 2026年9月28日· 開始 2025年9月29日 ✓· スコアの 29%
この投稿には日付が「Sep 29, 2025」と記載され、「Claude[2] Sonnet 4.5は本日よりどこでも利用可能です」とある。ドキュメントのモデルページには「Released September 29, 2025」と記載され、TechCrunch[4]は「月曜日に」リリースされたと報じている。
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· 追加 2026年9月28日· スコアの 29%
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· 追加 2026年9月28日· スコアの 29%
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· 公開 2025年9月29日· 開始 2025年9月29日· スコアの 7%
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· 公開 2025年9月29日· 開始 2025年9月29日· スコアの 7%
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。