- 開始
- 2026年2月17日確度 90%出典:出典
Claude Sonnet 4.6がリリース
原文から自動翻訳されています
元のタイトル: Claude Sonnet 4.6 Released
- 「Claude Sonnet 4.6は、当社史上最も高性能なSonnetモデルです」とされ、コーディング、コンピュータ操作、長文コンテキストの推論、エージェントの計画、知識労働、デザインの全面にわたるアップグレードである。[1][4]
- Free・Proユーザー向けにclaude.aiとClaude Coworkのデフォルトモデルとなり、無料プランにもファイル作成、コネクタ、スキル、圧縮機能が追加された。全Claudeプラン、Claude Code、API、主要クラウドプラットフォームすべてで利用可能。[1][3][4]
- Claude Codeでは、初期テスターの約70%がSonnet 4.5より本モデルを好み、Anthropicの11月のフラッグシップであるOpus 4.5よりも59%が本モデルを好んだ。過剰な設計や「怠慢さ」が少ないと評された。[1]
- 安全性研究者は「概して温かく、誠実で、社会的に協調的、時にはユーモラスな性格」を確認し、重大な高リスクのミスアライメントの兆候は見られなかった。プロンプトインジェクションへの耐性はSonnet 4.5より大幅に高く、ASL-3の下でリリースされた。[1][5]
- CNBCは、このリリースをソフトウェア株の売り崩しと結び付け、IGVソフトウェアETFはその年で20%以上下落していたと報じた。[3]
注目の機能
- 価格はSonnet 4.5から変わらず、入力100万トークンあたり3ドル、出力100万トークンあたり15ドル。コンテキストウィンドウは100万トークン(発売時はベータ)、最大出力トークンは128,000。[1][2]
- Anthropicの表: SWE-bench Verifiedで79.6%、OSWorld-Verifiedで72.5%(Sonnet 4.5は61.4%)、Terminal-Bench 2.0で59.1%、BrowseCompで74.7%。[1]
- OSWorldのグラフでは、Sonnetの系列が2024年10月のClaude 3.5 Sonnetの14.9%からSonnet 4.6の72.5%まで推移している様子が示されている。[1]
- 適応型思考と拡張思考に加え、会話が上限に近づくと古いコンテキストを要約するコンテキスト圧縮機能をベータで搭載。[1][2]
- Databricksが企業のチャート、PDF、表の読み取りをテストするOfficeQAではOpus 4.6と同水準であり、Vending-Bench Arenaでは10か月分のシミュレーションにわたり大きく投資を続けたのち、収益化へと転換した。[1]
ベンチマーク[1]
| ベンチマーク | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (all models) |
|---|---|---|---|---|---|---|
| エージェント型ターミナルコーディング (Terminal-Bench 2.0) | 59.1% | 51.0% | 65.4% | 59.8% | 56.2% (54.2% self-reported) | 64.7% (64.0% self-reported, Codex CLI) |
| エージェント型コーディング (SWE-bench Verified) | 79.6% | 77.2% | 80.8% | 80.9% | 78.0% (Flash) | 80.0% |
| エージェント型コンピュータ操作 (OSWorld-Verified) | 72.5% | 61.4% | 72.7% | 66.3% | — | 38.2% |
| エージェント型ツール利用 (τ2-bench)、小売 | 91.7% | 86.2% | 91.9% | 88.9% | 85.3% | 82.0% |
| エージェント型ツール利用 (τ2-bench)、通信 | 97.9% | 98.0% | 99.3% | 98.2% | 98.0% | 98.7% |
| 大規模なツール利用 (MCP-Atlas) | 61.3% | 43.8% | 59.5% | 62.3% | 54.1% | 60.6% |
| エージェント型検索 (BrowseComp) | 74.7% | 43.9% | 84.0% | 67.8% | 59.2% (Deep Research) | 77.9% (Pro) |
| 複数分野にわたる推論 (Humanity's Last Exam)、ツールなし | 33.2% | 17.7% | 40.0% | 30.8% | 37.5% | 36.6% (Pro) |
| 複数分野にわたる推論 (Humanity's Last Exam)、ツールあり | 49.0% | 33.6% | 53.0% | 43.4% | 45.8% | 50.0% (Pro) |
| エージェント型財務分析 (Finance Agent v1.1) | 63.3% | 54.5% | 60.1% | 58.8% | 55.2% | 59.0% |
| オフィス業務 (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| 新規の問題解決 (ARC-AGI-2) | 58.3% | 13.6% | 68.8% | 37.6% | 31.1% | 54.2% (Pro) |
| 大学院レベルの推論 (GPQA Diamond) | 89.9% | 83.4% | 91.3% | 87.0% | 91.9% | 93.2% (Pro) |
| 視覚的推論 (MMMU-Pro)、ツールなし | 74.5% | 63.4% | 73.9% | 70.6% | 81.0% | 79.5% |
| 視覚的推論 (MMMU-Pro)、ツールあり | 75.6% | 68.9% | 77.3% | 73.9% | — | 80.4% |
| 多言語問答 (MMMLU) | 89.3% | 89.5% | 91.1% | 90.8% | 91.8% | 89.6% |
参考資料 5確度 88%総合信頼度: 88%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 5 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· 投稿 2026年9月28日· 開始 2026年2月17日 ✓· スコアの 31%
この投稿には日付が「Feb 17, 2026」と記載され、「Claude[2] Sonnet 4.6は現在、全Claudeプラン、Claude Cowork、Claude Code、当社のAPI、主要クラウドプラットフォームすべてで利用可能です」とある。ドキュメントのモデルページには「Released February 17, 2026」と記載され、CNBC[3]も同日これを報じている。
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· 追加 2026年9月28日· スコアの 31%
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· 公開 2026年2月17日· 開始 2026年2月17日· スコアの 13%
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· 公開 2026年2月17日· 開始 2026年2月17日· スコアの 13%
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· 公開 2026年2月17日· スコアの 13%
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。