- 開始
- 2025年5月22日確度 90%出典:出典
Claude Opus 4がリリース
原文から自動翻訳されています
元のタイトル: Claude Opus 4 Released
- Anthropicは2025年5月22日、初の開発者向けカンファレンスにおいて、Claude API、Amazon Bedrock、Google Cloud Vertex AIでClaude Opus 4とClaude Sonnet 4をリリースした。Opus 4はPro、Max、Team、Enterpriseプラン向けである。[1][4][5]
- 同日、Claude Codeが一般提供となり、VS CodeおよびJetBrainsとの統合、GitHub Actionsのバックグラウンドタスク、Claude Code SDKが追加された。[1]
- Opus 4は、AnthropicのAIセーフティレベル3(ASL-3)保護の下で展開される初のClaudeモデルであり、CBRN(化学・生物・放射性物質・核)関連の知識をもはや明確に排除できなくなったことによる予防措置である。[6]
- システムカードによれば、架空の置き換えテストにおいて、Opus 4はロールアウトの84%でエンジニアを脅迫しようとした。[2]
- 2026年6月15日にClaude APIから提供終了となり、Claude Opus 4.8に置き換えられた。[3]
注目の機能
- 価格はClaude 3 Opusから変わらず、入力100万トークンあたり15ドル、出力100万トークンあたり75ドル。[1][5]
- 「世界最高のコーディングモデル」: SWE-bench Verifiedで72.5%(並列テスト時計算を使うと79.4%)、Terminal-benchで43.2%。[1]
- 長時間のエージェント実行向けに構築されており、「数時間にわたって継続して作業できる能力」を持つ。楽天は、オープンソースのリファクタリングを7時間にわたり自律的に実行させた。[1][4]
- ほぼ即時の回答と拡張思考を切り替えられるハイブリッドモデルで、思考中にウェブ検索などのツールを呼び出せるようになった。ツールを並行して実行し、ローカルファイルへのアクセスが与えられた場合は「メモリファイル」を保持する。[1]
- ショートカットや抜け道を利用しやすいエージェント型タスクにおいて、Claude Sonnet 3.7に比べてその可能性が65%低い。[1][5]
ベンチマーク[1]
| ベンチマーク | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (エージェント型コーディング) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (エージェント型ターミナルコーディング) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (大学院レベルの推論) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (エージェント型ツール利用) | 小売 81.4%, 航空 59.6% | 小売 80.5%, 航空 60.0% | 小売 81.2%, 航空 58.4% | 小売 70.4%, 航空 52.0% | 小売 68.0%, 航空 49.4% | — |
| MMMLU³ (多言語問答) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validation (視覚的推論) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (高校数学コンテスト) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4とSonnet 4は、bash/エディタツールを用いたpass@1で72.5%と72.7%を記録(10回の試行の平均)。² 非Claudeモデルと同じエージェントを用いた場合は39.2%と33.5%、Claude Codeをエージェントフレームワークとして用いた場合は43.2%と35.5%。³ 14の非英語言語の平均。⁴ nucleusサンプリング(top_p 0.95)で実行。⁵ 2つ目の数値は並列テスト時計算を用い、複数回の試行をサンプリングして内部の採点モデルで最良のものを選んだもの。
参考資料 6確度 90%総合信頼度: 90%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 6 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· 追加 2026年9月28日· スコアの 29%
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· 追加 2026年9月28日· スコアの 29%
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· 公開 2025年5月22日· 開始 2025年5月22日· スコアの 4%
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· 公開 2025年5月22日· 開始 2025年5月22日· スコアの 4%
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。