Claude Opus 4.1がリリース
原文から自動翻訳されています
元のタイトル: Claude Opus 4.1 Released
- Anthropicは2025年8月5日、有料Claudeユーザー向けおよびClaude Code、そして同社のAPI、Amazon Bedrock、Google Cloud Vertex AIでClaude Opus 4.1をリリースした。価格はOpus 4と同じである。[1][2]
- これは、OpenAIが2019年以来初のオープンウェイト推論モデルをリリースしたのと同じ日であった。Anthropicは「今後数週間でモデルにさらに大幅な改善を加える予定」だと述べた。[1][6]
- 同日、GitHubはEnterpriseおよびPro+プラン向けのパブリックプレビューとしてこれをCopilotに導入した。[5]
- Opus 4と同様、ASL-3安全基準の下で展開されている。[3]
- 2026年8月5日、発売からちょうど1年後にClaude APIから提供終了となり、Claude Opus 4.8に置き換えられた。[4]
注目の機能
- Claude Opus 4の「エージェント型タスク、実務レベルのコーディング、推論」に関するアップグレードであり、より優れた詳細な調査とデータ分析、「特に詳細の追跡とエージェント型検索において」優れている。[1]
- SWE-bench Verifiedで74.5%(Opus 4の72.5%に対して)、Terminal-Benchで43.3%(39.2%に対して)。[1][6]
- Anthropicの表にあるその他のスコア: GPQA Diamondで80.9%、TAU-bench小売部門で82.4%、MMMLUで89.5%、AIME 2025で78.0%。[1]
- 顧客からの報告: GitHubは複数ファイルにわたるリファクタリングで顕著な向上を確認し、楽天は大規模なコードベースで「不要な変更を加えることなく」的確な修正を行えるとし、Windsurfは標準偏差1つ分の向上をOpus 4に対して確認した。[1]
- 価格はOpus 4と同様、入力100万トークンあたり15ドル、出力100万トークンあたり75ドル。API IDはclaude-opus-4-1-20250805。[1][6]
ベンチマーク[1]
| ベンチマーク | Claude Opus 4.1 | Claude Opus 4 | Claude Sonnet 4 | OpenAI o3 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified¹ (エージェント型コーディング) | 74.5% | 72.5% | 72.7% | 69.1% | 67.2% |
| Terminal-Bench² (エージェント型ターミナルコーディング) | 43.3% | 39.2% | 35.5% | 30.2% | 25.3% |
| GPQA Diamond (大学院レベルの推論) | 80.9% | 79.6% | 75.4% | 83.3% | 86.4% |
| TAU-bench (エージェント型ツール利用) | 小売 82.4%, 航空 56.0% | 小売 81.4%, 航空 59.6% | 小売 80.5%, 航空 60.0% | 小売 70.4%, 航空 52.0% | — |
| MMMLU³ (多言語問答) | 89.5% | 88.8% | 86.5% | 88.8% | — |
| MMMU, validation (視覚的推論) | 77.1% | 76.5% | 74.4% | 82.9% | 82% |
| AIME 2025⁴ (高校数学コンテスト) | 78.0% | 75.5% | 70.5% | 88.9% | 88% |
¹ Opus 4.1、Opus 4、Sonnet 4は、bash/エディタツールを用いたpass@1(単発パッチ、テスト時計算なし)で実行し、10回の試行の平均。² デフォルトのエージェントフレームワーク(Terminus 1)を用い、5回の試行の平均。³ Claudeのスコアは14の非英語言語の平均。⁴ nucleusサンプリング(top_p 0.95)で実行。
参考資料 6確度 89%総合信頼度: 89%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 6 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%anthropic.com/news/claude-opus-4-1anthropic.com· 投稿 2026年9月28日· 開始 2025年8月5日 ✓· スコアの 23%
Anthropic[3]の投稿には日付が「Aug 5, 2025」と記載され、「本日、Claude[2][4] Opus 4.1をリリースします……有料Claudeユーザーおよび Claude Codeで現在利用可能です。当社のAPI、Amazon Bedrock、Google Cloud Vertex AIでも利用できます」とある。Claudeのリリースノートおよび GitHub[5]のチェンジログも同じ日付を記載している。
- [2]90%Claude Platform release notes - Claude Platform Docsplatform.claude.com· 追加 2026年9月28日· スコアの 23%
"August 5, 2025 We've launched Claude[4] Opus 4.1, an incremental update to Claude Opus 4", which does not allow both temperature and top_p to be set; later entries record structured outputs launching for Opus 4.1 (14 November 2025) and its retirement.
- [3]90%System Card Addendum: Claude Opus 4.1anthropic.com· 追加 2026年9月28日· スコアの 23%
Anthropic's[1] system card addendum: "Like Claude[2][4] Opus 4, Claude Opus 4.1 is deployed under the AI Safety Level 3 (ASL-3) Standard"; it is not "notably more capable" than Opus 4 under the RSP, so new evaluations were voluntary.
- [4]90%Model deprecations - Claude Platform Docsplatform.claude.com· 追加 2026年9月28日· スコアの 23%
Anthropic[1][3] notified developers on 5 June 2026 that Claude[2] Opus 4.1 (claude-opus-4-1-20250805) would be retired; it was retired on 5 August 2026, one year after release, with claude-opus-4-8 as the replacement.
- [5]85%Anthropic Claude Opus 4.1 is now in public preview in GitHub Copilotgithub.blog· 公開 2025年8月5日· 開始 2025年8月5日· スコアの 5%
GitHub's changelog, "Release August 5, 2025": Claude[2][4] Opus 4.1, "the successor to Claude Opus 4", is available in GitHub Copilot Chat for Copilot Enterprise and Pro+ plans on github.com, Visual Studio Code and GitHub Mobile.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。