- 開始
- 2024年10月22日確度 90%出典:出典
アップグレード版Claude 3.5 Sonnetがリリース
原文から自動翻訳されています
元のタイトル: Claude 3.5 Sonnet Upgrade Released
- Anthropicは「アップグレード版のClaude 3.5 Sonnet」を発表し、「前世代モデルに対して全面的な改善が施されており、特にコーディングで大きな向上がある」とした。その日から全ユーザーが利用可能となり、新しいClaude 3.5 Haikuは今月後半に提供予定とされた。[1]
- コンピュータ操作機能がパブリックベータとして登場した。Claudeは画面を見て、カーソルを動かし、ボタンをクリックし、文字を入力する。Anthropicは3.5 Sonnetを「パブリックベータでコンピュータ操作を提供する初のフロンティアAIモデル」と呼びつつ、「依然として実験的であり、時に扱いにくくエラーを起こしやすい」としている。[1][4]
- カーソルを操作するため、Claudeは各スクリーンショット上で動かす必要のあるピクセル数を数える。Anthropicは、電卓やテキストエディタといった単純なソフトウェアでこの能力を学習させた。[3]
- その日から開発者はAnthropic API、Amazon Bedrock、Google Cloud Vertex AIで利用できるようになった。Asana、Canva、Cognition、DoorDash、Replit、The Browser Companyが早期利用者となり、Amazonは早期アクセスを得た。[1][5]
- 米国と英国のAIセーフティ・インスティテュートが発売前に共同でテストを行った。AnthropicはこれをASL-2のまま維持し、コンピュータ操作の検知と、危害が発生しているかどうかを判定する分類器を追加した。[1]
注目の機能
- 価格と速度は6月のClaude 3.5 Sonnetと同じ。[1]
- SWE-bench Verifiedは33.4%から49.0%に上昇し、OpenAIのo1-previewを含む公開されている全モデルを上回った。[1]
- TAU-benchのエージェント型ツール利用は、小売部門で62.6%から69.2%に、航空部門で36.0%から46.0%に上昇した。[1]
- OSWorldでは、スクリーンショットのみで14.9%を記録し、次点のシステムの7.8%を上回った。より多くのステップを許容した場合は22.0%だった。[1][2]
- スクロール、ドラッグ、ズームは依然として苦手であり、Anthropicはリスクの低いタスクから始めるよう勧めている。[1]
ベンチマーク[1]
| ベンチマーク | Claude 3.5 Sonnet (new) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| 大学院レベルの推論 (GPQA Diamond) | 65.0% (0ショットCoT) | 41.6% (0ショットCoT) | 59.4% (0ショットCoT) | 53.6% (0ショットCoT) | 40.2% (0ショットCoT) | 59.1% (0ショットCoT) | 51.0% (0ショットCoT) |
| 大学レベルの知識 (MMLU Pro) | 78.0% (0ショットCoT) | 65.0% (0ショットCoT) | 75.1% (0ショットCoT) | — | — | 75.8% (0ショットCoT) | 67.3% (0ショットCoT) |
| コード (HumanEval) | 93.7% (0ショット) | 88.1% (0ショット) | 92.0% (0ショット) | 90.2% (0ショット) | 87.2% (0ショット) | — | — |
| 数学の問題解決 (MATH) | 78.3% (0ショットCoT) | 69.2% (0ショットCoT) | 71.1% (0ショットCoT) | 76.6% (0ショットCoT) | 70.2% (0ショットCoT) | 86.5% (4ショットCoT) | 77.9% (4ショットCoT) |
| 高校数学コンテスト (AIME 2024) | 16.0% (0ショットCoT) | 5.3% (0ショットCoT) | 9.6% (0ショットCoT) | 9.3% (0ショットCoT) | — | — | — |
| 視覚的な質疑応答 (MMMU) | 70.4% (0ショットCoT) | — | 68.3% (0ショットCoT) | 69.1% (0ショットCoT) | 59.4% (0ショットCoT) | 65.9% (0ショットCoT) | 62.3% (0ショットCoT) |
| エージェント型コーディング (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| エージェント型ツール利用 (TAU-bench)、小売 | 69.2% | 51.0% | 62.6% | — | — | — | — |
| エージェント型ツール利用 (TAU-bench)、航空 | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Anthropicの評価表では、一般的なモデルとは異なり応答前に大量の計算時間を要するため、OpenAIのo1モデルファミリーは除外されている。
参考資料 5確度 90%総合信頼度: 90%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 5 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· 投稿 2026年9月28日· 開始 2024年10月22日 ✓· スコアの 46%
この投稿には日付が「Oct 22, 2024」と記載され、「アップグレード版のClaude 3.5 Sonnetは現在、全ユーザーが利用可能です。本日より、開発者はコンピュータ操作のベータ版を使って開発できます」とある。TechCrunch[4]とCNBC[5]も同じ日、「火曜日に」このリリースを報じている。
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· 追加 2026年9月28日· スコアの 46%
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· 公開 2024年10月22日· スコアの 3%
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· 公開 2024年10月22日· 開始 2024年10月22日· スコアの 3%
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· 公開 2024年10月22日· 開始 2024年10月22日· スコアの 3%
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。