- 開始
- 2024年6月20日確度 92%出典:techcrunch.com
Claude 3.5 Sonnetがリリース
原文から自動翻訳されています
元のタイトル: Claude 3.5 Sonnet Released
- 「本日、今後展開されるClaude 3.5モデルファミリーの最初のリリースであるClaude 3.5 Sonnetを発表します」とし、「当社の中間モデルであるClaude 3 Sonnetの速度とコストで」Claude 3 Opusを上回るとした。[1][4]
- Claude.aiとClaude iOSアプリで無料提供され、ProおよびTeam契約者にはより高いレート制限が適用された。同日、Anthropic API、Amazon Bedrock、Google Cloud Vertex AIでも利用可能になった。[1][5]
- Artifactsと共にリリースされた。これは会話の横に表示されるウィンドウで、コード、文書、ウェブサイトのデザインが表示され、ユーザーがそれらをリアルタイムで確認、編集、発展させられる。[1][3]
- ASL-2のままとされ、Anthropicは事前展開テストのために英国AIセーフティ・インスティテュートに提供し、その結果は米国AIセーフティ・インスティテュートと共有された。[1]
- Anthropicは、2024年後半にClaude 3.5 HaikuとClaude 3.5 Opusを追加してファミリーを完成させる予定だと述べた。[1]
注目の機能
- 価格は入力100万トークンあたり3ドル、出力100万トークンあたり15ドルで、コンテキストウィンドウは200Kトークン。AWSはClaude 3 Opusより80%安いとしている。[1][5]
- Claude 3 Opusの2倍の速度で動作する。[1][4]
- Anthropicのモデルカード: GPQA Diamondで59.4%、MMLUで88.7%、HumanEvalで92.0%、MATHで71.1%と、Claude 3 Opusの50.4%、86.8%、84.9%、60.1%を上回った。[2]
- 社内のエージェント型コーディング評価――オープンソースのコードベースへのバグ修正や機能追加――では64%の問題を解決し、Claude 3 Opusの38%を上回った。[1][2]
- これまでで最も強力なAnthropicのビジョンモデルであり、チャートやグラフの読み取り、不完全な画像からのテキスト転写に優れ、MMMUで68.3%を記録した。[1][2]
ベンチマーク[1]
| ベンチマーク | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| 大学院レベルの推論 (GPQA, Diamond) | 59.4%* (0ショットCoT) | 50.4% (0ショットCoT) | 53.6% (0ショットCoT) | — | — |
| 大学レベルの知識 (MMLU)、5ショット | 88.7%** (5ショット) | 86.8% (5ショット) | — | 85.9% (5ショット) | 86.1% (5ショット) |
| 大学レベルの知識 (MMLU)、0ショットCoT | 88.3% (0ショットCoT) | 85.7% (0ショットCoT) | 88.7% (0ショットCoT) | — | — |
| コード (HumanEval) | 92.0% (0ショット) | 84.9% (0ショット) | 90.2% (0ショット) | 84.1% (0ショット) | 84.1% (0ショット) |
| 多言語の数学 (MGSM) | 91.6% (0ショットCoT) | 90.7% (0ショットCoT) | 90.5% (0ショットCoT) | 87.5% (8ショット) | — |
| テキストに基づく推論 (DROP, F1 score) | 87.1 (3ショット) | 83.1 (3ショット) | 83.4 (3ショット) | 74.9 (variable shots) | 83.5 (3ショット, pre-trained model) |
| 複合評価 (BIG-Bench-Hard) | 93.1% (3ショットCoT) | 86.8% (3ショットCoT) | — | 89.2% (3ショットCoT) | 85.3% (3ショットCoT, pre-trained model) |
| 数学の問題解決 (MATH) | 71.1% (0ショットCoT) | 60.1% (0ショットCoT) | 76.6% (0ショットCoT) | 67.7% (4ショット) | 57.8% (4ショットCoT) |
| 小学校レベルの数学 (GSM8K) | 96.4% (0ショットCoT) | 95.0% (0ショットCoT) | — | 90.8% (11ショット) | 94.1% (8ショットCoT) |
* Claude 3.5 Sonnetは、maj@32を用いた5ショットCoTのGPQAで67.2%を記録。** Claude 3.5 Sonnetは、5ショットCoTプロンプティングを用いたMMLUで90.4%を記録。
参考資料 5確度 85%総合信頼度: 85%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 5 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· 投稿 2026年9月28日· 開始 2024年6月20日· スコアの 32%
Anthropic[2]:「本日、Claude 3.5 Sonnetを発表します」「Claude.aiで現在無料で利用できます」。ページのヘッダーは現在Jun 21, 2024と表示されているが、TechCrunch[4]とAWSはいずれも2024年6月20日にこのリリースを公表しており、モデルIDもclaude-3-5-sonnet-20240620である。
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· 追加 2026年9月28日· スコアの 32%
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· 追加 2026年9月28日· スコアの 32%
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· 公開 2024年6月20日· 開始 2024年6月20日 ✓· スコアの 1%
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· 公開 2024年6月20日· 開始 2024年6月20日· スコアの 1%
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。