- Mula
- 20 Jun 202492% KEYAKINANdaripada techcrunch.com
Claude 3.5 Sonnet Dilancarkan
Diterjemah secara automatik daripada asal
Tajuk asal: Claude 3.5 Sonnet Released
- "Today, we're launching Claude 3.5 Sonnet—our first release in the forthcoming Claude 3.5 model family" (Hari ini, kami melancarkan Claude 3.5 Sonnet - keluaran pertama kami dalam keluarga model Claude 3.5 yang akan datang), yang mengatasi Claude 3 Opus "with the speed and cost of our mid-tier model, Claude 3 Sonnet" (dengan kelajuan dan kos model peringkat pertengahan kami, Claude 3 Sonnet)[1][4]
- Percuma di Claude.ai dan aplikasi iOS Claude, dengan had kadar lebih tinggi untuk pelanggan Pro dan Team, serta tersedia pada hari yang sama di API Anthropic, Amazon Bedrock dan Vertex AI milik Google Cloud[1][5]
- Ia dilancarkan bersama Artifacts, sebuah tetingkap di sebelah perbualan tempat kod, dokumen dan reka bentuk laman web muncul supaya pengguna boleh melihat, menyunting dan membina di atasnya secara masa nyata[1][3]
- Ia kekal pada ASL-2; Anthropic menyerahkannya kepada Institut Keselamatan AI UK untuk ujian pra-penggunaan, yang berkongsi keputusannya dengan Institut Keselamatan AI AS[1]
- Anthropic berkata ia akan melengkapkan keluarga ini dengan Claude 3.5 Haiku dan Claude 3.5 Opus kemudian pada 2024[1]
Ciri-ciri menonjol
- Berharga $3 setiap juta token input dan $15 setiap juta token output, dengan tetingkap konteks 200K token; AWS menyifatkannya 80 peratus lebih murah daripada Claude 3 Opus[1][5]
- Berjalan pada dua kali ganda kelajuan Claude 3 Opus[1][4]
- Kad model Anthropic: 59.4% pada GPQA Diamond, 88.7% pada MMLU, 92.0% pada HumanEval dan 71.1% pada MATH, berbanding 50.4%, 86.8%, 84.9% dan 60.1% bagi Claude 3 Opus[2]
- Ia menyelesaikan 64% masalah dalam penilaian pengekodan agentik dalaman - membaiki pepijat atau menambah ciri pada pangkalan kod sumber terbuka - berbanding 38% bagi Claude 3 Opus[1][2]
- Model penglihatan Anthropic yang terkuat setakat ini: lebih baik membaca carta dan graf serta menyalin teks daripada imej yang tidak sempurna, dengan skor 68.3% pada MMMU[1][2]
Penanda aras[1]
| Penanda aras | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| Penaakulan peringkat pascasiswazah (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| Pengetahuan peringkat sarjana muda (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| Pengetahuan peringkat sarjana muda (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| Kod (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| Matematik pelbagai bahasa (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| Penaakulan merentas teks (DROP, F1 score) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (variable shots) | 83.5 (3-shot, pre-trained model) |
| Penilaian campuran (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, pre-trained model) |
| Penyelesaian masalah matematik (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| Matematik sekolah rendah (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet mencatat 67.2% pada GPQA 5-shot CoT dengan maj@32. ** Claude 3.5 Sonnet mencatat 90.4% pada MMLU dengan gesaan 5-shot CoT.
Rujukan 585% KEYAKINANKeyakinan keseluruhan: 85%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 5 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Disiarkan 28 Sep 2026· Bermula 20 Jun 2024· 32% daripada skor
Anthropic[2]: "Today, we're launching Claude 3.5 Sonnet" dan ia "is now available for free on Claude.ai"; pengepala halaman kini menunjukkan Jun 21, 2024, tetapi TechCrunch[4] dan AWS kedua-duanya menyiarkan pelancaran itu pada 20 Jun 2024 dan ID modelnya ialah claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Ditambah 28 Sep 2026· 32% daripada skor
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Ditambah 28 Sep 2026· 32% daripada skor
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Diterbitkan 20 Jun 2024· Bermula 20 Jun 2024 ✓· 1% daripada skor
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Diterbitkan 20 Jun 2024· Bermula 20 Jun 2024· 1% daripada skor
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.