- Mulai
- 20 Jun 2024KEYAKINAN 92%dari techcrunch.com
Claude 3.5 Sonnet Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude 3.5 Sonnet Released
- “Hari ini, kami meluncurkan Claude 3.5 Sonnet—rilis pertama kami dalam keluarga model Claude 3.5 yang akan datang”, yang mengungguli Claude 3 Opus “dengan kecepatan dan biaya model tingkat menengah kami, Claude 3 Sonnet”[1][4]
- Gratis di Claude.ai dan aplikasi iOS Claude, dengan batas laju lebih tinggi bagi pelanggan Pro dan Team, dan tersedia pada hari yang sama di Anthropic API, Amazon Bedrock, dan Vertex AI milik Google Cloud[1][5]
- Model ini diluncurkan bersama Artifacts, jendela di samping percakapan tempat kode, dokumen, dan desain situs web muncul agar pengguna dapat melihat, menyunting, dan mengembangkannya secara waktu nyata[1][3]
- Model ini tetap pada ASL-2; Anthropic memberikannya kepada UK AI Safety Institute untuk pengujian pra-penerapan, yang membagikan hasilnya kepada US AI Safety Institute[1]
- Anthropic menyatakan akan melengkapi keluarga ini dengan Claude 3.5 Haiku dan Claude 3.5 Opus di kemudian hari pada 2024[1]
Fitur unggulan
- Berharga $3 per juta token masukan dan $15 per juta token keluaran, dengan jendela konteks 200K token; AWS menyebutnya 80 persen lebih murah daripada Claude 3 Opus[1][5]
- Berjalan dengan kecepatan dua kali Claude 3 Opus[1][4]
- Kartu model Anthropic: 59.4% pada GPQA Diamond, 88.7% pada MMLU, 92.0% pada HumanEval, dan 71.1% pada MATH, dibandingkan 50.4%, 86.8%, 84.9%, dan 60.1% milik Claude 3 Opus[2]
- Model ini menyelesaikan 64% masalah dalam evaluasi pemrograman agen internal - memperbaiki bug atau menambah fitur pada basis kode open-source - dibandingkan 38% untuk Claude 3 Opus[1][2]
- Model visual terkuat Anthropic sejauh ini: lebih baik membaca bagan dan grafik serta menyalin teks dari gambar yang tidak sempurna, dengan skor 68.3% pada MMMU[1][2]
Tolok ukur[1]
| Tolok ukur | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| Penalaran tingkat pascasarjana (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| Pengetahuan tingkat sarjana (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| Pengetahuan tingkat sarjana (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| Kode (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| Matematika multibahasa (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| Penalaran atas teks (DROP, skor F1) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (shot bervariasi) | 83.5 (3-shot, model pralatih) |
| Evaluasi campuran (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, model pralatih) |
| Pemecahan soal matematika (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| Matematika sekolah dasar (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet mendapat skor 67.2% pada GPQA 5-shot CoT dengan maj@32. ** Claude 3.5 Sonnet mendapat skor 90.4% pada MMLU dengan prompting 5-shot CoT.
Referensi 5KEYAKINAN 85%Keyakinan keseluruhan: 85%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 5 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Diposting 28 Sep 2026· Mulai 20 Jun 2024· 32% dari skor
Anthropic[2]: “Hari ini, kami meluncurkan Claude 3.5 Sonnet” dan model ini “kini tersedia gratis di Claude.ai”; header halaman kini menunjukkan 21 Jun 2024, tetapi TechCrunch[4] dan AWS sama-sama menerbitkan peluncurannya pada 20 Juni 2024 dan ID modelnya adalah claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Ditambahkan 28 Sep 2026· 32% dari skor
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Ditambahkan 28 Sep 2026· 32% dari skor
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Diterbitkan 20 Jun 2024· Mulai 20 Jun 2024 ✓· 1% dari skor
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Diterbitkan 20 Jun 2024· Mulai 20 Jun 2024· 1% dari skor
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.