- Mulai
- 24 Feb 2025KEYAKINAN 90%dari sumbernya
Claude 3.7 Sonnet Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude 3.7 Sonnet Released
- Anthropic menyebut Claude 3.7 Sonnet “model paling cerdas kami hingga saat ini dan model penalaran hibrida pertama di pasar”: satu model yang memberi jawaban nyaris instan atau “pemikiran langkah demi langkah yang diperluas dan diperlihatkan kepada pengguna”[1][4]
- Model ini dirilis ke setiap paket Claude - Free, Pro, Team, dan Enterprise - dan ke Claude Developer Platform, Amazon Bedrock, dan Vertex AI milik Google Cloud; pemikiran diperluas ada di setiap permukaan kecuali tingkat gratis[1][4]
- Claude Code, alat pemrograman agen pertama Anthropic, diluncurkan bersamanya sebagai pratinjau riset terbatas yang bekerja dari terminal, dan integrasi GitHub hadir di setiap paket Claude[1]
- Model ini memangkas penolakan yang tidak perlu sebesar 45% dibandingkan pendahulunya dan dirilis di bawah standar ASL-2[1][2]
- Versinya melompat dari 3.5 ke 3.7, dan pada Februari 2025 Claude 3.7 Sonnet mulai memainkan Pokémon Red secara langsung di Twitch[3][4]
Fitur unggulan
- $3 per juta token masukan dan $15 per juta token keluaran di kedua mode, termasuk token berpikir[1][4]
- Pengguna API menetapkan anggaran berpikir berukuran berapa pun hingga batas keluaran 128K token, menukar kecepatan dan biaya dengan kualitas[1]
- Grafik Anthropic menunjukkan 62.3% pada SWE-bench Verified (70.3% dengan scaffold khusus) dibandingkan 49.0% untuk 3.5 Sonnet yang ditingkatkan, dan 81.2% (ritel) dan 58.4% (maskapai) pada TAU-bench[1]
- Anthropic menyatakan lebih sedikit mengoptimalkan untuk kompetisi matematika dan pemrograman dan lebih banyak untuk tugas bisnis dunia nyata[1]
- Dalam mode standar ini adalah Claude 3.5 Sonnet yang ditingkatkan; dalam mode pemikiran diperluas model ini merenung sebelum menjawab, yang membantu matematika, fisika, mengikuti instruksi, dan pemrograman[1]
Tolok ukur[1]
| Tolok ukur | Claude 3.7 Sonnet (64K pemikiran diperluas) | Claude 3.7 Sonnet (tanpa pemikiran diperluas) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K pemikiran diperluas) | Grok 3 Beta (pemikiran diperluas) |
|---|---|---|---|---|---|---|---|
| Penalaran tingkat pascasarjana (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| Pemrograman agen (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| Penggunaan alat agen (TAU-bench), ritel | — | 81.2% | 71.5% | 73.5% | — | — | — |
| Penggunaan alat agen (TAU-bench), maskapai | — | 58.4% | 48.8% | 54.2% | — | — | — |
| Tanya jawab multibahasa (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| Penalaran visual (validasi MMMU) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| Mengikuti instruksi (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| Pemecahan soal matematika (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| Kompetisi matematika SMA (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 dirata-ratakan dari beberapa percobaan (hingga 16 untuk AIME dan SWE-bench Verified); angka kedua diuntungkan oleh komputasi uji paralel. ¹ Hasil TAU-bench o1 dilaporkan oleh OpenAI dan kemudian dihapus; hasil TAU-bench mungkin tidak dapat dibandingkan. ² 62.3% adalah pass@1 pada 500 soal dengan alat bash/editor ditambah “alat berpikir”; 70.3% memakai penilaian internal dan scaffold khusus pada subset yang dikurangi; DeepSeek R1 memakai kerangka Agentless. ³ Skor GPQA dan AIME 2024 yang tinggi dari Claude 3.7 Sonnet memakai penilaian internal dengan komputasi uji paralel; milik o1 dan Grok 3 memakai pemungutan suara mayoritas dengan 64 sampel.
Referensi 4KEYAKINAN 85%Keyakinan keseluruhan: 85%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 4 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Diposting 28 Sep 2026· Mulai 24 Feb 2025 ✓· 32% dari skor
Unggahan itu bertanggal “24 Feb 2025”: “Hari ini, kami mengumumkan Claude 3.7 Sonnet” dan model ini “kini tersedia di semua paket Claude”; TechCrunch[4] menyatakan model ini “diluncurkan kepada semua pengguna dan pengembang pada hari Senin” (24 Februari).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Ditambahkan 28 Sep 2026· 32% dari skor
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Ditambahkan 28 Sep 2026· 32% dari skor
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Diterbitkan 24 Feb 2025· Mulai 24 Feb 2025· 3% dari skor
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.