- Mula
- 24 Feb 202590% KEYAKINANdaripada sumber
Claude 3.7 Sonnet Dilancarkan
Diterjemah secara automatik daripada asal
Tajuk asal: Claude 3.7 Sonnet Released
- Anthropic menyebut Claude 3.7 Sonnet "our most intelligent model to date and the first hybrid reasoning model on the market" (model paling bijak kami setakat ini dan model penaakulan hibrid pertama di pasaran): satu model yang memberi jawapan hampir serta-merta atau "extended, step-by-step thinking that is made visible to the user" (pemikiran lanjutan langkah demi langkah yang dipaparkan kepada pengguna)[1][4]
- Ia dikeluarkan kepada setiap pelan Claude - Free, Pro, Team dan Enterprise - dan kepada Claude Developer Platform, Amazon Bedrock serta Vertex AI milik Google Cloud; pemikiran lanjutan ada pada setiap permukaan kecuali peringkat percuma[1][4]
- Claude Code, alat pengekodan agentik pertama Anthropic, dilancarkan bersamanya sebagai pratonton penyelidikan terhad yang berfungsi dari terminal, dan integrasi GitHub tiba kepada setiap pelan Claude[1]
- Ia mengurangkan penolakan yang tidak perlu sebanyak 45% berbanding pendahulunya dan dikeluarkan di bawah piawaian ASL-2[1][2]
- Versinya melompat daripada 3.5 kepada 3.7, dan pada Februari 2025 Claude 3.7 Sonnet mula bermain Pokémon Red secara langsung di Twitch[3][4]
Ciri-ciri menonjol
- $3 setiap juta token input dan $15 setiap juta token output dalam kedua-dua mod, termasuk token pemikiran[1][4]
- Pengguna API menetapkan bajet pemikiran dalam apa-apa saiz sehingga had output 128K token, menukar kelajuan dan kos dengan kualiti[1]
- Carta Anthropic memberikan 62.3% pada SWE-bench Verified (70.3% dengan perancah tersuai) berbanding 49.0% bagi 3.5 Sonnet yang dinaik taraf, dan 81.2% (runcit) serta 58.4% (penerbangan) pada TAU-bench[1]
- Anthropic berkata ia kurang mengoptimumkan untuk pertandingan matematik dan pengekodan dan lebih untuk tugas perniagaan dunia sebenar[1]
- Dalam mod standard ia ialah Claude 3.5 Sonnet yang dinaik taraf; dalam mod pemikiran lanjutan ia merenung sebelum menjawab, yang membantu matematik, fizik, pematuhan arahan dan pengekodan[1]
Penanda aras[1]
| Penanda aras | Claude 3.7 Sonnet (64K pemikiran lanjutan) | Claude 3.7 Sonnet (no pemikiran lanjutan) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K pemikiran lanjutan) | Grok 3 Beta (pemikiran lanjutan) |
|---|---|---|---|---|---|---|---|
| Penaakulan peringkat pascasiswazah (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| Pengekodan secara ejen (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| Penggunaan alat secara ejen (TAU-bench), retail | — | 81.2% | 71.5% | 73.5% | — | — | — |
| Penggunaan alat secara ejen (TAU-bench), airline | — | 58.4% | 48.8% | 54.2% | — | — | — |
| Soal jawab pelbagai bahasa (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| Penaakulan visual (MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| Pematuhan arahan (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| Penyelesaian masalah matematik (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| Pertandingan matematik sekolah menengah (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 purata atas beberapa percubaan (sehingga 16 untuk AIME dan SWE-bench Verified); angka kedua mendapat manfaat daripada pengiraan masa ujian selari. ¹ Keputusan TAU-bench o1 dilaporkan oleh OpenAI dan kemudian dipadam; keputusan TAU-bench mungkin tidak setanding. ² 62.3% ialah pass@1 pada 500 masalah dengan alat bash/penyunting serta "alat pemikiran"; 70.3% menggunakan pemarkahan dalaman dan perancah tersuai pada subset yang dikecilkan; DeepSeek R1 menggunakan rangka kerja Agentless. ³ Skor GPQA dan AIME 2024 yang tinggi bagi Claude 3.7 Sonnet menggunakan pemarkahan dalaman dengan pengiraan masa ujian selari; skor o1 dan Grok 3 menggunakan undian majoriti dengan 64 sampel.
Rujukan 485% KEYAKINANKeyakinan keseluruhan: 85%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 4 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Disiarkan 28 Sep 2026· Bermula 24 Feb 2025 ✓· 32% daripada skor
Siaran bertarikh "24 Feb 2025": "Hari ini, kami mengumumkan Claude 3.7 Sonnet" dan ia "kini tersedia pada semua pelan Claude"; TechCrunch[4] menyatakan ia "dilancarkan kepada semua pengguna dan pembangun pada hari Isnin" (24 Februari).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Ditambah 28 Sep 2026· 32% daripada skor
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Ditambah 28 Sep 2026· 32% daripada skor
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Diterbitkan 24 Feb 2025· Bermula 24 Feb 2025· 3% daripada skor
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.