- Mula
- 17 Feb 202690% KEYAKINANdaripada sumber
Claude Sonnet 4.6 Dilancarkan
Diterjemah secara automatik daripada asal
Tajuk asal: Claude Sonnet 4.6 Released
- "Claude Sonnet 4.6 is our most capable Sonnet model yet" (Claude Sonnet 4.6 ialah model Sonnet kami yang paling berupaya setakat ini), peningkatan penuh merentas pengekodan, penggunaan komputer, penaakulan konteks panjang, perancangan ejen, kerja pengetahuan dan reka bentuk[1][4]
- Ia menjadi model lalai dalam claude.ai dan Claude Cowork untuk pengguna Free dan Pro, dan peringkat percuma mendapat penciptaan fail, penyambung, kemahiran dan pemadatan; ia ada pada setiap pelan Claude, Claude Code, API dan semua platform awan utama[1][3][4]
- Dalam Claude Code, penguji awal lebih memilihnya berbanding Sonnet 4.5 kira-kira 70% daripada masa dan malah berbanding Opus 4.5, model utama Anthropic bulan November, 59% daripada masa, menyebutnya kurang cenderung melakukan kejuruteraan berlebihan dan "kemalasan"[1]
- Penyelidik keselamatan mendapati "a broadly warm, honest, prosocial, and at times funny character" (watak yang secara amnya mesra, jujur, prososial dan kadangkala lucu) dan tiada tanda ketidakselarasan besar berisiko tinggi; ia menentang suntikan gesaan jauh lebih baik berbanding Sonnet 4.5 dan dikeluarkan di bawah ASL-3[1][5]
- CNBC mengaitkan pelancaran itu dengan penjualan besar-besaran saham perisian, dengan ETF perisian IGV jatuh lebih 20% bagi tahun ini[3]
Ciri-ciri menonjol
- Harga tidak berubah daripada Sonnet 4.5 iaitu $3 setiap juta token input dan $15 setiap juta token output; tetingkap konteks 1M token (beta semasa pelancaran) dan output maksimum 128K[1][2]
- Jadual Anthropic: 79.6% pada SWE-bench Verified, 72.5% pada OSWorld-Verified (Sonnet 4.5: 61.4%), 59.1% pada Terminal-Bench 2.0 dan 74.7% pada BrowseComp[1]
- Carta OSWorld-nya menjejak barisan Sonnet daripada 14.9% bagi Claude 3.5 Sonnet Oktober 2024 kepada 72.5% bagi Sonnet 4.6[1]
- Pemikiran adaptif dan lanjutan, serta pemadatan konteks dalam beta yang meringkaskan konteks lama apabila perbualan menghampiri had[1][2]
- Ia menyamai Opus 4.6 pada OfficeQA, ujian Databricks untuk membaca carta, PDF dan jadual perusahaan, dan dalam Vending-Bench Arena ia melabur banyak selama sepuluh bulan simulasi sebelum beralih kepada keuntungan[1]
Penanda aras[1]
| Penanda aras | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (all models) |
|---|---|---|---|---|---|---|
| Pengekodan terminal secara ejen (Terminal-Bench 2.0) | 59.1% | 51.0% | 65.4% | 59.8% | 56.2% (54.2% dilaporkan sendiri) | 64.7% (64.0% dilaporkan sendiri, Codex CLI) |
| Pengekodan secara ejen (SWE-bench Verified) | 79.6% | 77.2% | 80.8% | 80.9% | 78.0% (Flash) | 80.0% |
| Penggunaan komputer secara ejen (OSWorld-Verified) | 72.5% | 61.4% | 72.7% | 66.3% | — | 38.2% |
| Penggunaan alat secara ejen (τ2-bench), retail | 91.7% | 86.2% | 91.9% | 88.9% | 85.3% | 82.0% |
| Penggunaan alat secara ejen (τ2-bench), telecom | 97.9% | 98.0% | 99.3% | 98.2% | 98.0% | 98.7% |
| Penggunaan alat berskala (MCP-Atlas) | 61.3% | 43.8% | 59.5% | 62.3% | 54.1% | 60.6% |
| Carian secara ejen (BrowseComp) | 74.7% | 43.9% | 84.0% | 67.8% | 59.2% (Deep Research) | 77.9% (Pro) |
| Penaakulan pelbagai disiplin (Humanity's Last Exam), tanpa alat | 33.2% | 17.7% | 40.0% | 30.8% | 37.5% | 36.6% (Pro) |
| Penaakulan pelbagai disiplin (Humanity's Last Exam), dengan alat | 49.0% | 33.6% | 53.0% | 43.4% | 45.8% | 50.0% (Pro) |
| Analisis kewangan secara ejen (Finance Agent v1.1) | 63.3% | 54.5% | 60.1% | 58.8% | 55.2% | 59.0% |
| Tugas pejabat (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| Penyelesaian masalah baharu (ARC-AGI-2) | 58.3% | 13.6% | 68.8% | 37.6% | 31.1% | 54.2% (Pro) |
| Penaakulan peringkat pascasiswazah (GPQA Diamond) | 89.9% | 83.4% | 91.3% | 87.0% | 91.9% | 93.2% (Pro) |
| Penaakulan visual (MMMU-Pro), without tools | 74.5% | 63.4% | 73.9% | 70.6% | 81.0% | 79.5% |
| Penaakulan visual (MMMU-Pro), with tools | 75.6% | 68.9% | 77.3% | 73.9% | — | 80.4% |
| Soal jawab pelbagai bahasa (MMMLU) | 89.3% | 89.5% | 91.1% | 90.8% | 91.8% | 89.6% |
Rujukan 588% KEYAKINANKeyakinan keseluruhan: 88%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 5 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· Disiarkan 28 Sep 2026· Bermula 17 Feb 2026 ✓· 31% daripada skor
Siaran bertarikh "Feb 17, 2026" dan menyatakan "Claude[2] Sonnet 4.6 is available now on all Claude plans, Claude Cowork, Claude Code, our API, and all major cloud platforms"; halaman model dokumentasi menyenaraikan "Released February 17, 2026" dan CNBC[3] melaporkannya pada hari itu.
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· Ditambah 28 Sep 2026· 31% daripada skor
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· Diterbitkan 17 Feb 2026· Bermula 17 Feb 2026· 13% daripada skor
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· Diterbitkan 17 Feb 2026· Bermula 17 Feb 2026· 13% daripada skor
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· Diterbitkan 17 Feb 2026· 13% daripada skor
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.