- Mulai
- 17 Feb 2026KEYAKINAN 90%dari sumbernya
Claude Sonnet 4.6 Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude Sonnet 4.6 Released
- “Claude Sonnet 4.6 adalah model Sonnet paling mumpuni kami sejauh ini”, peningkatan penuh di bidang pemrograman, penggunaan komputer, penalaran konteks panjang, perencanaan agen, pekerjaan pengetahuan, dan desain[1][4]
- Model ini menjadi model bawaan di claude.ai dan Claude Cowork untuk pengguna Free dan Pro, dan tingkat gratis mendapat pembuatan file, konektor, skill, dan pemadatan; model ini ada di setiap paket Claude, Claude Code, API, dan semua platform cloud utama[1][3][4]
- Di Claude Code, penguji awal lebih menyukainya daripada Sonnet 4.5 sekitar 70% dari waktu dan bahkan daripada Opus 4.5, andalan Anthropic bulan November, 59% dari waktu, menyebutnya lebih kecil kemungkinannya merekayasa berlebihan dan “malas”[1]
- Peneliti keselamatan menemukan “karakter yang secara umum hangat, jujur, prososial, dan kadang lucu” dan tidak ada tanda misalignment besar berisiko tinggi; model ini jauh lebih tahan terhadap prompt injection daripada Sonnet 4.5 dan dirilis di bawah ASL-3[1][5]
- CNBC mengaitkan peluncuran ini dengan aksi jual saham perangkat lunak, dengan ETF perangkat lunak IGV turun lebih dari 20% tahun ini[3]
Fitur unggulan
- Harga tidak berubah dari Sonnet 4.5, yaitu $3 per juta token masukan dan $15 per juta token keluaran; jendela konteks 1M token (beta saat peluncuran) dan keluaran maksimum 128K[1][2]
- Tabel Anthropic: 79.6% pada SWE-bench Verified, 72.5% pada OSWorld-Verified (Sonnet 4.5: 61.4%), 59.1% pada Terminal-Bench 2.0, dan 74.7% pada BrowseComp[1]
- Grafik OSWorld-nya menelusuri garis Sonnet dari 14.9% untuk Claude 3.5 Sonnet Oktober 2024 hingga 72.5% untuk Sonnet 4.6[1]
- Pemikiran adaptif dan diperluas, ditambah pemadatan konteks dalam beta yang meringkas konteks lama saat percakapan mendekati batasnya[1][2]
- Model ini menyamai Opus 4.6 pada OfficeQA, uji Databricks untuk membaca bagan, PDF, dan tabel perusahaan, dan dalam Vending-Bench Arena model ini berinvestasi besar-besaran selama sepuluh bulan simulasi sebelum beralih ke laba[1]
Tolok ukur[1]
| Tolok ukur | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (all models) |
|---|---|---|---|---|---|---|
| Pemrograman terminal agen (Terminal-Bench 2.0) | 59.1% | 51.0% | 65.4% | 59.8% | 56.2% (54.2% dilaporkan sendiri) | 64.7% (64.0% dilaporkan sendiri, Codex CLI) |
| Pemrograman agen (SWE-bench Verified) | 79.6% | 77.2% | 80.8% | 80.9% | 78.0% (Flash) | 80.0% |
| Penggunaan komputer agen (OSWorld-Verified) | 72.5% | 61.4% | 72.7% | 66.3% | — | 38.2% |
| Penggunaan alat agen (τ2-bench), ritel | 91.7% | 86.2% | 91.9% | 88.9% | 85.3% | 82.0% |
| Penggunaan alat agen (τ2-bench), telekomunikasi | 97.9% | 98.0% | 99.3% | 98.2% | 98.0% | 98.7% |
| Penggunaan alat berskala (MCP-Atlas) | 61.3% | 43.8% | 59.5% | 62.3% | 54.1% | 60.6% |
| Pencarian agen (BrowseComp) | 74.7% | 43.9% | 84.0% | 67.8% | 59.2% (Deep Research) | 77.9% (Pro) |
| Penalaran multidisiplin (Humanity's Last Exam), tanpa alat | 33.2% | 17.7% | 40.0% | 30.8% | 37.5% | 36.6% (Pro) |
| Penalaran multidisiplin (Humanity's Last Exam), dengan alat | 49.0% | 33.6% | 53.0% | 43.4% | 45.8% | 50.0% (Pro) |
| Analisis keuangan agen (Finance Agent v1.1) | 63.3% | 54.5% | 60.1% | 58.8% | 55.2% | 59.0% |
| Tugas perkantoran (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| Pemecahan masalah baru (ARC-AGI-2) | 58.3% | 13.6% | 68.8% | 37.6% | 31.1% | 54.2% (Pro) |
| Graduate-level reasoning (GPQA Diamond) | 89.9% | 83.4% | 91.3% | 87.0% | 91.9% | 93.2% (Pro) |
| Penalaran visual (MMMU-Pro), tanpa alat | 74.5% | 63.4% | 73.9% | 70.6% | 81.0% | 79.5% |
| Penalaran visual (MMMU-Pro), dengan alat | 75.6% | 68.9% | 77.3% | 73.9% | — | 80.4% |
| Tanya jawab multibahasa (MMMLU) | 89.3% | 89.5% | 91.1% | 90.8% | 91.8% | 89.6% |
Referensi 5KEYAKINAN 88%Keyakinan keseluruhan: 88%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 5 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· Diposting 28 Sep 2026· Mulai 17 Feb 2026 ✓· 31% dari skor
Unggahan itu bertanggal “17 Feb 2026” dan menyatakan “Claude[2] Sonnet 4.6 kini tersedia di semua paket Claude, Claude Cowork, Claude Code, API kami, dan semua platform cloud utama”; halaman model di dokumentasi mencantumkan “Dirilis 17 Februari 2026” dan CNBC[3] melaporkannya pada hari itu.
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· Ditambahkan 28 Sep 2026· 31% dari skor
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· Diterbitkan 17 Feb 2026· Mulai 17 Feb 2026· 13% dari skor
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· Diterbitkan 17 Feb 2026· Mulai 17 Feb 2026· 13% dari skor
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· Diterbitkan 17 Feb 2026· 13% dari skor
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.