- Mulai
- 29 Sep 2025KEYAKINAN 90%dari sumbernya
Claude Sonnet 4.5 Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude Sonnet 4.5 Released
- Anthropic menyebutnya “model pemrograman terbaik di dunia. Model terkuat untuk membangun agen yang kompleks. Model terbaik dalam menggunakan komputer”[1][4]
- “Tersedia di mana-mana hari ini” sebagai claude-sonnet-4-5 di Claude API dan di aplikasi Claude; Mike Krieger mengatakan model ini akan menjadi bawaan dan merekomendasikannya untuk “pada dasarnya setiap kasus penggunaan”[1][5]
- Model ini dirilis bersama checkpoint Claude Code dan ekstensi VS Code native, fitur penyuntingan konteks dan alat memori di API, eksekusi kode dan pembuatan file di aplikasi Claude, serta Claude Agent SDK, infrastruktur di balik Claude Code[1][4]
- “Ini adalah model frontier paling selaras yang pernah kami rilis”, dengan tingkat sikap menjilat dan penipuan yang lebih rendah, dirilis di bawah perlindungan AI Safety Level 3 (ASL-3)[1][3][4]
- Model ini tiba kurang dari dua bulan setelah Claude Opus 4.1, dengan Anthropic bernilai $183 miliar[4][5]
Fitur unggulan
- $3 per juta token masukan dan $15 per juta token keluaran, seperti Sonnet 4; jendela konteks 200K token, keluaran maksimum 64K, dan batas pengetahuan andal Januari 2025[1][2]
- 77.2% pada SWE-bench Verified, dirata-ratakan dari 10 percobaan tanpa komputasi uji, dan 82.0% dengan komputasi uji paralel[1]
- Model ini memimpin penggunaan komputer OSWorld dengan 61.4%, tempat Sonnet 4 memimpin dengan 42.2% empat bulan sebelumnya[1]
- Anthropic mengamati model ini mempertahankan fokus lebih dari 30 jam pada tugas multilangkah yang kompleks; CNBC mencatat Opus 4 mampu tujuh jam[1][5]
- Para ahli di bidang keuangan, hukum, kedokteran, dan STEM menilai pengetahuan domain dan penalarannya jauh di depan model lama, termasuk Opus 4.1[1]
Tolok ukur[1]
| Tolok ukur | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Pemrograman agen (SWE-bench Verified) | 77.2% / 82.0% dengan komputasi uji paralel | 74.5% / 79.4% dengan komputasi uji paralel | 72.7% / 80.2% dengan komputasi uji paralel | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| Pemrograman terminal agen (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| Penggunaan alat agen (τ2-bench), ritel | 86.2% | 86.8% | 83.8% | 81.1% | — |
| Penggunaan alat agen (τ2-bench), maskapai | 70.0% | 63.0% | 63.0% | 62.6% | — |
| Penggunaan alat agen (τ2-bench), telekomunikasi | 98.0% | 71.5% | 49.6% | 96.7% | — |
| Penggunaan komputer (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| Kompetisi matematika SMA (AIME 2025) | 100% (python) / 87.0% (tanpa alat) | 78.0% | 70.5% | 99.6% (python) / 94.6% (tanpa alat) | 88.0% |
| Graduate-level reasoning (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| Tanya jawab multibahasa (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| Penalaran visual (validasi MMMU) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| Analisis keuangan (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
Referensi 5KEYAKINAN 89%Keyakinan keseluruhan: 89%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 5 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Diposting 28 Sep 2026· Mulai 29 Sep 2025 ✓· 29% dari skor
Unggahan itu bertanggal “29 Sep 2025” dan menyatakan “Claude[2] Sonnet 4.5 tersedia di mana-mana hari ini”; halaman model di dokumentasi mencantumkan “Dirilis 29 September 2025” dan TechCrunch[4] melaporkan peluncuran itu “pada hari Senin”.
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Ditambahkan 28 Sep 2026· 29% dari skor
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Ditambahkan 28 Sep 2026· 29% dari skor
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Diterbitkan 29 Sep 2025· Mulai 29 Sep 2025· 7% dari skor
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Diterbitkan 29 Sep 2025· Mulai 29 Sep 2025· 7% dari skor
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.