- Mula
- 29 Sep 202590% KEYAKINANdaripada sumber
Claude Sonnet 4.5 Dilancarkan
Diterjemah secara automatik daripada asal
Tajuk asal: Claude Sonnet 4.5 Released
- Anthropic menyebutnya "the best coding model in the world. It's the strongest model for building complex agents. It's the best model at using computers" (model pengekodan terbaik di dunia. Ia model terkuat untuk membina ejen yang kompleks. Ia model terbaik dalam menggunakan komputer)[1][4]
- "Available everywhere today" (Tersedia di mana-mana hari ini) sebagai claude-sonnet-4-5 pada API Claude dan dalam aplikasi Claude; Mike Krieger berkata ia akan menjadi model lalai dan mengesyorkannya untuk "basically every use case" (pada dasarnya setiap kes penggunaan)[1][5]
- Ia dihantar bersama titik semak Claude Code dan sambungan VS Code asli, ciri penyuntingan konteks dan alat memori pada API, pelaksanaan kod dan penciptaan fail dalam aplikasi Claude, serta Claude Agent SDK, infrastruktur di sebalik Claude Code[1][4]
- "This is the most aligned frontier model we've ever released" (Ini model termaju yang paling selari yang pernah kami keluarkan), dengan kadar sikap mengampu dan penipuan yang lebih rendah, dikeluarkan di bawah perlindungan Tahap Keselamatan AI 3 (ASL-3)[1][3][4]
- Ia tiba kurang daripada dua bulan selepas Claude Opus 4.1, dengan Anthropic bernilai $183 bilion[4][5]
Ciri-ciri menonjol
- $3 setiap juta token input dan $15 setiap juta token output, seperti Sonnet 4; tetingkap konteks 200K token, output maksimum 64K dan had pengetahuan boleh dipercayai Januari 2025[1][2]
- 77.2% pada SWE-bench Verified, purata 10 percubaan tanpa pengiraan masa ujian, dan 82.0% dengan pengiraan masa ujian selari[1]
- Ia mendahului penggunaan komputer OSWorld pada 61.4%, yang sebelum ini dipimpin Sonnet 4 pada 42.2% empat bulan lebih awal[1]
- Anthropic memerhatikannya mengekalkan tumpuan lebih daripada 30 jam pada tugas berbilang langkah yang kompleks; CNBC menyatakan Opus 4 mampu tujuh jam[1][5]
- Pakar dalam kewangan, undang-undang, perubatan dan STEM mendapati pengetahuan domain dan penaakulannya jauh mendahului model lama, termasuk Opus 4.1[1]
Penanda aras[1]
| Penanda aras | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Pengekodan secara ejen (SWE-bench Verified) | 77.2% / 82.0% dengan pengiraan masa ujian selari | 74.5% / 79.4% dengan pengiraan masa ujian selari | 72.7% / 80.2% dengan pengiraan masa ujian selari | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| Pengekodan terminal secara ejen (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| Penggunaan alat secara ejen (τ2-bench), retail | 86.2% | 86.8% | 83.8% | 81.1% | — |
| Penggunaan alat secara ejen (τ2-bench), airline | 70.0% | 63.0% | 63.0% | 62.6% | — |
| Penggunaan alat secara ejen (τ2-bench), telecom | 98.0% | 71.5% | 49.6% | 96.7% | — |
| Penggunaan komputer (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| Pertandingan matematik sekolah menengah (AIME 2025) | 100% (python) / 87.0% (tanpa alat) | 78.0% | 70.5% | 99.6% (python) / 94.6% (tanpa alat) | 88.0% |
| Penaakulan peringkat pascasiswazah (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| Soal jawab pelbagai bahasa (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| Penaakulan visual (MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| Analisis kewangan (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
Rujukan 589% KEYAKINANKeyakinan keseluruhan: 89%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 5 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Disiarkan 28 Sep 2026· Bermula 29 Sep 2025 ✓· 29% daripada skor
Siaran bertarikh "Sep 29, 2025" dan menyatakan "Claude[2] Sonnet 4.5 is available everywhere today"; halaman model dokumentasi menyenaraikan "Released September 29, 2025" dan TechCrunch[4] melaporkan pelancaran itu "On Monday".
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Ditambah 28 Sep 2026· 29% daripada skor
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Ditambah 28 Sep 2026· 29% daripada skor
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Diterbitkan 29 Sep 2025· Bermula 29 Sep 2025· 7% daripada skor
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Diterbitkan 29 Sep 2025· Bermula 29 Sep 2025· 7% daripada skor
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.