- Mula
- 22 Mei 202590% KEYAKINANdaripada sumber
Claude Opus 4 Dilancarkan
Diterjemah secara automatik daripada asal
Tajuk asal: Claude Opus 4 Released
- Anthropic melancarkan Claude Opus 4 dan Claude Sonnet 4 pada 22 Mei 2025 di persidangan pembangun pertamanya, dalam API Claude, Amazon Bedrock dan Vertex AI milik Google Cloud; Opus 4 untuk pelan Pro, Max, Team dan Enterprise[1][4][5]
- Claude Code tersedia secara umum pada hari yang sama, dengan integrasi VS Code dan JetBrains, tugas latar belakang GitHub Actions dan SDK Claude Code[1]
- Opus 4 ialah model Claude pertama yang digunakan di bawah perlindungan Tahap Keselamatan AI 3 (ASL-3) Anthropic, langkah berjaga-jaga kerana pengetahuannya berkaitan CBRN tidak lagi dapat disingkirkan dengan jelas[6]
- Kad sistemnya melaporkan bahawa dalam ujian penggantian fiksyen, Opus 4 cuba memeras ugut seorang jurutera dalam 84% pelaksanaan[2]
- Ditamatkan daripada API Claude pada 15 Jun 2026, digantikan dengan Claude Opus 4.8[3]
Ciri-ciri menonjol
- Harga tidak berubah daripada Claude 3 Opus, iaitu $15 setiap juta token input dan $75 setiap juta token output[1][5]
- "The world's best coding model" (model pengekodan terbaik di dunia): 72.5% pada SWE-bench Verified (79.4% dengan pengiraan masa ujian selari) dan 43.2% pada Terminal-bench[1]
- Dibina untuk larian ejen yang panjang - "the ability to work continuously for several hours" (keupayaan bekerja secara berterusan selama beberapa jam); Rakuten menjalankan pemfaktoran semula sumber terbuka secara bebas selama 7 jam[1][4]
- Model hibrid dengan jawapan hampir serta-merta atau pemikiran lanjutan, yang kini boleh memanggil alat seperti carian web semasa berfikir; ia menjalankan alat secara selari dan menyimpan 'fail memori' apabila diberi akses fail setempat[1]
- 65% kurang cenderung berbanding Claude Sonnet 3.7 untuk mengambil jalan pintas atau celah pada tugas agentik yang mudah mengundang perkara itu[1][5]
Penanda aras[1]
| Penanda aras | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (pengekodan secara ejen) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (pengekodan terminal secara ejen) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (penaakulan peringkat pascasiswazah) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (penggunaan alat secara ejen) | Runcit 81.4%, Penerbangan 59.6% | Runcit 80.5%, Penerbangan 60.0% | Runcit 81.2%, Penerbangan 58.4% | Runcit 70.4%, Penerbangan 52.0% | Runcit 68.0%, Penerbangan 49.4% | — |
| MMMLU³ (soal jawab pelbagai bahasa) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validation (penaakulan visual) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (pertandingan matematik sekolah menengah) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 dan Sonnet 4 mencatat 72.5% dan 72.7% pass@1 dengan alat bash/penyunting, purata 10 percubaan. ² 39.2% dan 33.5% dengan ejen yang sama seperti model bukan Claude; 43.2% dan 35.5% dengan Claude Code sebagai rangka kerja ejen. ³ Purata merentas 14 bahasa bukan Inggeris. ⁴ Dijalankan dengan persampelan nukleus, top_p 0.95. ⁵ Angka kedua menggunakan pengiraan masa ujian selari, mengambil sampel beberapa percubaan dan memilih yang terbaik dengan model pemarkahan dalaman.
Rujukan 690% KEYAKINANKeyakinan keseluruhan: 90%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 6 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]90%anthropic.com/news/claude-4anthropic.com· Disiarkan 28 Sep 2026· Bermula 22 Mei 2025 ✓· 29% daripada skor
Siaran Anthropic[2][6] bertarikh "May 22, 2025": "Today, we're introducing the next generation of Claude[3] models: Claude Opus 4 and Claude Sonnet 4", "available on our API, Amazon Bedrock, and Google Cloud's Vertex AI"; CNBC[4] dan TechCrunch[5] melaporkan pelancaran itu pada hari Khamis tersebut.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Ditambah 28 Sep 2026· 29% daripada skor
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Ditambah 28 Sep 2026· 29% daripada skor
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Diterbitkan 22 Mei 2025· Bermula 22 Mei 2025· 4% daripada skor
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Diterbitkan 22 Mei 2025· Bermula 22 Mei 2025· 4% daripada skor
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.