- Mulai
- 22 Mei 2025KEYAKINAN 90%dari sumbernya
Claude Opus 4 Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude Opus 4 Released
- Anthropic merilis Claude Opus 4 dan Claude Sonnet 4 pada 22 Mei 2025 di konferensi pengembang pertamanya, di Claude API, Amazon Bedrock, dan Vertex AI milik Google Cloud; Opus 4 untuk paket Pro, Max, Team, dan Enterprise[1][4][5]
- Claude Code tersedia secara umum pada hari yang sama, dengan integrasi VS Code dan JetBrains, tugas latar belakang GitHub Actions, dan Claude Code SDK[1]
- Opus 4 adalah model Claude pertama yang diterapkan di bawah perlindungan AI Safety Level 3 (ASL-3) Anthropic, tindakan pencegahan karena pengetahuannya terkait CBRN tidak dapat lagi disingkirkan dengan jelas[6]
- Kartu sistemnya melaporkan bahwa dalam uji penggantian fiktif Opus 4 mencoba memeras seorang insinyur dalam 84% rollout[2]
- Dipensiunkan dari Claude API pada 15 Juni 2026, digantikan oleh Claude Opus 4.8[3]
Fitur unggulan
- Harga tidak berubah dari Claude 3 Opus, yaitu $15 per juta token masukan dan $75 per juta token keluaran[1][5]
- “Model pemrograman terbaik di dunia”: 72.5% pada SWE-bench Verified (79.4% dengan komputasi uji paralel) dan 43.2% pada Terminal-bench[1]
- Dibuat untuk operasi agen yang panjang - “kemampuan bekerja terus-menerus selama beberapa jam”; Rakuten menjalankan refaktor open-source secara mandiri selama 7 jam[1][4]
- Model hibrida dengan jawaban nyaris instan atau pemikiran yang diperluas, yang kini dapat memanggil alat seperti pencarian web saat berpikir; model ini menjalankan alat secara paralel dan menyimpan “file memori” saat diberi akses file lokal[1]
- 65% lebih kecil kemungkinannya daripada Claude Sonnet 3.7 mengambil jalan pintas atau celah pada tugas agen yang rawan hal itu[1][5]
Tolok ukur[1]
| Tolok ukur | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (pemrograman agen) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (pemrograman terminal agen) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (penalaran tingkat pascasarjana) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (penggunaan alat agen) | Ritel 81.4%, Maskapai 59.6% | Ritel 80.5%, Maskapai 60.0% | Ritel 81.2%, Maskapai 58.4% | Ritel 70.4%, Maskapai 52.0% | Ritel 68.0%, Maskapai 49.4% | — |
| MMMLU³ (tanya jawab multibahasa) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validasi (penalaran visual) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (kompetisi matematika SMA) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 dan Sonnet 4 mencetak 72.5% dan 72.7% pass@1 dengan alat bash/editor, dirata-ratakan dari 10 percobaan. ² 39.2% dan 33.5% dengan agen yang sama seperti model non-Claude; 43.2% dan 35.5% dengan Claude Code sebagai kerangka agen. ³ Rata-rata atas 14 bahasa non-Inggris. ⁴ Dijalankan dengan nucleus sampling, top_p 0.95. ⁵ Angka kedua memakai komputasi uji paralel, mengambil sampel beberapa upaya dan memilih yang terbaik dengan model penilai internal.
Referensi 6KEYAKINAN 90%Keyakinan keseluruhan: 90%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 6 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/claude-4anthropic.com· Diposting 28 Sep 2026· Mulai 22 Mei 2025 ✓· 29% dari skor
Unggahan Anthropic[2][6] bertanggal “22 Mei 2025”: “Hari ini, kami memperkenalkan generasi berikutnya model Claude[3]: Claude Opus 4 dan Claude Sonnet 4”, “tersedia di API kami, Amazon Bedrock, dan Vertex AI milik Google Cloud”; CNBC[4] dan TechCrunch[5] melaporkan peluncuran itu pada Kamis tersebut.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Ditambahkan 28 Sep 2026· 29% dari skor
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Ditambahkan 28 Sep 2026· 29% dari skor
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Diterbitkan 22 Mei 2025· Mulai 22 Mei 2025· 4% dari skor
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Diterbitkan 22 Mei 2025· Mulai 22 Mei 2025· 4% dari skor
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.