- Mulai
- 4 Mar 2024KEYAKINAN 90%dari sumbernya
Claude 3 Opus Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude 3 Opus Released
- Anthropic mengumumkan keluarga Claude 3 - Haiku, Sonnet, dan Opus “dalam urutan kemampuan yang menaik” - pada 4 Maret 2024, dengan Opus dan Sonnet tersedia pada hari yang sama di claude.ai dan Claude API, yang kini tersedia secara umum di 159 negara[1][4]
- Di claude.ai Opus diberikan kepada pelanggan Claude Pro sementara Sonnet menopang pengalaman gratis; Sonnet tiba di Amazon Bedrock dan pratinjau privat Google Cloud Vertex AI pada hari itu, “dengan Opus dan Haiku segera hadir di keduanya”[1]
- Anthropic mempertahankan model ini pada AI Safety Level 2 (ASL-2) setelah red-teaming menemukan “potensi risiko katastrofik yang dapat diabaikan saat ini”[1]
- CNBC mencatat pendukung Anthropic mencakup Google, Salesforce, dan Amazon, setelah kesepakatan pendanaan senilai sekitar $7.3 miliar selama setahun sebelumnya[4]
- Claude 3 Opus dinyatakan usang pada 30 Juni 2025 dan dipensiunkan dari Claude API pada 5 Januari 2026, digantikan oleh Claude Opus 4.8[3]
Fitur unggulan
- Claude 3 Opus adalah “model paling cerdas kami, dengan kinerja terbaik di pasar pada tugas yang sangat kompleks”, berharga $15 per juta token masukan dan $75 per juta token keluaran[1][5]
- Tolok ukur yang dilaporkan Anthropic: 86.8% pada MMLU, 50.4% pada GPQA Diamond, 95.0% pada GSM8K, dan 84.9% pada HumanEval, mengungguli GPT-4 yang mencetak 86.4%, 35.7%, 92.0%, dan 67.0%[1]
- Jendela konteks 200K token saat peluncuran, dengan masukan lebih dari 1 juta token tersedia “untuk kasus penggunaan tertentu”; pada uji recall Needle In A Haystack model ini melampaui akurasi 99% dan kadang menyadari kalimat yang disisipkan tampak dimasukkan secara buatan[1][5]
- Model visual pertama Claude: membaca foto, bagan, grafik, dan diagram teknis, hingga 20 gambar dalam satu permintaan, tetapi tidak akan mengidentifikasi orang[1][5]
- Opus “jauh lebih kecil kemungkinannya” menolak prompt yang tidak berbahaya dibandingkan model Claude sebelumnya, dan menggandakan akurasi Claude 2.1 pada pertanyaan faktual terbuka yang sulit; pengetahuannya mencapai Agustus 2023[1][2]
Tolok ukur[1]
| Tolok ukur | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (pengetahuan tingkat sarjana) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (penalaran tingkat pascasarjana) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (matematika sekolah dasar) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (pemecahan soal matematika) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (matematika multibahasa) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (kode) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, skor F1 (penalaran atas teks) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 shot bervariasi | 74.1 shot bervariasi |
| BIG-Bench-Hard (evaluasi campuran) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (tanya jawab pengetahuan) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (pengetahuan umum) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
Referensi 5KEYAKINAN 90%Keyakinan keseluruhan: 90%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 5 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Diposting 28 Sep 2026· Mulai 4 Mar 2024 ✓· 33% dari skor
Unggahan Anthropic[2] bertanggal “4 Mar 2024” dan menyatakan “Opus dan Sonnet kini tersedia untuk dipakai di claude[3].ai dan Claude API yang kini tersedia secara umum di 159 negara”; CNBC[4] dan TechCrunch[5] melaporkan peluncuran itu pada Senin yang sama.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Ditambahkan 28 Sep 2026· 33% dari skor
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Ditambahkan 28 Sep 2026· 33% dari skor
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Diterbitkan 4 Mar 2024· Mulai 4 Mar 2024· 1% dari skor
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Diterbitkan 4 Mar 2024· Mulai 4 Mar 2024· 1% dari skor
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.