- Mula
- 4 Mac 202490% KEYAKINANdaripada sumber
Claude 3 Opus Dilancarkan
Diterjemah secara automatik daripada asal
Tajuk asal: Claude 3 Opus Released
- Anthropic mengumumkan keluarga Claude 3 - Haiku, Sonnet dan Opus "in ascending order of capability" (mengikut tertib keupayaan menaik) - pada 4 Mac 2024, dengan Opus dan Sonnet tersedia pada hari yang sama dalam claude.ai dan API Claude, yang kini tersedia secara umum di 159 negara[1][4]
- Di claude.ai, Opus diberikan kepada pelanggan Claude Pro manakala Sonnet menggerakkan pengalaman percuma; Sonnet sampai ke Amazon Bedrock dan pratonton persendirian Google Cloud Vertex AI pada hari itu, "with Opus and Haiku coming soon to both" (dengan Opus dan Haiku menyusul tidak lama lagi di kedua-duanya)[1]
- Anthropic mengekalkan model ini pada Tahap Keselamatan AI 2 (ASL-2) selepas ujian red-team mendapati "negligible potential for catastrophic risk at this time" (potensi risiko bencana yang boleh diabaikan buat masa ini)[1]
- CNBC menyatakan penyokong Anthropic termasuk Google, Salesforce dan Amazon, selepas perjanjian pembiayaan berjumlah kira-kira $7.3 bilion sepanjang tahun sebelumnya[4]
- Claude 3 Opus dihentikan penggunaannya (deprecated) pada 30 Jun 2025 dan ditamatkan daripada API Claude pada 5 Januari 2026, digantikan oleh Claude Opus 4.8[3]
Ciri-ciri menonjol
- Claude 3 Opus ialah "our most intelligent model, with best-in-market performance on highly complex tasks" (model kami yang paling bijak, dengan prestasi terbaik di pasaran bagi tugas yang sangat kompleks), berharga $15 setiap juta token input dan $75 setiap juta token output[1][5]
- Penanda aras yang dilaporkan Anthropic: 86.8% pada MMLU, 50.4% pada GPQA Diamond, 95.0% pada GSM8K dan 84.9% pada HumanEval, mendahului GPT-4 yang mencatat 86.4%, 35.7%, 92.0% dan 67.0%[1]
- Tetingkap konteks 200K token semasa pelancaran, dengan input melebihi 1 juta token tersedia "for specific use cases" (untuk kes penggunaan tertentu); pada ujian ingatan Needle In A Haystack ia melepasi ketepatan 99% dan kadangkala menyedari ayat yang diselitkan itu kelihatan dimasukkan secara tiruan[1][5]
- Model penglihatan pertama Claude: ia membaca foto, carta, graf dan gambar rajah teknikal, sehingga 20 imej dalam satu permintaan, tetapi tidak akan mengenal pasti orang[1][5]
- Opus "significantly less likely" (jauh kurang berkemungkinan) menolak gesaan yang tidak berbahaya berbanding model Claude terdahulu, dan menggandakan ketepatan Claude 2.1 pada soalan fakta terbuka yang sukar; pengetahuannya sehingga Ogos 2023[1][2]
Penanda aras[1]
| Penanda aras | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (pengetahuan peringkat sarjana muda) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (penaakulan peringkat pascasiswazah) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (matematik sekolah rendah) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (penyelesaian masalah matematik) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (matematik pelbagai bahasa) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (kod) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, F1 score (penaakulan merentas teks) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 Variable shots | 74.1 Variable shots |
| BIG-Bench-Hard (penilaian campuran) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (soal jawab pengetahuan) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (pengetahuan am) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
Rujukan 590% KEYAKINANKeyakinan keseluruhan: 90%Sejauh mana sumber dan rujukan pin menyokong tarikhnya.Purata berpemberat bagi sejauh mana 5 rujukan, termasuk sumber, menyokong masa mula dan tamat pin; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharuTunjuk semua pin pada keyakinan 75% atau lebih baik
Entri pertama sentiasa sumber pin. Keyakinan keseluruhan ialah purata berpemberat bagi sejauh mana setiap rujukan menyokong masa mula dan tamat yang digunakan di atas; sesebuah rujukan diambil kira separuh kurang bagi setiap 180 hari lebih lama daripada yang terbaharu.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Disiarkan 28 Sep 2026· Bermula 4 Mac 2024 ✓· 33% daripada skor
Siaran Anthropic[2] bertarikh "Mar 4, 2024" dan menyatakan "Opus and Sonnet are now available to use in claude[3].ai and the Claude API which is now generally available in 159 countries"; CNBC[4] dan TechCrunch[5] melaporkan pelancaran itu pada hari Isnin yang sama.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Ditambah 28 Sep 2026· 33% daripada skor
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Ditambah 28 Sep 2026· 33% daripada skor
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Diterbitkan 4 Mac 2024· Bermula 4 Mac 2024· 1% daripada skor
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Diterbitkan 4 Mac 2024· Bermula 4 Mac 2024· 1% daripada skor
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Cadangkan pembetulan
Ada yang tertinggal atau salah? Nyatakan dengan kata-kata anda sendiri: pautan yang menyokong pin ini, tarikh mula atau tamat yang berbeza beserta sebabnya, atau fakta yang tiada atau tersilap. AI menyemaknya berbanding sumber pin ini, mencari yang lebih baik, dan menambah mana-mana halaman yang menyokong anda. Sumber pin itu sendiri tetap paling diambil kira. Gambar yang menunjukkan sesuatu yang lain, atau menunjukkannya dengan buruk, turut dilihat, dan dialihkan ke bawah atau diganti.