- शुरुआत
- 4 मार्च 202490% कॉन्फ़िडेंससोर्स से
Anthropic ने Claude 3 Opus रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude 3 Opus Released
- Anthropic ने 4 मार्च 2024 को Claude 3 फ़ैमिली की घोषणा की - Haiku, Sonnet और Opus, "क्षमता के बढ़ते क्रम में" - जिसमें Opus और Sonnet उसी दिन claude.ai और Claude API में उपलब्ध हो गए, जो अब 159 देशों में सामान्य रूप से उपलब्ध है[1][4]
- claude.ai पर Opus, Claude Pro सब्सक्राइबर्स को मिला जबकि Sonnet फ़्री एक्सपीरियंस को चलाता था; उसी दिन Sonnet, Amazon Bedrock और Google Cloud के Vertex AI प्राइवेट प्रीव्यू तक पहुँचा, "Opus और Haiku जल्द ही दोनों पर आने वाले थे"[1]
- Anthropic ने मॉडल को AI Safety Level 2 (ASL-2) पर रखा, क्योंकि रेड-टीमिंग में "इस समय विनाशकारी जोखिम की संभावना नगण्य" पाई गई[1]
- CNBC बताता है कि Anthropic के निवेशकों में Google, Salesforce और Amazon शामिल हैं, पिछले साल में लगभग $7.3 बिलियन के फ़ंडिंग डील के बाद[4]
- Claude 3 Opus को 30 जून 2025 को डिप्रिकेट किया गया और 5 जनवरी 2026 को Claude API से रिटायर कर दिया गया, जिसकी जगह Claude Opus 4.8 ने ली[3]
प्रमुख विशेषताएँ
- Claude 3 Opus "हमारा सबसे बुद्धिमान मॉडल है, जो बहुत जटिल कामों पर बाज़ार में सबसे बेहतरीन परफ़ॉर्मेंस देता है", जिसकी कीमत $15 प्रति मिलियन इनपुट टोकन और $75 प्रति मिलियन आउटपुट टोकन है[1][5]
- Anthropic के बताए बेंचमार्क: MMLU पर 86.8%, GPQA Diamond पर 50.4%, GSM8K पर 95.0% और HumanEval पर 84.9%, जो GPT-4 के 86.4%, 35.7%, 92.0% और 67.0% से आगे हैं[1]
- लॉन्च पर 200K-टोकन कॉन्टेक्स्ट विंडो, जिसमें "खास इस्तेमाल के मामलों के लिए" 1 मिलियन टोकन से ज़्यादा के इनपुट भी उपलब्ध थे; Needle In A Haystack रिकॉल पर इसने 99% सटीकता पार की और कभी-कभी यह नोटिस कर लिया कि प्लांट किया गया वाक्य कृत्रिम रूप से डाला गया लग रहा है[1][5]
- Claude का पहला विज़न मॉडल: यह फ़ोटो, चार्ट, ग्राफ़ और टेक्निकल डायग्राम पढ़ता है, एक रिक्वेस्ट में 20 इमेज तक, लेकिन लोगों की पहचान नहीं करेगा[1][5]
- Opus पहले के Claude मॉडलों की तुलना में हानिरहित प्रॉम्प्ट को मना करने की "काफ़ी कम संभावना" रखता है, और मुश्किल ओपन-एंडेड फ़ैक्चुअल सवालों पर Claude 2.1 की सटीकता को दोगुना करता है; इसका नॉलेज अगस्त 2023 तक जाता है[1][2]
बेंचमार्क[1]
| बेंचमार्क | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (अंडरग्रेजुएट-स्तर का नॉलेज) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (ग्रेजुएट-स्तर रीज़निंग) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (ग्रेड स्कूल गणित) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (गणित समस्या-समाधान) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (बहुभाषी गणित) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (कोड) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, F1 स्कोर (टेक्स्ट पर रीज़निंग) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 Variable shots | 74.1 Variable shots |
| BIG-Bench-Hard (मिश्रित इवैल्यूएशन) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (नॉलेज Q&A) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (सामान्य ज्ञान) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
संदर्भ 590% कॉन्फ़िडेंसकुल भरोसा: 90%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 5 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 4 मार्च 2024 ✓· स्कोर का 33%
Anthropic[2] की पोस्ट पर तारीख़ 'Mar 4, 2024' दी गई है और कहा गया है कि 'Opus और Sonnet अब claude[3].ai और Claude API में इस्तेमाल के लिए उपलब्ध हैं, जो अब 159 देशों में सामान्य रूप से उपलब्ध है'; CNBC[4] और TechCrunch[5] उस लॉन्च की खबर उसी सोमवार को देते हैं।
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 33%
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 33%
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· 4 मार्च 2024 को प्रकाशित· शुरुआत 4 मार्च 2024· स्कोर का 1%
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· 4 मार्च 2024 को प्रकाशित· शुरुआत 4 मार्च 2024· स्कोर का 1%
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।