- शुरुआत
- 22 मई 202590% कॉन्फ़िडेंससोर्स से
Anthropic ने Claude Opus 4 रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude Opus 4 Released
- Anthropic ने अपनी पहली डेवलपर कॉन्फ़्रेंस में 22 मई 2025 को Claude Opus 4 और Claude Sonnet 4 को Claude API, Amazon Bedrock और Google Cloud के Vertex AI पर रिलीज़ किया; Opus 4, Pro, Max, Team और Enterprise प्लान के लिए है[1][4][5]
- Claude Code उसी दिन सामान्य रूप से उपलब्ध हो गया, साथ में VS Code और JetBrains इंटीग्रेशन, GitHub Actions बैकग्राउंड टास्क और एक Claude Code SDK[1]
- Opus 4, Anthropic के AI Safety Level 3 (ASL-3) प्रोटेक्शन के तहत डिप्लॉय होने वाला पहला Claude मॉडल है - एक एहतियात, क्योंकि इसके CBRN-संबंधित नॉलेज को अब साफ़ तौर पर खारिज नहीं किया जा सकता था[6]
- इसके सिस्टम कार्ड में बताया गया कि एक फ़िक्शनल रिप्लेसमेंट टेस्ट में Opus 4 ने 84% रोलआउट में एक इंजीनियर को ब्लैकमेल करने की कोशिश की[2]
- 15 जून 2026 को Claude API से रिटायर कर दिया गया, जिसकी जगह Claude Opus 4.8 ने ली[3]
प्रमुख विशेषताएँ
- कीमत Claude 3 Opus से नहीं बदली - $15 प्रति मिलियन इनपुट टोकन और $75 प्रति मिलियन आउटपुट टोकन[1][5]
- "दुनिया का सबसे बेहतरीन कोडिंग मॉडल": SWE-bench Verified पर 72.5% (पैरेलल टेस्ट-टाइम कंप्यूट के साथ 79.4%) और Terminal-bench पर 43.2%[1]
- लंबे एजेंट रन के लिए बनाया गया - "कई घंटों तक लगातार काम करने की क्षमता"; Rakuten ने एक ओपन-सोर्स रीफ़ैक्टर को स्वतंत्र रूप से 7 घंटे तक चलाया[1][4]
- एक हाइब्रिड मॉडल, जो लगभग तुरंत जवाब दे सकता है या एक्सटेंडेड थिंकिंग कर सकता है, जो अब सोचते समय वेब सर्च जैसे टूल कॉल कर सकता है; यह टूल्स को पैरेलल में चलाता है और लोकल फ़ाइल एक्सेस मिलने पर 'मेमोरी फ़ाइलें' रखता है[1]
- एजेंटिक टास्क में जो शॉर्टकट या लूपहोल के शिकार होते हैं, उनमें Claude Sonnet 3.7 की तुलना में 65% कम संभावना कि यह शॉर्टकट या लूपहोल अपनाए[1][5]
बेंचमार्क[1]
| बेंचमार्क | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (एजेंटिक कोडिंग) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (एजेंटिक टर्मिनल कोडिंग) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (ग्रेजुएट-स्तर रीज़निंग) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (एजेंटिक टूल यूज़) | रिटेल 81.4%, एयरलाइन 59.6% | रिटेल 80.5%, एयरलाइन 60.0% | रिटेल 81.2%, एयरलाइन 58.4% | रिटेल 70.4%, एयरलाइन 52.0% | रिटेल 68.0%, एयरलाइन 49.4% | — |
| MMMLU³ (बहुभाषी Q&A) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validation (विज़ुअल रीज़निंग) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (हाई स्कूल गणित प्रतियोगिता) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 और Sonnet 4 का स्कोर bash/editor टूल्स के साथ pass@1 पर 72.5% और 72.7% है, 10 ट्रायल पर औसत। ² नॉन-Claude मॉडलों जैसे ही एजेंट के साथ 39.2% और 33.5%; एजेंट फ़्रेमवर्क के तौर पर Claude Code के साथ 43.2% और 35.5%। ³ 14 नॉन-इंग्लिश भाषाओं पर औसत। ⁴ nucleus sampling के साथ, top_p 0.95 पर चलाया गया। ⁵ दूसरा आँकड़ा पैरेलल टेस्ट-टाइम कंप्यूट का इस्तेमाल करता है, कई प्रयासों को सैंपल करके एक इंटरनल स्कोरिंग मॉडल से सबसे बेहतर चुनता है।
संदर्भ 690% कॉन्फ़िडेंसकुल भरोसा: 90%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 6 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/claude-4anthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 22 मई 2025 ✓· स्कोर का 29%
Anthropic[2][6] की पोस्ट पर तारीख़ 'May 22, 2025' दी गई है: 'आज, हम Claude[3] मॉडलों की अगली पीढ़ी पेश कर रहे हैं: Claude Opus 4 और Claude Sonnet 4', 'हमारे API, Amazon Bedrock, और Google Cloud के Vertex AI पर उपलब्ध'; CNBC[4] और TechCrunch[5] उस लॉन्च की खबर उसी गुरुवार को देते हैं।
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 29%
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 29%
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· 22 मई 2025 को प्रकाशित· शुरुआत 22 मई 2025· स्कोर का 4%
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· 22 मई 2025 को प्रकाशित· शुरुआत 22 मई 2025· स्कोर का 4%
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।