- शुरुआत
- 17 फ़र॰ 202690% कॉन्फ़िडेंससोर्स से
Anthropic ने Claude Sonnet 4.6 रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude Sonnet 4.6 Released
- "Claude Sonnet 4.6 अब तक का हमारा सबसे सक्षम Sonnet मॉडल है", कोडिंग, कंप्यूटर यूज़, लॉन्ग-कॉन्टेक्स्ट रीज़निंग, एजेंट प्लानिंग, नॉलेज वर्क और डिज़ाइन में एक पूरा अपग्रेड[1][4]
- यह Free और Pro यूज़र्स के लिए claude.ai और Claude Cowork में डिफ़ॉल्ट मॉडल बन गया, और फ़्री टियर को फ़ाइल क्रिएशन, कनेक्टर, स्किल्स और कंपैक्शन मिला; यह हर Claude प्लान, Claude Code, API और सभी बड़े क्लाउड प्लैटफ़ॉर्म पर है[1][3][4]
- Claude Code में, शुरुआती टेस्टर्स ने लगभग 70% बार इसे Sonnet 4.5 से ज़्यादा पसंद किया और यहाँ तक कि 59% बार Anthropic के नवंबर वाले फ़्लैगशिप Opus 4.5 से भी ज़्यादा, इसे ओवरइंजीनियरिंग और "आलस" की कम संभावना वाला बताते हुए[1]
- सेफ़्टी रिसर्चर्स को "व्यापक रूप से गर्मजोशी भरा, ईमानदार, समाज के लिए सकारात्मक, और कभी-कभी मज़ेदार किरदार" मिला और बड़े हाई-स्टेक्स मिसअलाइनमेंट के कोई संकेत नहीं मिले; यह Sonnet 4.5 की तुलना में प्रॉम्प्ट इंजेक्शन का कहीं बेहतर विरोध करता है और इसे ASL-3 के तहत रिलीज़ किया गया[1][5]
- CNBC ने इस लॉन्च को सॉफ़्टवेयर स्टॉक्स में आई बिकवाली से जोड़ा, जिसमें IGV सॉफ़्टवेयर ETF साल भर में 20% से ज़्यादा गिर गया[3]
प्रमुख विशेषताएँ
- कीमत Sonnet 4.5 से नहीं बदली - $3 प्रति मिलियन इनपुट टोकन और $15 प्रति मिलियन आउटपुट टोकन; 1M-टोकन कॉन्टेक्स्ट विंडो (लॉन्च पर बीटा में) और 128K मैक्स आउटपुट[1][2]
- Anthropic की टेबल: SWE-bench Verified पर 79.6%, OSWorld-Verified पर 72.5% (Sonnet 4.5: 61.4%), Terminal-Bench 2.0 पर 59.1% और BrowseComp पर 74.7%[1]
- इसका OSWorld चार्ट Sonnet लाइन को अक्टूबर 2024 के Claude 3.5 Sonnet के 14.9% से Sonnet 4.6 के 72.5% तक ट्रेस करता है[1]
- एडैप्टिव और एक्सटेंडेड थिंकिंग, साथ में बीटा में कॉन्टेक्स्ट कंपैक्शन जो बातचीत अपनी लिमिट के पास पहुँचने पर पुराने कॉन्टेक्स्ट को समराइज़ करता है[1][2]
- यह OfficeQA पर Opus 4.6 के बराबर है - Databricks का एंटरप्राइज़ चार्ट, PDF और टेबल पढ़ने का टेस्ट - और Vending-Bench Arena में इसने दस सिम्युलेटेड महीनों तक भारी निवेश किया, इससे पहले कि यह प्रॉफ़िट की तरफ़ मुड़ता[1]
बेंचमार्क[1]
| बेंचमार्क | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (all models) |
|---|---|---|---|---|---|---|
| एजेंटिक टर्मिनल कोडिंग (Terminal-Bench 2.0) | 59.1% | 51.0% | 65.4% | 59.8% | 56.2% (54.2% सेल्फ़-रिपोर्टेड) | 64.7% (64.0% सेल्फ़-रिपोर्टेड, Codex CLI) |
| एजेंटिक कोडिंग (SWE-bench Verified) | 79.6% | 77.2% | 80.8% | 80.9% | 78.0% (Flash) | 80.0% |
| एजेंटिक कंप्यूटर यूज़ (OSWorld-Verified) | 72.5% | 61.4% | 72.7% | 66.3% | — | 38.2% |
| एजेंटिक टूल यूज़ (τ2-bench), रिटेल | 91.7% | 86.2% | 91.9% | 88.9% | 85.3% | 82.0% |
| एजेंटिक टूल यूज़ (τ2-bench), टेलीकॉम | 97.9% | 98.0% | 99.3% | 98.2% | 98.0% | 98.7% |
| स्केल्ड टूल यूज़ (MCP-Atlas) | 61.3% | 43.8% | 59.5% | 62.3% | 54.1% | 60.6% |
| एजेंटिक सर्च (BrowseComp) | 74.7% | 43.9% | 84.0% | 67.8% | 59.2% (Deep Research) | 77.9% (Pro) |
| बहु-विषयक रीज़निंग (Humanity's Last Exam), टूल्स के बिना | 33.2% | 17.7% | 40.0% | 30.8% | 37.5% | 36.6% (Pro) |
| बहु-विषयक रीज़निंग (Humanity's Last Exam), टूल्स के साथ | 49.0% | 33.6% | 53.0% | 43.4% | 45.8% | 50.0% (Pro) |
| एजेंटिक फ़ाइनेंशियल एनालिसिस (Finance Agent v1.1) | 63.3% | 54.5% | 60.1% | 58.8% | 55.2% | 59.0% |
| ऑफ़िस टास्क (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| नए प्रकार की समस्या-समाधान (ARC-AGI-2) | 58.3% | 13.6% | 68.8% | 37.6% | 31.1% | 54.2% (Pro) |
| ग्रेजुएट-स्तर रीज़निंग (GPQA Diamond) | 89.9% | 83.4% | 91.3% | 87.0% | 91.9% | 93.2% (Pro) |
| विज़ुअल रीज़निंग (MMMU-Pro), टूल्स के बिना | 74.5% | 63.4% | 73.9% | 70.6% | 81.0% | 79.5% |
| विज़ुअल रीज़निंग (MMMU-Pro), टूल्स के साथ | 75.6% | 68.9% | 77.3% | 73.9% | — | 80.4% |
| बहुभाषी Q&A (MMMLU) | 89.3% | 89.5% | 91.1% | 90.8% | 91.8% | 89.6% |
संदर्भ 588% कॉन्फ़िडेंसकुल भरोसा: 88%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 5 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 17 फ़र॰ 2026 ✓· स्कोर का 31%
पोस्ट पर तारीख़ 'Feb 17, 2026' दी गई है और लिखा है 'Claude[2] Sonnet 4.6 अब सभी Claude प्लान, Claude Cowork, Claude Code, हमारे API, और सभी बड़े क्लाउड प्लैटफ़ॉर्म पर उपलब्ध है'; डॉक्स के मॉडल पेज पर 'Released February 17, 2026' लिखा है और CNBC[3] ने उसी दिन यह रिपोर्ट किया।
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 31%
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· 17 फ़र॰ 2026 को प्रकाशित· शुरुआत 17 फ़र॰ 2026· स्कोर का 13%
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· 17 फ़र॰ 2026 को प्रकाशित· शुरुआत 17 फ़र॰ 2026· स्कोर का 13%
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· 17 फ़र॰ 2026 को प्रकाशित· स्कोर का 13%
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।