- शुरुआत
- 24 फ़र॰ 202590% कॉन्फ़िडेंससोर्स से
Anthropic ने Claude 3.7 Sonnet रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude 3.7 Sonnet Released
- Anthropic ने Claude 3.7 Sonnet को "आज तक हमारा सबसे बुद्धिमान मॉडल और बाज़ार का पहला हाइब्रिड रीज़निंग मॉडल" कहा: एक ऐसा मॉडल जो लगभग तुरंत जवाब देता है या "एक्सटेंडेड, स्टेप-बाय-स्टेप थिंकिंग करता है जो यूज़र को दिखाई देती है"[1][4]
- यह हर Claude प्लान पर आया - Free, Pro, Team और Enterprise - और Claude Developer Platform, Amazon Bedrock और Google Cloud के Vertex AI पर; एक्सटेंडेड थिंकिंग फ़्री टियर को छोड़कर हर जगह मौजूद है[1][4]
- Claude Code, Anthropic का पहला एजेंटिक कोडिंग टूल, इसके साथ एक सीमित रिसर्च प्रीव्यू के तौर पर लॉन्च हुआ जो टर्मिनल से काम करता है, और GitHub इंटीग्रेशन हर Claude प्लान पर आया[1]
- यह अपने पूर्ववर्ती की तुलना में ज़रूरत से ज़्यादा मनाही को 45% कम करता है और इसे ASL-2 स्टैंडर्ड के तहत रिलीज़ किया गया[1][2]
- वर्ज़न 3.5 से सीधे 3.7 पर पहुँच गया, और फ़रवरी 2025 में Claude 3.7 Sonnet ने Twitch पर लाइव Pokémon Red खेलना शुरू किया[3][4]
प्रमुख विशेषताएँ
- दोनों मोड में $3 प्रति मिलियन इनपुट टोकन और $15 प्रति मिलियन आउटपुट टोकन, थिंकिंग टोकन शामिल[1][4]
- API यूज़र्स 128K-टोकन आउटपुट लिमिट तक किसी भी साइज़ का थिंकिंग बजट सेट कर सकते हैं, स्पीड और कीमत की जगह क्वालिटी लेते हुए[1]
- Anthropic के चार्ट SWE-bench Verified पर 62.3% (कस्टम स्कैफ़ोल्ड के साथ 70.3%) दिखाते हैं, जबकि अपग्रेड किए गए 3.5 Sonnet का 49.0% था, और TAU-bench पर 81.2% (रिटेल) और 58.4% (एयरलाइन)[1]
- Anthropic कहता है कि उसने मैथ्स और कोडिंग कॉम्पिटिशन के लिए कम और रीयल-वर्ल्ड बिज़नेस टास्क के लिए ज़्यादा ऑप्टिमाइज़ किया[1]
- स्टैंडर्ड मोड में यह एक अपग्रेड किया गया Claude 3.5 Sonnet है; एक्सटेंडेड थिंकिंग मोड में यह जवाब देने से पहले सोचता है, जो मैथ्स, फ़िज़िक्स, इंस्ट्रक्शन फ़ॉलोइंग और कोडिंग में मदद करता है[1]
बेंचमार्क[1]
| बेंचमार्क | Claude 3.7 Sonnet (64K extended thinking) | Claude 3.7 Sonnet (no extended thinking) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K extended thinking) | Grok 3 Beta (extended thinking) |
|---|---|---|---|---|---|---|---|
| ग्रेजुएट-स्तर रीज़निंग (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| एजेंटिक कोडिंग (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| एजेंटिक टूल यूज़ (TAU-bench), रिटेल | — | 81.2% | 71.5% | 73.5% | — | — | — |
| एजेंटिक टूल यूज़ (TAU-bench), एयरलाइन | — | 58.4% | 48.8% | 54.2% | — | — | — |
| बहुभाषी Q&A (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| विज़ुअल रीज़निंग (MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| इंस्ट्रक्शन-फ़ॉलोइंग (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| गणित समस्या-समाधान (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| हाई स्कूल गणित प्रतियोगिता (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1, कई ट्रायल पर औसत (AIME और SWE-bench Verified के लिए 16 तक); दूसरा आँकड़ा पैरेलल टेस्ट-टाइम कंप्यूट से फ़ायदा उठाता है। ¹ o1 के TAU-bench नतीजे OpenAI ने बताए थे और बाद में डिलीट कर दिए; TAU-bench के नतीजे तुलनीय नहीं हो सकते। ² 62.3%, bash/editor टूल्स के साथ 500 समस्याओं पर pass@1 है, साथ ही एक "थिंकिंग टूल"; 70.3%, इंटरनल स्कोरिंग और एक घटे हुए सबसेट पर कस्टम स्कैफ़ोल्ड का इस्तेमाल करता है; DeepSeek R1, Agentless फ़्रेमवर्क इस्तेमाल करता है। ³ Claude 3.7 Sonnet के ज़्यादा GPQA और AIME 2024 स्कोर पैरेलल टेस्ट-टाइम कंप्यूट के साथ इंटरनल स्कोरिंग इस्तेमाल करते हैं; o1 और Grok 3 के स्कोर 64 सैंपल के साथ मेजॉरिटी वोटिंग इस्तेमाल करते हैं।
संदर्भ 485% कॉन्फ़िडेंसकुल भरोसा: 85%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 4 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 24 फ़र॰ 2025 ✓· स्कोर का 32%
पोस्ट पर तारीख़ 'Feb 24, 2025' दी गई है: 'आज, हम Claude 3.7 Sonnet की घोषणा कर रहे हैं' और यह 'अब सभी Claude प्लान पर उपलब्ध है'; TechCrunch[4] कहता है कि यह 'सोमवार (24 फ़रवरी) को सभी यूज़र्स और डेवलपर्स के लिए रोलआउट हो रहा है'।
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 32%
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 32%
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· 24 फ़र॰ 2025 को प्रकाशित· शुरुआत 24 फ़र॰ 2025· स्कोर का 3%
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।