- शुरुआत
- 20 जून 202492% कॉन्फ़िडेंसtechcrunch.com से
Anthropic ने Claude 3.5 Sonnet रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude 3.5 Sonnet Released
- "आज, हम Claude 3.5 Sonnet लॉन्च कर रहे हैं—आने वाली Claude 3.5 मॉडल फ़ैमिली में हमारी पहली रिलीज़", जो Claude 3 Opus को "हमारे मिड-टियर मॉडल, Claude 3 Sonnet की स्पीड और कीमत" पर पीछे छोड़ता है[1][4]
- Claude.ai और Claude iOS ऐप पर फ़्री, Pro और Team सब्सक्राइबर्स के लिए ज़्यादा रेट लिमिट के साथ, और उसी दिन Anthropic API, Amazon Bedrock और Google Cloud के Vertex AI पर उपलब्ध[1][5]
- यह Artifacts के साथ लॉन्च हुआ, बातचीत के बगल में एक विंडो जहाँ कोड, डॉक्यूमेंट और वेबसाइट डिज़ाइन दिखते हैं, ताकि यूज़र्स इन्हें रीयल टाइम में देख, एडिट और आगे बना सकें[1][3]
- यह ASL-2 पर बना रहा; Anthropic ने इसे प्री-डिप्लॉयमेंट टेस्टिंग के लिए UK AI Safety Institute को दिया, जिसने नतीजे US AI Safety Institute के साथ शेयर किए[1]
- Anthropic ने कहा कि वह 2024 में बाद में Claude 3.5 Haiku और Claude 3.5 Opus के साथ इस फ़ैमिली को पूरा करेगा[1]
प्रमुख विशेषताएँ
- कीमत $3 प्रति मिलियन इनपुट टोकन और $15 प्रति मिलियन आउटपुट टोकन, 200K-टोकन कॉन्टेक्स्ट विंडो के साथ; AWS इसे Claude 3 Opus से 80 प्रतिशत सस्ता बताता है[1][5]
- Claude 3 Opus से दोगुनी स्पीड पर चलता है[1][4]
- Anthropic का मॉडल कार्ड: GPQA Diamond पर 59.4%, MMLU पर 88.7%, HumanEval पर 92.0% और MATH पर 71.1%, जबकि Claude 3 Opus के 50.4%, 86.8%, 84.9% और 60.1% थे[2]
- इसने एक इंटरनल एजेंटिक कोडिंग इवैल्यूएशन में 64% समस्याएँ हल कीं - किसी ओपन-सोर्स कोडबेस में बग ठीक करना या फ़ीचर जोड़ना - जबकि Claude 3 Opus के लिए यह 38% था[1][2]
- Anthropic का अब तक का सबसे मज़बूत विज़न मॉडल: चार्ट और ग्राफ़ पढ़ने और खराब क्वालिटी वाली इमेज से टेक्स्ट ट्रांसक्राइब करने में बेहतर, MMMU पर 68.3% स्कोर के साथ[1][2]
बेंचमार्क[1]
| बेंचमार्क | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| ग्रेजुएट-स्तर रीज़निंग (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| अंडरग्रेजुएट-स्तर का नॉलेज (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| अंडरग्रेजुएट-स्तर का नॉलेज (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| कोड (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| बहुभाषी गणित (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| टेक्स्ट पर रीज़निंग (DROP, F1 स्कोर) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (variable shots) | 83.5 (3-shot, pre-trained model) |
| मिश्रित इवैल्यूएशन (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, pre-trained model) |
| गणित समस्या-समाधान (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| ग्रेड स्कूल गणित (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet, maj@32 के साथ 5-shot CoT GPQA पर 67.2% स्कोर करता है। ** Claude 3.5 Sonnet, 5-shot CoT प्रॉम्प्टिंग के साथ MMLU पर 90.4% स्कोर करता है।
संदर्भ 585% कॉन्फ़िडेंसकुल भरोसा: 85%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 5 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 20 जून 2024· स्कोर का 32%
Anthropic[2]: 'आज, हम Claude 3.5 Sonnet लॉन्च कर रहे हैं' और यह 'अब Claude.ai पर फ़्री उपलब्ध है'; पेज हेडर अब Jun 21, 2024 दिखाता है, लेकिन TechCrunch[4] और AWS दोनों ने यह लॉन्च 20 जून 2024 को पब्लिश किया था, और मॉडल ID claude-3-5-sonnet-20240620 है।
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 32%
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 32%
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· 20 जून 2024 को प्रकाशित· शुरुआत 20 जून 2024 ✓· स्कोर का 1%
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· 20 जून 2024 को प्रकाशित· शुरुआत 20 जून 2024· स्कोर का 1%
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।