- शुरुआत
- 22 अक्टू॰ 202490% कॉन्फ़िडेंससोर्स से
Anthropic ने Claude 3.5 Sonnet का अपग्रेड रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude 3.5 Sonnet Upgrade Released
- Anthropic ने "एक अपग्रेड किए गए Claude 3.5 Sonnet" की घोषणा की, जिसमें "अपने पूर्ववर्ती की तुलना में हर मोर्चे पर सुधार, खासकर कोडिंग में बड़ी बढ़त" थी, जो उसी दिन सभी यूज़र्स के लिए उपलब्ध था, साथ ही नया Claude 3.5 Haiku महीने के बाद के लिए[1]
- कंप्यूटर यूज़ पब्लिक बीटा में आया: Claude स्क्रीन देखता है, कर्सर घुमाता है, बटन क्लिक करता है और टाइप करता है, और Anthropic 3.5 Sonnet को "पब्लिक बीटा में कंप्यूटर यूज़ देने वाला पहला फ्रंटियर AI मॉडल" कहता है - "अभी भी एक्सपेरिमेंटल—कभी-कभी बोझिल और गलती करने वाला"[1][4]
- कर्सर को नियंत्रित करने के लिए Claude हर स्क्रीनशॉट पर यह गिनता है कि उसे कितने पिक्सल हिलाने हैं; Anthropic ने यह स्किल कैलकुलेटर और टेक्स्ट एडिटर जैसे सिंपल सॉफ़्टवेयर पर ट्रेन की[3]
- डेवलपर्स उसी दिन इसे Anthropic API, Amazon Bedrock और Google Cloud के Vertex AI पर इस्तेमाल कर सकते थे; Asana, Canva, Cognition, DoorDash, Replit और The Browser Company शुरुआती यूज़र थे, और Amazon को शुरुआती एक्सेस मिला था[1][5]
- US और UK के AI Safety Institutes ने रिलीज़ से पहले इसे साथ मिलकर टेस्ट किया; Anthropic ने इसे ASL-2 पर रखा और ऐसे क्लासिफ़ायर जोड़े जो कंप्यूटर यूज़ और नुकसान होने की पहचान करते हैं[1]
प्रमुख विशेषताएँ
- जून वाले 3.5 Sonnet जैसी ही कीमत और स्पीड[1]
- SWE-bench Verified 33.4% से 49.0% तक बढ़ता है, जो OpenAI के o1-preview समेत हर पब्लिक रूप से उपलब्ध मॉडल से ऊपर है[1]
- TAU-bench एजेंटिक टूल यूज़ रिटेल में 62.6% से 69.2% और एयरलाइन डोमेन में 36.0% से 46.0% तक बढ़ता है[1]
- OSWorld पर इसने सिर्फ़ स्क्रीनशॉट्स से 14.9% स्कोर किया, जबकि अगले सबसे बेहतर सिस्टम का 7.8% था, और ज़्यादा स्टेप्स की छूट मिलने पर 22.0%[1][2]
- स्क्रॉलिंग, ड्रैगिंग और ज़ूमिंग अभी भी इसके लिए मुश्किल थे, और Anthropic ने कम जोखिम वाले कामों से शुरू करने की सलाह दी[1]
बेंचमार्क[1]
| बेंचमार्क | Claude 3.5 Sonnet (new) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| ग्रेजुएट-स्तर रीज़निंग (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| अंडरग्रेजुएट-स्तर का नॉलेज (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| कोड (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| गणित समस्या-समाधान (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| हाई स्कूल गणित प्रतियोगिता (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| विज़ुअल Q/A (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| एजेंटिक कोडिंग (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| एजेंटिक टूल यूज़ (TAU-bench), रिटेल | 69.2% | 51.0% | 62.6% | — | — | — | — |
| एजेंटिक टूल यूज़ (TAU-bench), एयरलाइन | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Anthropic की इवैल्यूएशन टेबल OpenAI के o1 मॉडल फ़ैमिली को शामिल नहीं करती, क्योंकि वे सामान्य मॉडलों के विपरीत, जवाब देने से पहले बड़े पैमाने पर कंप्यूटेशन टाइम पर निर्भर करते हैं।
संदर्भ 590% कॉन्फ़िडेंसकुल भरोसा: 90%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 5 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 22 अक्टू॰ 2024 ✓· स्कोर का 46%
पोस्ट पर तारीख़ 'Oct 22, 2024' दी गई है और लिखा है 'अपग्रेड किया गया Claude 3.5 Sonnet अब सभी यूज़र्स के लिए उपलब्ध है। आज से, डेवलपर्स कंप्यूटर यूज़ बीटा के साथ बना सकते हैं'; TechCrunch[4] और CNBC[5] उसी दिन 'मंगलवार को' रिलीज़ की खबर देते हैं।
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 46%
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· 22 अक्टू॰ 2024 को प्रकाशित· स्कोर का 3%
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· 22 अक्टू॰ 2024 को प्रकाशित· शुरुआत 22 अक्टू॰ 2024· स्कोर का 3%
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· 22 अक्टू॰ 2024 को प्रकाशित· शुरुआत 22 अक्टू॰ 2024· स्कोर का 3%
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।