- शुरुआत
- 29 सित॰ 202590% कॉन्फ़िडेंससोर्स से
Anthropic ने Claude Sonnet 4.5 रिलीज़ किया
मूल भाषा से अपने आप अनुवादित
मूल शीर्षक: Claude Sonnet 4.5 Released
- Anthropic ने इसे कहा "दुनिया का सबसे बेहतरीन कोडिंग मॉडल। यह जटिल एजेंट बनाने के लिए सबसे मज़बूत मॉडल है। यह कंप्यूटर इस्तेमाल करने में सबसे बेहतरीन मॉडल है"[1][4]
- "आज हर जगह उपलब्ध", Claude API पर claude-sonnet-4-5 के तौर पर और Claude ऐप्स में; Mike Krieger ने कहा कि यह डिफ़ॉल्ट होगा और उन्होंने इसे "लगभग हर इस्तेमाल के मामले" के लिए रिकमेंड किया[1][5]
- यह Claude Code चेकपॉइंट और एक नेटिव VS Code एक्सटेंशन, API पर एक कॉन्टेक्स्ट एडिटिंग फ़ीचर और मेमोरी टूल, Claude ऐप्स में कोड एक्ज़ीक्यूशन और फ़ाइल क्रिएशन, और Claude Agent SDK - Claude Code के पीछे का इंफ़्रास्ट्रक्चर - के साथ आया[1][4]
- "यह अब तक का सबसे अलाइन्ड फ्रंटियर मॉडल है जो हमने रिलीज़ किया है", कम सिकोफ़ैंसी और डिसेप्शन दरों के साथ, AI Safety Level 3 (ASL-3) प्रोटेक्शन के तहत रिलीज़ किया गया[1][3][4]
- यह Claude Opus 4.1 के दो महीने से भी कम समय बाद आया, जब Anthropic की वैल्यूएशन $183 बिलियन थी[4][5]
प्रमुख विशेषताएँ
- $3 प्रति मिलियन इनपुट टोकन और $15 प्रति मिलियन आउटपुट टोकन, Sonnet 4 जैसी ही; 200K-टोकन कॉन्टेक्स्ट विंडो, 64K मैक्स आउटपुट और जनवरी 2025 का भरोसेमंद नॉलेज कटऑफ़[1][2]
- SWE-bench Verified पर 77.2%, बिना टेस्ट-टाइम कंप्यूट के 10 ट्रायल पर औसत, और पैरेलल टेस्ट-टाइम कंप्यूट के साथ 82.0%[1]
- यह OSWorld कंप्यूटर यूज़ पर 61.4% के साथ आगे है, जहाँ चार महीने पहले Sonnet 4, 42.2% के साथ आगे था[1]
- Anthropic ने देखा कि यह जटिल मल्टी-स्टेप टास्क पर 30 घंटे से ज़्यादा फ़ोकस बनाए रखता है; CNBC बताता है कि Opus 4 सात घंटे तक कर पाया था[1][5]
- फ़ाइनेंस, लॉ, मेडिसिन और STEM के एक्सपर्ट्स ने पाया कि इसका डोमेन नॉलेज और रीज़निंग पुराने मॉडलों से - Opus 4.1 समेत - काफ़ी आगे है[1]
बेंचमार्क[1]
| बेंचमार्क | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| एजेंटिक कोडिंग (SWE-bench Verified) | 77.2% / 82.0% पैरेलल टेस्ट-टाइम कंप्यूट के साथ | 74.5% / 79.4% पैरेलल टेस्ट-टाइम कंप्यूट के साथ | 72.7% / 80.2% पैरेलल टेस्ट-टाइम कंप्यूट के साथ | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| एजेंटिक टर्मिनल कोडिंग (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| एजेंटिक टूल यूज़ (τ2-bench), रिटेल | 86.2% | 86.8% | 83.8% | 81.1% | — |
| एजेंटिक टूल यूज़ (τ2-bench), एयरलाइन | 70.0% | 63.0% | 63.0% | 62.6% | — |
| एजेंटिक टूल यूज़ (τ2-bench), टेलीकॉम | 98.0% | 71.5% | 49.6% | 96.7% | — |
| कंप्यूटर यूज़ (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| हाई स्कूल गणित प्रतियोगिता (AIME 2025) | 100% (python) / 87.0% (टूल्स के बिना) | 78.0% | 70.5% | 99.6% (python) / 94.6% (टूल्स के बिना) | 88.0% |
| ग्रेजुएट-स्तर रीज़निंग (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| बहुभाषी Q&A (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| विज़ुअल रीज़निंग (MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| फ़ाइनेंशियल एनालिसिस (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
संदर्भ 589% कॉन्फ़िडेंसकुल भरोसा: 89%पिन का स्रोत और संदर्भ उसकी तारीखों की कितनी पुष्टि करते हैं।सोर्स सहित 5 संदर्भ पिन के शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करते हैं, इसका भारित औसत; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है75% या उससे बेहतर कॉन्फ़िडेंस वाले सभी पिन दिखाएं
पहली एंट्री हमेशा पिन का सोर्स होती है। कुल कॉन्फ़िडेंस एक भारित औसत है कि हर संदर्भ ऊपर इस्तेमाल किए गए शुरू और खत्म होने के समय का कितनी मज़बूती से समर्थन करता है; सबसे नए संदर्भ से हर 180 दिन पुराना होने पर किसी संदर्भ की गिनती आधी हो जाती है।
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· 28 सित॰ 2026 को पोस्ट किया गया· शुरुआत 29 सित॰ 2025 ✓· स्कोर का 29%
पोस्ट पर तारीख़ 'Sep 29, 2025' दी गई है और लिखा है 'Claude[2] Sonnet 4.5 आज हर जगह उपलब्ध है'; डॉक्स के मॉडल पेज पर 'Released September 29, 2025' लिखा है और TechCrunch[4] इस लॉन्च की खबर 'सोमवार को' देता है।
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 29%
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· 28 सित॰ 2026 को जोड़ा गया· स्कोर का 29%
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· 29 सित॰ 2025 को प्रकाशित· शुरुआत 29 सित॰ 2025· स्कोर का 7%
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· 29 सित॰ 2025 को प्रकाशित· शुरुआत 29 सित॰ 2025· स्कोर का 7%
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
सुधार सुझाएं
कुछ छूट गया या गलत है? अपने शब्दों में बताएं: कोई लिंक जो इस पिन का समर्थन करता हो, कोई अलग शुरुआत या खत्म होने की तारीख और उसकी वजह, या कोई तथ्य जो छूट गया हो या गलत हो। AI इसे इस पिन के सोर्स से मिलाकर जांचता है, बेहतर सोर्स खोजता है, और जो भी पेज आपकी बात का समर्थन करता है उसे जोड़ देता है। पिन के अपने सोर्स की अहमियत फिर भी सबसे ज़्यादा रहती है। AI तस्वीरें भी देखता है: जो तस्वीर कुछ और दिखाती हो या ठीक से न दिखाती हो, उसे नीचे कर दिया जाता है या बदल दिया जाता है।