- البدء
- 24 فبراير 2025ثقة 90%من المصدر
إطلاق Claude 3.7 Sonnet
تُرجم تلقائيًا من الأصل
العنوان الأصلي: Claude 3.7 Sonnet Released
- وصفت Anthropic نموذج Claude 3.7 Sonnet بأنه «أذكى نماذجنا حتى الآن وأول نموذج استدلال هجين في السوق»: نموذج واحد يقدم إجابات شبه فورية أو «تفكيراً ممتداً خطوة بخطوة يظهر للمستخدم»[1][4]
- طُرح لكل خطط Claude، وهي Free وPro وTeam وEnterprise، ولمنصة Claude للمطورين وAmazon Bedrock وVertex AI من Google Cloud؛ والتفكير الممتد متاح في كل المنصات عدا الخطة المجانية[1][4]
- أُطلق معه Claude Code، أول أداة برمجة وكيلية من Anthropic، كمعاينة بحثية محدودة تعمل من الطرفية، ووصل تكامل GitHub إلى كل خطط Claude[1]
- يقلل الرفض غير الضروري بنسبة 45% مقارنة بسابقه، وصدر بموجب معيار ASL-2[1][2]
- قفز رقم الإصدار من 3.5 إلى 3.7، وفي فبراير 2025 بدأ Claude 3.7 Sonnet لعب Pokémon Red مباشرة على Twitch[3][4]
أبرز الميزات
- $3 لكل مليون رمز إدخال و$15 لكل مليون رمز إخراج في الوضعين، مع احتساب رموز التفكير[1][4]
- يحدد مستخدمو الواجهة البرمجية ميزانية تفكير بأي حجم حتى حد الإخراج البالغ 128 ألف رمز، مقايضةً بين السرعة والتكلفة والجودة[1]
- تعرض رسوم Anthropic البيانية نتيجة 62.3% في SWE-bench Verified (و70.3% مع هيكل مخصص) مقابل 49.0% لـ 3.5 Sonnet المطور، و81.2% (التجزئة) و58.4% (الطيران) في TAU-bench[1]
- تقول Anthropic إنها حسّنته بدرجة أقل لمسابقات الرياضيات والبرمجة وبدرجة أكبر لمهام الأعمال الواقعية[1]
- في الوضع العادي هو Claude 3.5 Sonnet مطور؛ وفي وضع التفكير الممتد يتأمل قبل الإجابة، ما يفيد في الرياضيات والفيزياء واتباع التعليمات والبرمجة[1]
نتائج الاختبارات[1]
| الاختبار | Claude 3.7 Sonnet (تفكير ممتد 64 ألفاً) | Claude 3.7 Sonnet (دون تفكير ممتد) | Claude 3.5 Sonnet (الجديد) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (تفكير ممتد 32 ألفاً) | Grok 3 Beta (تفكير ممتد) |
|---|---|---|---|---|---|---|---|
| الاستدلال على مستوى الدراسات العليا (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| البرمجة الوكيلية (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| استخدام الأدوات الوكيلي (TAU-bench)، التجزئة | — | 81.2% | 71.5% | 73.5% | — | — | — |
| استخدام الأدوات الوكيلي (TAU-bench)، الطيران | — | 58.4% | 48.8% | 54.2% | — | — | — |
| أسئلة وأجوبة متعددة اللغات (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| الاستدلال البصري (MMMU، مجموعة التحقق) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| اتباع التعليمات (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| حل المسائل الرياضية (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| مسابقة رياضيات للمرحلة الثانوية (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 بمتوسط عدة محاولات (حتى 16 لاختبارَي AIME وSWE-bench Verified)؛ وتستفيد النتيجة الثانية من حوسبة متوازية وقت الاختبار. ¹ نتائج o1 في TAU-bench نشرتها OpenAI ثم حذفتها لاحقاً؛ وقد لا تكون نتائج TAU-bench قابلة للمقارنة. ² 62.3% هي pass@1 على 500 مسألة مع أدوات bash والمحرر بالإضافة إلى «أداة تفكير»؛ أما 70.3% فتعتمد تسجيلاً داخلياً وهيكلاً مخصصاً على مجموعة فرعية مخفضة؛ ويستخدم DeepSeek R1 إطار Agentless. ³ تعتمد نتائج GPQA وAIME 2024 العالية لـ Claude 3.7 Sonnet تسجيلاً داخلياً مع حوسبة متوازية وقت الاختبار؛ أما نتائج o1 وGrok 3 فتعتمد التصويت بالأغلبية على 64 عينة.
المراجع 4ثقة 85%الثقة الإجمالية: 85%مدى دعم مصدر الدبوس ومراجعه لتواريخه.متوسط مرجّح لمدى قوة دعم 4 مراجع، بما فيها المصدر، لوقتَي بدء الدبوس وانتهائه؛ ويقل وزن المرجع إلى النصف عن كل 180 يومًا يسبق بها أحدث مرجععرض كل الدبابيس بثقة 75% أو أعلى
المدخل الأول هو دائمًا مصدر الدبوس. الثقة الإجمالية متوسط مرجّح لمدى قوة دعم كل مرجع لوقتَي البدء والانتهاء المستخدمين أعلاه؛ ويقل وزن المرجع إلى النصف عن كل 180 يومًا يسبق بها أحدث مرجع.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· نُشر 28 سبتمبر 2026· يبدأ 24 فبراير 2025 ✓· 32% من الدرجة
المنشور مؤرخ «24 فبراير 2025»: «نعلن اليوم عن Claude 3.7 Sonnet» وهو «متاح الآن في جميع خطط Claude»؛ وتقول TechCrunch[4] إنه «يُطرح للمستخدمين والمطورين يوم الاثنين» (24 فبراير).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· أُضيف 28 سبتمبر 2026· 32% من الدرجة
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· أُضيف 28 سبتمبر 2026· 32% من الدرجة
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· صدر 24 فبراير 2025· يبدأ 24 فبراير 2025· 3% من الدرجة
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
اقتراح تصحيح
هل ينقص شيء أو يوجد خطأ؟ قله بكلماتك: رابط يدعم هذا الدبوس، أو تاريخ بدء أو انتهاء مختلف مع السبب، أو معلومة ينقصها أو يخطئ فيها. يفحص الذكاء الاصطناعي ذلك بمقارنته بمصادر هذا الدبوس، ويبحث عن مصادر أفضل، ويضيف أي صفحة تدعم كلامك. وتبقى مصادر الدبوس نفسه الأثقل وزنًا. كما تُفحص الصورة التي تُظهر شيئًا آخر أو تُظهره بشكل سيئ، فتُنزَّل أو تُستبدل.