- البدء
- 20 يونيو 2024ثقة 92%من techcrunch.com
إطلاق Claude 3.5 Sonnet
تُرجم تلقائيًا من الأصل
العنوان الأصلي: Claude 3.5 Sonnet Released
- «نطلق اليوم Claude 3.5 Sonnet، أول إصدار في عائلة نماذج Claude 3.5 المرتقبة»، وهو يتفوق على Claude 3 Opus «بسرعة وتكلفة نموذجنا المتوسط Claude 3 Sonnet»[1][4]
- متاح مجاناً على Claude.ai وتطبيق Claude لنظام iOS، مع حدود استخدام أعلى لمشتركي Pro وTeam، ومتاح في اليوم نفسه عبر واجهة Anthropic البرمجية وAmazon Bedrock وVertex AI من Google Cloud[1][5]
- أُطلق النموذج مع Artifacts، وهي نافذة بجانب المحادثة تظهر فيها الشيفرات والمستندات وتصاميم المواقع ليتمكن المستخدمون من رؤيتها وتعديلها والبناء عليها في الوقت الفعلي[1][3]
- بقي النموذج عند مستوى ASL-2؛ وسلّمته Anthropic إلى معهد سلامة الذكاء الاصطناعي في المملكة المتحدة لاختباره قبل الإطلاق، وشارك المعهد النتائج مع نظيره الأمريكي[1]
- قالت Anthropic إنها ستستكمل العائلة بنموذجَي Claude 3.5 Haiku وClaude 3.5 Opus في وقت لاحق من 2024[1]
أبرز الميزات
- سعره $3 لكل مليون رمز إدخال و$15 لكل مليون رمز إخراج، مع نافذة سياق من 200 ألف رمز؛ وتصفه AWS بأنه أرخص بنسبة 80 في المئة من Claude 3 Opus[1][5]
- يعمل بضعف سرعة Claude 3 Opus[1][4]
- بحسب بطاقة النموذج من Anthropic: 59.4% في GPQA Diamond و88.7% في MMLU و92.0% في HumanEval و71.1% في MATH، مقابل 50.4% و86.8% و84.9% و60.1% لـ Claude 3 Opus[2]
- حلّ 64% من المسائل في تقييم داخلي للبرمجة الوكيلية، وهو إصلاح خلل أو إضافة ميزة في قاعدة شيفرة مفتوحة المصدر، مقابل 38% لـ Claude 3 Opus[1][2]
- أقوى نموذج رؤية لدى Anthropic حتى الآن: أفضل في قراءة المخططات والرسوم البيانية ونسخ النصوص من الصور غير الواضحة، ويسجل 68.3% في MMMU[1][2]
نتائج الاختبارات[1]
| الاختبار | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (نسخة أولية) |
|---|---|---|---|---|---|
| الاستدلال على مستوى الدراسات العليا (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| المعرفة على مستوى البكالوريوس (MMLU)، 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| المعرفة على مستوى البكالوريوس (MMLU)، 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| البرمجة (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| الرياضيات متعددة اللغات (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| الاستدلال على النصوص (DROP، مقياس F1) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (عدد أمثلة متغير) | 83.5 (3-shot، نموذج مدرَّب مسبقاً) |
| تقييمات مختلطة (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT، نموذج مدرَّب مسبقاً) |
| حل المسائل الرياضية (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| رياضيات المرحلة الابتدائية (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* يسجل Claude 3.5 Sonnet نسبة 67.2% في GPQA بأسلوب 5-shot CoT مع maj@32. ** يسجل Claude 3.5 Sonnet نسبة 90.4% في MMLU باستخدام أسلوب 5-shot CoT.
المراجع 5ثقة 85%الثقة الإجمالية: 85%مدى دعم مصدر الدبوس ومراجعه لتواريخه.متوسط مرجّح لمدى قوة دعم 5 مراجع، بما فيها المصدر، لوقتَي بدء الدبوس وانتهائه؛ ويقل وزن المرجع إلى النصف عن كل 180 يومًا يسبق بها أحدث مرجععرض كل الدبابيس بثقة 75% أو أعلى
المدخل الأول هو دائمًا مصدر الدبوس. الثقة الإجمالية متوسط مرجّح لمدى قوة دعم كل مرجع لوقتَي البدء والانتهاء المستخدمين أعلاه؛ ويقل وزن المرجع إلى النصف عن كل 180 يومًا يسبق بها أحدث مرجع.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· نُشر 28 سبتمبر 2026· يبدأ 20 يونيو 2024· 32% من الدرجة
قالت Anthropic[2]: «نطلق اليوم Claude 3.5 Sonnet» وإنه «متاح الآن مجاناً على Claude.ai»؛ وتعرض ترويسة الصفحة حالياً تاريخ 21 يونيو 2024، لكن TechCrunch[4] وAWS نشرتا خبر الإطلاق في 20 يونيو 2024، ومعرّف النموذج هو claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· أُضيف 28 سبتمبر 2026· 32% من الدرجة
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· أُضيف 28 سبتمبر 2026· 32% من الدرجة
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· صدر 20 يونيو 2024· يبدأ 20 يونيو 2024 ✓· 1% من الدرجة
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· صدر 20 يونيو 2024· يبدأ 20 يونيو 2024· 1% من الدرجة
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
اقتراح تصحيح
هل ينقص شيء أو يوجد خطأ؟ قله بكلماتك: رابط يدعم هذا الدبوس، أو تاريخ بدء أو انتهاء مختلف مع السبب، أو معلومة ينقصها أو يخطئ فيها. يفحص الذكاء الاصطناعي ذلك بمقارنته بمصادر هذا الدبوس، ويبحث عن مصادر أفضل، ويضيف أي صفحة تدعم كلامك. وتبقى مصادر الدبوس نفسه الأثقل وزنًا. كما تُفحص الصورة التي تُظهر شيئًا آخر أو تُظهره بشكل سيئ، فتُنزَّل أو تُستبدل.