- البدء
- 22 أكتوبر 2024ثقة 90%من المصدر
إطلاق النسخة المطورة من Claude 3.5 Sonnet
تُرجم تلقائيًا من الأصل
العنوان الأصلي: Claude 3.5 Sonnet Upgrade Released
- أعلنت Anthropic عن «نسخة مطورة من Claude 3.5 Sonnet» بـ«تحسينات شاملة مقارنة بسابقتها، مع مكاسب كبيرة بوجه خاص في البرمجة»، متاحة لجميع المستخدمين في اليوم نفسه، وعن Claude 3.5 Haiku الجديد لاحقاً في الشهر ذاته[1]
- وصل استخدام الحاسوب في نسخة تجريبية عامة: يرى Claude الشاشة ويحرك المؤشر وينقر على الأزرار ويكتب، وتصف Anthropic نموذج 3.5 Sonnet بأنه «أول نموذج ذكاء اصطناعي متقدم يقدم استخدام الحاسوب في نسخة تجريبية عامة»، وهو «لا يزال تجريبياً، وأحياناً مرهق ومعرض للأخطاء»[1][4]
- لتوجيه المؤشر يحسب Claude عدد البكسلات التي عليه تحريكها في كل لقطة شاشة؛ ودرّبته Anthropic على هذه المهارة باستخدام برامج بسيطة مثل الآلة الحاسبة ومحرر النصوص[3]
- استطاع المطورون استخدامه في اليوم نفسه عبر واجهة Anthropic البرمجية وAmazon Bedrock وVertex AI من Google Cloud؛ وكانت Asana وCanva وCognition وDoorDash وReplit وThe Browser Company من أوائل المستخدمين، وحصلت Amazon على وصول مبكر[1][5]
- اختبره معهدا سلامة الذكاء الاصطناعي في الولايات المتحدة والمملكة المتحدة بصورة مشتركة قبل الإطلاق؛ وأبقته Anthropic عند مستوى ASL-2 وأضافت مصنِّفات ترصد استخدام الحاسوب وما إذا كان الضرر يحدث فعلاً[1]
أبرز الميزات
- السعر والسرعة نفسهما كما في Claude 3.5 Sonnet الصادر في يونيو[1]
- ترتفع نتيجة SWE-bench Verified من 33.4% إلى 49.0%، متفوقةً على كل نموذج متاح للعامة بما فيها o1-preview من OpenAI[1]
- ترتفع نتيجة TAU-bench لاستخدام الأدوات الوكيلي من 62.6% إلى 69.2% في التجزئة ومن 36.0% إلى 46.0% في مجال الطيران[1]
- في OSWorld سجل 14.9% من لقطات الشاشة وحدها مقابل 7.8% لأفضل نظام تالٍ، و22.0% عند السماح له بعدد خطوات أكبر[1][2]
- ظل التمرير والسحب والتكبير صعباً عليه، ونصحت Anthropic بالبدء بمهام منخفضة المخاطر[1]
نتائج الاختبارات[1]
| الاختبار | Claude 3.5 Sonnet (الجديد) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| الاستدلال على مستوى الدراسات العليا (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| المعرفة على مستوى البكالوريوس (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| البرمجة (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| حل المسائل الرياضية (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| مسابقة رياضيات للمرحلة الثانوية (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| الأسئلة والأجوبة البصرية (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| البرمجة الوكيلية (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| استخدام الأدوات الوكيلي (TAU-bench)، التجزئة | 69.2% | 51.0% | 62.6% | — | — | — | — |
| استخدام الأدوات الوكيلي (TAU-bench)، الطيران | 46.0% | 22.8% | 36.0% | — | — | — | — |
* تستبعد جداول تقييم Anthropic عائلة نماذج o1 من OpenAI، لأنها تعتمد على وقت حوسبة طويل قبل الاستجابة، بخلاف النماذج المعتادة.
المراجع 5ثقة 90%الثقة الإجمالية: 90%مدى دعم مصدر الدبوس ومراجعه لتواريخه.متوسط مرجّح لمدى قوة دعم 5 مراجع، بما فيها المصدر، لوقتَي بدء الدبوس وانتهائه؛ ويقل وزن المرجع إلى النصف عن كل 180 يومًا يسبق بها أحدث مرجععرض كل الدبابيس بثقة 75% أو أعلى
المدخل الأول هو دائمًا مصدر الدبوس. الثقة الإجمالية متوسط مرجّح لمدى قوة دعم كل مرجع لوقتَي البدء والانتهاء المستخدمين أعلاه؛ ويقل وزن المرجع إلى النصف عن كل 180 يومًا يسبق بها أحدث مرجع.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· نُشر 28 سبتمبر 2026· يبدأ 22 أكتوبر 2024 ✓· 46% من الدرجة
المنشور مؤرخ «22 أكتوبر 2024» ويقول: «النسخة المطورة من Claude 3.5 Sonnet متاحة الآن لجميع المستخدمين. ابتداءً من اليوم يمكن للمطورين البناء باستخدام النسخة التجريبية لاستخدام الحاسوب»؛ وذكرت TechCrunch[4] وCNBC[5] أن الإطلاق جرى «يوم الثلاثاء» نفسه.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· أُضيف 28 سبتمبر 2026· 46% من الدرجة
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· صدر 22 أكتوبر 2024· 3% من الدرجة
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· صدر 22 أكتوبر 2024· يبدأ 22 أكتوبر 2024· 3% من الدرجة
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· صدر 22 أكتوبر 2024· يبدأ 22 أكتوبر 2024· 3% من الدرجة
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
اقتراح تصحيح
هل ينقص شيء أو يوجد خطأ؟ قله بكلماتك: رابط يدعم هذا الدبوس، أو تاريخ بدء أو انتهاء مختلف مع السبب، أو معلومة ينقصها أو يخطئ فيها. يفحص الذكاء الاصطناعي ذلك بمقارنته بمصادر هذا الدبوس، ويبحث عن مصادر أفضل، ويضيف أي صفحة تدعم كلامك. وتبقى مصادر الدبوس نفسه الأثقل وزنًا. كما تُفحص الصورة التي تُظهر شيئًا آخر أو تُظهره بشكل سيئ، فتُنزَّل أو تُستبدل.