- เริ่ม
- 22 ต.ค. 2024ความเชื่อมั่น 90%จาก แหล่งที่มา
เปิดตัว Claude 3.5 Sonnet รุ่นอัปเกรด
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Claude 3.5 Sonnet Upgrade Released
- Anthropic ประกาศ “Claude 3.5 Sonnet รุ่นอัปเกรด” ที่ “ดีขึ้นรอบด้านจากรุ่นก่อน โดยเฉพาะอย่างยิ่งในการเขียนโค้ดอย่างมีนัยสำคัญ” พร้อมใช้งานสำหรับผู้ใช้ทุกคนในวันนั้น และ Claude 3.5 Haiku ใหม่ในช่วงปลายเดือน[1]
- การใช้คอมพิวเตอร์มาถึงในรูปแบบเบต้าสาธารณะ: Claude มองหน้าจอ ขยับเคอร์เซอร์ คลิกปุ่ม และพิมพ์ โดย Anthropic เรียก 3.5 Sonnet ว่า “โมเดล AI ระดับแนวหน้าตัวแรกที่มีการใช้คอมพิวเตอร์ในเบต้าสาธารณะ” - “ยังเป็นการทดลอง - บางครั้งงุ่มง่ามและมีข้อผิดพลาดง่าย”[1][4]
- เพื่อควบคุมเคอร์เซอร์ Claude นับพิกเซลที่ต้องขยับในแต่ละภาพหน้าจอ โดย Anthropic ฝึกทักษะนี้กับซอฟต์แวร์ง่าย ๆ เช่นเครื่องคิดเลขและโปรแกรมแก้ไขข้อความ[3]
- นักพัฒนาใช้ได้ในวันนั้นบน Anthropic API, Amazon Bedrock และ Vertex AI ของ Google Cloud โดย Asana, Canva, Cognition, DoorDash, Replit และ The Browser Company เป็นผู้ใช้กลุ่มแรก และ Amazon ได้สิทธิ์เข้าถึงก่อนใคร[1][5]
- สถาบันความปลอดภัย AI ของสหรัฐฯ และสหราชอาณาจักรทดสอบร่วมกันก่อนเปิดตัว โดย Anthropic คงไว้ที่ ASL-2 และเพิ่มตัวจำแนกที่ตรวจจับการใช้คอมพิวเตอร์และว่ากำลังเกิดอันตรายหรือไม่[1]
จุดเด่น
- ราคาและความเร็วเท่ากับ 3.5 Sonnet ของเดือนมิถุนายน[1]
- SWE-bench Verified เพิ่มจาก 33.4% เป็น 49.0% สูงกว่าทุกโมเดลที่ใช้ได้สาธารณะ รวมถึง o1-preview ของ OpenAI[1]
- การใช้เครื่องมือแบบเอเจนต์ใน TAU-bench เพิ่มจาก 62.6% เป็น 69.2% ในหมวดค้าปลีก และจาก 36.0% เป็น 46.0% ในหมวดสายการบิน[1]
- ใน OSWorld ได้ 14.9% จากภาพหน้าจออย่างเดียว เทียบกับ 7.8% ของระบบที่ดีที่สุดถัดมา และ 22.0% เมื่อให้ใช้ขั้นตอนมากขึ้น[1][2]
- การเลื่อน การลาก และการซูมยังเป็นเรื่องยากสำหรับโมเดล และ Anthropic แนะนำให้เริ่มจากงานที่มีความเสี่ยงต่ำ[1]
เกณฑ์วัด[1]
| เกณฑ์วัด | Claude 3.5 Sonnet (ใหม่) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| การให้เหตุผลระดับบัณฑิตศึกษา (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| ความรู้ระดับปริญญาตรี (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| โค้ด (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| การแก้โจทย์คณิตศาสตร์ (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| การแข่งขันคณิตศาสตร์ระดับมัธยม (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| ถาม-ตอบจากภาพ (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| การเขียนโค้ดแบบเอเจนต์ (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| การใช้เครื่องมือแบบเอเจนต์ (TAU-bench), ค้าปลีก | 69.2% | 51.0% | 62.6% | — | — | — | — |
| การใช้เครื่องมือแบบเอเจนต์ (TAU-bench), สายการบิน | 46.0% | 22.8% | 36.0% | — | — | — | — |
* ตารางประเมินของ Anthropic ไม่รวมตระกูลโมเดล o1 ของ OpenAI เพราะต้องใช้เวลาคำนวณก่อนตอบอย่างมาก ต่างจากโมเดลทั่วไป
แหล่งอ้างอิง 5ความเชื่อมั่น 90%ความเชื่อมั่นโดยรวม: 90%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 5 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· โพสต์ 28 ก.ย. 2026· เริ่ม 22 ต.ค. 2024 ✓· 46% ของคะแนน
โพสต์ลงวันที่ “22 ต.ค. 2024” และระบุว่า “Claude 3.5 Sonnet รุ่นอัปเกรดพร้อมใช้งานแล้วสำหรับผู้ใช้ทุกคน ตั้งแต่วันนี้ นักพัฒนาสามารถสร้างด้วยเบต้าการใช้คอมพิวเตอร์ได้” ส่วน TechCrunch[4] และ CNBC[5] รายงานการเปิดตัว “เมื่อวันอังคาร” ในวันเดียวกัน
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· เพิ่มเมื่อ 28 ก.ย. 2026· 46% ของคะแนน
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· เผยแพร่ 22 ต.ค. 2024· 3% ของคะแนน
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· เผยแพร่ 22 ต.ค. 2024· เริ่ม 22 ต.ค. 2024· 3% ของคะแนน
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· เผยแพร่ 22 ต.ค. 2024· เริ่ม 22 ต.ค. 2024· 3% ของคะแนน
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่