- เริ่ม
- 29 ก.ย. 2025ความเชื่อมั่น 90%จาก แหล่งที่มา
เปิดตัว Claude Sonnet 4.5
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Claude Sonnet 4.5 Released
- Anthropic เรียกว่า “โมเดลเขียนโค้ดที่ดีที่สุดในโลก เป็นโมเดลที่แข็งแกร่งที่สุดสำหรับการสร้างเอเจนต์ที่ซับซ้อน และเป็นโมเดลที่ดีที่สุดในการใช้คอมพิวเตอร์”[1][4]
- “พร้อมใช้งานทุกที่วันนี้” ในชื่อ claude-sonnet-4-5 บน Claude API และในแอป Claude; Mike Krieger กล่าวว่าจะเป็นค่าเริ่มต้นและแนะนำให้ใช้ใน “เกือบทุกกรณีการใช้งาน”[1][5]
- เปิดตัวพร้อมจุดตรวจสอบ (checkpoint) ของ Claude Code และส่วนขยาย VS Code แบบเนทีฟ ฟีเจอร์แก้ไขบริบทและเครื่องมือหน่วยความจำบน API การรันโค้ดและการสร้างไฟล์ในแอป Claude และ Claude Agent SDK โครงสร้างพื้นฐานเบื้องหลัง Claude Code[1][4]
- “นี่คือโมเดลระดับแนวหน้าที่สอดคล้องกับเป้าหมายมนุษย์มากที่สุดที่เราเคยเปิดตัว” โดยมีอัตราการประจบสอพลอและการหลอกลวงต่ำลง และเปิดตัวภายใต้มาตรการป้องกัน AI Safety Level 3 (ASL-3)[1][3][4]
- มาถึงในเวลาไม่ถึงสองเดือนหลัง Claude Opus 4.1 โดย Anthropic มีมูลค่า 183 พันล้านดอลลาร์[4][5]
จุดเด่น
- 3 ดอลลาร์ต่อหนึ่งล้านโทเค็นอินพุต และ 15 ดอลลาร์ต่อหนึ่งล้านโทเค็นเอาต์พุต เท่ากับ Sonnet 4; หน้าต่างบริบท 200K โทเค็น เอาต์พุตสูงสุด 64K และข้อมูลความรู้ที่เชื่อถือได้ถึงเดือนมกราคม 2025[1][2]
- 77.2% ใน SWE-bench Verified เฉลี่ยจาก 10 ครั้งโดยไม่ใช้การคำนวณขณะทดสอบ และ 82.0% เมื่อใช้การคำนวณขณะทดสอบแบบขนาน[1]
- นำใน OSWorld ด้านการใช้คอมพิวเตอร์ที่ 61.4% ซึ่ง Sonnet 4 เคยนำที่ 42.2% เมื่อสี่เดือนก่อน[1]
- Anthropic สังเกตว่าโมเดลคงสมาธิได้นานกว่า 30 ชั่วโมงในงานหลายขั้นตอนที่ซับซ้อน ส่วน CNBC ระบุว่า Opus 4 ทำได้เจ็ดชั่วโมง[1][5]
- ผู้เชี่ยวชาญด้านการเงิน กฎหมาย การแพทย์ และ STEM พบว่าความรู้เฉพาะทางและการให้เหตุผลของโมเดลล้ำหน้าโมเดลรุ่นเก่าอย่างมาก รวมถึง Opus 4.1[1]
เกณฑ์วัด[1]
| เกณฑ์วัด | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| การเขียนโค้ดแบบเอเจนต์ (SWE-bench Verified) | 77.2% / 82.0% เมื่อใช้การคำนวณขณะทดสอบแบบขนาน | 74.5% / 79.4% เมื่อใช้การคำนวณขณะทดสอบแบบขนาน | 72.7% / 80.2% เมื่อใช้การคำนวณขณะทดสอบแบบขนาน | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| การเขียนโค้ดบนเทอร์มินัลแบบเอเจนต์ (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| การใช้เครื่องมือแบบเอเจนต์ (τ2-bench), ค้าปลีก | 86.2% | 86.8% | 83.8% | 81.1% | — |
| การใช้เครื่องมือแบบเอเจนต์ (τ2-bench), สายการบิน | 70.0% | 63.0% | 63.0% | 62.6% | — |
| การใช้เครื่องมือแบบเอเจนต์ (τ2-bench), โทรคมนาคม | 98.0% | 71.5% | 49.6% | 96.7% | — |
| การใช้คอมพิวเตอร์ (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| การแข่งขันคณิตศาสตร์ระดับมัธยม (AIME 2025) | 100% (python) / 87.0% (ไม่ใช้เครื่องมือ) | 78.0% | 70.5% | 99.6% (python) / 94.6% (ไม่ใช้เครื่องมือ) | 88.0% |
| การให้เหตุผลระดับบัณฑิตศึกษา (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| ถาม-ตอบหลายภาษา (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| การให้เหตุผลเชิงภาพ (MMMU ชุดตรวจสอบ) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| การวิเคราะห์การเงิน (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
แหล่งอ้างอิง 5ความเชื่อมั่น 89%ความเชื่อมั่นโดยรวม: 89%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 5 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· โพสต์ 28 ก.ย. 2026· เริ่ม 29 ก.ย. 2025 ✓· 29% ของคะแนน
โพสต์ลงวันที่ “29 ก.ย. 2025” และระบุว่า “Claude[2] Sonnet 4.5 พร้อมใช้งานทุกที่วันนี้” หน้าโมเดลในเอกสารระบุ “เปิดตัว 29 กันยายน 2025” และ TechCrunch[4] รายงานการเปิดตัว “ในวันจันทร์”
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· เพิ่มเมื่อ 28 ก.ย. 2026· 29% ของคะแนน
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· เพิ่มเมื่อ 28 ก.ย. 2026· 29% ของคะแนน
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· เผยแพร่ 29 ก.ย. 2025· เริ่ม 29 ก.ย. 2025· 7% ของคะแนน
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· เผยแพร่ 29 ก.ย. 2025· เริ่ม 29 ก.ย. 2025· 7% ของคะแนน
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่