- เริ่ม
- 17 ก.พ. 2026ความเชื่อมั่น 90%จาก แหล่งที่มา
เปิดตัว Claude Sonnet 4.6
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Claude Sonnet 4.6 Released
- “Claude Sonnet 4.6 คือโมเดล Sonnet ที่มีความสามารถสูงสุดของเราจนถึงตอนนี้” เป็นการอัปเกรดเต็มรูปแบบทั้งด้านการเขียนโค้ด การใช้คอมพิวเตอร์ การให้เหตุผลในบริบทยาว การวางแผนของเอเจนต์ งานความรู้ และการออกแบบ[1][4]
- กลายเป็นโมเดลเริ่มต้นใน claude.ai และ Claude Cowork สำหรับผู้ใช้ Free และ Pro และระดับฟรีได้ฟีเจอร์สร้างไฟล์ ตัวเชื่อมต่อ สกิล และการบีบอัดบริบท โดยมีในทุกแผนของ Claude, Claude Code, API และแพลตฟอร์มคลาวด์รายใหญ่ทั้งหมด[1][3][4]
- ใน Claude Code ผู้ทดสอบกลุ่มแรกชอบโมเดลนี้มากกว่า Sonnet 4.5 ราว 70% ของครั้งทั้งหมด และชอบมากกว่า Opus 4.5 โมเดลเรือธงเดือนพฤศจิกายนของ Anthropic ถึง 59% ของครั้ง โดยบอกว่ามีแนวโน้มน้อยลงที่จะทำเกินความจำเป็นและ “ขี้เกียจ”[1]
- นักวิจัยด้านความปลอดภัยพบ “บุคลิกที่อบอุ่น ซื่อสัตย์ เอื้อต่อสังคม และบางครั้งก็ตลก โดยรวม” และไม่พบสัญญาณของความไม่สอดคล้องครั้งใหญ่ที่มีเดิมพันสูง ต้านทานการแทรกพรอมต์ได้ดีกว่า Sonnet 4.5 มาก และเปิดตัวภายใต้ ASL-3[1][5]
- CNBC เชื่อมโยงการเปิดตัวกับการเทขายหุ้นซอฟต์แวร์ โดย IGV ETF ซอฟต์แวร์ลดลงกว่า 20% ในปีนี้[3]
จุดเด่น
- ราคาไม่เปลี่ยนจาก Sonnet 4.5 ที่ 3 ดอลลาร์ต่อหนึ่งล้านโทเค็นอินพุต และ 15 ดอลลาร์ต่อหนึ่งล้านโทเค็นเอาต์พุต หน้าต่างบริบท 1M โทเค็น (เป็นเบต้าตอนเปิดตัว) และเอาต์พุตสูงสุด 128K[1][2]
- ตารางของ Anthropic: 79.6% ใน SWE-bench Verified, 72.5% ใน OSWorld-Verified (Sonnet 4.5: 61.4%), 59.1% ใน Terminal-Bench 2.0 และ 74.7% ใน BrowseComp[1]
- แผนภูมิ OSWorld ของโมเดลแสดงเส้นพัฒนาการของ Sonnet จาก 14.9% สำหรับ Claude 3.5 Sonnet เดือนตุลาคม 2024 ถึง 72.5% สำหรับ Sonnet 4.6[1]
- การคิดแบบปรับตัวและแบบขยาย พร้อมการบีบอัดบริบทแบบเบต้าที่สรุปบริบทเก่าเมื่อบทสนทนาใกล้ถึงขีดจำกัด[1][2]
- เทียบเท่า Opus 4.6 ใน OfficeQA ซึ่งเป็นการทดสอบของ Databricks ในการอ่านแผนภูมิ PDF และตารางขององค์กร และใน Vending-Bench Arena โมเดลลงทุนอย่างหนักเป็นเวลาสิบเดือนจำลองก่อนเปลี่ยนไปทำกำไร[1]
เกณฑ์วัด[1]
| เกณฑ์วัด | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (ทุกโมเดล) |
|---|---|---|---|---|---|---|
| การเขียนโค้ดบนเทอร์มินัลแบบเอเจนต์ (Terminal-Bench 2.0) | 59.1% | 51.0% | 65.4% | 59.8% | 56.2% (54.2% รายงานเอง) | 64.7% (64.0% รายงานเอง, Codex CLI) |
| การเขียนโค้ดแบบเอเจนต์ (SWE-bench Verified) | 79.6% | 77.2% | 80.8% | 80.9% | 78.0% (Flash) | 80.0% |
| การใช้คอมพิวเตอร์แบบเอเจนต์ (OSWorld-Verified) | 72.5% | 61.4% | 72.7% | 66.3% | — | 38.2% |
| การใช้เครื่องมือแบบเอเจนต์ (τ2-bench), ค้าปลีก | 91.7% | 86.2% | 91.9% | 88.9% | 85.3% | 82.0% |
| การใช้เครื่องมือแบบเอเจนต์ (τ2-bench), โทรคมนาคม | 97.9% | 98.0% | 99.3% | 98.2% | 98.0% | 98.7% |
| การใช้เครื่องมือในวงกว้าง (MCP-Atlas) | 61.3% | 43.8% | 59.5% | 62.3% | 54.1% | 60.6% |
| การค้นหาแบบเอเจนต์ (BrowseComp) | 74.7% | 43.9% | 84.0% | 67.8% | 59.2% (Deep Research) | 77.9% (Pro) |
| การให้เหตุผลหลายสาขาวิชา (Humanity's Last Exam), ไม่ใช้เครื่องมือ | 33.2% | 17.7% | 40.0% | 30.8% | 37.5% | 36.6% (Pro) |
| การให้เหตุผลหลายสาขาวิชา (Humanity's Last Exam), พร้อมเครื่องมือ | 49.0% | 33.6% | 53.0% | 43.4% | 45.8% | 50.0% (Pro) |
| การวิเคราะห์การเงินแบบเอเจนต์ (Finance Agent v1.1) | 63.3% | 54.5% | 60.1% | 58.8% | 55.2% | 59.0% |
| งานสำนักงาน (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| การแก้ปัญหาใหม่ (ARC-AGI-2) | 58.3% | 13.6% | 68.8% | 37.6% | 31.1% | 54.2% (Pro) |
| การให้เหตุผลระดับบัณฑิตศึกษา (GPQA Diamond) | 89.9% | 83.4% | 91.3% | 87.0% | 91.9% | 93.2% (Pro) |
| การให้เหตุผลเชิงภาพ (MMMU-Pro), ไม่ใช้เครื่องมือ | 74.5% | 63.4% | 73.9% | 70.6% | 81.0% | 79.5% |
| การให้เหตุผลเชิงภาพ (MMMU-Pro), พร้อมเครื่องมือ | 75.6% | 68.9% | 77.3% | 73.9% | — | 80.4% |
| ถาม-ตอบหลายภาษา (MMMLU) | 89.3% | 89.5% | 91.1% | 90.8% | 91.8% | 89.6% |
แหล่งอ้างอิง 5ความเชื่อมั่น 88%ความเชื่อมั่นโดยรวม: 88%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 5 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· โพสต์ 28 ก.ย. 2026· เริ่ม 17 ก.พ. 2026 ✓· 31% ของคะแนน
โพสต์ลงวันที่ “17 ก.พ. 2026” และระบุว่า “Claude[2] Sonnet 4.6 พร้อมใช้งานแล้วบนทุกแผนของ Claude, Claude Cowork, Claude Code, API ของเรา และแพลตฟอร์มคลาวด์รายใหญ่ทั้งหมด” หน้าโมเดลในเอกสารระบุ “เปิดตัว 17 กุมภาพันธ์ 2026” และ CNBC[3] รายงานในวันนั้น
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· เพิ่มเมื่อ 28 ก.ย. 2026· 31% ของคะแนน
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· เผยแพร่ 17 ก.พ. 2026· เริ่ม 17 ก.พ. 2026· 13% ของคะแนน
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· เผยแพร่ 17 ก.พ. 2026· เริ่ม 17 ก.พ. 2026· 13% ของคะแนน
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· เผยแพร่ 17 ก.พ. 2026· 13% ของคะแนน
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่