- เริ่ม
- 24 ก.พ. 2025ความเชื่อมั่น 90%จาก แหล่งที่มา
เปิดตัว Claude 3.7 Sonnet
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Claude 3.7 Sonnet Released
- Anthropic เรียก Claude 3.7 Sonnet ว่า “โมเดลที่ฉลาดที่สุดของเราจนถึงปัจจุบันและเป็นโมเดลให้เหตุผลแบบไฮบริดตัวแรกในตลาด”: โมเดลเดียวที่ให้คำตอบเกือบทันที หรือ “การคิดแบบขยายทีละขั้นที่แสดงให้ผู้ใช้เห็น”[1][4]
- เปิดให้ทุกแผนของ Claude - Free, Pro, Team และ Enterprise - และบน Claude Developer Platform, Amazon Bedrock และ Vertex AI ของ Google Cloud โดยการคิดแบบขยายมีในทุกช่องทางยกเว้นระดับฟรี[1][4]
- Claude Code เครื่องมือเขียนโค้ดแบบเอเจนต์ตัวแรกของ Anthropic เปิดตัวพร้อมกันเป็นตัวอย่างวิจัยจำกัดที่ทำงานจากเทอร์มินัล และการเชื่อมต่อ GitHub มาถึงทุกแผนของ Claude[1]
- ลดการปฏิเสธที่ไม่จำเป็นลง 45% เมื่อเทียบกับรุ่นก่อน และเปิดตัวภายใต้มาตรฐาน ASL-2[1][2]
- หมายเลขเวอร์ชันกระโดดจาก 3.5 เป็น 3.7 และในเดือนกุมภาพันธ์ 2025 Claude 3.7 Sonnet เริ่มเล่น Pokémon Red สดทาง Twitch[3][4]
จุดเด่น
- 3 ดอลลาร์ต่อหนึ่งล้านโทเค็นอินพุต และ 15 ดอลลาร์ต่อหนึ่งล้านโทเค็นเอาต์พุตในทั้งสองโหมด รวมโทเค็นการคิด[1][4]
- ผู้ใช้ API ตั้งงบประมาณการคิดขนาดเท่าใดก็ได้ถึงขีดจำกัดเอาต์พุต 128K โทเค็น โดยแลกความเร็วและต้นทุนกับคุณภาพ[1]
- แผนภูมิของ Anthropic ให้ 62.3% ใน SWE-bench Verified (70.3% เมื่อใช้โครงสร้างเสริมแบบกำหนดเอง) เทียบกับ 49.0% ของ 3.5 Sonnet รุ่นอัปเกรด และ 81.2% (ค้าปลีก) และ 58.4% (สายการบิน) ใน TAU-bench[1]
- Anthropic ระบุว่าปรับแต่งเพื่อการแข่งขันคณิตศาสตร์และการเขียนโค้ดน้อยลง และเน้นงานธุรกิจในโลกจริงมากขึ้น[1]
- ในโหมดมาตรฐานเป็น Claude 3.5 Sonnet ที่อัปเกรด ส่วนในโหมดการคิดแบบขยายจะไตร่ตรองก่อนตอบ ซึ่งช่วยด้านคณิตศาสตร์ ฟิสิกส์ การทำตามคำสั่ง และการเขียนโค้ด[1]
เกณฑ์วัด[1]
| เกณฑ์วัด | Claude 3.7 Sonnet (64K การคิดแบบขยาย) | Claude 3.7 Sonnet (ไม่ใช้การคิดแบบขยาย) | Claude 3.5 Sonnet (ใหม่) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K การคิดแบบขยาย) | Grok 3 Beta (การคิดแบบขยาย) |
|---|---|---|---|---|---|---|---|
| การให้เหตุผลระดับบัณฑิตศึกษา (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| การเขียนโค้ดแบบเอเจนต์ (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| การใช้เครื่องมือแบบเอเจนต์ (TAU-bench), ค้าปลีก | — | 81.2% | 71.5% | 73.5% | — | — | — |
| การใช้เครื่องมือแบบเอเจนต์ (TAU-bench), สายการบิน | — | 58.4% | 48.8% | 54.2% | — | — | — |
| ถาม-ตอบหลายภาษา (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| การให้เหตุผลเชิงภาพ (MMMU ชุดตรวจสอบ) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| การทำตามคำสั่ง (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| การแก้โจทย์คณิตศาสตร์ (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| การแข่งขันคณิตศาสตร์ระดับมัธยม (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 เฉลี่ยจากหลายครั้ง (สูงสุด 16 ครั้งสำหรับ AIME และ SWE-bench Verified); ตัวเลขที่สองได้ประโยชน์จากการคำนวณขณะทดสอบแบบขนาน ¹ ผล TAU-bench ของ o1 ถูกรายงานโดย OpenAI และต่อมาถูกลบ ผล TAU-bench อาจเปรียบเทียบกันไม่ได้ ² 62.3% คือ pass@1 จาก 500 โจทย์ด้วยเครื่องมือ bash/editor บวก “เครื่องมือการคิด”; 70.3% ใช้การให้คะแนนภายในและโครงสร้างเสริมแบบกำหนดเองบนชุดย่อยที่ลดขนาด; DeepSeek R1 ใช้เฟรมเวิร์ก Agentless ³ คะแนน GPQA และ AIME 2024 ที่สูงของ Claude 3.7 Sonnet ใช้การให้คะแนนภายในพร้อมการคำนวณขณะทดสอบแบบขนาน ส่วนของ o1 และ Grok 3 ใช้การลงคะแนนเสียงข้างมากด้วย 64 ตัวอย่าง
แหล่งอ้างอิง 4ความเชื่อมั่น 85%ความเชื่อมั่นโดยรวม: 85%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 4 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· โพสต์ 28 ก.ย. 2026· เริ่ม 24 ก.พ. 2025 ✓· 32% ของคะแนน
โพสต์ลงวันที่ “24 ก.พ. 2025”: “วันนี้ เราประกาศ Claude 3.7 Sonnet” และ “พร้อมใช้งานแล้วบนทุกแผนของ Claude” ส่วน TechCrunch[4] ระบุว่า “กำลังทยอยเปิดให้ผู้ใช้และนักพัฒนาทุกคนในวันจันทร์” (24 กุมภาพันธ์)
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· เพิ่มเมื่อ 28 ก.ย. 2026· 32% ของคะแนน
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· เพิ่มเมื่อ 28 ก.ย. 2026· 32% ของคะแนน
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· เผยแพร่ 24 ก.พ. 2025· เริ่ม 24 ก.พ. 2025· 3% ของคะแนน
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่