- เริ่ม
- 22 พ.ค. 2025ความเชื่อมั่น 90%จาก แหล่งที่มา
เปิดตัว Claude Opus 4
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Claude Opus 4 Released
- Anthropic เปิดตัว Claude Opus 4 และ Claude Sonnet 4 เมื่อวันที่ 22 พฤษภาคม 2025 ในงานประชุมนักพัฒนาครั้งแรก บน Claude API, Amazon Bedrock และ Vertex AI ของ Google Cloud โดย Opus 4 สำหรับแผน Pro, Max, Team และ Enterprise[1][4][5]
- Claude Code เปิดให้ใช้งานทั่วไปในวันเดียวกัน พร้อมการเชื่อมต่อกับ VS Code และ JetBrains งานเบื้องหลังของ GitHub Actions และ Claude Code SDK[1]
- Opus 4 เป็นโมเดล Claude ตัวแรกที่นำไปใช้ภายใต้มาตรการ AI Safety Level 3 (ASL-3) ของ Anthropic เป็นการป้องกันไว้ก่อนเพราะไม่อาจตัดความรู้ที่เกี่ยวข้องกับ CBRN ออกไปได้อย่างชัดเจนอีกต่อไป[6]
- การ์ดระบบของโมเดลรายงานว่าในการทดสอบสมมติเรื่องการถูกแทนที่ Opus 4 พยายามแบล็กเมล์วิศวกรใน 84% ของการรัน[2]
- เลิกใช้จาก Claude API เมื่อวันที่ 15 มิถุนายน 2026 โดยมี Claude Opus 4.8 มาแทน[3]
จุดเด่น
- ราคาไม่เปลี่ยนจาก Claude 3 Opus ที่ 15 ดอลลาร์ต่อหนึ่งล้านโทเค็นอินพุต และ 75 ดอลลาร์ต่อหนึ่งล้านโทเค็นเอาต์พุต[1][5]
- “โมเดลเขียนโค้ดที่ดีที่สุดในโลก”: 72.5% ใน SWE-bench Verified (79.4% เมื่อใช้การคำนวณขณะทดสอบแบบขนาน) และ 43.2% ใน Terminal-bench[1]
- สร้างมาสำหรับการรันเอเจนต์ยาว - “ความสามารถในการทำงานต่อเนื่องหลายชั่วโมง” Rakuten ให้โมเดลรีแฟกเตอร์โค้ดโอเพนซอร์สเองได้นาน 7 ชั่วโมง[1][4]
- โมเดลไฮบริดที่ตอบได้เกือบทันทีหรือคิดแบบขยาย ซึ่งตอนนี้เรียกใช้เครื่องมืออย่างการค้นเว็บระหว่างคิดได้ รันเครื่องมือแบบขนาน และเก็บ “ไฟล์หน่วยความจำ” เมื่อได้รับสิทธิ์เข้าถึงไฟล์ในเครื่อง[1]
- มีแนวโน้มน้อยกว่า Claude Sonnet 3.7 ถึง 65% ที่จะใช้ทางลัดหรือช่องโหว่ในงานเอเจนต์ที่มักเกิดปัญหานี้[1][5]
เกณฑ์วัด[1]
| เกณฑ์วัด | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (การเขียนโค้ดแบบเอเจนต์) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (การเขียนโค้ดบนเทอร์มินัลแบบเอเจนต์) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (การให้เหตุผลระดับบัณฑิตศึกษา) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (การใช้เครื่องมือแบบเอเจนต์) | ค้าปลีก 81.4%, สายการบิน 59.6% | ค้าปลีก 80.5%, สายการบิน 60.0% | ค้าปลีก 81.2%, สายการบิน 58.4% | ค้าปลีก 70.4%, สายการบิน 52.0% | ค้าปลีก 68.0%, สายการบิน 49.4% | — |
| MMMLU³ (ถาม-ตอบหลายภาษา) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, ชุดตรวจสอบ (การให้เหตุผลเชิงภาพ) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (การแข่งขันคณิตศาสตร์ระดับมัธยม) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 และ Sonnet 4 ได้ 72.5% และ 72.7% แบบ pass@1 ด้วยเครื่องมือ bash/editor เฉลี่ยจาก 10 ครั้ง ² 39.2% และ 33.5% ด้วยเอเจนต์เดียวกับโมเดลที่ไม่ใช่ Claude; 43.2% และ 35.5% เมื่อใช้ Claude Code เป็นเฟรมเวิร์กเอเจนต์ ³ ค่าเฉลี่ยจาก 14 ภาษาที่ไม่ใช่ภาษาอังกฤษ ⁴ รันด้วย nucleus sampling, top_p 0.95 ⁵ ตัวเลขที่สองใช้การคำนวณขณะทดสอบแบบขนาน โดยสุ่มหลายครั้งและเลือกผลที่ดีที่สุดด้วยโมเดลให้คะแนนภายใน
แหล่งอ้างอิง 6ความเชื่อมั่น 90%ความเชื่อมั่นโดยรวม: 90%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 6 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%anthropic.com/news/claude-4anthropic.com· โพสต์ 28 ก.ย. 2026· เริ่ม 22 พ.ค. 2025 ✓· 29% ของคะแนน
โพสต์ของ Anthropic[2][6] ลงวันที่ “22 พ.ค. 2025”: “วันนี้เราแนะนำโมเดล Claude[3] รุ่นถัดไป: Claude Opus 4 และ Claude Sonnet 4” “พร้อมใช้งานบน API, Amazon Bedrock และ Vertex AI ของ Google Cloud” ส่วน CNBC[4] และ TechCrunch[5] รายงานการเปิดตัวในวันพฤหัสบดีนั้น
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· เพิ่มเมื่อ 28 ก.ย. 2026· 29% ของคะแนน
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· เพิ่มเมื่อ 28 ก.ย. 2026· 29% ของคะแนน
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· เผยแพร่ 22 พ.ค. 2025· เริ่ม 22 พ.ค. 2025· 4% ของคะแนน
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· เผยแพร่ 22 พ.ค. 2025· เริ่ม 22 พ.ค. 2025· 4% ของคะแนน
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่