- เริ่ม
- 4 มี.ค. 2024ความเชื่อมั่น 90%จาก แหล่งที่มา
เปิดตัว Claude 3 Opus
แปลอัตโนมัติจากต้นฉบับ
ชื่อต้นฉบับ: Claude 3 Opus Released
- Anthropic ประกาศตระกูล Claude 3 - Haiku, Sonnet และ Opus “เรียงตามความสามารถจากน้อยไปมาก” - เมื่อวันที่ 4 มีนาคม 2024 โดย Opus และ Sonnet ใช้ได้ในวันเดียวกันใน claude.ai และ Claude API ซึ่งตอนนี้เปิดให้ใช้งานทั่วไปใน 159 ประเทศ[1][4]
- บน claude.ai Opus เปิดให้สมาชิก Claude Pro ส่วน Sonnet ขับเคลื่อนประสบการณ์ใช้ฟรี Sonnet เข้าสู่ Amazon Bedrock และตัวอย่างส่วนตัวของ Google Cloud Vertex AI ในวันนั้น “โดย Opus และ Haiku จะตามมาเร็ว ๆ นี้ในทั้งสองแห่ง”[1]
- Anthropic คงโมเดลไว้ที่ AI Safety Level 2 (ASL-2) หลังการทดสอบ red-team พบ “ศักยภาพที่จะก่อความเสี่ยงหายนะน้อยมากในขณะนี้”[1]
- CNBC ระบุว่าผู้สนับสนุน Anthropic รวมถึง Google, Salesforce และ Amazon หลังข้อตกลงระดมทุนรวมราว 7.3 พันล้านดอลลาร์ในปีที่ผ่านมา[4]
- Claude 3 Opus ถูกประกาศเลิกสนับสนุนเมื่อวันที่ 30 มิถุนายน 2025 และเลิกใช้จาก Claude API เมื่อวันที่ 5 มกราคม 2026 โดยมี Claude Opus 4.8 มาแทน[3]
จุดเด่น
- Claude 3 Opus คือ “โมเดลที่ฉลาดที่สุดของเรา ด้วยประสิทธิภาพดีที่สุดในตลาดสำหรับงานที่ซับซ้อนสูง” ราคา 15 ดอลลาร์ต่อหนึ่งล้านโทเค็นอินพุต และ 75 ดอลลาร์ต่อหนึ่งล้านโทเค็นเอาต์พุต[1][5]
- ผลเกณฑ์วัดที่ Anthropic รายงาน: 86.8% ใน MMLU, 50.4% ใน GPQA Diamond, 95.0% ใน GSM8K และ 84.9% ใน HumanEval นำหน้า 86.4%, 35.7%, 92.0% และ 67.0% ของ GPT-4[1]
- หน้าต่างบริบท 200K โทเค็นเมื่อเปิดตัว โดยอินพุตเกิน 1 ล้านโทเค็นใช้ได้ “สำหรับกรณีการใช้งานเฉพาะ” ในการทดสอบการเรียกคืน Needle In A Haystack โมเดลทำได้เกิน 99% และบางครั้งสังเกตได้ว่าประโยคที่ฝังไว้ดูเหมือนถูกแทรกเข้ามาอย่างไม่เป็นธรรมชาติ[1][5]
- โมเดลวิชันตัวแรกของ Claude: อ่านภาพถ่าย แผนภูมิ กราฟ และแผนภาพเทคนิคได้ สูงสุด 20 ภาพในคำขอเดียว แต่จะไม่ระบุตัวบุคคล[1][5]
- Opus “มีแนวโน้มน้อยลงอย่างมีนัยสำคัญ” ที่จะปฏิเสธพรอมต์ที่ไม่เป็นอันตรายเมื่อเทียบกับโมเดล Claude รุ่นก่อน และมีความแม่นยำเป็นสองเท่าของ Claude 2.1 ในคำถามข้อเท็จจริงปลายเปิดที่ยาก ข้อมูลความรู้ถึงเดือนสิงหาคม 2023[1][2]
เกณฑ์วัด[1]
| เกณฑ์วัด | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (ความรู้ระดับปริญญาตรี) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (การให้เหตุผลระดับบัณฑิตศึกษา) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (คณิตศาสตร์ระดับประถม) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (การแก้โจทย์คณิตศาสตร์) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (คณิตศาสตร์หลายภาษา) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (โค้ด) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, คะแนน F1 (การให้เหตุผลจากข้อความ) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 จำนวนช็อตแปรผัน | 74.1 จำนวนช็อตแปรผัน |
| BIG-Bench-Hard (การประเมินแบบผสม) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (ถาม-ตอบความรู้) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (ความรู้ทั่วไป) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
แหล่งอ้างอิง 5ความเชื่อมั่น 90%ความเชื่อมั่นโดยรวม: 90%แหล่งที่มาและแหล่งอ้างอิงของหมุดยืนยันวันที่ได้ดีเพียงใดค่าเฉลี่ยถ่วงน้ำหนักว่าแหล่งอ้างอิง 5 แหล่ง รวมแหล่งที่มา สนับสนุนเวลาเริ่มและสิ้นสุดของหมุดมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุดแสดงหมุดทั้งหมดที่มีความเชื่อมั่น 75% ขึ้นไป
รายการแรกคือแหล่งที่มาของหมุดเสมอ ความเชื่อมั่นโดยรวมคือค่าเฉลี่ยถ่วงน้ำหนักว่าแต่ละแหล่งอ้างอิงสนับสนุนเวลาเริ่มและสิ้นสุดด้านบนมากเพียงใด แหล่งอ้างอิงจะมีน้ำหนักลดลงครึ่งหนึ่งทุก ๆ 180 วันที่เก่ากว่าแหล่งล่าสุด
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· โพสต์ 28 ก.ย. 2026· เริ่ม 4 มี.ค. 2024 ✓· 33% ของคะแนน
โพสต์ของ Anthropic[2] ลงวันที่ “4 มี.ค. 2024” และระบุว่า “Opus และ Sonnet พร้อมใช้งานแล้วใน claude[3].ai และ Claude API ซึ่งตอนนี้เปิดให้ใช้งานทั่วไปใน 159 ประเทศ” ส่วน CNBC[4] และ TechCrunch[5] รายงานการเปิดตัวในวันจันทร์เดียวกัน
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· เพิ่มเมื่อ 28 ก.ย. 2026· 33% ของคะแนน
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· เพิ่มเมื่อ 28 ก.ย. 2026· 33% ของคะแนน
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· เผยแพร่ 4 มี.ค. 2024· เริ่ม 4 มี.ค. 2024· 1% ของคะแนน
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· เผยแพร่ 4 มี.ค. 2024· เริ่ม 4 มี.ค. 2024· 1% ของคะแนน
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
เสนอการแก้ไข
มีอะไรขาดหรือผิดไหม บอกด้วยคำพูดของคุณเอง: ลิงก์ที่สนับสนุนหมุดนี้ วันที่เริ่มหรือสิ้นสุดที่ต่างออกไปพร้อมเหตุผล หรือข้อเท็จจริงที่ขาดหรือผิด AI จะตรวจสอบกับแหล่งที่มาของหมุด ค้นหาแหล่งที่ดีกว่า และเพิ่มหน้าที่สนับสนุนคุณ แหล่งที่มาของหมุดเองยังคงมีน้ำหนักมากที่สุด รูปภาพที่แสดงสิ่งอื่นหรือแสดงได้ไม่ดีก็จะถูกตรวจสอบ และเลื่อนลงหรือแทนที่