- Bắt đầu
- 4 thg 3, 2024ĐỘ TIN CẬY 90%từ nguồn
Claude 3 Opus ra mắt
Được dịch tự động từ bản gốc
Tiêu đề gốc: Claude 3 Opus Released
- Ngày 4 tháng 3 năm 2024, Anthropic công bố họ Claude 3 - Haiku, Sonnet và Opus “theo thứ tự tăng dần về năng lực” - với Opus và Sonnet có sẵn ngay trong ngày trên claude.ai và Claude API, nay đã sẵn sàng rộng rãi tại 159 quốc gia[1][4]
- Trên claude.ai, Opus dành cho người đăng ký Claude Pro trong khi Sonnet vận hành trải nghiệm miễn phí; Sonnet đến Amazon Bedrock và bản xem trước riêng tư của Google Cloud Vertex AI ngay hôm đó, “còn Opus và Haiku sẽ sớm có mặt trên cả hai”[1]
- Anthropic giữ mô hình ở Mức An toàn AI 2 (ASL-2) sau khi thử nghiệm red-team cho thấy “khả năng gây rủi ro thảm khốc là không đáng kể ở thời điểm này”[1]
- CNBC lưu ý những bên hậu thuẫn Anthropic gồm Google, Salesforce và Amazon, sau các thỏa thuận tài trợ tổng cộng khoảng 7.3 tỷ đô la trong năm trước đó[4]
- Claude 3 Opus bị đánh dấu lỗi thời vào ngày 30 tháng 6 năm 2025 và ngừng hoạt động trên Claude API vào ngày 5 tháng 1 năm 2026, được thay bằng Claude Opus 4.8[3]
Tính năng nổi bật
- Claude 3 Opus là “mô hình thông minh nhất của chúng tôi, với hiệu năng tốt nhất thị trường ở các tác vụ rất phức tạp”, có giá 15 đô la cho mỗi triệu token đầu vào và 75 đô la cho mỗi triệu token đầu ra[1][5]
- Các bài đánh giá Anthropic công bố: 86.8% trên MMLU, 50.4% trên GPQA Diamond, 95.0% trên GSM8K và 84.9% trên HumanEval, vượt các mức 86.4%, 35.7%, 92.0% và 67.0% của GPT-4[1]
- Cửa sổ ngữ cảnh 200K token khi ra mắt, với đầu vào trên 1 triệu token có sẵn “cho các trường hợp sử dụng cụ thể”; trong bài kiểm tra ghi nhớ Needle In A Haystack, mô hình vượt 99% độ chính xác và đôi lúc nhận ra câu được gài vào trông như bị chèn một cách nhân tạo[1][5]
- Mô hình thị giác đầu tiên của Claude: đọc được ảnh chụp, biểu đồ, đồ thị và sơ đồ kỹ thuật, tối đa 20 hình ảnh trong một yêu cầu, nhưng sẽ không nhận dạng con người[1][5]
- Opus “ít có khả năng hơn đáng kể” so với các mô hình Claude trước đó trong việc từ chối các lời nhắc vô hại, và gấp đôi độ chính xác của Claude 2.1 ở các câu hỏi thực tế mở khó; kiến thức kéo dài đến tháng 8 năm 2023[1][2]
Điểm chuẩn[1]
| Chuẩn đánh giá | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (kiến thức trình độ đại học) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (suy luận trình độ sau đại học) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (toán tiểu học) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (giải toán) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (toán đa ngôn ngữ) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (mã) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, điểm F1 (suy luận trên văn bản) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 số shot thay đổi | 74.1 số shot thay đổi |
| BIG-Bench-Hard (đánh giá hỗn hợp) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (hỏi đáp kiến thức) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (kiến thức thông thường) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
Tài liệu tham khảo 5ĐỘ TIN CẬY 90%Độ tin cậy tổng thể: 90%Mức độ nguồn và tài liệu tham khảo của ghim củng cố các ngày của nó.Trung bình có trọng số về mức độ 5 tài liệu, gồm cả nguồn, ủng hộ thời điểm bắt đầu và kết thúc của ghim; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhấtHiện tất cả ghim có độ tin cậy từ 75% trở lên
Mục đầu tiên luôn là nguồn của ghim. Độ tin cậy tổng thể là trung bình có trọng số về mức độ mỗi tài liệu ủng hộ thời điểm bắt đầu và kết thúc được dùng ở trên; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhất.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Đăng 28 thg 9, 2026· Bắt đầu 4 thg 3, 2024 ✓· 33% điểm số
Bài đăng của Anthropic[2] đề ngày “Mar 4, 2024” và nói “Opus và Sonnet hiện có thể dùng trên claude[3].ai và Claude API, nay đã sẵn sàng rộng rãi tại 159 quốc gia”; CNBC[4] và TechCrunch[5] đưa tin về đợt ra mắt trong cùng ngày Thứ Hai đó.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Thêm 28 thg 9, 2026· 33% điểm số
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Thêm 28 thg 9, 2026· 33% điểm số
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Xuất bản 4 thg 3, 2024· Bắt đầu 4 thg 3, 2024· 1% điểm số
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Xuất bản 4 thg 3, 2024· Bắt đầu 4 thg 3, 2024· 1% điểm số
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Đề xuất chỉnh sửa
Thiếu hay sai điều gì? Hãy nói bằng lời của bạn: một liên kết củng cố ghim này, một ngày bắt đầu hoặc kết thúc khác kèm lý do, hoặc một thông tin còn thiếu hay sai. AI đối chiếu với các nguồn của ghim này, tìm nguồn tốt hơn và thêm mọi trang ủng hộ bạn. Các nguồn của chính ghim vẫn được tính nhiều nhất. Hình ảnh thể hiện nội dung khác hoặc thể hiện kém cũng được xem xét, rồi bị hạ xuống hoặc thay thế.