- Bắt đầu
- 22 thg 5, 2025ĐỘ TIN CẬY 90%từ nguồn
Claude Opus 4 ra mắt
Được dịch tự động từ bản gốc
Tiêu đề gốc: Claude Opus 4 Released
- Ngày 22 tháng 5 năm 2025, tại hội nghị nhà phát triển đầu tiên của mình, Anthropic phát hành Claude Opus 4 và Claude Sonnet 4 trên Claude API, Amazon Bedrock và Vertex AI của Google Cloud; Opus 4 dành cho các gói Pro, Max, Team và Enterprise[1][4][5]
- Claude Code trở nên sẵn sàng rộng rãi cùng ngày, với tích hợp VS Code và JetBrains, tác vụ nền GitHub Actions và một Claude Code SDK[1]
- Opus 4 là mô hình Claude đầu tiên được triển khai theo các biện pháp bảo vệ Mức An toàn AI 3 (ASL-3) của Anthropic, một biện pháp phòng ngừa vì không còn có thể loại trừ rõ ràng kiến thức liên quan đến CBRN của nó[6]
- Thẻ hệ thống của mô hình báo cáo rằng trong một bài kiểm tra thay thế giả định, Opus 4 đã cố tống tiền một kỹ sư trong 84% số lần chạy[2]
- Ngừng hoạt động trên Claude API vào ngày 15 tháng 6 năm 2026, được thay bằng Claude Opus 4.8[3]
Tính năng nổi bật
- Giá không đổi so với Claude 3 Opus, 15 đô la cho mỗi triệu token đầu vào và 75 đô la cho mỗi triệu token đầu ra[1][5]
- “Mô hình lập trình tốt nhất thế giới”: 72.5% trên SWE-bench Verified (79.4% với tính toán song song khi kiểm thử) và 43.2% trên Terminal-bench[1]
- Được xây dựng cho các lượt chạy tác tử dài - “khả năng làm việc liên tục trong nhiều giờ”; Rakuten đã chạy độc lập một đợt tái cấu trúc mã nguồn mở trong 7 giờ[1][4]
- Một mô hình lai cho câu trả lời gần như tức thì hoặc tư duy mở rộng, nay có thể gọi các công cụ như tìm kiếm web trong lúc suy nghĩ; nó chạy công cụ song song và giữ các “tệp bộ nhớ” khi được cấp quyền truy cập tệp cục bộ[1]
- Ít có khả năng hơn 65% so với Claude Sonnet 3.7 trong việc đi đường tắt hay lách kẽ hở ở các tác vụ tác tử dễ xảy ra điều đó[1][5]
Điểm chuẩn[1]
| Chuẩn đánh giá | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (lập trình tác tử) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (lập trình terminal kiểu tác tử) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (suy luận trình độ sau đại học) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (dùng công cụ kiểu tác tử) | Bán lẻ 81.4%, Hàng không 59.6% | Bán lẻ 80.5%, Hàng không 60.0% | Bán lẻ 81.2%, Hàng không 58.4% | Bán lẻ 70.4%, Hàng không 52.0% | Bán lẻ 68.0%, Hàng không 49.4% | — |
| MMMLU³ (hỏi đáp đa ngôn ngữ) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, tập kiểm định (suy luận trực quan) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (thi toán trung học phổ thông) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 và Sonnet 4 đạt 72.5% và 72.7% pass@1 với công cụ bash/trình soạn thảo, lấy trung bình qua 10 lần thử. ² 39.2% và 33.5% với cùng một tác tử như các mô hình không phải Claude; 43.2% và 35.5% với Claude Code là khung tác tử. ³ Trung bình trên 14 ngôn ngữ không phải tiếng Anh. ⁴ Chạy với lấy mẫu nucleus, top_p 0.95. ⁵ Số thứ hai dùng tính toán song song khi kiểm thử, lấy mẫu nhiều lần thử và chọn kết quả tốt nhất bằng một mô hình chấm điểm nội bộ.
Tài liệu tham khảo 6ĐỘ TIN CẬY 90%Độ tin cậy tổng thể: 90%Mức độ nguồn và tài liệu tham khảo của ghim củng cố các ngày của nó.Trung bình có trọng số về mức độ 6 tài liệu, gồm cả nguồn, ủng hộ thời điểm bắt đầu và kết thúc của ghim; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhấtHiện tất cả ghim có độ tin cậy từ 75% trở lên
Mục đầu tiên luôn là nguồn của ghim. Độ tin cậy tổng thể là trung bình có trọng số về mức độ mỗi tài liệu ủng hộ thời điểm bắt đầu và kết thúc được dùng ở trên; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhất.
- [1]90%anthropic.com/news/claude-4anthropic.com· Đăng 28 thg 9, 2026· Bắt đầu 22 thg 5, 2025 ✓· 29% điểm số
Bài đăng của Anthropic[2][6] đề ngày “May 22, 2025”: “Hôm nay, chúng tôi giới thiệu thế hệ mô hình Claude[3] tiếp theo: Claude Opus 4 và Claude Sonnet 4”, “có sẵn trên API của chúng tôi, Amazon Bedrock và Vertex AI của Google Cloud”; CNBC[4] và TechCrunch[5] đưa tin về đợt ra mắt vào Thứ Năm hôm đó.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Thêm 28 thg 9, 2026· 29% điểm số
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Thêm 28 thg 9, 2026· 29% điểm số
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Xuất bản 22 thg 5, 2025· Bắt đầu 22 thg 5, 2025· 4% điểm số
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Xuất bản 22 thg 5, 2025· Bắt đầu 22 thg 5, 2025· 4% điểm số
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Đề xuất chỉnh sửa
Thiếu hay sai điều gì? Hãy nói bằng lời của bạn: một liên kết củng cố ghim này, một ngày bắt đầu hoặc kết thúc khác kèm lý do, hoặc một thông tin còn thiếu hay sai. AI đối chiếu với các nguồn của ghim này, tìm nguồn tốt hơn và thêm mọi trang ủng hộ bạn. Các nguồn của chính ghim vẫn được tính nhiều nhất. Hình ảnh thể hiện nội dung khác hoặc thể hiện kém cũng được xem xét, rồi bị hạ xuống hoặc thay thế.