- Bắt đầu
- 4 thg 3, 2024ĐỘ TIN CẬY 95%từ anthropic.com
Claude 3 Sonnet ra mắt
Được dịch tự động từ bản gốc
Tiêu đề gốc: Claude 3 Sonnet Released
- Ngày 4 tháng 3 năm 2024, Anthropic công bố họ Claude 3 - Haiku, Sonnet và Opus - với Opus và Sonnet “hiện có thể dùng trên claude.ai và Claude API”, nay đã sẵn sàng rộng rãi tại 159 quốc gia; Haiku sẽ đến sau[3]
- Sonnet vận hành “trải nghiệm miễn phí trên claude.ai”, còn Opus dành riêng cho người đăng ký Claude Pro, và ra mắt cùng ngày trên Amazon Bedrock và ở dạng bản xem trước riêng tư trên Vertex AI Model Garden của Google Cloud[3][4]
- Anthropic giới thiệu mô hình là mô hình “đạt sự cân bằng lý tưởng giữa trí thông minh và tốc độ—đặc biệt cho khối lượng công việc doanh nghiệp”, và ở hầu hết khối lượng công việc nhanh gấp đôi Claude 2 và Claude 2.1[3][4]
- Cả họ mô hình giữ ở Mức An toàn AI 2 (ASL-2) theo Chính sách Mở rộng Có trách nhiệm của Anthropic, và từ chối các lời nhắc vô hại gần ranh giới bảo vệ ít thường xuyên hơn nhiều so với các mô hình Claude trước đó[3]
- Khi Anthropic cho Claude 3 Sonnet ngừng hoạt động vào tháng 7 năm 2025, khoảng 200 người đã tụ họp tại San Francisco để dự một “đám tang”[2]
Tính năng nổi bật
- Có giá 3 đô la cho mỗi triệu token đầu vào và 15 đô la cho mỗi triệu token đầu ra, với cửa sổ ngữ cảnh 200K token[3]
- Thế hệ Claude đầu tiên có thị giác: đọc được ảnh chụp, biểu đồ, đồ thị và sơ đồ kỹ thuật, tối đa 20 hình ảnh trong một yêu cầu, dù Anthropic đã chặn nó nhận dạng con người[1][5]
- Điểm chuẩn trong thẻ mô hình: 79.0% trên MMLU (5-shot), 40.4% trên GPQA Diamond, 92.3% trên GSM8K và 73.0% trên lập trình Python HumanEval[1]
- Được huấn luyện trên phần cứng của Amazon Web Services và Google Cloud với PyTorch, JAX và Triton; mô hình trả lời từ dữ liệu trước tháng 8 năm 2023 và không thể tìm kiếm trên web[1][5]
- Các cách dùng Anthropic gợi ý: truy xuất trên các cơ sở tri thức lớn, gợi ý sản phẩm và dự báo, tạo mã và phân tích văn bản từ hình ảnh[3]
Điểm chuẩn[3]
| Chuẩn đánh giá | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| Kiến thức trình độ đại học (MMLU) | 86.8% (5-shot) | 79.0% (5-shot) | 75.2% (5-shot) | 86.4% (5-shot) | 70.0% (5-shot) | 83.7% (5-shot) | 71.8% (5-shot) |
| Suy luận trình độ sau đại học (GPQA, Diamond) | 50.4% (0-shot CoT) | 40.4% (0-shot CoT) | 33.3% (0-shot CoT) | 35.7% (0-shot CoT) | 28.1% (0-shot CoT) | — | — |
| Toán tiểu học (GSM8K) | 95.0% (0-shot CoT) | 92.3% (0-shot CoT) | 88.9% (0-shot CoT) | 92.0% (5-shot CoT) | 57.1% (5-shot) | 94.4% (Maj1@32) | 86.5% (Maj1@32) |
| Giải toán (MATH) | 60.1% (0-shot CoT) | 43.1% (0-shot CoT) | 38.9% (0-shot CoT) | 52.9% (4-shot) | 34.1% (4-shot) | 53.2% (4-shot) | 32.6% (4-shot) |
| Toán đa ngôn ngữ (MGSM) | 90.7% (0-shot) | 83.5% (0-shot) | 75.1% (0-shot) | 74.5% (8-shot) | — | 79.0% (8-shot) | 63.5% (8-shot) |
| Mã (HumanEval) | 84.9% (0-shot) | 73.0% (0-shot) | 75.9% (0-shot) | 67.0% (0-shot) | 48.1% (0-shot) | 74.4% (0-shot) | 67.7% (0-shot) |
| Suy luận trên văn bản (DROP, điểm F1) | 83.1 (3-shot) | 78.9 (3-shot) | 78.4 (3-shot) | 80.9 (3-shot) | 64.1 (3-shot) | 82.4 (số shot thay đổi) | 74.1 (số shot thay đổi) |
| Đánh giá hỗn hợp (BIG-Bench-Hard) | 86.8% (3-shot CoT) | 82.9% (3-shot CoT) | 73.7% (3-shot CoT) | 83.1% (3-shot CoT) | 66.6% (3-shot CoT) | 83.6% (3-shot CoT) | 75.0% (3-shot CoT) |
| Hỏi đáp kiến thức (ARC-Challenge) | 96.4% (25-shot) | 93.2% (25-shot) | 89.2% (25-shot) | 96.3% (25-shot) | 85.2% (25-shot) | — | — |
| Kiến thức thông thường (HellaSwag) | 95.4% (10-shot) | 89.0% (10-shot) | 85.9% (10-shot) | 95.3% (10-shot) | 85.5% (10-shot) | 87.8% (10-shot) | 84.7% (10-shot) |
Tài liệu tham khảo 5ĐỘ TIN CẬY 83%Độ tin cậy tổng thể: 83%Mức độ nguồn và tài liệu tham khảo của ghim củng cố các ngày của nó.Trung bình có trọng số về mức độ 5 tài liệu, gồm cả nguồn, ủng hộ thời điểm bắt đầu và kết thúc của ghim; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhấtHiện tất cả ghim có độ tin cậy từ 75% trở lên
Mục đầu tiên luôn là nguồn của ghim. Độ tin cậy tổng thể là trung bình có trọng số về mức độ mỗi tài liệu ủng hộ thời điểm bắt đầu và kết thúc được dùng ở trên; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhất.
- [1]90%anthropic.com/claude-3-model-cardanthropic.com· Đăng 28 thg 9, 2026· Bắt đầu 4 thg 3, 2024· 48% điểm số
Thẻ mô hình không ghi ngày ra mắt, nên ngày lấy theo bài đăng ra mắt: “Giới thiệu thế hệ Claude tiếp theo, Mar 4, 2024” - “Opus và Sonnet hiện có thể dùng trên claude.ai và Claude API”; bài đăng ngày 04 MAR 2024 của AWS thông báo “sự có mặt của Claude 3 Sonnet của Anthropic[3] ngay hôm nay trên Amazon[4] Bedrock”.
- [2]75%Claude (AI) - Wikipediaen.wikipedia.org· Thêm 28 thg 9, 2026· 48% điểm số
The Sonnet table lists Claude 3 Sonnet as released 4 March 2024 and discontinued; the article adds that when Anthropic[1][3] retired it in July 2025 around 200 people gathered in San Francisco for a "funeral".
- [3]95%Introducing the next generation of Claudeanthropic.com· Xuất bản 4 thg 3, 2024· Bắt đầu 4 thg 3, 2024 ✓· 1% điểm số
Anthropic's[1] launch post, dated "Mar 4, 2024": "Opus and Sonnet are now available to use in claude.ai and the Claude API which is now generally available in 159 countries", with Sonnet at $3/$15 per million tokens and a 200K context window, powering the free claude.ai. The model card that is the source carries no launch date, so this row dates the pin.
- [4]90%Anthropic's Claude 3 Sonnet foundation model is now available in Amazon Bedrockaws.amazon.com· Xuất bản 4 thg 3, 2024· Bắt đầu 4 thg 3, 2024· 1% điểm số
AWS News Blog post by Channy Yun, 04 MAR 2024: "We're also announcing the availability of Anthropic's[1][3] Claude 3 Sonnet today in Amazon Bedrock, with Claude 3 Opus and Claude 3 Haiku coming soon"; Sonnet is two times faster than Claude 2 and 2.1.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Xuất bản 4 thg 3, 2024· Bắt đầu 4 thg 3, 2024· 1% điểm số
TechCrunch's same-day report: Opus and Sonnet "are available now on the web and via Anthropic's[1][3] dev console and API, Amazon's[4] Bedrock platform and Google's Vertex AI"; Claude 3 is Anthropic's first multimodal model, takes up to 20 images per request, cannot identify people and answers only from data before August 2023.
Đề xuất chỉnh sửa
Thiếu hay sai điều gì? Hãy nói bằng lời của bạn: một liên kết củng cố ghim này, một ngày bắt đầu hoặc kết thúc khác kèm lý do, hoặc một thông tin còn thiếu hay sai. AI đối chiếu với các nguồn của ghim này, tìm nguồn tốt hơn và thêm mọi trang ủng hộ bạn. Các nguồn của chính ghim vẫn được tính nhiều nhất. Hình ảnh thể hiện nội dung khác hoặc thể hiện kém cũng được xem xét, rồi bị hạ xuống hoặc thay thế.