- Bắt đầu
- 22 thg 10, 2024ĐỘ TIN CẬY 90%từ nguồn
Claude 3.5 Sonnet nâng cấp ra mắt
Được dịch tự động từ bản gốc
Tiêu đề gốc: Claude 3.5 Sonnet Upgrade Released
- Anthropic công bố “một Claude 3.5 Sonnet nâng cấp” với “những cải tiến toàn diện so với người tiền nhiệm, đặc biệt đáng kể về lập trình”, có sẵn cho mọi người dùng ngay hôm đó, cùng Claude 3.5 Haiku mới vào cuối tháng[1]
- Tính năng sử dụng máy tính xuất hiện ở dạng beta công khai: Claude nhìn màn hình, di chuyển con trỏ, bấm nút và gõ phím, và Anthropic gọi 3.5 Sonnet là “mô hình AI tiên phong đầu tiên cung cấp tính năng sử dụng máy tính ở dạng beta công khai” - “vẫn còn mang tính thử nghiệm—đôi lúc vụng về và dễ mắc lỗi”[1][4]
- Để điều khiển con trỏ, Claude đếm số điểm ảnh cần di chuyển trên từng ảnh chụp màn hình; Anthropic huấn luyện kỹ năng này trên các phần mềm đơn giản như máy tính bỏ túi và trình soạn thảo văn bản[3]
- Nhà phát triển có thể dùng nó ngay hôm đó trên Anthropic API, Amazon Bedrock và Vertex AI của Google Cloud; Asana, Canva, Cognition, DoorDash, Replit và The Browser Company là những người dùng đầu tiên, và Amazon đã có quyền truy cập sớm[1][5]
- Các Viện An toàn AI của Hoa Kỳ và Vương quốc Anh đã cùng thử nghiệm mô hình trước khi phát hành; Anthropic giữ nó ở mức ASL-2 và bổ sung các bộ phân loại phát hiện việc sử dụng máy tính và liệu có gây hại hay không[1]
Tính năng nổi bật
- Cùng giá và tốc độ với bản 3.5 Sonnet hồi tháng 6[1]
- SWE-bench Verified tăng từ 33.4% lên 49.0%, cao hơn mọi mô hình công khai khác kể cả o1-preview của OpenAI[1]
- Điểm dùng công cụ kiểu tác tử trên TAU-bench tăng từ 62.6% lên 69.2% ở mảng bán lẻ và từ 36.0% lên 46.0% ở mảng hàng không[1]
- Trên OSWorld, mô hình đạt 14.9% chỉ từ ảnh chụp màn hình so với 7.8% của hệ thống tốt nhất kế tiếp, và 22.0% khi được phép dùng nhiều bước hơn[1][2]
- Cuộn trang, kéo thả và phóng to vẫn còn khó với mô hình, và Anthropic khuyên nên bắt đầu với các tác vụ rủi ro thấp[1]
Điểm chuẩn[1]
| Chuẩn đánh giá | Claude 3.5 Sonnet (mới) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Suy luận trình độ sau đại học (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| Kiến thức trình độ đại học (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| Mã (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| Giải toán (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| Thi toán trung học phổ thông (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| Hỏi đáp trực quan (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| Lập trình tác tử (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| Dùng công cụ kiểu tác tử (TAU-bench), bán lẻ | 69.2% | 51.0% | 62.6% | — | — | — | — |
| Dùng công cụ kiểu tác tử (TAU-bench), hàng không | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Các bảng đánh giá của Anthropic loại trừ họ mô hình o1 của OpenAI, vì chúng phụ thuộc vào thời gian tính toán trước khi phản hồi rất dài, không như các mô hình thông thường.
Tài liệu tham khảo 5ĐỘ TIN CẬY 90%Độ tin cậy tổng thể: 90%Mức độ nguồn và tài liệu tham khảo của ghim củng cố các ngày của nó.Trung bình có trọng số về mức độ 5 tài liệu, gồm cả nguồn, ủng hộ thời điểm bắt đầu và kết thúc của ghim; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhấtHiện tất cả ghim có độ tin cậy từ 75% trở lên
Mục đầu tiên luôn là nguồn của ghim. Độ tin cậy tổng thể là trung bình có trọng số về mức độ mỗi tài liệu ủng hộ thời điểm bắt đầu và kết thúc được dùng ở trên; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhất.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Đăng 28 thg 9, 2026· Bắt đầu 22 thg 10, 2024 ✓· 46% điểm số
Bài đăng đề ngày “Oct 22, 2024” và nói “Claude 3.5 Sonnet nâng cấp hiện đã có cho mọi người dùng. Bắt đầu từ hôm nay, nhà phát triển có thể xây dựng với bản beta sử dụng máy tính”; TechCrunch[4] và CNBC[5] đưa tin về bản phát hành “vào Thứ Ba” cùng ngày.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Thêm 28 thg 9, 2026· 46% điểm số
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Xuất bản 22 thg 10, 2024· 3% điểm số
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Xuất bản 22 thg 10, 2024· Bắt đầu 22 thg 10, 2024· 3% điểm số
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Xuất bản 22 thg 10, 2024· Bắt đầu 22 thg 10, 2024· 3% điểm số
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Đề xuất chỉnh sửa
Thiếu hay sai điều gì? Hãy nói bằng lời của bạn: một liên kết củng cố ghim này, một ngày bắt đầu hoặc kết thúc khác kèm lý do, hoặc một thông tin còn thiếu hay sai. AI đối chiếu với các nguồn của ghim này, tìm nguồn tốt hơn và thêm mọi trang ủng hộ bạn. Các nguồn của chính ghim vẫn được tính nhiều nhất. Hình ảnh thể hiện nội dung khác hoặc thể hiện kém cũng được xem xét, rồi bị hạ xuống hoặc thay thế.