- Mulai
- 22 Okt 2024KEYAKINAN 90%dari sumbernya
Peningkatan Claude 3.5 Sonnet Dirilis
Diterjemahkan otomatis dari aslinya
Judul asli: Claude 3.5 Sonnet Upgrade Released
- Anthropic mengumumkan “Claude 3.5 Sonnet yang ditingkatkan” dengan “peningkatan menyeluruh dibanding pendahulunya, dengan kemajuan yang sangat signifikan dalam pemrograman”, tersedia bagi semua pengguna hari itu, dan Claude 3.5 Haiku baru untuk akhir bulan[1]
- Penggunaan komputer hadir dalam beta publik: Claude melihat layar, menggerakkan kursor, mengeklik tombol, dan mengetik, dan Anthropic menyebut 3.5 Sonnet “model AI frontier pertama yang menawarkan penggunaan komputer dalam beta publik” - “masih bersifat eksperimental—kadang kikuk dan rawan kesalahan”[1][4]
- Untuk mengarahkan kursor, Claude menghitung piksel yang perlu digeser pada setiap tangkapan layar; Anthropic melatih keterampilan itu pada perangkat lunak sederhana seperti kalkulator dan editor teks[3]
- Pengembang dapat memakainya hari itu di Anthropic API, Amazon Bedrock, dan Vertex AI milik Google Cloud; Asana, Canva, Cognition, DoorDash, Replit, dan The Browser Company adalah pengguna awal, dan Amazon mendapat akses awal[1][5]
- Institut Keselamatan AI AS dan Inggris mengujinya bersama sebelum rilis; Anthropic mempertahankannya pada ASL-2 dan menambahkan pengklasifikasi yang mendeteksi penggunaan komputer dan apakah bahaya sedang terjadi[1]
Fitur unggulan
- Harga dan kecepatan sama dengan 3.5 Sonnet versi Juni[1]
- SWE-bench Verified naik dari 33.4% menjadi 49.0%, di atas semua model yang tersedia untuk umum termasuk o1-preview milik OpenAI[1]
- Penggunaan alat agen TAU-bench naik dari 62.6% menjadi 69.2% di ritel dan dari 36.0% menjadi 46.0% di ranah maskapai[1]
- Pada OSWorld model ini mencetak 14.9% dari tangkapan layar saja dibandingkan 7.8% milik sistem terbaik berikutnya, dan 22.0% ketika diberi lebih banyak langkah[1][2]
- Menggulir, menyeret, dan memperbesar masih sulit baginya, dan Anthropic menyarankan memulai dengan tugas berisiko rendah[1]
Tolok ukur[1]
| Tolok ukur | Claude 3.5 Sonnet (new) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Penalaran tingkat pascasarjana (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| Pengetahuan tingkat sarjana (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| Kode (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| Pemecahan soal matematika (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| Kompetisi matematika SMA (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| Tanya jawab visual (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| Pemrograman agen (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| Penggunaan alat agen (TAU-bench), ritel | 69.2% | 51.0% | 62.6% | — | — | — | — |
| Penggunaan alat agen (TAU-bench), maskapai | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Tabel evaluasi Anthropic tidak menyertakan keluarga model o1 milik OpenAI, karena bergantung pada waktu komputasi pra-respons yang ekstensif, tidak seperti model pada umumnya.
Referensi 5KEYAKINAN 90%Keyakinan keseluruhan: 90%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 5 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Diposting 28 Sep 2026· Mulai 22 Okt 2024 ✓· 46% dari skor
Unggahan itu bertanggal “22 Okt 2024” dan menyatakan “Claude 3.5 Sonnet yang ditingkatkan kini tersedia untuk semua pengguna. Mulai hari ini, pengembang dapat membangun dengan beta penggunaan komputer”; TechCrunch[4] dan CNBC[5] melaporkan rilis itu “pada hari Selasa” yang sama.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Ditambahkan 28 Sep 2026· 46% dari skor
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Diterbitkan 22 Okt 2024· 3% dari skor
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Diterbitkan 22 Okt 2024· Mulai 22 Okt 2024· 3% dari skor
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Diterbitkan 22 Okt 2024· Mulai 22 Okt 2024· 3% dari skor
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.