- Beginn
- 22. Okt. 202490 % SICHERHEITlaut der Quelle
Upgrade für Claude 3.5 Sonnet veröffentlicht
Automatisch aus dem Original übersetzt
Originaltitel: Claude 3.5 Sonnet Upgrade Released
- Anthropic kündigte „ein aktualisiertes Claude 3.5 Sonnet“ an mit „durchgängigen Verbesserungen gegenüber seinem Vorgänger, mit besonders deutlichen Fortschritten bei der Programmierung“, ab diesem Tag für alle Nutzer verfügbar, sowie das neue Claude 3.5 Haiku für später im Monat[1]
- Computer Use erschien in öffentlicher Beta: Claude betrachtet den Bildschirm, bewegt einen Cursor, klickt Schaltflächen an und tippt, und Anthropic nennt 3.5 Sonnet „das erste Frontier-KI-Modell, das Computer Use in öffentlicher Beta anbietet“ – „noch experimentell, zeitweise umständlich und fehleranfällig“[1][4]
- Um den Cursor zu steuern, zählt Claude bei jedem Screenshot die Pixel, die es bewegen muss; Anthropic trainierte die Fähigkeit an einfacher Software wie einem Taschenrechner und einem Texteditor[3]
- Entwickler konnten es noch am selben Tag auf der Anthropic API, Amazon Bedrock und Google Clouds Vertex AI nutzen; Asana, Canva, Cognition, DoorDash, Replit und The Browser Company waren frühe Nutzer, und Amazon hatte frühen Zugriff[1][5]
- Die AI Safety Institutes der USA und Großbritanniens testeten es gemeinsam vor der Veröffentlichung; Anthropic beließ es bei ASL-2 und fügte Klassifikatoren hinzu, die Computer Use erkennen und ob dabei Schaden entsteht[1]
Bemerkenswerte Merkmale
- Gleicher Preis und gleiche Geschwindigkeit wie das 3.5 Sonnet vom Juni[1]
- SWE-bench Verified steigt von 33,4 % auf 49,0 %, über jedem öffentlich verfügbaren Modell einschließlich OpenAIs o1-preview[1]
- Die agentische Tool-Nutzung bei TAU-bench steigt im Einzelhandel von 62,6 % auf 69,2 % und im Bereich Fluggesellschaft von 36,0 % auf 46,0 %[1]
- Bei OSWorld erzielte es allein anhand von Screenshots 14,9 % gegenüber 7,8 % beim nächstbesten System, und 22,0 %, wenn mehr Schritte erlaubt waren[1][2]
- Scrollen, Ziehen und Zoomen fielen ihm noch schwer, und Anthropic empfahl, mit risikoarmen Aufgaben zu beginnen[1]
Benchmarks[1]
| Benchmark | Claude 3.5 Sonnet (neu) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Schlussfolgern auf Graduiertenniveau (GPQA Diamond) | 65,0 % (0-shot CoT) | 41,6 % (0-shot CoT) | 59,4 % (0-shot CoT) | 53,6 % (0-shot CoT) | 40,2 % (0-shot CoT) | 59,1 % (0-shot CoT) | 51,0 % (0-shot CoT) |
| Wissen auf Bachelor-Niveau (MMLU Pro) | 78,0 % (0-shot CoT) | 65,0 % (0-shot CoT) | 75,1 % (0-shot CoT) | — | — | 75,8 % (0-shot CoT) | 67,3 % (0-shot CoT) |
| Code (HumanEval) | 93,7 % (0-shot) | 88,1 % (0-shot) | 92,0 % (0-shot) | 90,2 % (0-shot) | 87,2 % (0-shot) | — | — |
| Mathematisches Problemlösen (MATH) | 78,3 % (0-shot CoT) | 69,2 % (0-shot CoT) | 71,1 % (0-shot CoT) | 76,6 % (0-shot CoT) | 70,2 % (0-shot CoT) | 86,5 % (4-shot CoT) | 77,9 % (4-shot CoT) |
| Mathematikwettbewerb auf Highschool-Niveau (AIME 2024) | 16,0 % (0-shot CoT) | 5,3 % (0-shot CoT) | 9,6 % (0-shot CoT) | 9,3 % (0-shot CoT) | — | — | — |
| Visuelle Fragen und Antworten (MMMU) | 70,4 % (0-shot CoT) | — | 68,3 % (0-shot CoT) | 69,1 % (0-shot CoT) | 59,4 % (0-shot CoT) | 65,9 % (0-shot CoT) | 62,3 % (0-shot CoT) |
| Agentische Programmierung (SWE-bench Verified) | 49,0 % | 40,6 % | 33,4 % | — | — | — | — |
| Agentische Tool-Nutzung (TAU-bench), Einzelhandel | 69,2 % | 51,0 % | 62,6 % | — | — | — | — |
| Agentische Tool-Nutzung (TAU-bench), Fluggesellschaft | 46,0 % | 22,8 % | 36,0 % | — | — | — | — |
* Anthropics Bewertungstabellen schließen OpenAIs o1-Modellfamilie aus, da diese im Gegensatz zu typischen Modellen von umfangreicher Rechenzeit vor der Antwort abhängt.
Belege 590 % SICHERHEITGesamtvertrauen: 90%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 5 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Gepostet am 28. Sept. 2026· Beginn 22. Okt. 2024 ✓· 46 % der Wertung
Der Beitrag ist auf „Oct 22, 2024“ datiert und sagt, „Das aktualisierte Claude 3.5 Sonnet ist jetzt für alle Nutzer verfügbar. Ab heute können Entwickler mit der Computer-Use-Beta entwickeln“; TechCrunch[4] und CNBC[5] berichten von der Veröffentlichung „am Dienstag“ desselben Tages.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Hinzugefügt am 28. Sept. 2026· 46 % der Wertung
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Veröffentlicht am 22. Okt. 2024· 3 % der Wertung
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Veröffentlicht am 22. Okt. 2024· Beginn 22. Okt. 2024· 3 % der Wertung
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Veröffentlicht am 22. Okt. 2024· Beginn 22. Okt. 2024· 3 % der Wertung
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.