- Beginn
- 20. Juni 202492 % SICHERHEITlaut techcrunch.com
Claude 3.5 Sonnet veröffentlicht
Automatisch aus dem Original übersetzt
Originaltitel: Claude 3.5 Sonnet Released
- „Heute veröffentlichen wir Claude 3.5 Sonnet – unsere erste Veröffentlichung in der kommenden Claude-3.5-Modellfamilie“, das Claude 3 Opus übertrifft, „bei der Geschwindigkeit und den Kosten unseres mittleren Modells, Claude 3 Sonnet“[1][4]
- Kostenlos auf Claude.ai und in der Claude-iOS-App, mit höheren Rate-Limits für Pro- und Team-Abonnenten, und am selben Tag verfügbar auf der Anthropic API, Amazon Bedrock und Google Clouds Vertex AI[1][5]
- Es startete mit Artifacts, einem Fenster neben der Konversation, in dem Code, Dokumente und Website-Designs erscheinen, sodass Nutzer sie in Echtzeit sehen, bearbeiten und weiterentwickeln können[1][3]
- Es blieb bei ASL-2; Anthropic übergab es dem UK AI Safety Institute für Tests vor der Einführung, das die Ergebnisse mit dem US AI Safety Institute teilte[1]
- Anthropic erklärte, die Familie später 2024 mit Claude 3.5 Haiku und Claude 3.5 Opus zu vervollständigen[1]
Bemerkenswerte Merkmale
- Bepreist mit 3 $ pro Million Eingabetokens und 15 $ pro Million Ausgabetokens, mit einem 200.000-Token-Kontextfenster; AWS bezeichnet es als 80 Prozent günstiger als Claude 3 Opus[1][5]
- Läuft doppelt so schnell wie Claude 3 Opus[1][4]
- Anthropics Model Card: 59,4 % bei GPQA Diamond, 88,7 % bei MMLU, 92,0 % bei HumanEval und 71,1 % bei MATH, gegenüber 50,4 %, 86,8 %, 84,9 % und 60,1 % bei Claude 3 Opus[2]
- Es löste 64 % der Aufgaben in einer internen Bewertung zu agentischer Programmierung – das Beheben eines Bugs oder das Hinzufügen einer Funktion zu einer Open-Source-Codebasis – gegenüber 38 % bei Claude 3 Opus[1][2]
- Anthropics bislang stärkstes Vision-Modell: besser im Lesen von Diagrammen und Grafiken und im Transkribieren von Text aus unvollkommenen Bildern, mit 68,3 % bei MMMU[1][2]
Benchmarks[1]
| Benchmark | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (früher Snapshot) |
|---|---|---|---|---|---|
| Schlussfolgern auf Graduiertenniveau (GPQA, Diamond) | 59,4 %* (0-shot CoT) | 50,4 % (0-shot CoT) | 53,6 % (0-shot CoT) | — | — |
| Wissen auf Bachelor-Niveau (MMLU), 5-shot | 88,7 %** (5-shot) | 86,8 % (5-shot) | — | 85,9 % (5-shot) | 86,1 % (5-shot) |
| Wissen auf Bachelor-Niveau (MMLU), 0-shot CoT | 88,3 % (0-shot CoT) | 85,7 % (0-shot CoT) | 88,7 % (0-shot CoT) | — | — |
| Code (HumanEval) | 92,0 % (0-shot) | 84,9 % (0-shot) | 90,2 % (0-shot) | 84,1 % (0-shot) | 84,1 % (0-shot) |
| Mehrsprachige Mathematik (MGSM) | 91,6 % (0-shot CoT) | 90,7 % (0-shot CoT) | 90,5 % (0-shot CoT) | 87,5 % (8-shot) | — |
| Schlussfolgern über Text (DROP, F1-Wert) | 87,1 (3-shot) | 83,1 (3-shot) | 83,4 (3-shot) | 74,9 (variable Shot-Anzahl) | 83,5 (3-shot, vortrainiertes Modell) |
| Gemischte Bewertungen (BIG-Bench-Hard) | 93,1 % (3-shot CoT) | 86,8 % (3-shot CoT) | — | 89,2 % (3-shot CoT) | 85,3 % (3-shot CoT, vortrainiertes Modell) |
| Mathematisches Problemlösen (MATH) | 71,1 % (0-shot CoT) | 60,1 % (0-shot CoT) | 76,6 % (0-shot CoT) | 67,7 % (4-shot) | 57,8 % (4-shot CoT) |
| Grundschulmathematik (GSM8K) | 96,4 % (0-shot CoT) | 95,0 % (0-shot CoT) | — | 90,8 % (11-shot) | 94,1 % (8-shot CoT) |
* Claude 3.5 Sonnet erreicht 67,2 % bei 5-shot-CoT-GPQA mit maj@32. ** Claude 3.5 Sonnet erreicht 90,4 % bei MMLU mit 5-shot-CoT-Prompting.
Belege 585 % SICHERHEITGesamtvertrauen: 85%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 5 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Gepostet am 28. Sept. 2026· Beginn 20. Juni 2024· 32 % der Wertung
Anthropic[2]: „Heute veröffentlichen wir Claude 3.5 Sonnet“, und es sei „jetzt kostenlos auf Claude.ai verfügbar“; die Kopfzeile der Seite zeigt inzwischen Jun 21, 2024, doch TechCrunch[4] und AWS veröffentlichten den Launch beide am 20. Juni 2024, und die Modell-ID lautet claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Hinzugefügt am 28. Sept. 2026· 32 % der Wertung
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Hinzugefügt am 28. Sept. 2026· 32 % der Wertung
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Veröffentlicht am 20. Juni 2024· Beginn 20. Juni 2024 ✓· 1 % der Wertung
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Veröffentlicht am 20. Juni 2024· Beginn 20. Juni 2024· 1 % der Wertung
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.