- Beginn
- 24. Feb. 202590 % SICHERHEITlaut der Quelle
Claude 3.7 Sonnet veröffentlicht
Automatisch aus dem Original übersetzt
Originaltitel: Claude 3.7 Sonnet Released
- Anthropic bezeichnete Claude 3.7 Sonnet als „unser bisher intelligentestes Modell und das erste hybride Reasoning-Modell auf dem Markt“: ein Modell, das nahezu sofortige Antworten liefert oder „erweitertes, schrittweises Denken, das dem Nutzer sichtbar gemacht wird“[1][4]
- Es ging an jeden Claude-Plan – Free, Pro, Team und Enterprise – sowie an die Claude Developer Platform, Amazon Bedrock und Google Clouds Vertex AI; erweitertes Denken ist auf jeder Oberfläche außer der kostenlosen Stufe verfügbar[1][4]
- Claude Code, Anthropics erstes agentisches Programmiertool, erschien zugleich als begrenzte Forschungsvorschau, die vom Terminal aus arbeitet, und die GitHub-Integration kam zu jedem Claude-Plan[1]
- Es senkt unnötige Ablehnungen gegenüber seinem Vorgänger um 45 % und wurde unter dem ASL-2-Standard veröffentlicht[1][2]
- Die Versionsnummer sprang von 3.5 auf 3.7, und im Februar 2025 begann Claude 3.7 Sonnet, live auf Twitch Pokémon Rot zu spielen[3][4]
Bemerkenswerte Merkmale
- 3 $ pro Million Eingabetokens und 15 $ pro Million Ausgabetokens in beiden Modi, Denk-Tokens eingeschlossen[1][4]
- API-Nutzer legen ein Denkbudget beliebiger Größe bis zur Ausgabegrenze von 128.000 Tokens fest und tauschen so Geschwindigkeit und Kosten gegen Qualität[1]
- Anthropics Diagramme zeigen 62,3 % bei SWE-bench Verified (70,3 % mit einem angepassten Scaffold) gegenüber 49,0 % beim aktualisierten 3.5 Sonnet, sowie 81,2 % (Einzelhandel) und 58,4 % (Fluggesellschaft) bei TAU-bench[1]
- Anthropic erklärt, weniger für Mathematik- und Programmierwettbewerbe und mehr für reale Geschäftsaufgaben optimiert zu haben[1]
- Im Standardmodus ist es ein aktualisiertes Claude 3.5 Sonnet; im Modus des erweiterten Denkens reflektiert es, bevor es antwortet, was Mathematik, Physik, dem Befolgen von Anweisungen und Programmierung hilft[1]
Benchmarks[1]
| Benchmark | Claude 3.7 Sonnet (64K erweitertes Denken) | Claude 3.7 Sonnet (ohne erweitertes Denken) | Claude 3.5 Sonnet (neu) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K erweitertes Denken) | Grok 3 Beta (erweitertes Denken) |
|---|---|---|---|---|---|---|---|
| Schlussfolgern auf Graduiertenniveau (GPQA Diamond)³ | 78,2 % / 84,8 % | 68,0 % | 65,0 % | 75,7 % / 78,0 % | 79,7 % | 71,5 % | 80,2 % / 84,6 % |
| Agentische Programmierung (SWE-bench Verified)² | — | 62,3 % / 70,3 % | 49,0 % | 48,9 % | 49,3 % | 49,2 % | — |
| Agentische Tool-Nutzung (TAU-bench), Einzelhandel | — | 81,2 % | 71,5 % | 73,5 % | — | — | — |
| Agentische Tool-Nutzung (TAU-bench), Fluggesellschaft | — | 58,4 % | 48,8 % | 54,2 % | — | — | — |
| Mehrsprachige Fragen und Antworten (MMMLU) | 86,1 % | 83,2 % | 82,1 % | 87,7 % | 79,5 % | — | — |
| Visuelles Schlussfolgern (MMMU, Validierung) | 75 % | 71,8 % | 70,4 % | 78,2 % | — | — | 76,0 % / 78,0 % |
| Befolgen von Anweisungen (IFEval) | 93,2 % | 90,8 % | 90,2 % | — | — | 83,3 % | — |
| Mathematisches Problemlösen (MATH 500) | 96,2 % | 82,2 % | 78,0 % | 96,4 % | 97,9 % | 97,3 % | — |
| Mathematikwettbewerb auf Highschool-Niveau (AIME 2024)³ | 61,3 % / 80,0 % | 23,3 % | 16,0 % | 79,2 % / 83,3 % | 87,3 % | 79,8 % | 83,9 % / 93,3 % |
Pass@1, gemittelt über mehrere Durchläufe (bis zu 16 bei AIME und SWE-bench Verified); ein zweiter Wert profitiert von paralleler Test-Time-Compute. ¹ Die TAU-bench-Ergebnisse von o1 wurden von OpenAI gemeldet und später gelöscht; die TAU-bench-Ergebnisse sind möglicherweise nicht vergleichbar. ² 62,3 % ist pass@1 bei 500 Aufgaben mit Bash-/Editor-Tools plus einem „Denk-Tool“; 70,3 % nutzt interne Bewertung und ein angepasstes Scaffold auf einer reduzierten Teilmenge; DeepSeek R1 nutzt das Agentless-Framework. ³ Claude 3.7 Sonnets hohe GPQA- und AIME-2024-Werte nutzen interne Bewertung mit paralleler Test-Time-Compute; die Werte von o1 und Grok 3 nutzen Mehrheitsentscheid mit 64 Stichproben.
Belege 485 % SICHERHEITGesamtvertrauen: 85%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 4 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Gepostet am 28. Sept. 2026· Beginn 24. Feb. 2025 ✓· 32 % der Wertung
Der Beitrag ist auf „Feb 24, 2025“ datiert: „Heute kündigen wir Claude 3.7 Sonnet an“, und es sei „jetzt auf allen Claude-Plänen verfügbar“; TechCrunch[4] schreibt, es werde „am Montag“ (24. Februar) „für alle Nutzer und Entwickler ausgerollt“.
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Hinzugefügt am 28. Sept. 2026· 32 % der Wertung
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Hinzugefügt am 28. Sept. 2026· 32 % der Wertung
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Veröffentlicht am 24. Feb. 2025· Beginn 24. Feb. 2025· 3 % der Wertung
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.