- Beginn
- 29. Sept. 202590 % SICHERHEITlaut der Quelle
Claude Sonnet 4.5 veröffentlicht
Automatisch aus dem Original übersetzt
Originaltitel: Claude Sonnet 4.5 Released
- Anthropic bezeichnete es als „das weltbeste Programmiermodell. Es ist das stärkste Modell zum Bau komplexer Agenten. Es ist das beste Modell in der Nutzung von Computern“[1][4]
- „Ab heute überall verfügbar“ als claude-sonnet-4-5 in der Claude API und in den Claude-Apps; Mike Krieger sagte, es werde die Standardeinstellung sein, und empfahl es für „praktisch jeden Anwendungsfall“[1][5]
- Es erschien mit Checkpoints für Claude Code und einer nativen VS-Code-Erweiterung, einer Funktion zur Kontextbearbeitung und einem Memory-Tool auf der API, Codeausführung und Dateierstellung in den Claude-Apps sowie dem Claude Agent SDK, der Infrastruktur hinter Claude Code[1][4]
- „Dies ist das am besten ausgerichtete Frontier-Modell, das wir je veröffentlicht haben“, mit niedrigeren Raten an Sykophantie und Täuschung, veröffentlicht unter den Schutzmaßnahmen von AI Safety Level 3 (ASL-3)[1][3][4]
- Es erschien weniger als zwei Monate nach Claude Opus 4.1, wobei Anthropic mit 183 Milliarden Dollar bewertet wurde[4][5]
Bemerkenswerte Merkmale
- 3 $ pro Million Eingabetokens und 15 $ pro Million Ausgabetokens, wie bei Sonnet 4; 200.000-Token-Kontextfenster, 64.000 maximale Ausgabe und ein zuverlässiger Wissensstand bis Januar 2025[1][2]
- 77,2 % bei SWE-bench Verified, gemittelt über 10 Durchläufe ohne Test-Time-Compute, und 82,0 % mit paralleler Test-Time-Compute[1]
- Es führt bei OSWorld-Computernutzung mit 61,4 %, wo Sonnet 4 vier Monate zuvor mit 42,2 % geführt hatte[1]
- Anthropic beobachtete, dass es bei komplexen, mehrstufigen Aufgaben über 30 Stunden lang fokussiert blieb; CNBC merkt an, dass Opus 4 es auf sieben brachte[1][5]
- Experten aus Finanzwesen, Recht, Medizin und den MINT-Fächern befanden sein Fachwissen und Reasoning als deutlich vor älteren Modellen, einschließlich Opus 4.1[1]
Benchmarks[1]
| Benchmark | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Agentische Programmierung (SWE-bench Verified) | 77,2 % / 82,0 % mit paralleler Test-Time-Compute | 74,5 % / 79,4 % mit paralleler Test-Time-Compute | 72,7 % / 80,2 % mit paralleler Test-Time-Compute | 72,8 % (GPT-5) / 74,5 % (GPT-5-Codex) | 67,2 % |
| Agentische Terminal-Programmierung (Terminal-Bench) | 50,0 % | 46,5 % | 36,4 % | 43,8 % | 25,3 % |
| Agentische Tool-Nutzung (τ2-bench), Einzelhandel | 86,2 % | 86,8 % | 83,8 % | 81,1 % | — |
| Agentische Tool-Nutzung (τ2-bench), Fluggesellschaft | 70,0 % | 63,0 % | 63,0 % | 62,6 % | — |
| Agentische Tool-Nutzung (τ2-bench), Telekommunikation | 98,0 % | 71,5 % | 49,6 % | 96,7 % | — |
| Computernutzung (OSWorld) | 61,4 % | 44,4 % | 42,2 % | — | — |
| Mathematikwettbewerb auf Highschool-Niveau (AIME 2025) | 100 % (Python) / 87,0 % (ohne Tools) | 78,0 % | 70,5 % | 99,6 % (Python) / 94,6 % (ohne Tools) | 88,0 % |
| Schlussfolgern auf Graduiertenniveau (GPQA Diamond) | 83,4 % | 81,0 % | 76,1 % | 85,7 % | 86,4 % |
| Mehrsprachige Fragen und Antworten (MMMLU) | 89,1 % | 89,5 % | 86,5 % | 89,4 % | — |
| Visuelles Schlussfolgern (MMMU, Validierung) | 77,8 % | 77,1 % | 74,4 % | 84,2 % | 82,0 % |
| Finanzanalyse (Finance Agent) | 55,3 % | 50,9 % | 44,5 % | 46,9 % | 29,4 % |
Belege 589 % SICHERHEITGesamtvertrauen: 89%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 5 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Gepostet am 28. Sept. 2026· Beginn 29. Sept. 2025 ✓· 29 % der Wertung
Der Beitrag ist auf „Sep 29, 2025“ datiert und sagt, „Claude[2] Sonnet 4.5 ist ab heute überall verfügbar“; die Docs-Modellseite listet „Released September 29, 2025“, und TechCrunch[4] berichtet vom Launch „am Montag“.
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Hinzugefügt am 28. Sept. 2026· 29 % der Wertung
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Hinzugefügt am 28. Sept. 2026· 29 % der Wertung
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Veröffentlicht am 29. Sept. 2025· Beginn 29. Sept. 2025· 7 % der Wertung
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Veröffentlicht am 29. Sept. 2025· Beginn 29. Sept. 2025· 7 % der Wertung
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.