- Beginn
- 17. Feb. 202690 % SICHERHEITlaut der Quelle
Claude Sonnet 4.6 veröffentlicht
Automatisch aus dem Original übersetzt
Originaltitel: Claude Sonnet 4.6 Released
- „Claude Sonnet 4.6 ist unser bisher fähigstes Sonnet-Modell“, ein umfassendes Upgrade bei Programmierung, Computernutzung, Langkontext-Reasoning, Agentenplanung, Wissensarbeit und Design[1][4]
- Es wurde das Standardmodell in claude.ai und Claude Cowork für Free- und Pro-Nutzer, und die kostenlose Stufe erhielt Dateierstellung, Connectors, Skills und Compaction; es ist auf jedem Claude-Plan, in Claude Code, auf der API und auf allen großen Cloud-Plattformen verfügbar[1][3][4]
- In Claude Code bevorzugten frühe Tester es gegenüber Sonnet 4.5 in etwa 70 % der Fälle und sogar gegenüber Opus 4.5, Anthropics Flaggschiff vom November, in 59 % der Fälle, und bezeichneten es als weniger anfällig für Overengineering und „Faulheit“[1]
- Sicherheitsforscher fanden „einen insgesamt warmherzigen, ehrlichen, prosozialen und zeitweise witzigen Charakter“ und keine Anzeichen größerer, folgenschwerer Fehlausrichtung; es widersteht Prompt Injection deutlich besser als Sonnet 4.5 und wurde unter ASL-3 veröffentlicht[1][5]
- CNBC brachte den Launch mit einem Ausverkauf von Software-Aktien in Verbindung, wobei der Software-ETF IGV im Jahresverlauf mehr als 20 % verlor[3]
Bemerkenswerte Merkmale
- Preis unverändert gegenüber Sonnet 4.5: 3 $ pro Million Eingabetokens und 15 $ pro Million Ausgabetokens; ein 1-Millionen-Token-Kontextfenster (beim Launch in der Beta) und 128.000 maximale Ausgabe[1][2]
- Anthropics Tabelle: 79,6 % bei SWE-bench Verified, 72,5 % bei OSWorld-Verified (Sonnet 4.5: 61,4 %), 59,1 % bei Terminal-Bench 2.0 und 74,7 % bei BrowseComp[1]
- Sein OSWorld-Diagramm zeichnet die Sonnet-Linie von 14,9 % beim Claude 3.5 Sonnet vom Oktober 2024 bis zu 72,5 % bei Sonnet 4.6 nach[1]
- Adaptives und erweitertes Denken, plus Context Compaction in der Beta, die älteren Kontext zusammenfasst, wenn sich eine Konversation ihrer Grenze nähert[1][2]
- Es erreicht bei OfficeQA, Databricks’ Test zum Lesen von Unternehmensdiagrammen, PDFs und Tabellen, das Niveau von Opus 4.6, und in der Vending-Bench Arena investierte es zehn simulierte Monate lang stark, bevor es auf Profit umschwenkte[1]
Benchmarks[1]
| Benchmark | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (alle Modelle) |
|---|---|---|---|---|---|---|
| Agentische Terminal-Programmierung (Terminal-Bench 2.0) | 59,1 % | 51,0 % | 65,4 % | 59,8 % | 56,2 % (54,2 % selbst gemeldet) | 64,7 % (64,0 % selbst gemeldet, Codex CLI) |
| Agentische Programmierung (SWE-bench Verified) | 79,6 % | 77,2 % | 80,8 % | 80,9 % | 78,0 % (Flash) | 80,0 % |
| Agentische Computernutzung (OSWorld-Verified) | 72,5 % | 61,4 % | 72,7 % | 66,3 % | — | 38,2 % |
| Agentische Tool-Nutzung (τ2-bench), Einzelhandel | 91,7 % | 86,2 % | 91,9 % | 88,9 % | 85,3 % | 82,0 % |
| Agentische Tool-Nutzung (τ2-bench), Telekommunikation | 97,9 % | 98,0 % | 99,3 % | 98,2 % | 98,0 % | 98,7 % |
| Skalierte Tool-Nutzung (MCP-Atlas) | 61,3 % | 43,8 % | 59,5 % | 62,3 % | 54,1 % | 60,6 % |
| Agentische Suche (BrowseComp) | 74,7 % | 43,9 % | 84,0 % | 67,8 % | 59,2 % (Deep Research) | 77,9 % (Pro) |
| Fachübergreifendes Schlussfolgern (Humanity's Last Exam), ohne Tools | 33,2 % | 17,7 % | 40,0 % | 30,8 % | 37,5 % | 36,6 % (Pro) |
| Fachübergreifendes Schlussfolgern (Humanity's Last Exam), mit Tools | 49,0 % | 33,6 % | 53,0 % | 43,4 % | 45,8 % | 50,0 % (Pro) |
| Agentische Finanzanalyse (Finance Agent v1.1) | 63,3 % | 54,5 % | 60,1 % | 58,8 % | 55,2 % | 59,0 % |
| Büroaufgaben (GDPval-AA Elo) | 1.633 | 1.276 | 1.606 | 1.416 | 1.201 | 1.462 |
| Lösen neuartiger Probleme (ARC-AGI-2) | 58,3 % | 13,6 % | 68,8 % | 37,6 % | 31,1 % | 54,2 % (Pro) |
| Schlussfolgern auf Graduiertenniveau (GPQA Diamond) | 89,9 % | 83,4 % | 91,3 % | 87,0 % | 91,9 % | 93,2 % (Pro) |
| Visuelles Schlussfolgern (MMMU-Pro), ohne Tools | 74,5 % | 63,4 % | 73,9 % | 70,6 % | 81,0 % | 79,5 % |
| Visuelles Schlussfolgern (MMMU-Pro), mit Tools | 75,6 % | 68,9 % | 77,3 % | 73,9 % | — | 80,4 % |
| Mehrsprachige Fragen und Antworten (MMMLU) | 89,3 % | 89,5 % | 91,1 % | 90,8 % | 91,8 % | 89,6 % |
Belege 588 % SICHERHEITGesamtvertrauen: 88%Wie gut die Quelle und die Belege des Pins seine Termine stützen.Gewichteter Durchschnitt, wie fest 5 Belege einschließlich der Quelle die Start- und Endzeiten des Pins stützen; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so vielAlle Pins mit mindestens 75 % Sicherheit anzeigen
Der erste Eintrag ist immer die Quelle des Pins. Die Gesamtsicherheit ist ein gewichteter Durchschnitt, wie fest jeder Beleg die oben verwendeten Start- und Endzeiten stützt; ein Beleg zählt für je 180 Tage, die er älter ist als der neueste, nur halb so viel.
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· Gepostet am 28. Sept. 2026· Beginn 17. Feb. 2026 ✓· 31 % der Wertung
Der Beitrag ist auf „Feb 17, 2026“ datiert und sagt, „Claude[2] Sonnet 4.6 ist jetzt auf allen Claude-Plänen, in Claude Cowork, Claude Code, unserer API und auf allen großen Cloud-Plattformen verfügbar“; die Docs-Modellseite listet „Released February 17, 2026“, und CNBC[3] berichtete am selben Tag darüber.
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· Hinzugefügt am 28. Sept. 2026· 31 % der Wertung
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· Veröffentlicht am 17. Feb. 2026· Beginn 17. Feb. 2026· 13 % der Wertung
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· Veröffentlicht am 17. Feb. 2026· Beginn 17. Feb. 2026· 13 % der Wertung
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· Veröffentlicht am 17. Feb. 2026· 13 % der Wertung
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
Korrektur vorschlagen
Fehlt etwas oder stimmt etwas nicht? Sag es in deinen eigenen Worten: ein Link, der diesen Pin belegt, ein anderes Start- oder Enddatum und warum, oder eine Angabe, die fehlt oder falsch ist. Die KI prüft es an den Quellen dieses Pins, sucht nach besseren und ergänzt jede Seite, die dich bestätigt. Die eigenen Quellen des Pins zählen weiterhin am meisten. Auch Bilder sieht sich die KI an: Eines, das etwas anderes oder die Sache schlecht zeigt, wird nach hinten gestellt oder ersetzt.