- Inizio
- 29 set 2025AFFIDABILITÀ 90%da la fonte
Rilasciato Claude Sonnet 4.5
Tradotto automaticamente dall’originale
Titolo originale: Claude Sonnet 4.5 Released
- Anthropic lo ha definito «il miglior modello di programmazione al mondo. È il modello più forte per costruire agenti complessi. È il miglior modello nell'uso dei computer»[1][4]
- «Disponibile ovunque oggi» come claude-sonnet-4-5 sull'API di Claude e nelle app Claude; Mike Krieger ha detto che sarebbe stato il modello predefinito e lo ha consigliato per «praticamente ogni caso d'uso»[1][5]
- È uscito con i checkpoint di Claude Code e un'estensione nativa per VS Code, una funzione di modifica del contesto e uno strumento di memoria sull'API, esecuzione di codice e creazione di file nelle app Claude, e il Claude Agent SDK, l'infrastruttura alla base di Claude Code[1][4]
- «Questo è il modello di frontiera più allineato che abbiamo mai rilasciato», con tassi più bassi di piaggeria e inganno, rilasciato con le protezioni AI Safety Level 3 (ASL-3)[1][3][4]
- È arrivato a meno di due mesi da Claude Opus 4.1, con Anthropic valutata 183 miliardi di dollari[4][5]
Caratteristiche principali
- 3 $ per milione di token in input e 15 $ per milione di token in output, come per Sonnet 4; finestra di contesto da 200K token, 64K di output massimo e un knowledge cutoff affidabile a gennaio 2025[1][2]
- 77,2% su SWE-bench Verified, in media su 10 prove senza calcolo al momento del test, e 82,0% con calcolo parallelo al momento del test[1]
- Guida OSWorld per l'uso del computer con il 61,4%, dove Sonnet 4 era in testa con il 42,2% quattro mesi prima[1]
- Anthropic lo ha osservato mantenere la concentrazione per più di 30 ore su compiti complessi in più passaggi; la CNBC osserva che Opus 4 ne reggeva sette[1][5]
- Esperti di finanza, diritto, medicina e discipline STEM hanno trovato le sue conoscenze di dominio e il suo ragionamento ben superiori a quelli dei modelli precedenti, compreso Opus 4.1[1]
Benchmark[1]
| Benchmark | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Programmazione con agenti (SWE-bench Verified) | 77.2% / 82.0% con calcolo parallelo al momento del test | 74.5% / 79.4% con calcolo parallelo al momento del test | 72.7% / 80.2% con calcolo parallelo al momento del test | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| Programmazione da terminale con agenti (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| Uso di strumenti con agenti (τ2-bench), retail | 86.2% | 86.8% | 83.8% | 81.1% | — |
| Uso di strumenti con agenti (τ2-bench), compagnie aeree | 70.0% | 63.0% | 63.0% | 62.6% | — |
| Uso di strumenti con agenti (τ2-bench), telecomunicazioni | 98.0% | 71.5% | 49.6% | 96.7% | — |
| Uso del computer (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| Competizione di matematica delle superiori (AIME 2025) | 100% (python) / 87.0% (senza strumenti) | 78.0% | 70.5% | 99.6% (python) / 94.6% (senza strumenti) | 88.0% |
| Ragionamento di livello post-laurea (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| Domande e risposte multilingue (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| Ragionamento visivo (MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| Analisi finanziaria (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
Fonti 5AFFIDABILITÀ 89%Affidabilità complessiva: 89%Quanto la fonte e le altre fonti del pin ne confermano le date.Media ponderata di quanto 5 fonti, compresa quella principale, confermano gli orari di inizio e fine del pin; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recenteMostra tutti i pin con affidabilità pari o superiore al 75%
La prima voce è sempre la fonte del pin. L’affidabilità complessiva è una media ponderata di quanto ogni fonte conferma gli orari di inizio e fine indicati sopra; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recente.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Postato il 28 set 2026· Inizio 29 set 2025 ✓· 29% del punteggio
Il post è datato «Sep 29, 2025» e dice «Claude[2] Sonnet 4.5 is available everywhere today»; la pagina dei modelli della documentazione riporta «Released September 29, 2025» e TechCrunch[4] riporta il lancio «lunedì».
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Aggiunto il 28 set 2026· 29% del punteggio
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Aggiunto il 28 set 2026· 29% del punteggio
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Pubblicato il 29 set 2025· Inizio 29 set 2025· 7% del punteggio
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Pubblicato il 29 set 2025· Inizio 29 set 2025· 7% del punteggio
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Suggerisci una correzione
Manca qualcosa o c’è un errore? Dillo con parole tue: un link che conferma questo pin, una data di inizio o fine diversa e perché, o un fatto che manca o è sbagliato. L’IA lo confronta con le fonti del pin, ne cerca di migliori e aggiunge qualsiasi pagina ti dia ragione. Le fonti del pin contano comunque di più. Anche un’immagine che mostra altro, o lo mostra male, viene esaminata e spostata in basso o sostituita.