- Inizio
- 24 feb 2025AFFIDABILITÀ 90%da la fonte
Rilasciato Claude 3.7 Sonnet
Tradotto automaticamente dall’originale
Titolo originale: Claude 3.7 Sonnet Released
- Anthropic ha definito Claude 3.7 Sonnet «il nostro modello più intelligente finora e il primo modello di ragionamento ibrido sul mercato»: un unico modello che dà risposte quasi istantanee o un «ragionamento esteso, passo dopo passo, reso visibile all'utente»[1][4]
- È arrivato a ogni piano Claude - Free, Pro, Team ed Enterprise - e alla Claude Developer Platform, ad Amazon Bedrock e a Vertex AI di Google Cloud; il thinking esteso è disponibile su ogni superficie tranne il livello gratuito[1][4]
- Claude Code, il primo strumento di programmazione con agenti di Anthropic, è stato lanciato con il modello come anteprima di ricerca limitata che funziona dal terminale, e l'integrazione con GitHub è arrivata a ogni piano Claude[1]
- Riduce del 45% i rifiuti non necessari rispetto al predecessore ed è stato rilasciato con lo standard ASL-2[1][2]
- La versione è passata da 3.5 a 3.7 e a febbraio 2025 Claude 3.7 Sonnet ha iniziato a giocare a Pokémon Rosso in diretta su Twitch[3][4]
Caratteristiche principali
- 3 $ per milione di token in input e 15 $ per milione di token in output in entrambe le modalità, compresi i token di ragionamento[1][4]
- Gli utenti dell'API impostano un budget di ragionamento di qualsiasi dimensione fino al limite di output di 128K token, scambiando velocità e costo con la qualità[1]
- I grafici di Anthropic indicano il 62,3% su SWE-bench Verified (70,3% con un'impalcatura personalizzata) contro il 49,0% del 3.5 Sonnet aggiornato, e l'81,2% (retail) e il 58,4% (compagnie aeree) su TAU-bench[1]
- Anthropic dice di aver ottimizzato meno per le competizioni di matematica e programmazione e più per compiti aziendali del mondo reale[1]
- In modalità standard è un Claude 3.5 Sonnet aggiornato; in modalità di thinking esteso riflette prima di rispondere, il che aiuta in matematica, fisica, rispetto delle istruzioni e programmazione[1]
Benchmark[1]
| Benchmark | Claude 3.7 Sonnet (thinking esteso da 64K) | Claude 3.7 Sonnet (senza thinking esteso) | Claude 3.5 Sonnet (nuovo) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (thinking esteso da 32K) | Grok 3 Beta (thinking esteso) |
|---|---|---|---|---|---|---|---|
| Ragionamento di livello post-laurea (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| Programmazione con agenti (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| Uso di strumenti con agenti (TAU-bench), retail | — | 81.2% | 71.5% | 73.5% | — | — | — |
| Uso di strumenti con agenti (TAU-bench), compagnie aeree | — | 58.4% | 48.8% | 54.2% | — | — | — |
| Domande e risposte multilingue (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| Ragionamento visivo (MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| Rispetto delle istruzioni (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| Risoluzione di problemi matematici (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| Competizione di matematica delle superiori (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 in media su più prove (fino a 16 per AIME e SWE-bench Verified); una seconda cifra beneficia del calcolo parallelo al momento del test. ¹ I risultati TAU-bench di o1 sono stati riportati da OpenAI e poi eliminati; i risultati di TAU-bench potrebbero non essere confrontabili. ² Il 62,3% è pass@1 su 500 problemi con strumenti bash/editor più un «thinking tool»; il 70,3% usa un punteggio interno e un'impalcatura personalizzata su un sottoinsieme ridotto; DeepSeek R1 usa il framework Agentless. ³ I punteggi elevati di Claude 3.7 Sonnet su GPQA e AIME 2024 usano un punteggio interno con calcolo parallelo al momento del test; quelli di o1 e Grok 3 usano il voto di maggioranza con 64 campioni.
Fonti 4AFFIDABILITÀ 85%Affidabilità complessiva: 85%Quanto la fonte e le altre fonti del pin ne confermano le date.Media ponderata di quanto 4 fonti, compresa quella principale, confermano gli orari di inizio e fine del pin; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recenteMostra tutti i pin con affidabilità pari o superiore al 75%
La prima voce è sempre la fonte del pin. L’affidabilità complessiva è una media ponderata di quanto ogni fonte conferma gli orari di inizio e fine indicati sopra; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recente.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Postato il 28 set 2026· Inizio 24 feb 2025 ✓· 32% del punteggio
Il post è datato «Feb 24, 2025»: «Today, we're announcing Claude 3.7 Sonnet» e «è ora disponibile su tutti i piani Claude»; TechCrunch[4] dice che «viene distribuito a tutti gli utenti e sviluppatori lunedì» (24 febbraio).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Aggiunto il 28 set 2026· 32% del punteggio
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Aggiunto il 28 set 2026· 32% del punteggio
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Pubblicato il 24 feb 2025· Inizio 24 feb 2025· 3% del punteggio
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Suggerisci una correzione
Manca qualcosa o c’è un errore? Dillo con parole tue: un link che conferma questo pin, una data di inizio o fine diversa e perché, o un fatto che manca o è sbagliato. L’IA lo confronta con le fonti del pin, ne cerca di migliori e aggiunge qualsiasi pagina ti dia ragione. Le fonti del pin contano comunque di più. Anche un’immagine che mostra altro, o lo mostra male, viene esaminata e spostata in basso o sostituita.