- Inizio
- 20 giu 2024AFFIDABILITÀ 92%da techcrunch.com
Rilasciato Claude 3.5 Sonnet
Tradotto automaticamente dall’originale
Titolo originale: Claude 3.5 Sonnet Released
- «Oggi lanciamo Claude 3.5 Sonnet - il nostro primo rilascio della prossima famiglia di modelli Claude 3.5», che supera Claude 3 Opus «con la velocità e il costo del nostro modello di fascia media, Claude 3 Sonnet»[1][4]
- Gratuito su Claude.ai e nell'app Claude per iOS, con limiti di utilizzo più alti per gli abbonati Pro e Team, e disponibile lo stesso giorno sull'API di Anthropic, su Amazon Bedrock e su Vertex AI di Google Cloud[1][5]
- È stato lanciato con Artifacts, una finestra accanto alla conversazione dove compaiono codice, documenti e progetti di siti web, così che gli utenti possano vederli, modificarli e svilupparli in tempo reale[1][3]
- È rimasto ad ASL-2; Anthropic lo ha fornito all'AI Safety Institute del Regno Unito per i test pre-distribuzione, che ne ha condiviso i risultati con l'AI Safety Institute degli Stati Uniti[1]
- Anthropic ha detto che avrebbe completato la famiglia con Claude 3.5 Haiku e Claude 3.5 Opus più avanti nel 2024[1]
Caratteristiche principali
- Al prezzo di 3 $ per milione di token in input e 15 $ per milione di token in output, con una finestra di contesto da 200K token; AWS lo definisce più economico dell'80 percento rispetto a Claude 3 Opus[1][5]
- Funziona al doppio della velocità di Claude 3 Opus[1][4]
- Model card di Anthropic: 59,4% su GPQA Diamond, 88,7% su MMLU, 92,0% su HumanEval e 71,1% su MATH, contro il 50,4%, 86,8%, 84,9% e 60,1% di Claude 3 Opus[2]
- Ha risolto il 64% dei problemi in una valutazione interna di programmazione con agenti - correggere un bug o aggiungere una funzione a un codice open source - contro il 38% di Claude 3 Opus[1][2]
- Il modello con visione più forte di Anthropic finora: migliore nella lettura di grafici e diagrammi e nella trascrizione di testo da immagini imperfette, con il 68,3% su MMMU[1][2]
Benchmark[1]
| Benchmark | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (snapshot iniziale) |
|---|---|---|---|---|---|
| Ragionamento di livello post-laurea (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| Conoscenze di livello universitario (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| Conoscenze di livello universitario (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| Codice (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| Matematica multilingue (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| Ragionamento sul testo (DROP, punteggio F1) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (shot variabili) | 83.5 (3-shot, modello preaddestrato) |
| Valutazioni miste (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, modello preaddestrato) |
| Risoluzione di problemi matematici (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| Matematica delle scuole elementari (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet ottiene il 67,2% su GPQA 5-shot CoT con maj@32. ** Claude 3.5 Sonnet ottiene il 90,4% su MMLU con prompt 5-shot CoT.
Fonti 5AFFIDABILITÀ 85%Affidabilità complessiva: 85%Quanto la fonte e le altre fonti del pin ne confermano le date.Media ponderata di quanto 5 fonti, compresa quella principale, confermano gli orari di inizio e fine del pin; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recenteMostra tutti i pin con affidabilità pari o superiore al 75%
La prima voce è sempre la fonte del pin. L’affidabilità complessiva è una media ponderata di quanto ogni fonte conferma gli orari di inizio e fine indicati sopra; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recente.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Postato il 28 set 2026· Inizio 20 giu 2024· 32% del punteggio
Anthropic[2]: «Today, we're launching Claude 3.5 Sonnet» e «è ora disponibile gratuitamente su Claude.ai»; l'intestazione della pagina ora mostra il 21 giugno 2024, ma TechCrunch[4] e AWS hanno entrambi pubblicato il lancio il 20 giugno 2024 e l'ID del modello è claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Aggiunto il 28 set 2026· 32% del punteggio
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Aggiunto il 28 set 2026· 32% del punteggio
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Pubblicato il 20 giu 2024· Inizio 20 giu 2024 ✓· 1% del punteggio
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Pubblicato il 20 giu 2024· Inizio 20 giu 2024· 1% del punteggio
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Suggerisci una correzione
Manca qualcosa o c’è un errore? Dillo con parole tue: un link che conferma questo pin, una data di inizio o fine diversa e perché, o un fatto che manca o è sbagliato. L’IA lo confronta con le fonti del pin, ne cerca di migliori e aggiunge qualsiasi pagina ti dia ragione. Le fonti del pin contano comunque di più. Anche un’immagine che mostra altro, o lo mostra male, viene esaminata e spostata in basso o sostituita.