- Inizio
- 4 mar 2024AFFIDABILITÀ 90%da la fonte
Rilasciato Claude 3 Opus
Tradotto automaticamente dall’originale
Titolo originale: Claude 3 Opus Released
- Anthropic ha annunciato la famiglia Claude 3 - Haiku, Sonnet e Opus «in ordine crescente di capacità» - il 4 marzo 2024, con Opus e Sonnet disponibili lo stesso giorno su claude.ai e nell'API di Claude, ora disponibile in via generale in 159 paesi[1][4]
- Su claude.ai Opus è andato agli abbonati Claude Pro mentre Sonnet alimentava l'esperienza gratuita; Sonnet è arrivato su Amazon Bedrock e in un'anteprima privata di Google Cloud Vertex AI quel giorno, «con Opus e Haiku in arrivo presto su entrambi»[1]
- Anthropic ha mantenuto il modello al livello di sicurezza IA 2 (ASL-2) dopo che il red-teaming ha rilevato un «potenziale trascurabile di rischio catastrofico in questo momento»[1]
- La CNBC osserva che tra i sostenitori di Anthropic ci sono Google, Salesforce e Amazon, dopo accordi di finanziamento per circa 7,3 miliardi di dollari complessivi nell'anno precedente[4]
- Claude 3 Opus è stato dichiarato obsoleto il 30 giugno 2025 e ritirato dall'API di Claude il 5 gennaio 2026, sostituito da Claude Opus 4.8[3]
Caratteristiche principali
- Claude 3 Opus è «il nostro modello più intelligente, con le migliori prestazioni sul mercato nei compiti molto complessi», al prezzo di 15 $ per milione di token in input e 75 $ per milione di token in output[1][5]
- Benchmark riportati da Anthropic: 86,8% su MMLU, 50,4% su GPQA Diamond, 95,0% su GSM8K e 84,9% su HumanEval, davanti all'86,4%, 35,7%, 92,0% e 67,0% di GPT-4[1]
- Una finestra di contesto da 200K token al lancio, con input oltre 1 milione di token disponibili «per casi d'uso specifici»; nel richiamo Needle In A Haystack ha superato il 99% di accuratezza e a volte ha notato che la frase inserita sembrava inserita artificialmente[1][5]
- Il primo modello con visione di Claude: legge foto, grafici, diagrammi e schemi tecnici, fino a 20 immagini in una richiesta, ma non identifica le persone[1][5]
- Opus ha una probabilità «significativamente inferiore» rispetto ai precedenti modelli Claude di rifiutare prompt innocui e raddoppia l'accuratezza di Claude 2.1 sulle domande fattuali difficili e aperte; le conoscenze arrivano ad agosto 2023[1][2]
Benchmark[1]
| Benchmark | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (conoscenze di livello universitario) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (ragionamento di livello post-laurea) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (matematica delle scuole elementari) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (risoluzione di problemi matematici) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (matematica multilingue) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (codice) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, punteggio F1 (ragionamento sul testo) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 shot variabili | 74.1 shot variabili |
| BIG-Bench-Hard (valutazioni miste) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (domande e risposte di conoscenza) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (conoscenza comune) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
Fonti 5AFFIDABILITÀ 90%Affidabilità complessiva: 90%Quanto la fonte e le altre fonti del pin ne confermano le date.Media ponderata di quanto 5 fonti, compresa quella principale, confermano gli orari di inizio e fine del pin; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recenteMostra tutti i pin con affidabilità pari o superiore al 75%
La prima voce è sempre la fonte del pin. L’affidabilità complessiva è una media ponderata di quanto ogni fonte conferma gli orari di inizio e fine indicati sopra; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recente.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Postato il 28 set 2026· Inizio 4 mar 2024 ✓· 33% del punteggio
Il post di Anthropic[2] è datato «Mar 4, 2024» e dice «Opus and Sonnet are now available to use in claude[3].ai and the Claude API which is now generally available in 159 countries»; CNBC[4] e TechCrunch[5] riportano il lancio lo stesso lunedì.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Aggiunto il 28 set 2026· 33% del punteggio
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Aggiunto il 28 set 2026· 33% del punteggio
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Pubblicato il 4 mar 2024· Inizio 4 mar 2024· 1% del punteggio
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Pubblicato il 4 mar 2024· Inizio 4 mar 2024· 1% del punteggio
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Suggerisci una correzione
Manca qualcosa o c’è un errore? Dillo con parole tue: un link che conferma questo pin, una data di inizio o fine diversa e perché, o un fatto che manca o è sbagliato. L’IA lo confronta con le fonti del pin, ne cerca di migliori e aggiunge qualsiasi pagina ti dia ragione. Le fonti del pin contano comunque di più. Anche un’immagine che mostra altro, o lo mostra male, viene esaminata e spostata in basso o sostituita.