- Inizio
- 22 ott 2024AFFIDABILITÀ 90%da la fonte
Rilasciato l'aggiornamento di Claude 3.5 Sonnet
Tradotto automaticamente dall’originale
Titolo originale: Claude 3.5 Sonnet Upgrade Released
- Anthropic ha annunciato «un Claude 3.5 Sonnet aggiornato» con «miglioramenti su tutta la linea rispetto al predecessore, con guadagni particolarmente significativi nella programmazione», disponibile per tutti gli utenti quel giorno, e il nuovo Claude 3.5 Haiku per più avanti nel mese[1]
- L'uso del computer è arrivato in beta pubblica: Claude guarda lo schermo, muove un cursore, clicca i pulsanti e digita, e Anthropic definisce 3.5 Sonnet «il primo modello di IA di frontiera a offrire l'uso del computer in beta pubblica» - «ancora sperimentale: a volte macchinoso e soggetto a errori»[1][4]
- Per guidare il cursore Claude conta i pixel di cui deve spostarsi in ogni screenshot; Anthropic ha addestrato questa abilità su software semplici come una calcolatrice e un editor di testo[3]
- Gli sviluppatori hanno potuto usarlo quel giorno sull'API di Anthropic, su Amazon Bedrock e su Vertex AI di Google Cloud; Asana, Canva, Cognition, DoorDash, Replit e The Browser Company sono stati i primi utenti e Amazon aveva accesso anticipato[1][5]
- Gli AI Safety Institute di Stati Uniti e Regno Unito lo hanno testato congiuntamente prima del rilascio; Anthropic lo ha mantenuto ad ASL-2 e ha aggiunto classificatori che individuano l'uso del computer e se si sta verificando un danno[1]
Caratteristiche principali
- Stesso prezzo e stessa velocità del 3.5 Sonnet di giugno[1]
- SWE-bench Verified sale dal 33,4% al 49,0%, sopra ogni modello disponibile pubblicamente compreso o1-preview di OpenAI[1]
- L'uso di strumenti con agenti su TAU-bench sale dal 62,6% al 69,2% nel retail e dal 36,0% al 46,0% nel settore delle compagnie aeree[1]
- Su OSWorld ha ottenuto il 14,9% dai soli screenshot contro il 7,8% del miglior sistema successivo, e il 22,0% quando gli sono stati concessi più passaggi[1][2]
- Scorrere, trascinare e fare zoom erano ancora difficili per il modello, e Anthropic ha consigliato di iniziare con compiti a basso rischio[1]
Benchmark[1]
| Benchmark | Claude 3.5 Sonnet (nuovo) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Ragionamento di livello post-laurea (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| Conoscenze di livello universitario (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| Codice (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| Risoluzione di problemi matematici (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| Competizione di matematica delle superiori (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| Domande e risposte visive (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| Programmazione con agenti (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| Uso di strumenti con agenti (TAU-bench), retail | 69.2% | 51.0% | 62.6% | — | — | — | — |
| Uso di strumenti con agenti (TAU-bench), compagnie aeree | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Le tabelle di valutazione di Anthropic escludono la famiglia di modelli o1 di OpenAI, perché dipendono da un lungo tempo di calcolo prima della risposta, a differenza dei modelli tipici.
Fonti 5AFFIDABILITÀ 90%Affidabilità complessiva: 90%Quanto la fonte e le altre fonti del pin ne confermano le date.Media ponderata di quanto 5 fonti, compresa quella principale, confermano gli orari di inizio e fine del pin; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recenteMostra tutti i pin con affidabilità pari o superiore al 75%
La prima voce è sempre la fonte del pin. L’affidabilità complessiva è una media ponderata di quanto ogni fonte conferma gli orari di inizio e fine indicati sopra; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recente.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Postato il 28 set 2026· Inizio 22 ott 2024 ✓· 46% del punteggio
Il post è datato «22 ott. 2024» e dice «Il Claude 3.5 Sonnet aggiornato è ora disponibile per tutti gli utenti. Da oggi, gli sviluppatori possono creare con la beta dell'uso del computer»; TechCrunch[4] e CNBC[5] riportano il rilascio «martedì» lo stesso giorno.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Aggiunto il 28 set 2026· 46% del punteggio
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Pubblicato il 22 ott 2024· 3% del punteggio
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Pubblicato il 22 ott 2024· Inizio 22 ott 2024· 3% del punteggio
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Pubblicato il 22 ott 2024· Inizio 22 ott 2024· 3% del punteggio
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Suggerisci una correzione
Manca qualcosa o c’è un errore? Dillo con parole tue: un link che conferma questo pin, una data di inizio o fine diversa e perché, o un fatto che manca o è sbagliato. L’IA lo confronta con le fonti del pin, ne cerca di migliori e aggiunge qualsiasi pagina ti dia ragione. Le fonti del pin contano comunque di più. Anche un’immagine che mostra altro, o lo mostra male, viene esaminata e spostata in basso o sostituita.