- Début
- 22 oct. 2024CONFIANCE 90 %selon la source
Sortie de la mise à jour de Claude 3.5 Sonnet
Traduit automatiquement de l’original
Titre original: Claude 3.5 Sonnet Upgrade Released
- Anthropic a annoncé « une version améliorée de Claude 3.5 Sonnet » avec « des améliorations générales par rapport à son prédécesseur, avec des gains particulièrement significatifs en codage », disponible pour tous les utilisateurs ce jour-là, ainsi que le nouveau Claude 3.5 Haiku pour plus tard dans le mois[1]
- L'utilisation d'ordinateur est arrivée en bêta publique : Claude regarde l'écran, déplace un curseur, clique sur des boutons et tape du texte, et Anthropic qualifie 3.5 Sonnet de « premier modèle d'IA de pointe à proposer l'utilisation d'ordinateur en bêta publique » - « encore expérimental, parfois lourd et sujet à erreurs »[1][4]
- Pour diriger le curseur, Claude compte les pixels dont il doit se déplacer sur chaque capture d'écran ; Anthropic a entraîné cette compétence sur des logiciels simples tels qu'une calculatrice et un éditeur de texte[3]
- Les développeurs pouvaient l'utiliser ce jour-là sur l'API Anthropic, Amazon Bedrock et Vertex AI de Google Cloud ; Asana, Canva, Cognition, DoorDash, Replit et The Browser Company en étaient les premiers utilisateurs, et Amazon disposait d'un accès anticipé[1][5]
- Les instituts de sécurité de l'IA américain et britannique l'ont testé conjointement avant sa sortie ; Anthropic l'a maintenu à l'ASL-2 et a ajouté des classificateurs qui détectent l'utilisation d'ordinateur et l'éventualité d'un préjudice[1]
Caractéristiques notables
- Même prix et même vitesse que le 3.5 Sonnet de juin[1]
- SWE-bench Verified passe de 33.4% à 49.0%, dépassant tous les modèles disponibles publiquement, y compris o1-preview d'OpenAI[1]
- L'utilisation agentique d'outils de TAU-bench passe de 62.6% à 69.2% dans le domaine de la vente au détail et de 36.0% à 46.0% dans le domaine des compagnies aériennes[1]
- Sur OSWorld, il a obtenu 14.9% à partir des seules captures d'écran, contre 7.8% pour le meilleur système suivant, et 22.0% lorsqu'un plus grand nombre d'étapes était autorisé[1][2]
- Le défilement, le glissement et le zoom restaient difficiles pour lui, et Anthropic recommandait de commencer par des tâches à faible risque[1]
Benchmarks[1]
| Benchmark | Claude 3.5 Sonnet (new) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Raisonnement de niveau doctorat (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| Connaissances de niveau licence (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| Code (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| Résolution de problèmes mathématiques (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| Compétition de mathématiques de niveau lycée (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| Questions-réponses visuelles (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| Codage agentique (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| Utilisation agentique d'outils (TAU-bench), vente au détail | 69.2% | 51.0% | 62.6% | — | — | — | — |
| Utilisation agentique d'outils (TAU-bench), compagnie aérienne | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Les tableaux d'évaluation d'Anthropic excluent la famille de modèles o1 d'OpenAI, car ceux-ci dépendent d'un temps de calcul important avant de répondre, contrairement aux modèles habituels.
Références 5CONFIANCE 90 %Confiance globale: 90%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 5 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Publié le 28 sept. 2026· Début 22 oct. 2024 ✓· 46 % du score
L'article est daté du « 22 octobre 2024 » et indique : « La version améliorée de Claude 3.5 Sonnet est désormais disponible pour tous les utilisateurs. Dès aujourd'hui, les développeurs peuvent créer avec la bêta d'utilisation d'ordinateur » ; TechCrunch[4] et CNBC[5] rapportent la sortie « mardi », ce même jour.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Ajouté le 28 sept. 2026· 46 % du score
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Publié le 22 oct. 2024· 3 % du score
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Publié le 22 oct. 2024· Début 22 oct. 2024· 3 % du score
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Publié le 22 oct. 2024· Début 22 oct. 2024· 3 % du score
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.