- Début
- 20 juin 2024CONFIANCE 92 %selon techcrunch.com
Sortie de Claude 3.5 Sonnet
Traduit automatiquement de l’original
Titre original: Claude 3.5 Sonnet Released
- « Aujourd'hui, nous lançons Claude 3.5 Sonnet, notre première sortie de la future famille de modèles Claude 3.5 », qui surpasse Claude 3 Opus « à la vitesse et au coût de notre modèle intermédiaire, Claude 3 Sonnet »[1][4]
- Gratuit sur Claude.ai et l'application iOS Claude, avec des limites de débit plus élevées pour les abonnés Pro et Team, et disponible le même jour sur l'API Anthropic, Amazon Bedrock et Vertex AI de Google Cloud[1][5]
- Il a été lancé avec Artifacts, une fenêtre à côté de la conversation où apparaissent le code, les documents et les designs de sites web, permettant aux utilisateurs de les voir, de les modifier et de les développer en temps réel[1][3]
- Il est resté à l'ASL-2 ; Anthropic l'a confié au UK AI Safety Institute pour des tests préalables au déploiement, qui a partagé les résultats avec l'US AI Safety Institute[1]
- Anthropic a annoncé qu'elle compléterait la famille avec Claude 3.5 Haiku et Claude 3.5 Opus plus tard en 2024[1]
Caractéristiques notables
- Facturé 3 $ par million de jetons en entrée et 15 $ par million de jetons en sortie, avec une fenêtre de contexte de 200K jetons ; AWS le qualifie de 80% moins cher que Claude 3 Opus[1][5]
- Fonctionne deux fois plus vite que Claude 3 Opus[1][4]
- Fiche modèle d'Anthropic : 59.4% sur GPQA Diamond, 88.7% sur MMLU, 92.0% sur HumanEval et 71.1% sur MATH, contre 50.4%, 86.8%, 84.9% et 60.1% pour Claude 3 Opus[2]
- Il a résolu 64% des problèmes d'une évaluation interne de codage agentique - corriger un bug ou ajouter une fonctionnalité à une base de code open source - contre 38% pour Claude 3 Opus[1][2]
- Le modèle de vision le plus performant d'Anthropic à ce jour : meilleur pour lire des graphiques et retranscrire du texte à partir d'images imparfaites, avec un score de 68.3% sur MMMU[1][2]
Benchmarks[1]
| Benchmark | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| Raisonnement de niveau doctorat (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| Connaissances de niveau licence (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| Connaissances de niveau licence (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| Code (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| Mathématiques multilingues (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| Raisonnement sur texte (DROP, F1 score) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (variable shots) | 83.5 (3-shot, pre-trained model) |
| Évaluations mixtes (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, pre-trained model) |
| Résolution de problèmes mathématiques (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| Mathématiques de niveau primaire (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet obtient 67.2% sur GPQA en 5-shot CoT avec maj@32. ** Claude 3.5 Sonnet obtient 90.4% sur MMLU avec une invite en 5-shot CoT.
Références 5CONFIANCE 85 %Confiance globale: 85%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 5 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Publié le 28 sept. 2026· Début 20 juin 2024· 32 % du score
Anthropic[2] : « Aujourd'hui, nous lançons Claude 3.5 Sonnet » et il « est désormais disponible gratuitement sur Claude.ai » ; l'en-tête de la page affiche désormais le 21 juin 2024, mais TechCrunch[4] et AWS ont tous deux publié le lancement le 20 juin 2024, et l'identifiant du modèle est claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Ajouté le 28 sept. 2026· 32 % du score
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Ajouté le 28 sept. 2026· 32 % du score
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Publié le 20 juin 2024· Début 20 juin 2024 ✓· 1 % du score
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Publié le 20 juin 2024· Début 20 juin 2024· 1 % du score
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.