- Début
- 4 mars 2024CONFIANCE 90 %selon la source
Sortie de Claude 3 Opus
Traduit automatiquement de l’original
Titre original: Claude 3 Opus Released
- Anthropic a annoncé la famille Claude 3 - Haiku, Sonnet et Opus « par ordre croissant de capacité » - le 4 mars 2024, Opus et Sonnet étant disponibles le même jour sur claude.ai et l'API Claude, désormais généralement disponible dans 159 pays[1][4]
- Sur claude.ai, Opus a été réservé aux abonnés Claude Pro tandis que Sonnet alimentait l'expérience gratuite ; Sonnet a atteint Amazon Bedrock et un aperçu privé de Google Cloud Vertex AI ce même jour, « Opus et Haiku devant bientôt rejoindre les deux »[1]
- Anthropic a maintenu le modèle au niveau de sécurité IA 2 (ASL-2) après que les tests de type « red team » ont conclu à un « potentiel négligeable de risque catastrophique pour le moment »[1]
- CNBC note que les investisseurs d'Anthropic comptent Google, Salesforce et Amazon, après des accords de financement totalisant environ 7,3 milliards de dollars sur l'année précédente[4]
- Claude 3 Opus a été déprécié le 30 juin 2025 et retiré de l'API Claude le 5 janvier 2026, remplacé par Claude Opus 4.8[3]
Caractéristiques notables
- Claude 3 Opus est « notre modèle le plus intelligent, avec les meilleures performances du marché sur les tâches très complexes », facturé 15 $ par million de jetons en entrée et 75 $ par million de jetons en sortie[1][5]
- Résultats rapportés par Anthropic : 86.8% sur MMLU, 50.4% sur GPQA Diamond, 95.0% sur GSM8K et 84.9% sur HumanEval, devançant les 86.4%, 35.7%, 92.0% et 67.0% de GPT-4[1]
- Une fenêtre de contexte de 200K jetons au lancement, avec des entrées de plus d'un million de jetons disponibles « pour des cas d'usage spécifiques » ; sur le test de rappel Needle In A Haystack, il a dépassé 99% de précision et a parfois remarqué que la phrase insérée semblait ajoutée artificiellement[1][5]
- Le premier modèle de Claude doté de la vision : il lit des photos, des graphiques, des diagrammes et des schémas techniques, jusqu'à 20 images par requête, mais refuse d'identifier des personnes[1][5]
- Opus est « nettement moins susceptible » que les précédents modèles Claude de refuser des requêtes inoffensives, et double la précision de Claude 2.1 sur des questions factuelles ouvertes difficiles ; ses connaissances vont jusqu'à août 2023[1][2]
Benchmarks[1]
| Benchmark | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (connaissances de niveau licence) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (raisonnement de niveau doctorat) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (mathématiques de niveau primaire) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (résolution de problèmes mathématiques) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (mathématiques multilingues) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (code) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, F1 score (raisonnement sur texte) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 Variable shots | 74.1 Variable shots |
| BIG-Bench-Hard (évaluations mixtes) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (questions-réponses de connaissances) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (connaissances générales) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
Références 5CONFIANCE 90 %Confiance globale: 90%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 5 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Publié le 28 sept. 2026· Début 4 mars 2024 ✓· 33 % du score
L'article d'Anthropic[2] est daté du « 4 mars 2024 » et dit : « Opus et Sonnet sont désormais disponibles sur claude[3].ai et l'API Claude », qui est désormais généralement disponible dans 159 pays ; CNBC[4] et TechCrunch[5] rapportent le lancement ce même lundi.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Ajouté le 28 sept. 2026· 33 % du score
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Ajouté le 28 sept. 2026· 33 % du score
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Publié le 4 mars 2024· Début 4 mars 2024· 1 % du score
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Publié le 4 mars 2024· Début 4 mars 2024· 1 % du score
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.