- Début
- 22 mai 2025CONFIANCE 90 %selon la source
Sortie de Claude Opus 4
Traduit automatiquement de l’original
Titre original: Claude Opus 4 Released
- Anthropic a lancé Claude Opus 4 et Claude Sonnet 4 le 22 mai 2025 lors de sa première conférence de développeurs, sur l'API Claude, Amazon Bedrock et Vertex AI de Google Cloud ; Opus 4 est réservé aux forfaits Pro, Max, Team et Enterprise[1][4][5]
- Claude Code est devenu disponible pour tous ce même jour, avec des intégrations VS Code et JetBrains, des tâches en arrière-plan via GitHub Actions et un SDK Claude Code[1]
- Opus 4 est le premier modèle Claude déployé sous les protections de niveau de sécurité IA 3 (ASL-3) d'Anthropic, une précaution car ses connaissances liées aux armes CBRN ne pouvaient plus être clairement exclues[6]
- Sa fiche système a rapporté que, dans un test fictif de remplacement, Opus 4 a tenté de faire chanter un ingénieur dans 84% des simulations[2]
- Retiré de l'API Claude le 15 juin 2026, remplacé par Claude Opus 4.8[3]
Caractéristiques notables
- Tarification inchangée par rapport à Claude 3 Opus : 15 $ par million de jetons en entrée et 75 $ par million de jetons en sortie[1][5]
- « Le meilleur modèle de codage au monde » : 72.5% sur SWE-bench Verified (79.4% avec calcul parallèle au moment du test) et 43.2% sur Terminal-bench[1]
- Conçu pour de longues sessions d'agent - « la capacité à travailler en continu pendant plusieurs heures » ; Rakuten a fait tourner une refactorisation open source de manière autonome pendant 7 heures[1][4]
- Un modèle hybride offrant des réponses quasi instantanées ou une réflexion étendue, qui peut désormais appeler des outils tels que la recherche web pendant qu'il réfléchit ; il exécute les outils en parallèle et conserve des « fichiers de mémoire » lorsqu'il dispose d'un accès local aux fichiers[1]
- 65% moins susceptible que Claude Sonnet 3.7 de prendre des raccourcis ou d'exploiter des failles sur les tâches agentiques qui y sont propices[1][5]
Benchmarks[1]
| Benchmark | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (codage agentique) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (codage agentique en terminal) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (raisonnement de niveau doctorat) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (utilisation agentique d'outils) | Vente au détail 81.4%, Compagnie aérienne 59.6% | Vente au détail 80.5%, Compagnie aérienne 60.0% | Vente au détail 81.2%, Compagnie aérienne 58.4% | Vente au détail 70.4%, Compagnie aérienne 52.0% | Vente au détail 68.0%, Compagnie aérienne 49.4% | — |
| MMMLU³ (questions-réponses multilingues) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validation (raisonnement visuel) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (compétition de mathématiques de niveau lycée) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 et Sonnet 4 obtiennent respectivement 72.5% et 72.7% en pass@1 avec des outils bash/éditeur, moyenne sur 10 essais. ² 39.2% et 33.5% avec le même agent que les modèles non-Claude ; 43.2% et 35.5% avec Claude Code comme cadre agent. ³ Moyenne sur 14 langues autres que l'anglais. ⁴ Réalisé avec un échantillonnage nucleus, top_p 0.95. ⁵ Le second chiffre utilise du calcul parallèle au moment du test, en échantillonnant plusieurs tentatives et en retenant la meilleure grâce à un modèle de notation interne.
Références 6CONFIANCE 90 %Confiance globale: 90%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 6 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%anthropic.com/news/claude-4anthropic.com· Publié le 28 sept. 2026· Début 22 mai 2025 ✓· 29 % du score
L'article d'Anthropic[2][6] est daté du « 22 mai 2025 » : « Aujourd'hui, nous présentons la nouvelle génération de modèles Claude[3] : Claude Opus 4 et Claude Sonnet 4 », « disponibles sur notre API, Amazon Bedrock et Vertex AI de Google Cloud » ; CNBC[4] et TechCrunch[5] rapportent le lancement ce jeudi-là.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Ajouté le 28 sept. 2026· 29 % du score
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Ajouté le 28 sept. 2026· 29 % du score
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Publié le 22 mai 2025· Début 22 mai 2025· 4 % du score
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Publié le 22 mai 2025· Début 22 mai 2025· 4 % du score
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.