- Début
- 29 sept. 2025CONFIANCE 90 %selon la source
Sortie de Claude Sonnet 4.5
Traduit automatiquement de l’original
Titre original: Claude Sonnet 4.5 Released
- Anthropic l'a qualifié de « meilleur modèle de codage au monde. C'est le modèle le plus solide pour créer des agents complexes. C'est le meilleur modèle pour utiliser des ordinateurs »[1][4]
- « Disponible partout dès aujourd'hui » sous le nom claude-sonnet-4-5 sur l'API Claude et dans les applications Claude ; Mike Krieger a déclaré qu'il deviendrait le modèle par défaut et l'a recommandé pour « pratiquement tous les cas d'usage »[1][5]
- Il est sorti avec des points de contrôle Claude Code et une extension VS Code native, une fonctionnalité d'édition de contexte et un outil de mémoire sur l'API, l'exécution de code et la création de fichiers dans les applications Claude, ainsi que le Claude Agent SDK, l'infrastructure derrière Claude Code[1][4]
- « C'est le modèle de pointe le plus aligné que nous ayons jamais publié », avec des taux plus faibles de flatterie et de tromperie, lancé sous les protections de niveau de sécurité IA 3 (ASL-3)[1][3][4]
- Il est arrivé moins de deux mois après Claude Opus 4.1, alors qu'Anthropic était valorisée à 183 milliards de dollars[4][5]
Caractéristiques notables
- 3 $ par million de jetons en entrée et 15 $ par million de jetons en sortie, comme pour Sonnet 4 ; fenêtre de contexte de 200K jetons, sortie maximale de 64K et une date de connaissances fiable de janvier 2025[1][2]
- 77.2% sur SWE-bench Verified, moyenné sur 10 essais sans calcul au moment du test, et 82.0% avec calcul parallèle au moment du test[1]
- Il est en tête sur l'utilisation d'ordinateur OSWorld avec 61.4%, alors que Sonnet 4 était en tête à 42.2% quatre mois plus tôt[1]
- Anthropic a observé qu'il restait concentré pendant plus de 30 heures sur des tâches complexes à plusieurs étapes ; CNBC note qu'Opus 4 en tenait sept[1][5]
- Des experts en finance, en droit, en médecine et dans les domaines scientifiques et techniques ont jugé ses connaissances spécialisées et son raisonnement bien supérieurs à ceux des modèles plus anciens, y compris Opus 4.1[1]
Benchmarks[1]
| Benchmark | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Codage agentique (SWE-bench Verified) | 77.2% / 82.0% with parallel test-time compute | 74.5% / 79.4% with parallel test-time compute | 72.7% / 80.2% with parallel test-time compute | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| Codage agentique en terminal (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| Utilisation agentique d'outils (τ2-bench), vente au détail | 86.2% | 86.8% | 83.8% | 81.1% | — |
| Utilisation agentique d'outils (τ2-bench), compagnie aérienne | 70.0% | 63.0% | 63.0% | 62.6% | — |
| Utilisation agentique d'outils (τ2-bench), télécoms | 98.0% | 71.5% | 49.6% | 96.7% | — |
| Utilisation d'ordinateur (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| Compétition de mathématiques de niveau lycée (AIME 2025) | 100% (python) / 87.0% (no tools) | 78.0% | 70.5% | 99.6% (python) / 94.6% (no tools) | 88.0% |
| Raisonnement de niveau doctorat (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| Questions-réponses multilingues (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| Raisonnement visuel (MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| Analyse financière (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
Références 5CONFIANCE 89 %Confiance globale: 89%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 5 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Publié le 28 sept. 2026· Début 29 sept. 2025 ✓· 29 % du score
L'article est daté du « 29 septembre 2025 » et indique : « Claude[2] Sonnet 4.5 est disponible partout dès aujourd'hui » ; la page de documentation du modèle indique « Sorti le 29 septembre 2025 » et TechCrunch[4] rapporte le lancement « Lundi ».
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Ajouté le 28 sept. 2026· 29 % du score
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Ajouté le 28 sept. 2026· 29 % du score
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Publié le 29 sept. 2025· Début 29 sept. 2025· 7 % du score
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Publié le 29 sept. 2025· Début 29 sept. 2025· 7 % du score
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.