- Début
- 24 févr. 2025CONFIANCE 90 %selon la source
Sortie de Claude 3.7 Sonnet
Traduit automatiquement de l’original
Titre original: Claude 3.7 Sonnet Released
- Anthropic a qualifié Claude 3.7 Sonnet de « notre modèle le plus intelligent à ce jour et le premier modèle de raisonnement hybride sur le marché » : un seul modèle qui donne des réponses quasi instantanées ou « une réflexion étendue, étape par étape, rendue visible à l'utilisateur »[1][4]
- Il a été déployé sur tous les forfaits Claude - Free, Pro, Team et Enterprise - ainsi que sur la Claude Developer Platform, Amazon Bedrock et Vertex AI de Google Cloud ; la réflexion étendue est disponible partout sauf sur le forfait gratuit[1][4]
- Claude Code, le premier outil de codage agentique d'Anthropic, a été lancé avec lui en aperçu de recherche limité fonctionnant depuis le terminal, et l'intégration GitHub est arrivée sur tous les forfaits Claude[1]
- Il réduit les refus inutiles de 45% par rapport à son prédécesseur et a été lancé sous la norme ASL-2[1][2]
- Le numéro de version est passé de 3.5 à 3.7, et en février 2025, Claude 3.7 Sonnet a commencé à jouer à Pokémon Rouge en direct sur Twitch[3][4]
Caractéristiques notables
- 3 $ par million de jetons en entrée et 15 $ par million de jetons en sortie dans les deux modes, jetons de réflexion inclus[1][4]
- Les utilisateurs de l'API définissent un budget de réflexion de la taille souhaitée jusqu'à la limite de sortie de 128K jetons, échangeant vitesse et coût contre qualité[1]
- Les graphiques d'Anthropic indiquent 62.3% sur SWE-bench Verified (70.3% avec un échafaudage personnalisé) contre 49.0% pour la version améliorée de 3.5 Sonnet, et 81.2% (vente au détail) et 58.4% (compagnie aérienne) sur TAU-bench[1]
- Anthropic affirme avoir moins optimisé pour les compétitions de mathématiques et de codage et davantage pour les tâches commerciales réelles[1]
- En mode standard, c'est une version améliorée de Claude 3.5 Sonnet ; en mode de réflexion étendue, il réfléchit avant de répondre, ce qui aide en mathématiques, en physique, dans le suivi d'instructions et en codage[1]
Benchmarks[1]
| Benchmark | Claude 3.7 Sonnet (64K extended thinking) | Claude 3.7 Sonnet (no extended thinking) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K extended thinking) | Grok 3 Beta (extended thinking) |
|---|---|---|---|---|---|---|---|
| Raisonnement de niveau doctorat (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| Codage agentique (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| Utilisation agentique d'outils (TAU-bench), vente au détail | — | 81.2% | 71.5% | 73.5% | — | — | — |
| Utilisation agentique d'outils (TAU-bench), compagnie aérienne | — | 58.4% | 48.8% | 54.2% | — | — | — |
| Questions-réponses multilingues (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| Raisonnement visuel (MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| Suivi d'instructions (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| Résolution de problèmes mathématiques (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| Compétition de mathématiques de niveau lycée (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 moyenné sur plusieurs essais (jusqu'à 16 pour AIME et SWE-bench Verified) ; un second chiffre bénéficie du calcul parallèle au moment du test. ¹ Les résultats TAU-bench d'o1 ont été rapportés par OpenAI puis supprimés ; les résultats TAU-bench pourraient ne pas être comparables. ² 62.3% est le pass@1 sur 500 problèmes avec des outils bash/éditeur plus un « outil de réflexion » ; 70.3% utilise une notation interne et un échafaudage personnalisé sur un sous-ensemble réduit ; DeepSeek R1 utilise le cadre Agentless. ³ Les scores élevés de Claude 3.7 Sonnet sur GPQA et AIME 2024 utilisent une notation interne avec calcul parallèle au moment du test ; ceux d'o1 et de Grok 3 utilisent un vote majoritaire sur 64 échantillons.
Références 4CONFIANCE 85 %Confiance globale: 85%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 4 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Publié le 28 sept. 2026· Début 24 févr. 2025 ✓· 32 % du score
L'article est daté du « 24 février 2025 » : « Aujourd'hui, nous annonçons Claude 3.7 Sonnet » et il « est désormais disponible sur tous les forfaits Claude » ; TechCrunch[4] indique qu'il « est déployé pour tous les utilisateurs et développeurs lundi » (24 février).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Ajouté le 28 sept. 2026· 32 % du score
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Ajouté le 28 sept. 2026· 32 % du score
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Publié le 24 févr. 2025· Début 24 févr. 2025· 3 % du score
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.