- Inicio
- 24 feb 202590% DE CONFIANZAsegún la fuente
Anthropic lanza Claude 3.7 Sonnet
Traducido automáticamente del original
Título original: Claude 3.7 Sonnet Released
- Anthropic llamó a Claude 3.7 Sonnet «nuestro modelo más inteligente hasta la fecha y el primer modelo de razonamiento híbrido del mercado»: un modelo que ofrece respuestas casi instantáneas o «un pensamiento extendido, paso a paso, que se hace visible para el usuario»[1][4]
- Salió en todos los planes de Claude - Free, Pro, Team y Enterprise - y en la Claude Developer Platform, Amazon Bedrock y Vertex AI de Google Cloud; el pensamiento extendido está en todas las superficies excepto en el nivel gratuito[1][4]
- Claude Code, la primera herramienta de codificación agéntica de Anthropic, se lanzó junto con él como vista previa de investigación limitada que funciona desde la terminal, y la integración con GitHub llegó a todos los planes de Claude[1]
- Reduce las negativas innecesarias en un 45% respecto a su predecesor y se lanzó bajo el estándar ASL-2[1][2]
- La versión saltó de 3.5 a 3.7, y en febrero de 2025 Claude 3.7 Sonnet empezó a jugar a Pokémon Red en directo en Twitch[3][4]
Características destacadas
- $3 por millón de tokens de entrada y $15 por millón de tokens de salida en ambos modos, tokens de pensamiento incluidos[1][4]
- Los usuarios de la API fijan un presupuesto de pensamiento de cualquier tamaño hasta el límite de salida de 128K tokens, intercambiando velocidad y coste por calidad[1]
- Los gráficos de Anthropic dan 62.3% en SWE-bench Verified (70.3% con un andamiaje personalizado) frente al 49.0% del 3.5 Sonnet actualizado, y 81.2% (minorista) y 58.4% (aerolínea) en TAU-bench[1]
- Anthropic dice que lo optimizó menos para competencias de matemáticas y codificación y más para tareas empresariales del mundo real[1]
- En modo estándar es un Claude 3.5 Sonnet mejorado; en modo de pensamiento extendido reflexiona antes de responder, lo que ayuda en matemáticas, física, seguimiento de instrucciones y codificación[1]
Pruebas de referencia[1]
| Prueba de referencia | Claude 3.7 Sonnet (pensamiento extendido de 64K) | Claude 3.7 Sonnet (sin pensamiento extendido) | Claude 3.5 Sonnet (nuevo) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (pensamiento extendido de 32K) | Grok 3 Beta (pensamiento extendido) |
|---|---|---|---|---|---|---|---|
| Razonamiento de nivel de posgrado (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| Codificación agéntica (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| Uso agéntico de herramientas (TAU-bench), minorista | — | 81.2% | 71.5% | 73.5% | — | — | — |
| Uso agéntico de herramientas (TAU-bench), aerolínea | — | 58.4% | 48.8% | 54.2% | — | — | — |
| Preguntas y respuestas multilingües (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| Razonamiento visual (validación MMMU) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| Seguimiento de instrucciones (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| Resolución de problemas matemáticos (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| Competencia de matemáticas de secundaria (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 promediado en varias pruebas (hasta 16 para AIME y SWE-bench Verified); una segunda cifra se beneficia del cómputo paralelo en tiempo de prueba. ¹ Los resultados de o1 en TAU-bench fueron reportados por OpenAI y después eliminados; los resultados de TAU-bench pueden no ser comparables. ² 62.3% es pass@1 en 500 problemas con herramientas de bash/editor más una «herramienta de pensamiento»; 70.3% usa puntuación interna y un andamiaje personalizado en un subconjunto reducido; DeepSeek R1 usa el marco Agentless. ³ Las altas puntuaciones de Claude 3.7 Sonnet en GPQA y AIME 2024 usan puntuación interna con cómputo paralelo en tiempo de prueba; las de o1 y Grok 3 usan votación mayoritaria con 64 muestras.
Referencias 485% DE CONFIANZAConfianza general: 85%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 4 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Publicado el 28 sept 2026· Empieza 24 feb 2025 ✓· 32% de la puntuación
La publicación está fechada el «24 de febrero de 2025»: «Hoy anunciamos Claude 3.7 Sonnet» y «ya está disponible en todos los planes de Claude»; TechCrunch[4] dice que «se está implementando para todos los usuarios y desarrolladores el lunes» (24 de febrero).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Añadido el 28 sept 2026· 32% de la puntuación
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Añadido el 28 sept 2026· 32% de la puntuación
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Publicado el 24 feb 2025· Empieza 24 feb 2025· 3% de la puntuación
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.