- Inicio
- 17 feb 202690% DE CONFIANZAsegún la fuente
Anthropic lanza Claude Sonnet 4.6
Traducido automáticamente del original
Título original: Claude Sonnet 4.6 Released
- «Claude Sonnet 4.6 es nuestro modelo Sonnet más capaz hasta la fecha», una mejora completa en codificación, uso del ordenador, razonamiento de contexto largo, planificación de agentes, trabajo de conocimiento y diseño[1][4]
- Se convirtió en el modelo predeterminado en claude.ai y Claude Cowork para los usuarios Free y Pro, y el nivel gratuito obtuvo creación de archivos, conectores, habilidades y compactación; está en todos los planes de Claude, Claude Code, la API y todas las principales plataformas en la nube[1][3][4]
- En Claude Code, los primeros evaluadores lo preferían a Sonnet 4.5 alrededor del 70% de las veces e incluso a Opus 4.5, el modelo insignia de Anthropic de noviembre, el 59% de las veces, calificándolo de menos propenso a la sobreingeniería y a la «pereza»[1]
- Los investigadores de seguridad encontraron «un carácter en general cálido, honesto, prosocial y a veces divertido» y ninguna señal de desalineación grave de alto riesgo; resiste la inyección de instrucciones mucho mejor que Sonnet 4.5 y se lanzó bajo ASL-3[1][5]
- CNBC relacionó el lanzamiento con una liquidación de acciones de software, con el ETF de software IGV bajando más de un 20% en el año[3]
Características destacadas
- Precio sin cambios respecto a Sonnet 4.5: $3 por millón de tokens de entrada y $15 por millón de tokens de salida; una ventana de contexto de 1M de tokens (en beta en el lanzamiento) y una salida máxima de 128K[1][2]
- Tabla de Anthropic: 79.6% en SWE-bench Verified, 72.5% en OSWorld-Verified (Sonnet 4.5: 61.4%), 59.1% en Terminal-Bench 2.0 y 74.7% en BrowseComp[1]
- Su gráfico de OSWorld traza la línea de Sonnet desde el 14.9% del Claude 3.5 Sonnet de octubre de 2024 hasta el 72.5% de Sonnet 4.6[1]
- Pensamiento adaptativo y extendido, además de compactación de contexto en beta que resume el contexto más antiguo a medida que una conversación se acerca a su límite[1][2]
- Iguala a Opus 4.6 en OfficeQA, la prueba de Databricks para leer gráficos, PDF y tablas empresariales, y en Vending-Bench Arena invirtió mucho durante diez meses simulados antes de pasar a ser rentable[1]
Pruebas de referencia[1]
| Prueba de referencia | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (todos los modelos) |
|---|---|---|---|---|---|---|
| Codificación agéntica en terminal (Terminal-Bench 2.0) | 59.1% | 51.0% | 65.4% | 59.8% | 56.2% (54.2% autoinformado) | 64.7% (64.0% autoinformado, Codex CLI) |
| Codificación agéntica (SWE-bench Verified) | 79.6% | 77.2% | 80.8% | 80.9% | 78.0% (Flash) | 80.0% |
| Uso agéntico del ordenador (OSWorld-Verified) | 72.5% | 61.4% | 72.7% | 66.3% | — | 38.2% |
| Uso agéntico de herramientas (τ2-bench), minorista | 91.7% | 86.2% | 91.9% | 88.9% | 85.3% | 82.0% |
| Uso agéntico de herramientas (τ2-bench), telecomunicaciones | 97.9% | 98.0% | 99.3% | 98.2% | 98.0% | 98.7% |
| Uso de herramientas a escala (MCP-Atlas) | 61.3% | 43.8% | 59.5% | 62.3% | 54.1% | 60.6% |
| Búsqueda agéntica (BrowseComp) | 74.7% | 43.9% | 84.0% | 67.8% | 59.2% (Deep Research) | 77.9% (Pro) |
| Razonamiento multidisciplinario (Humanity's Last Exam), sin herramientas | 33.2% | 17.7% | 40.0% | 30.8% | 37.5% | 36.6% (Pro) |
| Razonamiento multidisciplinario (Humanity's Last Exam), con herramientas | 49.0% | 33.6% | 53.0% | 43.4% | 45.8% | 50.0% (Pro) |
| Análisis financiero agéntico (Finance Agent v1.1) | 63.3% | 54.5% | 60.1% | 58.8% | 55.2% | 59.0% |
| Tareas de oficina (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| Resolución de problemas novedosos (ARC-AGI-2) | 58.3% | 13.6% | 68.8% | 37.6% | 31.1% | 54.2% (Pro) |
| Razonamiento de nivel de posgrado (GPQA Diamond) | 89.9% | 83.4% | 91.3% | 87.0% | 91.9% | 93.2% (Pro) |
| Razonamiento visual (MMMU-Pro), sin herramientas | 74.5% | 63.4% | 73.9% | 70.6% | 81.0% | 79.5% |
| Razonamiento visual (MMMU-Pro), con herramientas | 75.6% | 68.9% | 77.3% | 73.9% | — | 80.4% |
| Preguntas y respuestas multilingües (MMMLU) | 89.3% | 89.5% | 91.1% | 90.8% | 91.8% | 89.6% |
Referencias 588% DE CONFIANZAConfianza general: 88%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 5 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· Publicado el 28 sept 2026· Empieza 17 feb 2026 ✓· 31% de la puntuación
La publicación está fechada el «17 de febrero de 2026» y dice: «Claude[2] Sonnet 4.6 ya está disponible en todos los planes de Claude, Claude Cowork, Claude Code, nuestra API y todas las principales plataformas en la nube»; la página de documentación del modelo indica «Lanzado el 17 de febrero de 2026» y CNBC[3] lo informó ese mismo día.
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· Añadido el 28 sept 2026· 31% de la puntuación
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· Publicado el 17 feb 2026· Empieza 17 feb 2026· 13% de la puntuación
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· Publicado el 17 feb 2026· Empieza 17 feb 2026· 13% de la puntuación
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· Publicado el 17 feb 2026· 13% de la puntuación
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.