- Início
- 17 de fev. de 202690% DE CONFIANÇAde a fonte
Claude Sonnet 4.6 é lançado
Traduzido automaticamente do original
Título original: Claude Sonnet 4.6 Released
- “O Claude Sonnet 4.6 é nosso modelo Sonnet mais capaz até hoje”, uma evolução completa em programação, uso do computador, raciocínio de contexto longo, planejamento de agentes, trabalho do conhecimento e design[1][4]
- Tornou-se o modelo padrão no claude.ai e no Claude Cowork para usuários Free e Pro, e o plano gratuito ganhou criação de arquivos, conectores, skills e compactação; está em todos os planos do Claude, no Claude Code, na API e em todas as principais plataformas de nuvem[1][3][4]
- No Claude Code, os primeiros testadores o preferiram ao Sonnet 4.5 cerca de 70% das vezes e até ao Opus 4.5, o modelo principal da Anthropic em novembro, 59% das vezes, dizendo que é menos propenso a excesso de engenharia e a “preguiça”[1]
- Pesquisadores de segurança encontraram “um caráter em geral caloroso, honesto, pró-social e, por vezes, divertido” e nenhum sinal de desalinhamento grave em situações de alto risco; ele resiste muito melhor à injeção de prompt que o Sonnet 4.5 e foi lançado sob o ASL-3[1][5]
- A CNBC ligou o lançamento a uma liquidação de ações de software, com o ETF de software IGV em queda de mais de 20% no ano[3]
Destaques
- Preço inalterado em relação ao Sonnet 4.5: US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída; janela de contexto de 1 milhão de tokens (em beta no lançamento) e 128 mil de saída máxima[1][2]
- Tabela da Anthropic: 79,6% no SWE-bench Verified, 72,5% no OSWorld-Verified (Sonnet 4.5: 61,4%), 59,1% no Terminal-Bench 2.0 e 74,7% no BrowseComp[1]
- Seu gráfico do OSWorld traça a linha Sonnet de 14,9% no Claude 3.5 Sonnet de outubro de 2024 a 72,5% no Sonnet 4.6[1]
- Raciocínio adaptativo e estendido, além de compactação de contexto em beta, que resume o contexto mais antigo quando uma conversa se aproxima do limite[1][2]
- Ele iguala o Opus 4.6 no OfficeQA, o teste da Databricks de leitura de gráficos, PDFs e tabelas corporativos, e no Vending-Bench Arena investiu pesado por dez meses simulados antes de passar a buscar lucro[1]
Benchmarks[1]
| Benchmark | Sonnet 4.6 | Sonnet 4.5 | Opus 4.6 | Opus 4.5 | Gemini 3 Pro | GPT-5.2 (all models) |
|---|---|---|---|---|---|---|
| Programação em terminal com agentes (Terminal-Bench 2.0) | 59,1% | 51,0% | 65,4% | 59,8% | 56,2% (54,2% autorrelatado) | 64,7% (64,0% autorrelatado, Codex CLI) |
| Programação com agentes (SWE-bench Verified) | 79,6% | 77,2% | 80,8% | 80,9% | 78,0% (Flash) | 80,0% |
| Uso do computador por agentes (OSWorld-Verified) | 72,5% | 61,4% | 72,7% | 66,3% | — | 38,2% |
| Uso de ferramentas por agentes (τ2-bench), varejo | 91,7% | 86,2% | 91,9% | 88,9% | 85,3% | 82,0% |
| Uso de ferramentas por agentes (τ2-bench), telecomunicações | 97,9% | 98,0% | 99,3% | 98,2% | 98,0% | 98,7% |
| Uso de ferramentas em escala (MCP-Atlas) | 61,3% | 43,8% | 59,5% | 62,3% | 54,1% | 60,6% |
| Busca com agentes (BrowseComp) | 74,7% | 43,9% | 84,0% | 67,8% | 59,2% (Deep Research) | 77,9% (Pro) |
| Raciocínio multidisciplinar (Humanity's Last Exam), sem ferramentas | 33,2% | 17,7% | 40,0% | 30,8% | 37,5% | 36,6% (Pro) |
| Raciocínio multidisciplinar (Humanity's Last Exam), com ferramentas | 49,0% | 33,6% | 53,0% | 43,4% | 45,8% | 50,0% (Pro) |
| Análise financeira com agentes (Finance Agent v1.1) | 63,3% | 54,5% | 60,1% | 58,8% | 55,2% | 59,0% |
| Tarefas de escritório (GDPval-AA Elo) | 1633 | 1276 | 1606 | 1416 | 1201 | 1462 |
| Resolução de problemas inéditos (ARC-AGI-2) | 58,3% | 13,6% | 68,8% | 37,6% | 31,1% | 54,2% (Pro) |
| Raciocínio de nível de pós-graduação (GPQA Diamond) | 89,9% | 83,4% | 91,3% | 87,0% | 91,9% | 93,2% (Pro) |
| Raciocínio visual (MMMU-Pro), sem ferramentas | 74,5% | 63,4% | 73,9% | 70,6% | 81,0% | 79,5% |
| Raciocínio visual (MMMU-Pro), com ferramentas | 75,6% | 68,9% | 77,3% | 73,9% | — | 80,4% |
| Perguntas e respostas multilíngues (MMMLU) | 89,3% | 89,5% | 91,1% | 90,8% | 91,8% | 89,6% |
Referências 588% DE CONFIANÇAConfiança geral: 88%Quanto a fonte e as referências do pin sustentam suas datas.Média ponderada de quanto 5 referências, incluindo a fonte, sustentam os horários de início e fim do pin; uma referência conta metade a cada 180 dias a mais em relação à mais recenteMostrar todos os pins com confiança de 75% ou mais
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
- [1]90%anthropic.com/news/claude-sonnet-4-6anthropic.com· Postado em 28 de set. de 2026· Início 17 de fev. de 2026 ✓· 31% da pontuação
A publicação é datada de “17 de fev. de 2026” e diz “O Claude[2] Sonnet 4.6 está disponível agora em todos os planos do Claude, no Claude Cowork, no Claude Code, em nossa API e em todas as principais plataformas de nuvem”; a página do modelo na documentação lista “Lançado em 17 de fevereiro de 2026” e a CNBC[3] noticiou nesse dia.
- [2]90%Claude Sonnet 4.6 - Claude Platform Docsplatform.claude.com· Adicionado em 28 de set. de 2026· 31% da pontuação
Anthropic's[1][5] model page: claude-sonnet-4-6, 1M-token context, 128K max output (300K Batch beta), $3/$15 per million tokens, adaptive thinking (extended deprecated), text and images in, an August 2025 reliable knowledge cutoff, "Released February 17, 2026".
- [3]85%Anthropic releases Claude Sonnet 4.6, continuing breakneck pace of AI model releasescnbc.com· Publicado em 17 de fev. de 2026· Início 17 de fev. de 2026· 13% da pontuação
CNBC, 2026-02-17: the default for free and Pro users in Claude[2] and Claude Cowork, better at computers, coding, design and knowledge work; Anthropic's[1][5] advances had fed a sell-off in software stocks, with the iShares Expanded Tech-Software Sector ETF (IGV) down more than 20% for the year.
- [4]80%Claude Sonnet 4.6 Brings Improved Coding, Computer Use, and Office Tasksmacrumors.com· Publicado em 17 de fev. de 2026· Início 17 de fev. de 2026· 13% da pontuação
MacRumors, 2026-02-17: "Anthropic[1][5] today updated its Sonnet model to version 4.6", available on all Claude[2] plans, with file creation, connectors, skills and compaction added for free users; Opus 4.6 stays the better choice for the hardest agentic work.
- [5]90%System Card: Claude Sonnet 4.6anthropic.com· Publicado em 17 de fev. de 2026· 13% da pontuação
Anthropic's[1] system card dated "February 17, 2026", which records the model's release under the AI Safety Level 3 (ASL-3) Standard; a 6 March 2026 changelog entry updated its BrowseComp scores after an improved cheating-detection pipeline.
Sugerir uma correção
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.