- Início
- 24 de fev. de 202590% DE CONFIANÇAde a fonte
Claude 3.7 Sonnet é lançado
Traduzido automaticamente do original
Título original: Claude 3.7 Sonnet Released
- A Anthropic chamou o Claude 3.7 Sonnet de “nosso modelo mais inteligente até hoje e o primeiro modelo de raciocínio híbrido do mercado”: um único modelo que dá respostas quase instantâneas ou “raciocínio estendido, passo a passo, tornado visível ao usuário”[1][4]
- Ele foi liberado para todos os planos do Claude - Free, Pro, Team e Enterprise - e para a Claude Developer Platform, o Amazon Bedrock e o Vertex AI do Google Cloud; o raciocínio estendido está em todas as superfícies, exceto no plano gratuito[1][4]
- O Claude Code, a primeira ferramenta de programação com agentes da Anthropic, foi lançado com ele como prévia de pesquisa limitada que funciona a partir do terminal, e a integração com o GitHub chegou a todos os planos do Claude[1]
- Ele reduz recusas desnecessárias em 45% em relação ao antecessor e foi lançado sob o padrão ASL-2[1][2]
- A versão saltou de 3.5 para 3.7, e em fevereiro de 2025 o Claude 3.7 Sonnet começou a jogar Pokémon Red ao vivo na Twitch[3][4]
Destaques
- US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída nos dois modos, incluindo os tokens de raciocínio[1][4]
- Usuários da API definem um orçamento de raciocínio de qualquer tamanho até o limite de saída de 128 mil tokens, trocando velocidade e custo por qualidade[1]
- Os gráficos da Anthropic mostram 62,3% no SWE-bench Verified (70,3% com um scaffold personalizado) contra 49,0% do 3.5 Sonnet atualizado, e 81,2% (varejo) e 58,4% (companhias aéreas) no TAU-bench[1]
- A Anthropic diz que otimizou menos para competições de matemática e programação e mais para tarefas empresariais do mundo real[1]
- No modo padrão, é um Claude 3.5 Sonnet atualizado; no modo de raciocínio estendido, reflete antes de responder, o que ajuda em matemática, física, seguimento de instruções e programação[1]
Benchmarks[1]
| Benchmark | Claude 3.7 Sonnet (64K extended thinking) | Claude 3.7 Sonnet (no extended thinking) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K extended thinking) | Grok 3 Beta (extended thinking) |
|---|---|---|---|---|---|---|---|
| Raciocínio de nível de pós-graduação (GPQA Diamond)³ | 78,2% / 84,8% | 68,0% | 65,0% | 75,7% / 78,0% | 79,7% | 71,5% | 80,2% / 84,6% |
| Programação com agentes (SWE-bench Verified)² | — | 62,3% / 70,3% | 49,0% | 48,9% | 49,3% | 49,2% | — |
| Uso de ferramentas por agentes (TAU-bench), varejo | — | 81,2% | 71,5% | 73,5% | — | — | — |
| Uso de ferramentas por agentes (TAU-bench), companhia aérea | — | 58,4% | 48,8% | 54,2% | — | — | — |
| Perguntas e respostas multilíngues (MMMLU) | 86,1% | 83,2% | 82,1% | 87,7% | 79,5% | — | — |
| Raciocínio visual (MMMU validação) | 75% | 71,8% | 70,4% | 78,2% | — | — | 76,0% / 78,0% |
| Seguimento de instruções (IFEval) | 93,2% | 90,8% | 90,2% | — | — | 83,3% | — |
| Resolução de problemas matemáticos (MATH 500) | 96,2% | 82,2% | 78,0% | 96,4% | 97,9% | 97,3% | — |
| Competição de matemática do ensino médio (AIME 2024)³ | 61,3% / 80,0% | 23,3% | 16,0% | 79,2% / 83,3% | 87,3% | 79,8% | 83,9% / 93,3% |
Pass@1 em média de várias tentativas (até 16 para o AIME e o SWE-bench Verified); um segundo valor se beneficia de computação paralela em tempo de teste. ¹ Os resultados do o1 no TAU-bench foram divulgados pela OpenAI e depois apagados; os resultados do TAU-bench podem não ser comparáveis. ² 62,3% é o pass@1 em 500 problemas com ferramentas de bash/editor mais uma “ferramenta de raciocínio”; 70,3% usa pontuação interna e um scaffold personalizado em um subconjunto reduzido; o DeepSeek R1 usa o framework Agentless. ³ As pontuações altas do Claude 3.7 Sonnet no GPQA e no AIME 2024 usam pontuação interna com computação paralela em tempo de teste; as do o1 e do Grok 3 usam votação majoritária com 64 amostras.
Referências 485% DE CONFIANÇAConfiança geral: 85%Quanto a fonte e as referências do pin sustentam suas datas.Média ponderada de quanto 4 referências, incluindo a fonte, sustentam os horários de início e fim do pin; uma referência conta metade a cada 180 dias a mais em relação à mais recenteMostrar todos os pins com confiança de 75% ou mais
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· Postado em 28 de set. de 2026· Início 24 de fev. de 2025 ✓· 32% da pontuação
A publicação é datada de “24 de fev. de 2025”: “Hoje, estamos anunciando o Claude 3.7 Sonnet” e ele “já está disponível em todos os planos do Claude”; a TechCrunch[4] diz que ele “está sendo liberado para todos os usuários e desenvolvedores na segunda-feira” (24 de fevereiro).
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· Adicionado em 28 de set. de 2026· 32% da pontuação
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Adicionado em 28 de set. de 2026· 32% da pontuação
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· Publicado em 24 de fev. de 2025· Início 24 de fev. de 2025· 3% da pontuação
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Sugerir uma correção
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.