- Início
- 29 de set. de 202590% DE CONFIANÇAde a fonte
Claude Sonnet 4.5 é lançado
Traduzido automaticamente do original
Título original: Claude Sonnet 4.5 Released
- A Anthropic o chamou de “o melhor modelo de programação do mundo. É o modelo mais forte para criar agentes complexos. É o melhor modelo em usar computadores”[1][4]
- “Disponível em todos os lugares hoje” como claude-sonnet-4-5 na API do Claude e nos apps do Claude; Mike Krieger disse que ele seria o padrão e o recomendou para “basicamente todos os casos de uso”[1][5]
- Ele chegou com checkpoints do Claude Code e uma extensão nativa para VS Code, um recurso de edição de contexto e uma ferramenta de memória na API, execução de código e criação de arquivos nos apps do Claude, e o Claude Agent SDK, a infraestrutura por trás do Claude Code[1][4]
- “Este é o modelo de fronteira mais alinhado que já lançamos”, com menores taxas de bajulação e engano, lançado sob as proteções do AI Safety Level 3 (ASL-3)[1][3][4]
- Chegou menos de dois meses depois do Claude Opus 4.1, com a Anthropic avaliada em US$ 183 bilhões[4][5]
Destaques
- US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída, como no Sonnet 4; janela de contexto de 200 mil tokens, 64 mil de saída máxima e corte de conhecimento confiável em janeiro de 2025[1][2]
- 77,2% no SWE-bench Verified, em média de 10 tentativas sem computação em tempo de teste, e 82,0% com computação paralela em tempo de teste[1]
- Lidera o uso do computador no OSWorld com 61,4%, onde o Sonnet 4 havia liderado com 42,2% quatro meses antes[1]
- A Anthropic observou que ele mantém o foco por mais de 30 horas em tarefas complexas de várias etapas; a CNBC observa que o Opus 4 chegou a sete[1][5]
- Especialistas em finanças, direito, medicina e áreas STEM consideraram seu conhecimento de domínio e seu raciocínio bem à frente dos modelos mais antigos, incluindo o Opus 4.1[1]
Benchmarks[1]
| Benchmark | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Programação com agentes (SWE-bench Verified) | 77,2% / 82,0% com computação paralela em tempo de teste | 74,5% / 79,4% com computação paralela em tempo de teste | 72,7% / 80,2% com computação paralela em tempo de teste | 72,8% (GPT-5) / 74,5% (GPT-5-Codex) | 67,2% |
| Programação em terminal com agentes (Terminal-Bench) | 50,0% | 46,5% | 36,4% | 43,8% | 25,3% |
| Uso de ferramentas por agentes (τ2-bench), varejo | 86,2% | 86,8% | 83,8% | 81,1% | — |
| Uso de ferramentas por agentes (τ2-bench), companhia aérea | 70,0% | 63,0% | 63,0% | 62,6% | — |
| Uso de ferramentas por agentes (τ2-bench), telecomunicações | 98,0% | 71,5% | 49,6% | 96,7% | — |
| Uso do computador (OSWorld) | 61,4% | 44,4% | 42,2% | — | — |
| Competição de matemática do ensino médio (AIME 2025) | 100% (python) / 87,0% (sem ferramentas) | 78,0% | 70,5% | 99,6% (python) / 94,6% (sem ferramentas) | 88,0% |
| Raciocínio de nível de pós-graduação (GPQA Diamond) | 83,4% | 81,0% | 76,1% | 85,7% | 86,4% |
| Perguntas e respostas multilíngues (MMMLU) | 89,1% | 89,5% | 86,5% | 89,4% | — |
| Raciocínio visual (MMMU validação) | 77,8% | 77,1% | 74,4% | 84,2% | 82,0% |
| Análise financeira (Finance Agent) | 55,3% | 50,9% | 44,5% | 46,9% | 29,4% |
Referências 589% DE CONFIANÇAConfiança geral: 89%Quanto a fonte e as referências do pin sustentam suas datas.Média ponderada de quanto 5 referências, incluindo a fonte, sustentam os horários de início e fim do pin; uma referência conta metade a cada 180 dias a mais em relação à mais recenteMostrar todos os pins com confiança de 75% ou mais
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Postado em 28 de set. de 2026· Início 29 de set. de 2025 ✓· 29% da pontuação
O texto é datado de “29 de set. de 2025” e diz “O Claude[2] Sonnet 4.5 está disponível em todos os lugares hoje”; a página do modelo na documentação lista “Lançado em 29 de setembro de 2025” e a TechCrunch[4] noticia o lançamento “na segunda-feira”.
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Adicionado em 28 de set. de 2026· 29% da pontuação
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Adicionado em 28 de set. de 2026· 29% da pontuação
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Publicado em 29 de set. de 2025· Início 29 de set. de 2025· 7% da pontuação
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Publicado em 29 de set. de 2025· Início 29 de set. de 2025· 7% da pontuação
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Sugerir uma correção
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.