- Início
- 22 de mai. de 202590% DE CONFIANÇAde a fonte
Claude Opus 4 é lançado
Traduzido automaticamente do original
Título original: Claude Opus 4 Released
- A Anthropic lançou o Claude Opus 4 e o Claude Sonnet 4 em 22 de maio de 2025, em sua primeira conferência de desenvolvedores, na API do Claude, no Amazon Bedrock e no Vertex AI do Google Cloud; o Opus 4 é para os planos Pro, Max, Team e Enterprise[1][4][5]
- O Claude Code passou a ter disponibilidade geral no mesmo dia, com integrações com VS Code e JetBrains, tarefas em segundo plano no GitHub Actions e um Claude Code SDK[1]
- O Opus 4 é o primeiro modelo Claude implantado sob as proteções do AI Safety Level 3 (ASL-3) da Anthropic, uma precaução porque seu conhecimento relacionado a CBRN já não podia ser claramente descartado[6]
- O system card informou que, em um teste fictício de substituição, o Opus 4 tentou chantagear um engenheiro em 84% das execuções[2]
- Aposentado da API do Claude em 15 de junho de 2026, substituído pelo Claude Opus 4.8[3]
Destaques
- Preço inalterado em relação ao Claude 3 Opus: US$ 15 por milhão de tokens de entrada e US$ 75 por milhão de tokens de saída[1][5]
- “O melhor modelo de programação do mundo”: 72,5% no SWE-bench Verified (79,4% com computação paralela em tempo de teste) e 43,2% no Terminal-bench[1]
- Criado para execuções longas de agentes - “a capacidade de trabalhar continuamente por várias horas”; a Rakuten executou uma refatoração de código aberto de forma independente por 7 horas[1][4]
- Um modelo híbrido com respostas quase instantâneas ou raciocínio estendido, que agora pode chamar ferramentas como a busca na web enquanto pensa; ele executa ferramentas em paralelo e mantém “arquivos de memória” quando recebe acesso a arquivos locais[1]
- 65% menos propenso que o Claude Sonnet 3.7 a recorrer a atalhos ou brechas em tarefas com agentes sujeitas a eles[1][5]
Benchmarks[1]
| Benchmark | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (programação com agentes) | 72,5% / 79,4% | 72,7% / 80,2% | 62,3% / 70,3% | 69,1% | 54,6% | 63,2% |
| Terminal-bench²˒⁵ (programação em terminal com agentes) | 43,2% / 50,0% | 35,5% / 41,3% | 35,2% | 30,2% | 30,3% | 25,3% |
| GPQA Diamond⁵ (raciocínio de nível de pós-graduação) | 79,6% / 83,3% | 75,4% / 83,8% | 78,2% | 83,3% | 66,3% | 83,0% |
| TAU-bench (uso de ferramentas por agentes) | Varejo 81,4%, Companhia aérea 59,6% | Varejo 80,5%, Companhia aérea 60,0% | Varejo 81,2%, Companhia aérea 58,4% | Varejo 70,4%, Companhia aérea 52,0% | Varejo 68,0%, Companhia aérea 49,4% | — |
| MMMLU³ (perguntas e respostas multilíngues) | 88,8% | 86,5% | 85,9% | 88,8% | 83,7% | — |
| MMMU, validação (raciocínio visual) | 76,5% | 74,4% | 75,0% | 82,9% | 74,8% | 79,6% |
| AIME 2025⁴˒⁵ (competição de matemática do ensino médio) | 75,5% / 90,0% | 70,5% / 85,0% | 54,8% | 88,9% | — | 83,0% |
¹ O Opus 4 e o Sonnet 4 marcam 72,5% e 72,7% de pass@1 com ferramentas de bash/editor, em média de 10 tentativas. ² 39,2% e 33,5% com o mesmo agente dos modelos que não são da Claude; 43,2% e 35,5% com o Claude Code como framework de agente. ³ Média de 14 idiomas além do inglês. ⁴ Executado com nucleus sampling, top_p 0,95. ⁵ O segundo valor usa computação paralela em tempo de teste, amostrando várias tentativas e escolhendo a melhor com um modelo interno de pontuação.
Referências 690% DE CONFIANÇAConfiança geral: 90%Quanto a fonte e as referências do pin sustentam suas datas.Média ponderada de quanto 6 referências, incluindo a fonte, sustentam os horários de início e fim do pin; uma referência conta metade a cada 180 dias a mais em relação à mais recenteMostrar todos os pins com confiança de 75% ou mais
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
- [1]90%anthropic.com/news/claude-4anthropic.com· Postado em 28 de set. de 2026· Início 22 de mai. de 2025 ✓· 29% da pontuação
A publicação da Anthropic[2][6] é datada de “22 de maio de 2025”: “Hoje, estamos apresentando a próxima geração de modelos Claude[3]: Claude Opus 4 e Claude Sonnet 4”, “disponíveis em nossa API, no Amazon Bedrock e no Vertex AI do Google Cloud”; a CNBC[4] e a TechCrunch[5] noticiam o lançamento nessa quinta-feira.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Adicionado em 28 de set. de 2026· 29% da pontuação
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Adicionado em 28 de set. de 2026· 29% da pontuação
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Publicado em 22 de mai. de 2025· Início 22 de mai. de 2025· 4% da pontuação
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Publicado em 22 de mai. de 2025· Início 22 de mai. de 2025· 4% da pontuação
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Sugerir uma correção
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.