Título original: Claude Opus 4.1 Released
| Benchmark | Claude Opus 4.1 | Claude Opus 4 | Claude Sonnet 4 | OpenAI o3 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| SWE-bench Verified¹ (programação com agentes) | 74,5% | 72,5% | 72,7% | 69,1% | 67,2% |
| Terminal-Bench² (programação em terminal com agentes) | 43,3% | 39,2% | 35,5% | 30,2% | 25,3% |
| GPQA Diamond (raciocínio de nível de pós-graduação) | 80,9% | 79,6% | 75,4% | 83,3% | 86,4% |
| TAU-bench (uso de ferramentas por agentes) | Varejo 82,4%, Companhia aérea 56,0% | Varejo 81,4%, Companhia aérea 59,6% | Varejo 80,5%, Companhia aérea 60,0% | Varejo 70,4%, Companhia aérea 52,0% | — |
| MMMLU³ (perguntas e respostas multilíngues) | 89,5% | 88,8% | 86,5% | 88,8% | — |
| MMMU, validação (raciocínio visual) | 77,1% | 76,5% | 74,4% | 82,9% | 82% |
| AIME 2025⁴ (competição de matemática do ensino médio) | 78,0% | 75,5% | 70,5% | 88,9% | 88% |
¹ Opus 4.1, Opus 4 e Sonnet 4 executados com pass@1 e ferramentas de bash/editor, em média de 10 tentativas, patches de tentativa única, sem computação em tempo de teste. ² Framework de agente padrão (Terminus 1), em média de 5 tentativas. ³ As pontuações do Claude são a média de 14 idiomas além do inglês. ⁴ Executado com nucleus sampling, top_p 0,95.
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
A publicação da Anthropic[3] é datada de “5 de ago. de 2025”: “Hoje estamos lançando o Claude[2][4] Opus 4.1 ... agora disponível para usuários pagos do Claude e no Claude Code. Ele também está em nossa API, no Amazon Bedrock e no Vertex AI do Google Cloud”; as notas de versão do Claude e o changelog do GitHub[5] trazem a mesma data.
"August 5, 2025 We've launched Claude[4] Opus 4.1, an incremental update to Claude Opus 4", which does not allow both temperature and top_p to be set; later entries record structured outputs launching for Opus 4.1 (14 November 2025) and its retirement.
Anthropic's[1] system card addendum: "Like Claude[2][4] Opus 4, Claude Opus 4.1 is deployed under the AI Safety Level 3 (ASL-3) Standard"; it is not "notably more capable" than Opus 4 under the RSP, so new evaluations were voluntary.
Anthropic[1][3] notified developers on 5 June 2026 that Claude[2] Opus 4.1 (claude-opus-4-1-20250805) would be retired; it was retired on 5 August 2026, one year after release, with claude-opus-4-8 as the replacement.
GitHub's changelog, "Release August 5, 2025": Claude[2][4] Opus 4.1, "the successor to Claude Opus 4", is available in GitHub Copilot Chat for Copilot Enterprise and Pro+ plans on github.com, Visual Studio Code and GitHub Mobile.
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.