- Início
- 4 de mar. de 202490% DE CONFIANÇAde a fonte
Claude 3 Opus é lançado
Traduzido automaticamente do original
Título original: Claude 3 Opus Released
- A Anthropic anunciou a família Claude 3 - Haiku, Sonnet e Opus “em ordem crescente de capacidade” - em 4 de março de 2024, com Opus e Sonnet disponíveis no mesmo dia no claude.ai e na API do Claude, agora com disponibilidade geral em 159 países[1][4]
- No claude.ai, o Opus foi para os assinantes do Claude Pro, enquanto o Sonnet movia a experiência gratuita; o Sonnet chegou ao Amazon Bedrock e a uma prévia privada do Google Cloud Vertex AI nesse dia, “com Opus e Haiku chegando em breve a ambos”[1]
- A Anthropic manteve o modelo no AI Safety Level 2 (ASL-2) depois que testes de red team encontraram “potencial desprezível de risco catastrófico neste momento”[1]
- A CNBC observa que entre os apoiadores da Anthropic estão Google, Salesforce e Amazon, após acordos de financiamento que somaram cerca de US$ 7,3 bilhões no ano anterior[4]
- O Claude 3 Opus foi descontinuado em 30 de junho de 2025 e aposentado da API do Claude em 5 de janeiro de 2026, substituído pelo Claude Opus 4.8[3]
Destaques
- O Claude 3 Opus é “nosso modelo mais inteligente, com o melhor desempenho do mercado em tarefas altamente complexas”, com preço de US$ 15 por milhão de tokens de entrada e US$ 75 por milhão de tokens de saída[1][5]
- Benchmarks divulgados pela Anthropic: 86,8% no MMLU, 50,4% no GPQA Diamond, 95,0% no GSM8K e 84,9% no HumanEval, à frente dos 86,4%, 35,7%, 92,0% e 67,0% do GPT-4[1]
- Uma janela de contexto de 200 mil tokens no lançamento, com entradas acima de 1 milhão de tokens disponíveis “para casos de uso específicos”; no teste de recuperação Needle In A Haystack, passou de 99% de precisão e às vezes percebeu que a frase plantada parecia inserida artificialmente[1][5]
- O primeiro modelo de visão do Claude: lê fotos, gráficos, diagramas e esquemas técnicos, até 20 imagens em uma única requisição, mas não identifica pessoas[1][5]
- O Opus tem “significativamente menos probabilidade” que os modelos Claude anteriores de recusar prompts inofensivos e dobra a precisão do Claude 2.1 em perguntas factuais abertas difíceis; o conhecimento vai até agosto de 2023[1][2]
Benchmarks[1]
| Benchmark | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (conhecimento de nível de graduação) | 86,8% 5 shot | 79,0% 5-shot | 75,2% 5-shot | 86,4% 5-shot | 70,0% 5-shot | 83,7% 5-shot | 71,8% 5-shot |
| GPQA, Diamond (raciocínio de nível de pós-graduação) | 50,4% 0-shot CoT | 40,4% 0-shot CoT | 33,3% 0-shot CoT | 35,7% 0-shot CoT | 28,1% 0-shot CoT | — | — |
| GSM8K (matemática do ensino fundamental) | 95,0% 0-shot CoT | 92,3% 0-shot CoT | 88,9% 0-shot CoT | 92,0% 5-shot CoT | 57,1% 5-shot | 94,4% Maj1@32 | 86,5% Maj1@32 |
| MATH (resolução de problemas matemáticos) | 60,1% 0-shot CoT | 43,1% 0-shot CoT | 38,9% 0-shot CoT | 52,9% 4-shot | 34,1% 4-shot | 53,2% 4-shot | 32,6% 4-shot |
| MGSM (matemática multilíngue) | 90,7% 0-shot | 83,5% 0-shot | 75,1% 0-shot | 74,5% 8-shot | — | 79,0% 8-shot | 63,5% 8-shot |
| HumanEval (código) | 84,9% 0-shot | 73,0% 0-shot | 75,9% 0-shot | 67,0% 0-shot | 48,1% 0-shot | 74,4% 0-shot | 67,7% 0-shot |
| DROP, F1 score (raciocínio sobre texto) | 83,1 3-shot | 78,9 3-shot | 78,4 3-shot | 80,9 3-shot | 64,1 3-shot | 82,4 shots variáveis | 74,1 shots variáveis |
| BIG-Bench-Hard (avaliações mistas) | 86,8% 3-shot CoT | 82,9% 3-shot CoT | 73,7% 3-shot CoT | 83,1% 3-shot CoT | 66,6% 3-shot CoT | 83,6% 3-shot CoT | 75,0% 3-shot CoT |
| ARC-Challenge (perguntas e respostas de conhecimento) | 96,4% 25-shot | 93,2% 25-shot | 89,2% 25-shot | 96,3% 25-shot | 85,2% 25-shot | — | — |
| HellaSwag (conhecimento geral) | 95,4% 10-shot | 89,0% 10-shot | 85,9% 10-shot | 95,3% 10-shot | 85,5% 10-shot | 87,8% 10-shot | 84,7% 10-shot |
Referências 590% DE CONFIANÇAConfiança geral: 90%Quanto a fonte e as referências do pin sustentam suas datas.Média ponderada de quanto 5 referências, incluindo a fonte, sustentam os horários de início e fim do pin; uma referência conta metade a cada 180 dias a mais em relação à mais recenteMostrar todos os pins com confiança de 75% ou mais
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Postado em 28 de set. de 2026· Início 4 de mar. de 2024 ✓· 33% da pontuação
O texto da Anthropic[2] é datado de “4 de mar. de 2024” e diz “Opus e Sonnet já estão disponíveis para uso no claude[3].ai e na API do Claude, que agora tem disponibilidade geral em 159 países”; a CNBC[4] e a TechCrunch[5] noticiam o lançamento na mesma segunda-feira.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Adicionado em 28 de set. de 2026· 33% da pontuação
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Adicionado em 28 de set. de 2026· 33% da pontuação
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Publicado em 4 de mar. de 2024· Início 4 de mar. de 2024· 1% da pontuação
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Publicado em 4 de mar. de 2024· Início 4 de mar. de 2024· 1% da pontuação
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Sugerir uma correção
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.