- Início
- 20 de jun. de 202492% DE CONFIANÇAde techcrunch.com
Claude 3.5 Sonnet é lançado
Traduzido automaticamente do original
Título original: Claude 3.5 Sonnet Released
- “Hoje, estamos lançando o Claude 3.5 Sonnet - nosso primeiro lançamento na futura família de modelos Claude 3.5”, que supera o Claude 3 Opus “com a velocidade e o custo de nosso modelo intermediário, o Claude 3 Sonnet”[1][4]
- Gratuito no Claude.ai e no app Claude para iOS, com limites de uso maiores para assinantes Pro e Team, e disponível no mesmo dia na API da Anthropic, no Amazon Bedrock e no Vertex AI do Google Cloud[1][5]
- Foi lançado com o Artifacts, uma janela ao lado da conversa em que código, documentos e projetos de sites aparecem para que os usuários possam vê-los, editá-los e desenvolvê-los em tempo real[1][3]
- Permaneceu no ASL-2; a Anthropic o entregou ao UK AI Safety Institute para testes antes da implantação, que compartilhou os resultados com o US AI Safety Institute[1]
- A Anthropic disse que completaria a família com o Claude 3.5 Haiku e o Claude 3.5 Opus ainda em 2024[1]
Destaques
- Preço de US$ 3 por milhão de tokens de entrada e US$ 15 por milhão de tokens de saída, com janela de contexto de 200 mil tokens; a AWS o chama de 80 por cento mais barato que o Claude 3 Opus[1][5]
- Roda com o dobro da velocidade do Claude 3 Opus[1][4]
- Model card da Anthropic: 59,4% no GPQA Diamond, 88,7% no MMLU, 92,0% no HumanEval e 71,1% no MATH, contra 50,4%, 86,8%, 84,9% e 60,1% do Claude 3 Opus[2]
- Resolveu 64% dos problemas em uma avaliação interna de programação com agentes - corrigir um bug ou acrescentar um recurso a uma base de código aberta - contra 38% do Claude 3 Opus[1][2]
- O modelo de visão mais forte da Anthropic até então: melhor em ler gráficos e diagramas e transcrever texto de imagens imperfeitas, com 68,3% no MMMU[1][2]
Benchmarks[1]
| Benchmark | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| Raciocínio de nível de pós-graduação (GPQA, Diamond) | 59,4%* (0-shot CoT) | 50,4% (0-shot CoT) | 53,6% (0-shot CoT) | — | — |
| Conhecimento de nível de graduação (MMLU), 5-shot | 88,7%** (5-shot) | 86,8% (5-shot) | — | 85,9% (5-shot) | 86,1% (5-shot) |
| Conhecimento de nível de graduação (MMLU), 0-shot CoT | 88,3% (0-shot CoT) | 85,7% (0-shot CoT) | 88,7% (0-shot CoT) | — | — |
| Código (HumanEval) | 92,0% (0-shot) | 84,9% (0-shot) | 90,2% (0-shot) | 84,1% (0-shot) | 84,1% (0-shot) |
| Matemática multilíngue (MGSM) | 91,6% (0-shot CoT) | 90,7% (0-shot CoT) | 90,5% (0-shot CoT) | 87,5% (8-shot) | — |
| Raciocínio sobre texto (DROP, F1 score) | 87,1 (3-shot) | 83,1 (3-shot) | 83,4 (3-shot) | 74,9 (shots variáveis) | 83,5 (3-shot, modelo pré-treinado) |
| Avaliações mistas (BIG-Bench-Hard) | 93,1% (3-shot CoT) | 86,8% (3-shot CoT) | — | 89,2% (3-shot CoT) | 85,3% (3-shot CoT, modelo pré-treinado) |
| Resolução de problemas matemáticos (MATH) | 71,1% (0-shot CoT) | 60,1% (0-shot CoT) | 76,6% (0-shot CoT) | 67,7% (4-shot) | 57,8% (4-shot CoT) |
| Matemática do ensino fundamental (GSM8K) | 96,4% (0-shot CoT) | 95,0% (0-shot CoT) | — | 90,8% (11-shot) | 94,1% (8-shot CoT) |
* O Claude 3.5 Sonnet marca 67,2% no GPQA com CoT de 5-shot e maj@32. ** O Claude 3.5 Sonnet marca 90,4% no MMLU com prompts CoT de 5-shot.
Referências 585% DE CONFIANÇAConfiança geral: 85%Quanto a fonte e as referências do pin sustentam suas datas.Média ponderada de quanto 5 referências, incluindo a fonte, sustentam os horários de início e fim do pin; uma referência conta metade a cada 180 dias a mais em relação à mais recenteMostrar todos os pins com confiança de 75% ou mais
A primeira entrada é sempre a fonte do pin. A confiança geral é uma média ponderada de quanto cada referência sustenta os horários de início e fim usados acima; uma referência conta metade a cada 180 dias a mais em relação à mais recente.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Postado em 28 de set. de 2026· Início 20 de jun. de 2024· 32% da pontuação
Anthropic[2]: “Hoje, estamos lançando o Claude 3.5 Sonnet” e ele “já está disponível gratuitamente no Claude.ai”; o cabeçalho da página agora mostra 21 de jun. de 2024, mas a TechCrunch[4] e a AWS publicaram o lançamento em 20 de junho de 2024 e o ID do modelo é claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Adicionado em 28 de set. de 2026· 32% da pontuação
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Adicionado em 28 de set. de 2026· 32% da pontuação
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Publicado em 20 de jun. de 2024· Início 20 de jun. de 2024 ✓· 1% da pontuação
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Publicado em 20 de jun. de 2024· Início 20 de jun. de 2024· 1% da pontuação
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Sugerir uma correção
Falta algo ou há um erro? Diga com suas palavras: um link que sustente este pin, uma data de início ou fim diferente e por quê, ou um fato que falta ou está errado. A IA confere isso com as fontes do pin, procura outras melhores e adiciona qualquer página que dê razão a você. As fontes do próprio pin continuam contando mais. Uma imagem que mostra outra coisa, ou mostra mal, também é analisada e rebaixada ou substituída.