- Inicio
- 20 jun 202492% DE CONFIANZAsegún techcrunch.com
Anthropic lanza Claude 3.5 Sonnet
Traducido automáticamente del original
Título original: Claude 3.5 Sonnet Released
- «Hoy lanzamos Claude 3.5 Sonnet, nuestro primer lanzamiento de la próxima familia de modelos Claude 3.5», que supera a Claude 3 Opus «con la velocidad y el coste de nuestro modelo de nivel intermedio, Claude 3 Sonnet»[1][4]
- Gratuito en Claude.ai y en la aplicación de Claude para iOS, con límites de tasa más altos para los suscriptores de Pro y Team, y disponible ese mismo día en la API de Anthropic, Amazon Bedrock y Vertex AI de Google Cloud[1][5]
- Se lanzó con Artifacts, una ventana junto a la conversación donde aparecen código, documentos y diseños de sitios web para que los usuarios puedan verlos, editarlos y construir sobre ellos en tiempo real[1][3]
- Se mantuvo en ASL-2; Anthropic lo entregó al UK AI Safety Institute para pruebas previas al despliegue, que compartió los resultados con el US AI Safety Institute[1]
- Anthropic dijo que completaría la familia con Claude 3.5 Haiku y Claude 3.5 Opus más adelante en 2024[1]
Características destacadas
- Con un precio de $3 por millón de tokens de entrada y $15 por millón de tokens de salida, con una ventana de contexto de 200K tokens; AWS lo describe como un 80 por ciento más económico que Claude 3 Opus[1][5]
- Funciona al doble de la velocidad de Claude 3 Opus[1][4]
- Ficha del modelo de Anthropic: 59.4% en GPQA Diamond, 88.7% en MMLU, 92.0% en HumanEval y 71.1% en MATH, frente al 50.4%, 86.8%, 84.9% y 60.1% de Claude 3 Opus[2]
- Resolvió el 64% de los problemas en una evaluación interna de codificación agéntica - corregir un error o añadir una función a una base de código abierto - frente al 38% de Claude 3 Opus[1][2]
- El modelo de visión más potente de Anthropic hasta la fecha: mejor leyendo gráficos y diagramas y transcribiendo texto de imágenes imperfectas, con una puntuación de 68.3% en MMMU[1][2]
Pruebas de referencia[1]
| Prueba de referencia | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (early snapshot) |
|---|---|---|---|---|---|
| Razonamiento de nivel de posgrado (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| Conocimiento de nivel universitario (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| Conocimiento de nivel universitario (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| Código (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| Matemáticas multilingües (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| Razonamiento sobre texto (DROP, puntuación F1) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (variable shots) | 83.5 (3-shot, pre-trained model) |
| Evaluaciones mixtas (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, pre-trained model) |
| Resolución de problemas matemáticos (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| Matemáticas de escuela primaria (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet obtiene 67.2% en GPQA con 5-shot CoT y maj@32. ** Claude 3.5 Sonnet obtiene 90.4% en MMLU con instrucciones de tipo 5-shot CoT.
Referencias 585% DE CONFIANZAConfianza general: 85%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 5 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Publicado el 28 sept 2026· Empieza 20 jun 2024· 32% de la puntuación
Anthropic[2]: «Hoy lanzamos Claude 3.5 Sonnet» y «ya está disponible de forma gratuita en Claude.ai»; el encabezado de la página ahora muestra el 21 de junio de 2024, pero TechCrunch[4] y AWS publicaron ambos el lanzamiento el 20 de junio de 2024 y el identificador del modelo es claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Añadido el 28 sept 2026· 32% de la puntuación
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Añadido el 28 sept 2026· 32% de la puntuación
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Publicado el 20 jun 2024· Empieza 20 jun 2024 ✓· 1% de la puntuación
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Publicado el 20 jun 2024· Empieza 20 jun 2024· 1% de la puntuación
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.