- Inicio
- 22 oct 202490% DE CONFIANZAsegún la fuente
Anthropic lanza la actualización de Claude 3.5 Sonnet
Traducido automáticamente del original
Título original: Claude 3.5 Sonnet Upgrade Released
- Anthropic anunció «un Claude 3.5 Sonnet actualizado» con «mejoras generalizadas respecto a su predecesor, con avances especialmente significativos en codificación», disponible para todos los usuarios ese mismo día, y el nuevo Claude 3.5 Haiku para más adelante ese mes[1]
- El uso del ordenador llegó en beta pública: Claude mira la pantalla, mueve un cursor, hace clic en botones y escribe, y Anthropic llama a 3.5 Sonnet «el primer modelo de IA de frontera en ofrecer el uso del ordenador en beta pública» - «todavía experimental, a veces incómodo y propenso a errores»[1][4]
- Para dirigir el cursor, Claude cuenta los píxeles que necesita mover en cada captura de pantalla; Anthropic entrenó la habilidad con software sencillo como una calculadora y un editor de texto[3]
- Los desarrolladores pudieron usarlo ese mismo día en la API de Anthropic, Amazon Bedrock y Vertex AI de Google Cloud; Asana, Canva, Cognition, DoorDash, Replit y The Browser Company fueron usuarios tempranos, y Amazon tuvo acceso anticipado[1][5]
- Los AI Safety Institutes de EE. UU. y el Reino Unido lo probaron conjuntamente antes del lanzamiento; Anthropic lo mantuvo en ASL-2 y añadió clasificadores que detectan el uso del ordenador y si se está produciendo un daño[1]
Características destacadas
- Mismo precio y velocidad que el Claude 3.5 Sonnet de junio[1]
- SWE-bench Verified sube del 33.4% al 49.0%, por delante de todos los modelos disponibles públicamente, incluido el o1-preview de OpenAI[1]
- El uso agéntico de herramientas en TAU-bench sube del 62.6% al 69.2% en el ámbito minorista y del 36.0% al 46.0% en el de las aerolíneas[1]
- En OSWorld obtuvo 14.9% solo a partir de capturas de pantalla frente al 7.8% del siguiente mejor sistema, y 22.0% cuando se le permitieron más pasos[1][2]
- Desplazarse, arrastrar y hacer zoom seguían siendo difíciles para el modelo, y Anthropic recomendó empezar con tareas de bajo riesgo[1]
Pruebas de referencia[1]
| Prueba de referencia | Claude 3.5 Sonnet (nuevo) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Razonamiento de nivel de posgrado (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| Conocimiento de nivel universitario (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| Código (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| Resolución de problemas matemáticos (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| Competencia de matemáticas de secundaria (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| Preguntas y respuestas visuales (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| Codificación agéntica (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| Uso agéntico de herramientas (TAU-bench), minorista | 69.2% | 51.0% | 62.6% | — | — | — | — |
| Uso agéntico de herramientas (TAU-bench), aerolínea | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Las tablas de evaluación de Anthropic excluyen el modelo o1 de OpenAI, ya que dependen de un tiempo de cómputo previo a la respuesta extenso, a diferencia de los modelos habituales.
Referencias 590% DE CONFIANZAConfianza general: 90%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 5 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Publicado el 28 sept 2026· Empieza 22 oct 2024 ✓· 46% de la puntuación
La publicación está fechada el «22 de octubre de 2024» y dice: «El Claude 3.5 Sonnet actualizado ya está disponible para todos los usuarios. A partir de hoy, los desarrolladores pueden crear con la beta de uso del ordenador»; TechCrunch[4] y CNBC[5] informan del lanzamiento «el martes», ese mismo día.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Añadido el 28 sept 2026· 46% de la puntuación
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Publicado el 22 oct 2024· 3% de la puntuación
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Publicado el 22 oct 2024· Empieza 22 oct 2024· 3% de la puntuación
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Publicado el 22 oct 2024· Empieza 22 oct 2024· 3% de la puntuación
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.