- Inicio
- 29 sept 202590% DE CONFIANZAsegún la fuente
Anthropic lanza Claude Sonnet 4.5
Traducido automáticamente del original
Título original: Claude Sonnet 4.5 Released
- Anthropic lo llamó «el mejor modelo de codificación del mundo. Es el modelo más fuerte para construir agentes complejos. Es el mejor modelo usando ordenadores»[1][4]
- «Disponible en todas partes hoy» como claude-sonnet-4-5 en la API de Claude y en las aplicaciones de Claude; Mike Krieger dijo que sería el modelo predeterminado y lo recomendó para «básicamente todos los casos de uso»[1][5]
- Se lanzó con puntos de control de Claude Code y una extensión nativa para VS Code, una función de edición de contexto y una herramienta de memoria en la API, ejecución de código y creación de archivos en las aplicaciones de Claude, y el Claude Agent SDK, la infraestructura detrás de Claude Code[1][4]
- «Este es el modelo de frontera más alineado que hemos lanzado nunca», con tasas más bajas de adulación y engaño, lanzado bajo las protecciones del Nivel de Seguridad de IA 3 (ASL-3)[1][3][4]
- Llegó menos de dos meses después de Claude Opus 4.1, con Anthropic valorada en $183 mil millones[4][5]
Características destacadas
- $3 por millón de tokens de entrada y $15 por millón de tokens de salida, como en Sonnet 4; ventana de contexto de 200K tokens, salida máxima de 64K y una fecha límite de conocimiento fiable de enero de 2025[1][2]
- 77.2% en SWE-bench Verified, promediado en 10 pruebas sin cómputo en tiempo de prueba, y 82.0% con cómputo paralelo en tiempo de prueba[1]
- Lidera el uso del ordenador en OSWorld con un 61.4%, donde Sonnet 4 había liderado con un 42.2% cuatro meses antes[1]
- Anthropic observó que mantenía el enfoque durante más de 30 horas en tareas complejas de varios pasos; CNBC señala que Opus 4 aguantó siete[1][5]
- Expertos en finanzas, derecho, medicina y ciencias descubrieron que su conocimiento del dominio y su razonamiento estaban muy por delante de los modelos más antiguos, incluido Opus 4.1[1]
Pruebas de referencia[1]
| Prueba de referencia | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Codificación agéntica (SWE-bench Verified) | 77.2% / 82.0% con cómputo paralelo en tiempo de prueba | 74.5% / 79.4% con cómputo paralelo en tiempo de prueba | 72.7% / 80.2% con cómputo paralelo en tiempo de prueba | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| Codificación agéntica en terminal (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| Uso agéntico de herramientas (τ2-bench), minorista | 86.2% | 86.8% | 83.8% | 81.1% | — |
| Uso agéntico de herramientas (τ2-bench), aerolínea | 70.0% | 63.0% | 63.0% | 62.6% | — |
| Uso agéntico de herramientas (τ2-bench), telecomunicaciones | 98.0% | 71.5% | 49.6% | 96.7% | — |
| Uso del ordenador (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| Competencia de matemáticas de secundaria (AIME 2025) | 100% (python) / 87.0% (sin herramientas) | 78.0% | 70.5% | 99.6% (python) / 94.6% (sin herramientas) | 88.0% |
| Razonamiento de nivel de posgrado (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| Preguntas y respuestas multilingües (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| Razonamiento visual (validación MMMU) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| Análisis financiero (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
Referencias 589% DE CONFIANZAConfianza general: 89%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 5 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Publicado el 28 sept 2026· Empieza 29 sept 2025 ✓· 29% de la puntuación
La publicación está fechada el «29 de septiembre de 2025» y dice: «Claude[2] Sonnet 4.5 está disponible en todas partes hoy»; la página de documentación del modelo indica «Lanzado el 29 de septiembre de 2025» y TechCrunch[4] informa del lanzamiento «el lunes».
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Añadido el 28 sept 2026· 29% de la puntuación
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Añadido el 28 sept 2026· 29% de la puntuación
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Publicado el 29 sept 2025· Empieza 29 sept 2025· 7% de la puntuación
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Publicado el 29 sept 2025· Empieza 29 sept 2025· 7% de la puntuación
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.