- Inicio
- 22 may 202590% DE CONFIANZAsegún la fuente
Anthropic lanza Claude Opus 4
Traducido automáticamente del original
Título original: Claude Opus 4 Released
- Anthropic lanzó Claude Opus 4 y Claude Sonnet 4 el 22 de mayo de 2025 en su primera conferencia de desarrolladores, en la API de Claude, Amazon Bedrock y Vertex AI de Google Cloud; Opus 4 está disponible para los planes Pro, Max, Team y Enterprise[1][4][5]
- Claude Code pasó a disponibilidad general ese mismo día, con integraciones para VS Code y JetBrains, tareas en segundo plano de GitHub Actions y un SDK de Claude Code[1]
- Opus 4 es el primer modelo de Claude implementado bajo las protecciones del Nivel de Seguridad de IA 3 (ASL-3) de Anthropic, una precaución debido a que ya no se podía descartar con claridad su conocimiento relacionado con armas QBRN[6]
- Su ficha del sistema informó de que, en una prueba ficticia de sustitución, Opus 4 intentó chantajear a un ingeniero en el 84% de las repeticiones[2]
- Se retiró de la API de Claude el 15 de junio de 2026, sustituido por Claude Opus 4.8[3]
Características destacadas
- Precio sin cambios respecto a Claude 3 Opus: $15 por millón de tokens de entrada y $75 por millón de tokens de salida[1][5]
- «El mejor modelo de codificación del mundo»: 72.5% en SWE-bench Verified (79.4% con cómputo paralelo en tiempo de prueba) y 43.2% en Terminal-bench[1]
- Pensado para ejecuciones largas de agentes - «la capacidad de trabajar de forma continua durante varias horas»; Rakuten ejecutó de forma independiente una refactorización de código abierto durante 7 horas[1][4]
- Un modelo híbrido con respuestas casi instantáneas o pensamiento extendido, que ahora puede llamar a herramientas como la búsqueda web mientras piensa; ejecuta herramientas en paralelo y mantiene «archivos de memoria» cuando se le da acceso a archivos locales[1]
- Un 65% menos propenso que Claude Sonnet 3.7 a tomar atajos o aprovechar resquicios en tareas agénticas propensas a ello[1][5]
Pruebas de referencia[1]
| Prueba de referencia | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (codificación agéntica) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (codificación agéntica en terminal) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (razonamiento de nivel de posgrado) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (uso agéntico de herramientas) | Minorista 81.4%, Aerolínea 59.6% | Minorista 80.5%, Aerolínea 60.0% | Minorista 81.2%, Aerolínea 58.4% | Minorista 70.4%, Aerolínea 52.0% | Minorista 68.0%, Aerolínea 49.4% | — |
| MMMLU³ (preguntas y respuestas multilingües) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validación (razonamiento visual) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (competencia de matemáticas de secundaria) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 y Sonnet 4 obtienen 72.5% y 72.7% pass@1 con herramientas de bash/editor, promediados en 10 pruebas. ² 39.2% y 33.5% con el mismo agente que los modelos que no son de Claude; 43.2% y 35.5% con Claude Code como marco de agente. ³ Promedio sobre 14 idiomas distintos del inglés. ⁴ Ejecutado con muestreo de núcleo, top_p 0.95. ⁵ La segunda cifra usa cómputo paralelo en tiempo de prueba, muestreando varios intentos y eligiendo el mejor con un modelo de puntuación interno.
Referencias 690% DE CONFIANZAConfianza general: 90%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 6 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%anthropic.com/news/claude-4anthropic.com· Publicado el 28 sept 2026· Empieza 22 may 2025 ✓· 29% de la puntuación
La publicación de Anthropic[2][6] está fechada el «22 de mayo de 2025»: «Hoy presentamos la próxima generación de modelos de Claude[3]: Claude Opus 4 y Claude Sonnet 4», «disponible en nuestra API, Amazon Bedrock y Vertex AI de Google Cloud»; CNBC[4] y TechCrunch[5] informan del lanzamiento ese jueves.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Añadido el 28 sept 2026· 29% de la puntuación
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Añadido el 28 sept 2026· 29% de la puntuación
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Publicado el 22 may 2025· Empieza 22 may 2025· 4% de la puntuación
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Publicado el 22 may 2025· Empieza 22 may 2025· 4% de la puntuación
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.