- Начало
- 22 мая 2025 г.ДОСТОВЕРНОСТЬ 90%от источник
Выпущена Claude Opus 4
Автоматический перевод оригинала
Оригинальное название: Claude Opus 4 Released
- 22 мая 2025 г. на своей первой конференции для разработчиков Anthropic выпустила Claude Opus 4 и Claude Sonnet 4 в Claude API, Amazon Bedrock и Vertex AI от Google Cloud; Opus 4 доступна на тарифах Pro, Max, Team и Enterprise[1][4][5]
- Claude Code в тот же день стал общедоступным — с интеграциями с VS Code и JetBrains, фоновыми задачами GitHub Actions и Claude Code SDK[1]
- Opus 4 — первая модель Claude, развёрнутая под защитой Anthropic уровня безопасности ИИ 3 (ASL-3), в порядке предосторожности, поскольку наличие у неё знаний, связанных с ХБРЯ-угрозами, больше нельзя было явно исключить[6]
- В её системной карте сообщалось, что в вымышленном тесте на замену Opus 4 пыталась шантажировать инженера в 84% прогонов[2]
- Выведена из Claude API 15 июня 2026 г., её заменила Claude Opus 4.8[3]
Примечательные особенности
- Цены не изменились по сравнению с Claude 3 Opus: 15 долларов за миллион входных токенов и 75 долларов за миллион выходных[1][5]
- «Лучшая в мире модель для программирования»: 72.5% в SWE-bench Verified (79.4% с параллельными вычислениями на этапе тестирования) и 43.2% в Terminal-bench[1]
- Создана для длительной работы агентов — «способность непрерывно работать несколько часов»; Rakuten самостоятельно запускала рефакторинг проекта с открытым кодом на 7 часов[1][4]
- Гибридная модель с почти мгновенными ответами или расширенным мышлением, которая теперь может вызывать инструменты, такие как веб-поиск, пока думает; она запускает инструменты параллельно и ведёт «файлы памяти», если получает доступ к локальным файлам[1]
- На 65% реже, чем Claude Sonnet 3.7, использует обходные пути или лазейки в агентных задачах, склонных к ним[1][5]
Бенчмарки[1]
| Бенчмарк | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (агентное программирование) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (агентное программирование в терминале) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (рассуждения уровня магистратуры) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (агентное использование инструментов) | Розница 81.4%, Авиаперевозки 59.6% | Розница 80.5%, Авиаперевозки 60.0% | Розница 81.2%, Авиаперевозки 58.4% | Розница 70.4%, Авиаперевозки 52.0% | Розница 68.0%, Авиаперевозки 49.4% | — |
| MMMLU³ (многоязычные вопросы и ответы) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, валидация (визуальные рассуждения) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (олимпиада по математике для старшеклассников) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4 и Sonnet 4 набирают 72.5% и 72.7% pass@1 с инструментами bash/editor, в среднем по 10 испытаниям. ² 39.2% и 33.5% с тем же агентом, что и у моделей не от Claude; 43.2% и 35.5% с Claude Code в качестве агентного фреймворка. ³ Среднее по 14 неанглийским языкам. ⁴ Запуск с nucleus sampling, top_p 0.95. ⁵ Второе значение использует параллельные вычисления на этапе тестирования: выбирается несколько попыток, и лучшая определяется внутренней оценочной моделью.
Источники 6ДОСТОВЕРНОСТЬ 90%Общая достоверность: 90%Насколько источник и ссылки пина подтверждают его даты.Взвешенное среднее того, насколько 6 источников, включая основной, подтверждают время начала и окончания пина; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новымПоказать все пины с достоверностью 75% и выше
Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
- [1]90%anthropic.com/news/claude-4anthropic.com· Размещено 28 сент. 2026 г.· Начало 22 мая 2025 г. ✓· 29% оценки
Публикация Anthropic[2][6] датирована «22 мая 2025 г.»: «Сегодня мы представляем следующее поколение моделей Claude[3]: Claude Opus 4 и Claude Sonnet 4», «доступных в нашем API, Amazon Bedrock и Vertex AI от Google Cloud»; CNBC[4] и TechCrunch[5] сообщили о запуске в тот четверг.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· Добавлено 28 сент. 2026 г.· 29% оценки
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Добавлено 28 сент. 2026 г.· 29% оценки
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· Опубликовано 22 мая 2025 г.· Начало 22 мая 2025 г.· 4% оценки
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· Опубликовано 22 мая 2025 г.· Начало 22 мая 2025 г.· 4% оценки
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
Предложить исправление
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.