- Начало
- 4 мар. 2024 г.ДОСТОВЕРНОСТЬ 90%от источник
Выпущена Claude 3 Opus
Автоматический перевод оригинала
Оригинальное название: Claude 3 Opus Released
- 4 марта 2024 г. Anthropic объявила о семействе Claude 3 — Haiku, Sonnet и Opus «в порядке возрастания возможностей»; Opus и Sonnet стали доступны в тот же день в claude.ai и Claude API, который теперь общедоступен в 159 странах[1][4]
- В claude.ai Opus получили подписчики Claude Pro, а Sonnet обеспечивала бесплатный доступ; Sonnet в тот день появилась в Amazon Bedrock и в закрытом предварительном доступе Google Cloud Vertex AI, «а Opus и Haiku скоро появятся в обеих»[1]
- Anthropic оставила модель на уровне безопасности ИИ 2 (ASL-2) после того, как «красные команды» обнаружили «пренебрежимо малый потенциал катастрофического риска на данный момент»[1]
- CNBC отмечает, что среди инвесторов Anthropic — Google, Salesforce и Amazon, после сделок по финансированию на общую сумму около 7.3 млрд долларов за предыдущий год[4]
- Claude 3 Opus объявлена устаревшей 30 июня 2025 г. и выведена из Claude API 5 января 2026 г., её заменила Claude Opus 4.8[3]
Примечательные особенности
- Claude 3 Opus — «наша самая интеллектуальная модель с лучшей на рынке производительностью в очень сложных задачах», стоимостью 15 долларов за миллион входных токенов и 75 долларов за миллион выходных[1][5]
- Бенчмарки, о которых сообщает Anthropic: 86.8% в MMLU, 50.4% в GPQA Diamond, 95.0% в GSM8K и 84.9% в HumanEval, впереди GPT-4 с 86.4%, 35.7%, 92.0% и 67.0%[1]
- Контекстное окно в 200 тыс. токенов при запуске, при этом вводы свыше 1 млн токенов доступны «для особых случаев»; в тесте на воспроизведение Needle In A Haystack она превысила 99% точности и порой замечала, что вставленное предложение выглядит искусственно добавленным[1][5]
- Первая модель Claude со зрением: она читает фотографии, диаграммы, графики и технические схемы, до 20 изображений в одном запросе, но не опознаёт людей[1][5]
- Opus «значительно реже», чем прежние модели Claude, отказывается отвечать на безобидные запросы и вдвое повышает точность Claude 2.1 на сложных открытых фактических вопросах; знания охватывают период до августа 2023 г.[1][2]
Бенчмарки[1]
| Бенчмарк | Claude 3 Opus | Claude 3 Sonnet | Claude 3 Haiku | GPT-4 | GPT-3.5 | Gemini 1.0 Ultra | Gemini 1.0 Pro |
|---|---|---|---|---|---|---|---|
| MMLU (знания уровня бакалавриата) | 86.8% 5 shot | 79.0% 5-shot | 75.2% 5-shot | 86.4% 5-shot | 70.0% 5-shot | 83.7% 5-shot | 71.8% 5-shot |
| GPQA, Diamond (рассуждения уровня магистратуры) | 50.4% 0-shot CoT | 40.4% 0-shot CoT | 33.3% 0-shot CoT | 35.7% 0-shot CoT | 28.1% 0-shot CoT | — | — |
| GSM8K (школьная математика) | 95.0% 0-shot CoT | 92.3% 0-shot CoT | 88.9% 0-shot CoT | 92.0% 5-shot CoT | 57.1% 5-shot | 94.4% Maj1@32 | 86.5% Maj1@32 |
| MATH (решение математических задач) | 60.1% 0-shot CoT | 43.1% 0-shot CoT | 38.9% 0-shot CoT | 52.9% 4-shot | 34.1% 4-shot | 53.2% 4-shot | 32.6% 4-shot |
| MGSM (многоязычная математика) | 90.7% 0-shot | 83.5% 0-shot | 75.1% 0-shot | 74.5% 8-shot | — | 79.0% 8-shot | 63.5% 8-shot |
| HumanEval (код) | 84.9% 0-shot | 73.0% 0-shot | 75.9% 0-shot | 67.0% 0-shot | 48.1% 0-shot | 74.4% 0-shot | 67.7% 0-shot |
| DROP, F1 (рассуждения над текстом) | 83.1 3-shot | 78.9 3-shot | 78.4 3-shot | 80.9 3-shot | 64.1 3-shot | 82.4 переменное число примеров | 74.1 переменное число примеров |
| BIG-Bench-Hard (смешанные оценки) | 86.8% 3-shot CoT | 82.9% 3-shot CoT | 73.7% 3-shot CoT | 83.1% 3-shot CoT | 66.6% 3-shot CoT | 83.6% 3-shot CoT | 75.0% 3-shot CoT |
| ARC-Challenge (вопросы и ответы на знания) | 96.4% 25-shot | 93.2% 25-shot | 89.2% 25-shot | 96.3% 25-shot | 85.2% 25-shot | — | — |
| HellaSwag (здравый смысл) | 95.4% 10-shot | 89.0% 10-shot | 85.9% 10-shot | 95.3% 10-shot | 85.5% 10-shot | 87.8% 10-shot | 84.7% 10-shot |
Источники 5ДОСТОВЕРНОСТЬ 90%Общая достоверность: 90%Насколько источник и ссылки пина подтверждают его даты.Взвешенное среднее того, насколько 5 источников, включая основной, подтверждают время начала и окончания пина; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новымПоказать все пины с достоверностью 75% и выше
Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
- [1]90%anthropic.com/news/claude-3-familyanthropic.com· Размещено 28 сент. 2026 г.· Начало 4 мар. 2024 г. ✓· 33% оценки
Публикация Anthropic[2] датирована «Mar 4, 2024» и сообщает: «Opus и Sonnet теперь доступны в claude[3].ai и Claude API, который теперь общедоступен в 159 странах»; CNBC[4] и TechCrunch[5] сообщили о запуске в тот же понедельник.
- [2]90%The Claude 3 Model Family: Opus, Sonnet, Haiku (model card)anthropic.com· Добавлено 28 сент. 2026 г.· 33% оценки
Anthropic's[1] Claude[3] 3 model card (the link resolves to the PDF): the Claude 3 models' knowledge cutoff is August 2023 and they are offered through the Claude API, Amazon Bedrock and Google Vertex AI; it carries the full evaluations behind the launch post's table.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· Добавлено 28 сент. 2026 г.· 33% оценки
Anthropic's[1][2] deprecation history: on 30 June 2025 it notified developers of Claude Opus 3's retirement, and claude-3-opus-20240229 was retired on 5 January 2026 with claude-opus-4-8 as the recommended replacement.
- [4]85%Anthropic, backed by Amazon and Google, debuts its most powerful chatbot yetcnbc.com· Опубликовано 4 мар. 2024 г.· Начало 4 мар. 2024 г.· 1% оценки
CNBC's same-day report (published 2024-03-04T14:00Z): "Anthropic[1][2] on Monday debuted Claude[3] 3"; Opus outperformed GPT-4 and Gemini Ultra on benchmark tests, it is Anthropic's first multimodal model, Opus and Sonnet are available in 159 countries, and Anthropic's backers include Google, Salesforce and Amazon after about $7.3 billion in funding deals over the past year.
- [5]85%Anthropic claims its new AI chatbot models beat OpenAI's GPT-4techcrunch.com· Опубликовано 4 мар. 2024 г.· Начало 4 мар. 2024 г.· 1% оценки
TechCrunch (Kyle Wiggers, 11:50 AM PST, 4 March 2024): Claude[3] 3 is Anthropic's[1][2] first multimodal model, can analyze up to 20 images in one request, starts with a 200,000-token context window (1 million for select customers), answers from data before August 2023, and Opus costs $15 per million input and $75 per million output tokens.
Предложить исправление
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.