- Начало
- 20 июн. 2024 г.ДОСТОВЕРНОСТЬ 92%от techcrunch.com
Выпущена Claude 3.5 Sonnet
Автоматический перевод оригинала
Оригинальное название: Claude 3.5 Sonnet Released
- «Сегодня мы запускаем Claude 3.5 Sonnet — первый релиз в готовящемся семействе моделей Claude 3.5», которая превосходит Claude 3 Opus «со скоростью и стоимостью нашей модели среднего уровня, Claude 3 Sonnet»[1][4]
- Бесплатно в Claude.ai и приложении Claude для iOS, с более высокими лимитами для подписчиков Pro и Team, и в тот же день доступна в API Anthropic, Amazon Bedrock и Vertex AI от Google Cloud[1][5]
- Она запустилась вместе с Artifacts — окном рядом с беседой, в котором появляются код, документы и макеты сайтов, чтобы пользователи могли видеть, править и развивать их в реальном времени[1][3]
- Она осталась на уровне ASL-2; Anthropic передала её Институту безопасности ИИ Великобритании для тестирования перед развёртыванием, и тот поделился результатами с Институтом безопасности ИИ США[1]
- Anthropic заявила, что завершит семейство моделями Claude 3.5 Haiku и Claude 3.5 Opus позже в 2024 г.[1]
Примечательные особенности
- Стоит 3 доллара за миллион входных токенов и 15 долларов за миллион выходных, с контекстным окном в 200 тыс. токенов; AWS называет её на 80 процентов дешевле Claude 3 Opus[1][5]
- Работает вдвое быстрее Claude 3 Opus[1][4]
- Карточка модели Anthropic: 59.4% в GPQA Diamond, 88.7% в MMLU, 92.0% в HumanEval и 71.1% в MATH против 50.4%, 86.8%, 84.9% и 60.1% у Claude 3 Opus[2]
- Она решила 64% задач во внутренней оценке агентного программирования — исправление ошибки или добавление функции в кодовую базу с открытым исходным кодом — против 38% у Claude 3 Opus[1][2]
- Самая сильная модель Anthropic со зрением на сегодняшний день: лучше читает диаграммы и графики и расшифровывает текст на несовершенных изображениях, набирая 68.3% в MMMU[1][2]
Бенчмарки[1]
| Бенчмарк | Claude 3.5 Sonnet | Claude 3 Opus | GPT-4o | Gemini 1.5 Pro | Llama-400b (ранний снимок) |
|---|---|---|---|---|---|
| Рассуждения уровня магистратуры (GPQA, Diamond) | 59.4%* (0-shot CoT) | 50.4% (0-shot CoT) | 53.6% (0-shot CoT) | — | — |
| Знания уровня бакалавриата (MMLU), 5-shot | 88.7%** (5-shot) | 86.8% (5-shot) | — | 85.9% (5-shot) | 86.1% (5-shot) |
| Знания уровня бакалавриата (MMLU), 0-shot CoT | 88.3% (0-shot CoT) | 85.7% (0-shot CoT) | 88.7% (0-shot CoT) | — | — |
| Код (HumanEval) | 92.0% (0-shot) | 84.9% (0-shot) | 90.2% (0-shot) | 84.1% (0-shot) | 84.1% (0-shot) |
| Многоязычная математика (MGSM) | 91.6% (0-shot CoT) | 90.7% (0-shot CoT) | 90.5% (0-shot CoT) | 87.5% (8-shot) | — |
| Рассуждения над текстом (DROP, F1) | 87.1 (3-shot) | 83.1 (3-shot) | 83.4 (3-shot) | 74.9 (переменное число примеров) | 83.5 (3-shot, предобученная модель) |
| Смешанные оценки (BIG-Bench-Hard) | 93.1% (3-shot CoT) | 86.8% (3-shot CoT) | — | 89.2% (3-shot CoT) | 85.3% (3-shot CoT, предобученная модель) |
| Решение математических задач (MATH) | 71.1% (0-shot CoT) | 60.1% (0-shot CoT) | 76.6% (0-shot CoT) | 67.7% (4-shot) | 57.8% (4-shot CoT) |
| Школьная математика (GSM8K) | 96.4% (0-shot CoT) | 95.0% (0-shot CoT) | — | 90.8% (11-shot) | 94.1% (8-shot CoT) |
* Claude 3.5 Sonnet набирает 67.2% в 5-shot CoT GPQA с maj@32. ** Claude 3.5 Sonnet набирает 90.4% в MMLU с запросами 5-shot CoT.
Источники 5ДОСТОВЕРНОСТЬ 85%Общая достоверность: 85%Насколько источник и ссылки пина подтверждают его даты.Взвешенное среднее того, насколько 5 источников, включая основной, подтверждают время начала и окончания пина; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новымПоказать все пины с достоверностью 75% и выше
Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
- [1]90%anthropic.com/news/claude-3-5-sonnetanthropic.com· Размещено 28 сент. 2026 г.· Начало 20 июн. 2024 г.· 32% оценки
Anthropic[2]: «Сегодня мы запускаем Claude 3.5 Sonnet», и она «теперь доступна бесплатно в Claude.ai»; в заголовке страницы теперь указано 21 июня 2024 г., но TechCrunch[4] и AWS опубликовали сообщение о запуске 20 июня 2024 г., а идентификатор модели — claude-3-5-sonnet-20240620.
- [2]90%Claude 3.5 Sonnet Model Card Addendumwww-cdn.anthropic.com· Добавлено 28 сент. 2026 г.· 32% оценки
Anthropic's[1] model card addendum: 59.4% on GPQA Diamond, 88.7% on MMLU (5-shot), 92.0% on HumanEval, 71.1% on MATH and 68.3% on MMMU, against Claude 3 Opus's 50.4%, 86.8%, 84.9%, 60.1% and 59.4%; 64% on the internal agentic coding evaluation against Opus's 38%.
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· Добавлено 28 сент. 2026 г.· 32% оценки
"On June 20, 2024, Anthropic[1][2] released Claude 3.5 Sonnet, which, according to the company's own benchmarks, performed better than the larger Claude 3 Opus", alongside Artifacts, which previews code, SVG graphics or websites in a separate window.
- [4]92%Anthropic claims its latest model is best-in-classtechcrunch.com· Опубликовано 20 июн. 2024 г.· Начало 20 июн. 2024 г. ✓· 1% оценки
TechCrunch, published 2024-06-20T14:00Z: Anthropic[1][2] "is releasing a powerful new generative AI model called Claude 3.5 Sonnet", about twice the speed of Claude 3 Opus, alongside Artifacts. It dates the launch 20 June, where Anthropic's own header now shows the 21 June UTC timestamp.
- [5]90%Anthropic's Claude 3.5 Sonnet model now available in Amazon Bedrock: Even more intelligence than Claude 3 Opus at one-fifth the costaws.amazon.com· Опубликовано 20 июн. 2024 г.· Начало 20 июн. 2024 г.· 1% оценки
AWS News Blog, 20 JUN 2024: "Today, Anthropic[1][2] introduced Claude 3.5 Sonnet ... now available in Amazon Bedrock"; 80 percent cheaper than Opus and about 10 percent better than Claude 3 Opus on most vision benchmarks.
Предложить исправление
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.