Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
Публикация датирована «Feb 24, 2025»: «Сегодня мы объявляем о Claude 3.7 Sonnet», и она «теперь доступна на всех тарифах Claude»; TechCrunch[4] пишет, что она «разворачивается для всех пользователей и разработчиков в понедельник» (24 февраля).
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.
Оригинальное название: Claude 3.7 Sonnet Released
| Бенчмарк | Claude 3.7 Sonnet (расширенное мышление, 64K) | Claude 3.7 Sonnet (без расширенного мышления) | Claude 3.5 Sonnet (новая) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (расширенное мышление, 32K) | Grok 3 Beta (расширенное мышление) |
|---|---|---|---|---|---|---|---|
| Рассуждения уровня магистратуры (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| Агентное программирование (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| Агентное использование инструментов (TAU-bench), розница | — | 81.2% | 71.5% | 73.5% | — | — | — |
| Агентное использование инструментов (TAU-bench), авиаперевозки | — | 58.4% | 48.8% | 54.2% | — | — | — |
| Многоязычные вопросы и ответы (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| Визуальные рассуждения (MMMU, валидация) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| Следование инструкциям (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| Решение математических задач (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| Олимпиада по математике для старшеклассников (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1 в среднем по нескольким испытаниям (до 16 для AIME и SWE-bench Verified); второе значение получено с параллельными вычислениями на этапе тестирования. ¹ Результаты o1 в TAU-bench были опубликованы OpenAI и позже удалены; результаты TAU-bench могут быть несопоставимы. ² 62.3% — это pass@1 на 500 задачах с инструментами bash/editor плюс «инструментом мышления»; 70.3% получено с внутренней оценкой и собственной обвязкой на сокращённом подмножестве; DeepSeek R1 использует фреймворк Agentless. ³ Высокие результаты Claude 3.7 Sonnet в GPQA и AIME 2024 получены с внутренней оценкой и параллельными вычислениями на этапе тестирования; у o1 и Grok 3 используется голосование большинством по 64 выборкам.