- Начало
- 29 сент. 2025 г.ДОСТОВЕРНОСТЬ 90%от источник
Выпущена Claude Sonnet 4.5
Автоматический перевод оригинала
Оригинальное название: Claude Sonnet 4.5 Released
- Anthropic назвала её «лучшей в мире моделью для программирования. Это самая сильная модель для создания сложных агентов. Это лучшая модель для работы с компьютерами»[1][4]
- «Доступна повсеместно сегодня» как claude-sonnet-4-5 в Claude API и в приложениях Claude; Майк Кригер сказал, что она станет моделью по умолчанию, и рекомендовал её для «практически любого случая использования»[1][5]
- Вместе с ней вышли контрольные точки Claude Code и нативное расширение для VS Code, функция редактирования контекста и инструмент памяти в API, выполнение кода и создание файлов в приложениях Claude, а также Claude Agent SDK — инфраструктура, на которой построен Claude Code[1][4]
- «Это самая согласованная передовая модель из всех, что мы когда-либо выпускали», с меньшей долей угодничества и обмана, выпущенная под защитой уровня безопасности ИИ 3 (ASL-3)[1][3][4]
- Она появилась менее чем через два месяца после Claude Opus 4.1, когда Anthropic оценивалась в 183 млрд долларов[4][5]
Примечательные особенности
- 3 доллара за миллион входных токенов и 15 долларов за миллион выходных, как у Sonnet 4; контекстное окно в 200 тыс. токенов, максимум 64 тыс. выходных токенов и надёжная граница знаний в январе 2025 г.[1][2]
- 77.2% в SWE-bench Verified в среднем по 10 испытаниям без вычислений на этапе тестирования и 82.0% с параллельными вычислениями на этапе тестирования[1]
- Она лидирует в OSWorld по работе с компьютером с 61.4%, тогда как четырьмя месяцами раньше Sonnet 4 лидировала с 42.2%[1]
- Anthropic наблюдала, как она сохраняет фокус более 30 часов на сложных многошаговых задачах; CNBC отмечает, что Opus 4 хватало на семь[1][5]
- Эксперты в области финансов, права, медицины и STEM нашли, что её предметные знания и рассуждения заметно опережают более старые модели, включая Opus 4.1[1]
Бенчмарки[1]
| Бенчмарк | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| Агентное программирование (SWE-bench Verified) | 77.2% / 82.0% с параллельными вычислениями на этапе тестирования | 74.5% / 79.4% с параллельными вычислениями на этапе тестирования | 72.7% / 80.2% с параллельными вычислениями на этапе тестирования | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| Агентное программирование в терминале (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| Агентное использование инструментов (τ2-bench), розница | 86.2% | 86.8% | 83.8% | 81.1% | — |
| Агентное использование инструментов (τ2-bench), авиаперевозки | 70.0% | 63.0% | 63.0% | 62.6% | — |
| Агентное использование инструментов (τ2-bench), телеком | 98.0% | 71.5% | 49.6% | 96.7% | — |
| Работа с компьютером (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| Олимпиада по математике для старшеклассников (AIME 2025) | 100% (python) / 87.0% (без инструментов) | 78.0% | 70.5% | 99.6% (python) / 94.6% (без инструментов) | 88.0% |
| Рассуждения уровня магистратуры (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| Многоязычные вопросы и ответы (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| Визуальные рассуждения (MMMU, валидация) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| Финансовый анализ (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
Источники 5ДОСТОВЕРНОСТЬ 89%Общая достоверность: 89%Насколько источник и ссылки пина подтверждают его даты.Взвешенное среднее того, насколько 5 источников, включая основной, подтверждают время начала и окончания пина; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новымПоказать все пины с достоверностью 75% и выше
Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· Размещено 28 сент. 2026 г.· Начало 29 сент. 2025 г. ✓· 29% оценки
Публикация датирована «Sep 29, 2025» и сообщает: «Claude[2] Sonnet 4.5 доступна повсеместно сегодня»; на странице модели в документации указано «Выпущена 29 сентября 2025 г.», а TechCrunch[4] пишет о запуске «в понедельник».
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· Добавлено 28 сент. 2026 г.· 29% оценки
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· Добавлено 28 сент. 2026 г.· 29% оценки
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· Опубликовано 29 сент. 2025 г.· Начало 29 сент. 2025 г.· 7% оценки
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· Опубликовано 29 сент. 2025 г.· Начало 29 сент. 2025 г.· 7% оценки
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
Предложить исправление
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.