- Начало
- 22 окт. 2024 г.ДОСТОВЕРНОСТЬ 90%от источник
Выпущено обновление Claude 3.5 Sonnet
Автоматический перевод оригинала
Оригинальное название: Claude 3.5 Sonnet Upgrade Released
- Anthropic объявила об «обновлённой Claude 3.5 Sonnet» с «улучшениями по всем направлениям по сравнению с предшественницей, особенно значительными в программировании», доступной всем пользователям в тот же день, и о новой Claude 3.5 Haiku позже в этом месяце[1]
- Работа с компьютером появилась в публичной бета-версии: Claude смотрит на экран, двигает курсор, нажимает кнопки и печатает, а Anthropic называет 3.5 Sonnet «первой передовой моделью ИИ, предлагающей работу с компьютером в публичной бета-версии» — «пока экспериментальной, порой неуклюжей и склонной к ошибкам»[1][4]
- Чтобы вести курсор, Claude подсчитывает пиксели, на которые нужно сдвинуться на каждом снимке экрана; Anthropic обучила этому навыку на простом программном обеспечении, таком как калькулятор и текстовый редактор[3]
- Разработчики могли использовать её в тот же день в API Anthropic, Amazon Bedrock и Vertex AI от Google Cloud; Asana, Canva, Cognition, DoorDash, Replit и The Browser Company были первыми пользователями, а Amazon имела ранний доступ[1][5]
- Институты безопасности ИИ США и Великобритании совместно протестировали её до выпуска; Anthropic оставила её на уровне ASL-2 и добавила классификаторы, которые распознают работу с компьютером и то, происходит ли вред[1]
Примечательные особенности
- Та же цена и скорость, что и у июньской 3.5 Sonnet[1]
- SWE-bench Verified вырастает с 33.4% до 49.0% — выше, чем у любой общедоступной модели, включая o1-preview от OpenAI[1]
- Агентное использование инструментов в TAU-bench вырастает с 62.6% до 69.2% в рознице и с 36.0% до 46.0% в авиаперевозках[1]
- В OSWorld она набрала 14.9% только по снимкам экрана против 7.8% у следующей по результату системы и 22.0%, когда ей разрешили больше шагов[1][2]
- Прокрутка, перетаскивание и масштабирование всё ещё давались ей с трудом, и Anthropic советовала начинать с задач низкого риска[1]
Бенчмарки[1]
| Бенчмарк | Claude 3.5 Sonnet (новая) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| Рассуждения уровня магистратуры (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| Знания уровня бакалавриата (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| Код (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| Решение математических задач (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| Олимпиада по математике для старшеклассников (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| Вопросы и ответы по изображениям (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| Агентное программирование (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| Агентное использование инструментов (TAU-bench), розница | 69.2% | 51.0% | 62.6% | — | — | — | — |
| Агентное использование инструментов (TAU-bench), авиаперевозки | 46.0% | 22.8% | 36.0% | — | — | — | — |
* В таблицы оценок Anthropic не входит семейство моделей o1 от OpenAI, поскольку, в отличие от типичных моделей, они зависят от длительных вычислений до ответа.
Источники 5ДОСТОВЕРНОСТЬ 90%Общая достоверность: 90%Насколько источник и ссылки пина подтверждают его даты.Взвешенное среднее того, насколько 5 источников, включая основной, подтверждают время начала и окончания пина; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новымПоказать все пины с достоверностью 75% и выше
Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· Размещено 28 сент. 2026 г.· Начало 22 окт. 2024 г. ✓· 46% оценки
Публикация датирована «Oct 22, 2024» и сообщает: «Обновлённая Claude 3.5 Sonnet теперь доступна всем пользователям. Начиная с сегодняшнего дня, разработчики могут создавать продукты с бета-версией работы с компьютером»; TechCrunch[4] и CNBC[5] сообщили о выпуске «во вторник» того же дня.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· Добавлено 28 сент. 2026 г.· 46% оценки
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· Опубликовано 22 окт. 2024 г.· 3% оценки
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· Опубликовано 22 окт. 2024 г.· Начало 22 окт. 2024 г.· 3% оценки
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· Опубликовано 22 окт. 2024 г.· Начало 22 окт. 2024 г.· 3% оценки
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
Предложить исправление
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.