- Начало
- 30 сент. 2026 г.ДОСТОВЕРНОСТЬ 90%от источник
Анонсирована Gemini 4 Argon
Автоматический перевод оригинала
Оригинальное название: Gemini 4 Argon Announced
- Google анонсировала Gemini 4 Argon 30 сентября 2026 г., назвав её своей «новой передовой моделью» для реальной программной инженерии, корпоративной интеллектуальной работы, например в юриспруденции и финансах, и киберзащиты[1]
- Сначала модель поступает к группе доверенных специалистов по киберзащите через программу Fairwind, а Google участвует в добровольном процессе правительства США по предварительному доступу к моделям, постепенно расширяя доступ[1]
- Google сделает её доступной разработчикам, предприятиям и обычным пользователям «как можно скорее», начиная с платных клиентов API и подписчиков Google AI Ultra, так что широкий выпуск пока ожидается[1]
- Внутри компании она уже обеспечивает рабочие процессы Google: агенты освободили более 300 ТиБ памяти в центрах обработки данных, превзошли базовый показатель квантовой подпрограммы на 40% и помогли перенести на Rust до 800 тыс.+ строк кода на C/C++ для ядра Zircon операционной системы Fuchsia[1]
- В демонстрации для киберзащиты модель обнаружила критическую уязвимость в медицинском программном обеспечении, используемом больницами по всему миру, которую пропустили предыдущие передовые модели[1]
Ключевые особенности
- Предел вывода увеличен до 1 миллиона токенов с 64K, так что модель может рассуждать в рамках одной траектории на протяжении сотен тысяч токенов[1]
- Вводная цена — $2 за миллион входных токенов и $10 за миллион выходных токенов, кэшированные входные данные дешевле на 95%; позднее — $4 и $20 за миллион[1]
- Новый рекорд на DeepSWE v1.1 — 77.9% (GPT-6 Astra — 74.1%, Claude Opus 5.5 — 74.2%), а также первое место на AutomationBench — 51.3% и на Vals Index — 68.9%[1][2]
- Понимание длинных видео LVBench — 91.7%, Vals Finance Agent v2 — 65.4% и Harvey's Legal Agent Benchmark — 19.6%[1][2]
- Устранение уязвимостей CWE-bench v1 — 68.0%, разделяет первое место; Google выпускает модель без киберограничений для доверенных специалистов по защите и собственных команд[1][2]
- Меры защиты: отказ выполнять вредоносные запросы с сохранением законной науки двойного назначения, лучший результат в тесте Gray Swan на непрямую инъекцию промптов, мониторинг цепочки рассуждений и действий, останавливающий выход за допустимые границы, и укреплённые песочницы[1][2]
Тесты[2]
| Тест | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (интеллектуальный труд) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (интеллектуальный труд, балл) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (интеллектуальный труд) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark (интеллектуальный труд) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (агентное программирование) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (агентное программирование) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (агентное программирование) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (агентное программирование) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (инженерия машинного обучения) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (наука и математика) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (наука и математика) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (наука и математика) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks (длинный контекст, до 128k, BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (длинный контекст, от 256k до 1M, BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam (использование компьютера, доля успешных) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (использование компьютера, автономный поднабор, частичный балл) | 69.2% | 72.6% | — | — |
| Chartography (мультимодальное понимание) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (мультимодальное понимание) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (кибербезопасность) | 68.0% | 68.0% | 58.0% | 67.0% |
Источники 2ДОСТОВЕРНОСТЬ 87%Общая достоверность: 87%Насколько источник и ссылки пина подтверждают его даты.Взвешенное среднее того, насколько 2 источника, включая основной, подтверждают время начала и окончания пина; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новымПоказать все пины с достоверностью 75% и выше
Первая запись — всегда источник пина. Общая достоверность — это взвешенное среднее того, насколько каждый источник подтверждает указанные выше время начала и окончания; вес источника уменьшается вдвое за каждые 180 дней разницы с самым новым.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· Размещено 30 сент. 2026 г.· Начало 30 сент. 2026 г. ✓· 50% оценки
Запись Google «Gemini 4 Argon: наша следующая эра передового интеллекта» датирована 30 сентября 2026 г. и гласит: «Сегодня мы анонсируем нашу новую передовую модель Gemini 4 Argon, которая поступает к группе доверенных специалистов по киберзащите»; широкая доступность для разработчиков, предприятий и обычных пользователей наступит «как можно скорее» (см. ориентировочный пин 4810).
- [2]85%Gemini - Google DeepMinddeepmind.google· Добавлено 30 сент. 2026 г.· Начало 30 сент. 2026 г.· 50% оценки
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
Предложить исправление
Чего-то не хватает или есть ошибка? Напишите своими словами: ссылку, подтверждающую этот пин, другую дату начала или окончания и почему, или факт, которого нет или который неверен. ИИ сверит это с источниками пина, поищет лучшие и добавит любую страницу, которая вас подтверждает. Собственные источники пина всё равно весят больше всего. Изображение, на котором показано что-то другое или показано плохо, тоже проверяется и опускается ниже или заменяется.