- 開始
- 2026年9月30日確度 90%出典:出典
「Gemini 4 Argon」発表
原文から自動翻訳されています
元のタイトル: Gemini 4 Argon Announced
Googleが新たなフロンティアモデル「Gemini 4 Argon」を発表。実世界のコーディング、企業のナレッジワーク、サイバー防衛に向けたモデルで、まず「Fairwind Program」を通じて信頼できるサイバー防衛担当者に提供し、その後、入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで広く公開する。
- Googleは2026年9月30日、実世界のソフトウェアエンジニアリング、法務や金融などの企業のナレッジワーク、サイバーセキュリティ防衛に向けた「新たなフロンティアモデル」として「Gemini 4 Argon」を発表した[1]
- まず「Fairwind Program」を通じて信頼できるサイバー防衛担当者の一部に提供される。Googleは米政府によるリリース前のモデルへのアクセスに関する任意のプロセスに参加しており、提供範囲は段階的に広げる[1]
- Googleは、有料APIの顧客とGoogle AI Ultra加入者から順に、開発者、企業、一般ユーザーへ「できるだけ早く」提供するとしており、広範な公開はまだ先になる[1]
- 社内ではすでにGoogleのワークフローを支えている。エージェントがデータセンター全体で300TiB超のメモリを解放し、量子サブルーチンのベースラインを40%上回り、FuchsiaOSのZirconカーネル向けに最大80万行超のC/C++をRustへ移行する作業を支援した[1]
- サイバー防衛のデモでは、世界中の病院で使われる医療ソフトウェアで、従来のフロンティアモデルが見逃していた重大な脆弱性を発見した[1]
主な特徴
- 出力上限は64Kから100万トークンに拡大され、1回の試行で数十万トークンにわたって推論できる[1]
- 導入価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルで、キャッシュされた入力は95%安い。その後は100万トークンあたり4ドルと20ドル[1]
- DeepSWE v1.1で77.9%(GPT-6 Astraは74.1%、Claude Opus 5.5は74.2%)と最高水準を更新し、AutomationBenchは51.3%、Vals Indexは68.9%でいずれも首位[1][2]
- 長尺動画理解のLVBenchは91.7%、Vals Finance Agent v2は65.4%、HarveyのLegal Agent Benchmarkは19.6%[1][2]
- 脆弱性修正のCWE-bench v1は68.0%で首位タイ。Googleはサイバー向けのガードレールを外した版を、信頼できる防衛担当者と自社チームに提供する[1][2]
- 安全対策:正当な二重用途の科学は維持しつつ有害な要求は拒否し、Gray Swanの間接プロンプトインジェクションのベンチマークで最高スコアを記録。思考の連鎖と行動の監視により範囲外の実行を停止し、サンドボックスも強化した[1][2]
ベンチマーク[2]
| ベンチマーク | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index(ナレッジワーク) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench(ナレッジワーク、スコア) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2(ナレッジワーク) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark(ナレッジワーク) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1(エージェント型コーディング) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2(エージェント型コーディング) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench(エージェント型コーディング) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0(エージェント型コーディング) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench(機械学習エンジニアリング) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1(科学・数学) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2(科学・数学) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench(科学・数学) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks(長いコンテキスト、128kまで、BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks(長いコンテキスト、256k〜1M、BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam(コンピューター操作、合格率) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0(コンピューター操作、オフラインサブセットの部分スコア) | 69.2% | 72.6% | — | — |
| Chartography(マルチモーダル理解) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench(マルチモーダル理解) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1(サイバーセキュリティ) | 68.0% | 68.0% | 58.0% | 67.0% |
参考資料 2確度 87%総合信頼度: 87%ピンの情報源と参照がその日付をどれだけ裏付けているか。出典を含む 2 件の資料がピンの開始・終了時刻をどれだけ強く裏付けているかの加重平均。最新の資料より180日古くなるごとに重みは半分になります確度75%以上のピンをすべて表示
最初の項目は常にピンの出典です。全体の確度は、各資料が上記の開始・終了時刻をどれだけ強く裏付けているかの加重平均です。最新の資料より180日古くなるごとに、重みは半分になります。
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· 投稿 2026年9月30日· 開始 2026年9月30日 ✓· スコアの 50%
Googleの記事「Gemini 4 Argon: our next era of frontier intelligence」の日付は2026年9月30日で、「本日、新たなフロンティアモデル『Gemini 4 Argon』を発表する。信頼できるサイバー防衛担当者の一部に展開中」と述べている。開発者、企業、一般ユーザーへの広範な提供は「できるだけ早く」続く(推定ピン4810を参照)。
- [2]85%Gemini - Google DeepMinddeepmind.google· 追加 2026年9月30日· 開始 2026年9月30日· スコアの 50%
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
修正を提案
足りない点や誤りがありますか? このピンを裏付けるリンク、別の開始日・終了日とその理由、欠けている情報や誤っている情報を、自由に書いてください。AIがこのピンの出典と照らし合わせ、より良い情報源を探し、裏付けとなるページがあれば参考資料として追加します。ピン自身の出典が引き続き最も重視されます。AIは画像も確認します。別のものが写っている画像や写りの悪い画像は、後ろに回すか差し替えます。