- Mulai
- 30 Sep 2026KEYAKINAN 90%dari sumbernya
Gemini 4 Argon Diumumkan
Diterjemahkan otomatis dari aslinya
Judul asli: Gemini 4 Argon Announced
- Google mengumumkan Gemini 4 Argon pada 30 September 2026 dan menyebutnya "model frontier baru" untuk rekayasa perangkat lunak dunia nyata, pekerjaan pengetahuan perusahaan seperti bidang hukum dan keuangan, serta pertahanan keamanan siber[1]
- Model ini diluncurkan lebih dulu kepada sejumlah pembela siber tepercaya melalui Fairwind Program, dan Google ikut serta dalam proses sukarela pemerintah AS untuk akses model pra-rilis sambil memperluas akses secara bertahap[1]
- Google akan menyediakannya bagi pengembang, perusahaan, dan konsumen "sesegera mungkin", dimulai dari pelanggan API berbayar dan pelanggan Google AI Ultra, sehingga rilis luasnya masih tertunda[1]
- Secara internal model ini sudah menggerakkan alur kerja Google: agen membebaskan lebih dari 300 TiB memori di berbagai pusat data, mengalahkan baseline subrutin kuantum sebesar 40%, dan membantu memigrasikan C/C++ ke Rust hingga 800K+ baris untuk kernel Zircon pada OS Fuchsia[1]
- Dalam demonstrasi untuk pertahanan siber, model ini menemukan kerentanan kritis pada perangkat lunak layanan kesehatan yang dipakai rumah sakit di seluruh dunia yang terlewat oleh model frontier sebelumnya[1]
Fitur unggulan
- Batas output diperluas menjadi 1 juta token, naik dari 64K, sehingga model dapat bernalar melalui ratusan ribu token dalam satu lintasan[1]
- Harga perkenalan $2 per juta token input dan $10 per juta token output, dengan input yang di-cache 95% lebih murah; setelahnya $4 dan $20 per juta[1]
- Rekor baru pada DeepSWE v1.1 sebesar 77.9% (GPT-6 Astra 74.1%, Claude Opus 5.5 74.2%), dan peringkat pertama pada AutomationBench dengan 51.3% serta pada Vals Index dengan 68.9%[1][2]
- Pemahaman video panjang LVBench 91.7%, Vals Finance Agent v2 65.4%, dan Harvey's Legal Agent Benchmark 19.6%[1][2]
- Perbaikan kerentanan CWE-bench v1 68.0%, berbagi peringkat pertama; Google merilisnya tanpa pagar pengaman siber untuk pembela tepercaya dan tim internalnya sendiri[1][2]
- Perlindungan: penolakan atas permintaan berbahaya dengan sains dwiguna yang sah tetap dipertahankan, skor tertinggi pada tolok ukur injeksi prompt tidak langsung milik Gray Swan, pemantauan rantai pemikiran dan tindakan yang menghentikan eksekusi di luar batas, serta sandbox yang diperkuat[1][2]
Tolok ukur[2]
| Tolok ukur | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (Pekerjaan pengetahuan) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (Pekerjaan pengetahuan, Skor) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (Pekerjaan pengetahuan) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark (Pekerjaan pengetahuan) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (Pengodean agentik) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (Pengodean agentik) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (Pengodean agentik) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (Pengodean agentik) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (Rekayasa ML) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (Sains dan matematika) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (Sains dan matematika) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (Sains dan matematika) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks (Konteks panjang, Hingga 128k, BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (Konteks panjang, 256k hingga 1M, BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam (Penggunaan komputer, Tingkat lulus) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (Penggunaan komputer, Subset luring, skor parsial) | 69.2% | 72.6% | — | — |
| Chartography (Pemahaman multimodal) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (Pemahaman multimodal) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (Keamanan siber) | 68.0% | 68.0% | 58.0% | 67.0% |
Referensi 2KEYAKINAN 87%Keyakinan keseluruhan: 87%Seberapa baik sumber dan referensi pin mendukung tanggalnya.Rata-rata tertimbang dari seberapa kuat 2 referensi, termasuk sumber, mendukung waktu mulai dan berakhir pin; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaruTampilkan semua pin dengan keyakinan 75% atau lebih tinggi
Entri pertama selalu merupakan sumber pin. Keyakinan keseluruhan adalah rata-rata tertimbang dari seberapa kuat setiap referensi mendukung waktu mulai dan berakhir yang digunakan di atas; bobot sebuah referensi berkurang setengahnya untuk setiap 180 hari lebih lama dari yang terbaru.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· Diposting 30 Sep 2026· Mulai 30 Sep 2026 ✓· 50% dari skor
Unggahan Google "Gemini 4 Argon: our next era of frontier intelligence" bertanggal 30 September 2026 dan menyebut "Hari ini, kami mengumumkan model frontier baru kami, Gemini 4 Argon, yang diluncurkan kepada sejumlah pembela siber tepercaya"; ketersediaan luas bagi pengembang, perusahaan, dan konsumen menyusul "sesegera mungkin" (lihat pin perkiraan 4810).
- [2]85%Gemini - Google DeepMinddeepmind.google· Ditambahkan 30 Sep 2026· Mulai 30 Sep 2026· 50% dari skor
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
Sarankan koreksi
Ada yang kurang atau salah? Sampaikan dengan kata-kata Anda sendiri: tautan yang mendukung pin ini, tanggal mulai atau berakhir yang berbeda beserta alasannya, atau fakta yang kurang atau keliru. AI memeriksanya terhadap sumber pin ini, mencari sumber yang lebih baik, dan menambahkan halaman mana pun yang mendukung Anda. Sumber pin itu sendiri tetap paling diperhitungkan. Gambar yang menampilkan hal lain, atau menampilkannya dengan buruk, juga diperiksa, lalu diturunkan atau diganti.