- Début
- 30 sept. 2026CONFIANCE 90 %selon la source
Annonce de Gemini 4 Argon
Traduit automatiquement de l’original
Titre original: Gemini 4 Argon Announced
- Google a annoncé Gemini 4 Argon le 30 septembre 2026, en le présentant comme son « nouveau modèle de pointe » pour le génie logiciel en conditions réelles, le travail de connaissance en entreprise (droit, finance) et la cyberdéfense[1]
- Il est d'abord déployé auprès d'un groupe de cyberdéfenseurs de confiance via le programme Fairwind, et Google participe au processus volontaire du gouvernement américain d'accès anticipé aux modèles avant leur sortie, tout en élargissant l'accès progressivement[1]
- Google le proposera aux développeurs, aux entreprises et au grand public « dès que possible », en commençant par les clients payants de l'API et les abonnés Google AI Ultra ; la diffusion large reste donc à venir[1]
- En interne, il alimente déjà les flux de travail de Google : des agents ont libéré plus de 300 TiB de mémoire dans les centres de données, battu de 40% une référence de sous-routine quantique et aidé à migrer jusqu'à 800K+ lignes de C/C++ vers Rust pour le noyau Zircon de Fuchsia OS[1]
- Lors d'une démonstration de cyberdéfense, il a découvert une faille critique dans un logiciel de santé utilisé par des hôpitaux du monde entier, que les modèles de pointe précédents n'avaient pas repérée[1]
Principales caractéristiques
- Limite de sortie portée à 1 million de jetons, contre 64K, ce qui permet au modèle de raisonner sur des centaines de milliers de jetons en une seule trajectoire[1]
- Prix de lancement de $2 par million de jetons en entrée et $10 par million de jetons en sortie, avec une entrée en cache 95% moins chère ; ensuite $4 et $20 par million[1]
- Nouvel état de l'art sur DeepSWE v1.1 avec 77.9% (GPT-6 Astra 74.1%, Claude Opus 5.5 74.2%), et premier sur AutomationBench avec 51.3% et sur le Vals Index avec 68.9%[1][2]
- Compréhension de vidéos longues LVBench 91.7%, Vals Finance Agent v2 65.4% et Harvey's Legal Agent Benchmark 19.6%[1][2]
- Correction de vulnérabilités CWE-bench v1 68.0%, à égalité pour la première place ; Google le diffuse sans garde-fous cyber aux défenseurs de confiance et à ses propres équipes[1][2]
- Protections : refus des demandes nuisibles tout en préservant la science légitime à double usage, meilleur score au benchmark d'injection de prompt indirecte de Gray Swan, surveillance de la chaîne de raisonnement et des actions qui interrompt toute exécution hors limites, et bacs à sable renforcés[1][2]
Benchmarks[2]
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (travail de connaissance) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (travail de connaissance, score) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (travail de connaissance) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark (travail de connaissance) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (programmation agentique) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (programmation agentique) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (programmation agentique) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (programmation agentique) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (ingénierie ML) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (sciences et mathématiques) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (sciences et mathématiques) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (sciences et mathématiques) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks (contexte long, jusqu'à 128k, BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (contexte long, de 256k à 1M, BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam (utilisation d'ordinateur, taux de réussite) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (utilisation d'ordinateur, sous-ensemble hors ligne, score partiel) | 69.2% | 72.6% | — | — |
| Chartography (compréhension multimodale) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (compréhension multimodale) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (cybersécurité) | 68.0% | 68.0% | 58.0% | 67.0% |
Références 2CONFIANCE 87 %Confiance globale: 87%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 2 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· Publié le 30 sept. 2026· Début 30 sept. 2026 ✓· 50 % du score
L'article de Google « Gemini 4 Argon: our next era of frontier intelligence » est daté du 30 septembre 2026 et indique « Today, we're announcing our new frontier model, Gemini 4 Argon, which is rolling out to a set of trusted cyber defenders » ; la disponibilité générale pour les développeurs, les entreprises et le grand public suivra « dès que possible » (voir la épingle estimée 4810).
- [2]85%Gemini - Google DeepMinddeepmind.google· Ajouté le 30 sept. 2026· Début 30 sept. 2026· 50 % du score
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.