- Inizio
- 30 set 2026AFFIDABILITÀ 90%da la fonte
Annunciato Gemini 4 Argon
Tradotto automaticamente dall’originale
Titolo originale: Gemini 4 Argon Announced
- Google ha annunciato Gemini 4 Argon il 30 settembre 2026, definendolo il suo «nuovo modello di frontiera» per l'ingegneria del software nel mondo reale, il lavoro di conoscenza aziendale come legale e finanza, e la difesa della cybersicurezza[1]
- Viene distribuito prima a un gruppo di difensori informatici fidati tramite il Fairwind Program, e Google partecipa al processo volontario del governo degli Stati Uniti per l'accesso ai modelli prima del rilascio mentre amplia gradualmente l'accesso[1]
- Google lo renderà disponibile a sviluppatori, aziende e consumatori «il prima possibile», a partire dai clienti API a pagamento e dagli abbonati Google AI Ultra, quindi il rilascio generale è ancora in sospeso[1]
- Internamente alimenta già i flussi di lavoro di Google: gli agenti hanno liberato oltre 300 TiB di memoria nei data center, hanno battuto del 40% una baseline di subroutine quantistica e hanno aiutato a migrare da C/C++ a Rust fino a oltre 800.000 righe per il kernel Zircon del sistema operativo Fuchsia[1]
- In una dimostrazione per la difesa informatica ha trovato una vulnerabilità critica in un software sanitario usato dagli ospedali di tutto il mondo che i precedenti modelli di frontiera non avevano individuato[1]
Caratteristiche principali
- Limite di output esteso a 1 milione di token, da 64K, così che il modello può ragionare su centinaia di migliaia di token in un'unica traiettoria[1]
- Prezzo introduttivo di 2 $ per milione di token in input e 10 $ per milione di token in output, con l'input in cache più economico del 95%; in seguito 4 $ e 20 $ per milione[1]
- Nuovo stato dell'arte su DeepSWE v1.1 al 77,9% (GPT-6 Astra 74,1%, Claude Opus 5.5 74,2%), e primo su AutomationBench al 51,3% e sul Vals Index al 68,9%[1][2]
- Comprensione di video lunghi LVBench 91,7%, Vals Finance Agent v2 65,4% e Legal Agent Benchmark di Harvey 19,6%[1][2]
- CWE-bench v1, correzione delle vulnerabilità, 68,0%, a pari merito per il primo posto; Google lo rilascia senza protezioni informatiche ai difensori fidati e ai propri team[1][2]
- Salvaguardie: rifiuto delle richieste dannose preservando la scienza legittima a duplice uso, punteggio massimo nel benchmark di prompt injection indiretta di Gray Swan, monitoraggio della catena di ragionamento e delle azioni che interrompe l'esecuzione fuori dai limiti e sandbox rafforzate[1][2]
Benchmark[2]
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (Lavoro di conoscenza) | 68,9% | 63,1% | 65,8% | 67,0% |
| AutomationBench (Lavoro di conoscenza, punteggio) | 51,3% | 41,4% | 31,4% | 42,5% |
| Vals Finance Agent v2 (Lavoro di conoscenza) | 65,4% | 53,5% | 58,9% | 58,6% |
| Harvey's Legal Agent Benchmark (Lavoro di conoscenza) | 19,6% | 5,4% | 6,7% | 3,8% |
| DeepSWE v1.1 (Programmazione agentica) | 77,9% | 74,1% | 67,4% | 74,2% |
| FrontierSWE v2 (Programmazione agentica) | 55,0% | 65,5% | 56,3% | 62,3% |
| Vibe Code Bench (Programmazione agentica) | 91,9% | 89,6% | 90,3% | 90,3% |
| Terminal-bench 4.0 (Programmazione agentica) | 57,4% | 58,2% | 57,9% | 66,4% |
| PostTrainBench (Ingegneria ML) | 45,3% | 44,3% | 40,2% | 49,3% |
| Terminal-Bench Science 0.1 (Scienze e matematica) | 57,6% | 68,1% | 52,6% | 63,3% |
| LABBench 2 (Scienze e matematica) | 88,8% | 85,4% | 68,6% | 73,1% |
| RiemannBench (Scienze e matematica) | 76,0% | 72,0% | 65,6% | 69,6% |
| GraphWalks (Contesto lungo, fino a 128k, BFS (F1)) | 99,7% | 98,7% | 91,4% | 90,6% |
| GraphWalks (Contesto lungo, da 256k a 1M, BFS (F1)) | 84,2% | 71,8% | 65,0% | 66,8% |
| Agent's Last Exam (Uso del computer, tasso di successo) | 39,5% | 34,2% | — | 38,2% |
| OSWorld-2.0 (Uso del computer, sottoinsieme offline, punteggio parziale) | 69,2% | 72,6% | — | — |
| Chartography (Comprensione multimodale) | 71,6% | 71,0% | 46,2% | 66,3% |
| LVBench (Comprensione multimodale) | 91,7% | 87,5% | 79,7% | 83,7% |
| CWE-bench v1 (Cybersicurezza) | 68,0% | 68,0% | 58,0% | 67,0% |
Fonti 2AFFIDABILITÀ 87%Affidabilità complessiva: 87%Quanto la fonte e le altre fonti del pin ne confermano le date.Media ponderata di quanto 2 fonti, compresa quella principale, confermano gli orari di inizio e fine del pin; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recenteMostra tutti i pin con affidabilità pari o superiore al 75%
La prima voce è sempre la fonte del pin. L’affidabilità complessiva è una media ponderata di quanto ogni fonte conferma gli orari di inizio e fine indicati sopra; una fonte conta la metà per ogni 180 giorni in più rispetto alla più recente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· Postato il 30 set 2026· Inizio 30 set 2026 ✓· 50% del punteggio
Il post di Google «Gemini 4 Argon: our next era of frontier intelligence» è datato 30 settembre 2026 e dice «Oggi annunciamo il nostro nuovo modello di frontiera, Gemini 4 Argon, che viene distribuito a un gruppo di difensori informatici fidati»; la disponibilità generale per sviluppatori, aziende e consumatori segue «il prima possibile» (vedi il pin stimato 4810).
- [2]85%Gemini - Google DeepMinddeepmind.google· Aggiunto il 30 set 2026· Inizio 30 set 2026· 50% del punteggio
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
Suggerisci una correzione
Manca qualcosa o c’è un errore? Dillo con parole tue: un link che conferma questo pin, una data di inizio o fine diversa e perché, o un fatto che manca o è sbagliato. L’IA lo confronta con le fonti del pin, ne cerca di migliori e aggiunge qualsiasi pagina ti dia ragione. Le fonti del pin contano comunque di più. Anche un’immagine che mostra altro, o lo mostra male, viene esaminata e spostata in basso o sostituita.