- Inicio
- 30 sept 202690% DE CONFIANZAsegún la fuente
Anuncio de Gemini 4 Argon
Traducido automáticamente del original
Título original: Gemini 4 Argon Announced
- Google anunció Gemini 4 Argon el 30 de septiembre de 2026 y lo calificó de su «nuevo modelo de vanguardia» para la ingeniería de software del mundo real, el trabajo del conocimiento empresarial, como el jurídico y el financiero, y la defensa en ciberseguridad[1]
- Llega primero a un grupo de defensores cibernéticos de confianza a través del Fairwind Program, y Google participa en el proceso voluntario del Gobierno de EE. UU. de acceso previo al lanzamiento a los modelos mientras amplía el acceso de forma gradual[1]
- Google lo pondrá a disposición de desarrolladores, empresas y consumidores «lo antes posible», empezando por los clientes de pago de la API y los suscriptores de Google AI Ultra, por lo que el lanzamiento general sigue pendiente[1]
- Internamente ya impulsa los flujos de trabajo de Google: sus agentes liberaron más de 300 TiB de memoria en centros de datos, superaron en un 40% una referencia de subrutinas cuánticas y ayudaron a migrar de C/C++ a Rust hasta 800K+ líneas del núcleo Zircon del sistema operativo Fuchsia[1]
- En una demostración de ciberdefensa encontró una vulnerabilidad crítica en un software sanitario usado por hospitales de todo el mundo que los modelos de vanguardia anteriores no habían detectado[1]
Características principales
- El límite de salida se amplía a 1 million de tokens, desde 64K, de modo que el modelo puede razonar a lo largo de cientos de miles de tokens en una sola trayectoria[1]
- Precio introductorio de $2 por million de tokens de entrada y $10 por million de tokens de salida, con la entrada en caché un 95% más barata; después, $4 y $20 por million[1]
- Nuevo récord del estado del arte en DeepSWE v1.1 con un 77.9% (GPT-6 Astra 74.1%, Claude Opus 5.5 74.2%), y primer puesto en AutomationBench con un 51.3% y en el Vals Index con un 68.9%[1][2]
- LVBench, comprensión de vídeos largos, 91.7%, Vals Finance Agent v2 65.4% y Harvey's Legal Agent Benchmark 19.6%[1][2]
- CWE-bench v1, corrección de vulnerabilidades, 68.0%, empatado en el primer puesto; Google lo lanza sin salvaguardas cibernéticas para defensores de confianza y sus propios equipos[1][2]
- Salvaguardas: rechazo de solicitudes dañinas preservando la ciencia legítima de doble uso, la mejor puntuación en el benchmark de inyección indirecta de prompts de Gray Swan, monitorización de la cadena de pensamiento y de las acciones que detiene la ejecución fuera de los límites, y entornos aislados reforzados[1][2]
Benchmarks[2]
| Benchmark | Gemini 4 Argon | GPT-6 Astra | Claude Fable 5.1 | Claude Opus 5.5 |
|---|---|---|---|---|
| Vals Index (trabajo del conocimiento) | 68.9% | 63.1% | 65.8% | 67.0% |
| AutomationBench (trabajo del conocimiento, puntuación) | 51.3% | 41.4% | 31.4% | 42.5% |
| Vals Finance Agent v2 (trabajo del conocimiento) | 65.4% | 53.5% | 58.9% | 58.6% |
| Harvey's Legal Agent Benchmark (trabajo del conocimiento) | 19.6% | 5.4% | 6.7% | 3.8% |
| DeepSWE v1.1 (programación agéntica) | 77.9% | 74.1% | 67.4% | 74.2% |
| FrontierSWE v2 (programación agéntica) | 55.0% | 65.5% | 56.3% | 62.3% |
| Vibe Code Bench (programación agéntica) | 91.9% | 89.6% | 90.3% | 90.3% |
| Terminal-bench 4.0 (programación agéntica) | 57.4% | 58.2% | 57.9% | 66.4% |
| PostTrainBench (ingeniería de aprendizaje automático) | 45.3% | 44.3% | 40.2% | 49.3% |
| Terminal-Bench Science 0.1 (ciencia y matemáticas) | 57.6% | 68.1% | 52.6% | 63.3% |
| LABBench 2 (ciencia y matemáticas) | 88.8% | 85.4% | 68.6% | 73.1% |
| RiemannBench (ciencia y matemáticas) | 76.0% | 72.0% | 65.6% | 69.6% |
| GraphWalks (contexto largo, hasta 128k, BFS (F1)) | 99.7% | 98.7% | 91.4% | 90.6% |
| GraphWalks (contexto largo, de 256k a 1M, BFS (F1)) | 84.2% | 71.8% | 65.0% | 66.8% |
| Agent's Last Exam (uso del ordenador, tasa de aciertos) | 39.5% | 34.2% | — | 38.2% |
| OSWorld-2.0 (uso del ordenador, subconjunto sin conexión, puntuación parcial) | 69.2% | 72.6% | — | — |
| Chartography (comprensión multimodal) | 71.6% | 71.0% | 46.2% | 66.3% |
| LVBench (comprensión multimodal) | 91.7% | 87.5% | 79.7% | 83.7% |
| CWE-bench v1 (ciberseguridad) | 68.0% | 68.0% | 58.0% | 67.0% |
Referencias 287% DE CONFIANZAConfianza general: 87%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 2 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argonblog.google· Publicado el 30 sept 2026· Empieza 30 sept 2026 ✓· 50% de la puntuación
La entrada de Google «Gemini 4 Argon: our next era of frontier intelligence» está fechada el 30 de septiembre de 2026 y dice: «Hoy anunciamos nuestro nuevo modelo de vanguardia, Gemini 4 Argon, que se está desplegando entre un grupo de defensores cibernéticos de confianza»; la disponibilidad general para desarrolladores, empresas y consumidores llegará «lo antes posible» (véase el pin estimado 4810).
- [2]85%Gemini - Google DeepMinddeepmind.google· Añadido el 30 sept 2026· Empieza 30 sept 2026· 50% de la puntuación
DeepMind's Gemini page now leads with Gemini 4 Argon and carries its benchmark table against GPT-6 Astra, Claude Fable 5.1 and Claude Opus 5.5, plus the four safeguard areas Google is strengthening before broad availability.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.