- Inicio
- 19 feb 202690% DE CONFIANZAsegún la fuente
Lanzamiento de Gemini 3.1 Pro
Traducido automáticamente del original
Título original: Gemini 3.1 Pro Released
- Google lanzó Gemini 3.1 Pro en vista previa el 19 de febrero de 2026, tres meses después de Gemini 3 Pro, y lo describió como la inteligencia central mejorada detrás de los recientes avances científicos y de investigación[1]
- Es «una base más inteligente y capaz para resolver problemas complejos», con un 77.1% verificado en ARC-AGI-2, que pone a prueba patrones lógicos totalmente nuevos[1]
- Google lo mantuvo en vista previa para validar las mejoras y perfeccionar los flujos de trabajo agénticos antes de su disponibilidad general «pronto»[1]
Características principales
- Disponible en la app de Gemini con límites más altos para los planes Google AI Pro y Ultra, y en NotebookLM solo para usuarios de Pro y Ultra[1]
- Los desarrolladores y las empresas lo obtienen en vista previa a través de la API de Gemini en AI Studio, Antigravity y Vertex AI, además de Gemini Enterprise[1]
- En la demostración de Google, programa una bandada de estorninos en 3D interactiva que los usuarios dirigen con seguimiento de manos y que reproduce una partitura generativa[1]
Benchmarks[3]
| Benchmark | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam (razonamiento académico (conjunto completo, texto + MM), sin herramientas) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam (razonamiento académico (conjunto completo, texto + MM), búsqueda (lista de bloqueo) + código) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2 (puzles de razonamiento abstracto, verificado por ARC Prize) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond (conocimiento científico, sin herramientas) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0 (programación agéntica en terminal, arnés Terminus-2) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0 (programación agéntica en terminal, otro mejor arnés autodeclarado) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified (programación agéntica, un solo intento) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public) (tareas variadas de programación agéntica, un solo intento) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro (problemas de programación competitiva de Codeforces, ICPC e IOI, Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode (programación para investigación científica) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents (tareas profesionales de largo horizonte) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo (tareas de expertos) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench (agentes y uso de herramientas, comercio minorista) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench (agentes y uso de herramientas, telecomunicaciones) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas (flujos de trabajo de varios pasos con MCP) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp (búsqueda agéntica, búsqueda + Python + navegación) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro (comprensión y razonamiento multimodal, sin herramientas) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU (preguntas y respuestas multilingües) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle) (rendimiento en contexto largo, 128k (media)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle) (rendimiento en contexto largo, 1M (puntual)) | 26.3% | 26.3% | — | — | — | — |
Referencias 385% DE CONFIANZAConfianza general: 85%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 3 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-problog.google· Publicado el 30 sept 2026· Empieza 19 feb 2026 ✓· 41% de la puntuación
La entrada de Google «Gemini 3.1 Pro: A smarter model for your most complex tasks» está fechada el 19 de febrero de 2026 y dice que se despliega ese día para desarrolladores, empresas y consumidores.
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· Añadido el 30 sept 2026· 41% de la puntuación
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
- [3]95%Gemini 3.1 Pro - Model Carddeepmind.google· Publicado el 19 feb 2026· 17% de la puntuación
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.