- Début
- 19 févr. 2026CONFIANCE 90 %selon la source
Sortie de Gemini 3.1 Pro
Traduit automatiquement de l’original
Titre original: Gemini 3.1 Pro Released
- Google a lancé Gemini 3.1 Pro en préversion le 19 février 2026, trois mois après Gemini 3 Pro, en le décrivant comme l'intelligence de base améliorée à l'origine de récentes avancées scientifiques et de recherche[1]
- C'est « une base plus intelligente et plus performante pour résoudre des problèmes complexes », avec 77.1% vérifié à ARC-AGI-2, qui teste des schémas logiques entièrement nouveaux[1]
- Google l'a maintenu en préversion pour valider les mises à jour et améliorer les flux de travail agentiques avant une disponibilité générale « prochaine »[1]
Principales caractéristiques
- Disponible dans l'application Gemini avec des limites plus élevées pour les formules Google AI Pro et Ultra, et dans NotebookLM pour les seuls utilisateurs Pro et Ultra[1]
- Les développeurs et les entreprises y accèdent en préversion via l'API Gemini dans AI Studio, Antigravity et Vertex AI, ainsi que Gemini Enterprise[1]
- Dans sa démonstration, Google lui fait coder un vol d'étourneaux en 3D interactif, piloté par suivi des mains, qui joue une partition générative[1]
Benchmarks[3]
| Benchmark | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam (raisonnement académique (jeu complet, texte + MM), sans outils) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam (raisonnement académique (jeu complet, texte + MM), recherche (liste d'exclusion) + code) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2 (puzzles de raisonnement abstrait, vérifié par ARC Prize) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond (connaissances scientifiques, sans outils) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0 (programmation agentique en terminal, harnais Terminus-2) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0 (programmation agentique en terminal, meilleur autre harnais déclaré par l'éditeur) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified (programmation agentique, une seule tentative) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public) (tâches de programmation agentique variées, une seule tentative) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro (problèmes de programmation compétitive de Codeforces, ICPC et IOI, Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode (programmation pour la recherche scientifique) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents (tâches professionnelles de longue haleine) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo (tâches d'expert) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench (agents et usage d'outils, commerce de détail) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench (agents et usage d'outils, télécoms) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas (flux de travail en plusieurs étapes avec MCP) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp (recherche agentique, recherche + Python + navigation) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro (compréhension et raisonnement multimodaux, sans outils) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU (questions-réponses multilingues) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle) (performance en contexte long, 128k (moyenne)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle) (performance en contexte long, 1M (ponctuel)) | 26.3% | 26.3% | — | — | — | — |
Références 3CONFIANCE 85 %Confiance globale: 85%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 3 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-problog.google· Publié le 30 sept. 2026· Début 19 févr. 2026 ✓· 41 % du score
L'article de Google « Gemini 3.1 Pro: A smarter model for your most complex tasks » est daté du 19 février 2026 et indique qu'il est déployé ce jour-là auprès des développeurs, des entreprises et du grand public.
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· Ajouté le 30 sept. 2026· 41 % du score
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
- [3]95%Gemini 3.1 Pro - Model Carddeepmind.google· Publié le 19 févr. 2026· 17 % du score
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.