Tiêu đề gốc: Gemini 3.1 Pro Released
| Bài kiểm tra | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam (Lý luận học thuật (toàn bộ tập, văn bản + MM), Không dùng công cụ) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam (Lý luận học thuật (toàn bộ tập, văn bản + MM), Tìm kiếm (danh sách chặn) + Mã) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2 (Câu đố lý luận trừu tượng, ARC Prize Verified) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond (Kiến thức khoa học, Không dùng công cụ) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0 (Lập trình terminal mang tính tác tử, bộ khung Terminus-2) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0 (Lập trình terminal mang tính tác tử, bộ khung tự báo cáo tốt nhất khác) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified (Lập trình mang tính tác tử, Một lần thử) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public) (Các tác vụ lập trình tác tử đa dạng, Một lần thử) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro (Các bài toán lập trình thi đấu từ Codeforces, ICPC và IOI, Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode (Lập trình nghiên cứu khoa học) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents (Các tác vụ chuyên nghiệp dài hạn) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo (Các tác vụ chuyên gia) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench (Tác tử và sử dụng công cụ, Bán lẻ) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench (Tác tử và sử dụng công cụ, Viễn thông) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas (Quy trình nhiều bước dùng MCP) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp (Tìm kiếm mang tính tác tử, Tìm kiếm + Python + Duyệt web) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro (Hiểu và suy luận đa phương thức, Không dùng công cụ) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU (Hỏi đáp đa ngôn ngữ) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle) (Hiệu năng ngữ cảnh dài, 128k (trung bình)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle) (Hiệu năng ngữ cảnh dài, 1M (theo điểm)) | 26.3% | 26.3% | — | — | — | — |
Mục đầu tiên luôn là nguồn của ghim. Độ tin cậy tổng thể là trung bình có trọng số về mức độ mỗi tài liệu ủng hộ thời điểm bắt đầu và kết thúc được dùng ở trên; một tài liệu được tính giảm một nửa cho mỗi 180 ngày cũ hơn tài liệu mới nhất.
Bài đăng “Gemini 3.1 Pro: Một mô hình thông minh hơn cho những tác vụ phức tạp nhất của bạn” của Google đề ngày 19 tháng 2 năm 2026 và nêu rằng nó đang được triển khai ngay trong ngày hôm đó cho nhà phát triển, doanh nghiệp và người dùng cá nhân.
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
Thiếu hay sai điều gì? Hãy nói bằng lời của bạn: một liên kết củng cố ghim này, một ngày bắt đầu hoặc kết thúc khác kèm lý do, hoặc một thông tin còn thiếu hay sai. AI đối chiếu với các nguồn của ghim này, tìm nguồn tốt hơn và thêm mọi trang ủng hộ bạn. Các nguồn của chính ghim vẫn được tính nhiều nhất. Hình ảnh thể hiện nội dung khác hoặc thể hiện kém cũng được xem xét, rồi bị hạ xuống hoặc thay thế.