- 시작
- 2026년 2월 19일신뢰도 90%출처 제공
제미나이 3.1 프로 출시
원문에서 자동 번역됨
원본 제목: Gemini 3.1 Pro Released
구글이 복잡한 추론을 위해 핵심 성능을 끌어올린 제미나이 3.1 프로를 프리뷰로 출시했다. ARC-AGI-2 검증 점수 77.1%를 기록했으며 제미나이 앱, 노트북LM, API, 버텍스 AI에서 만날 수 있다.
- 구글은 제미나이 3 프로 이후 석 달 만인 2026년 2월 19일 제미나이 3.1 프로를 프리뷰로 출시하며, 최근 과학·연구 성과의 밑바탕이 된 업그레이드된 핵심 지능이라고 설명했다[1]
- "복잡한 문제 해결을 위한 더 똑똑하고 유능한 기반"이며, 완전히 새로운 논리 패턴을 시험하는 ARC-AGI-2에서 검증 점수 77.1%를 받았다[1]
- 구글은 업데이트를 검증하고 에이전트 워크플로를 개선하기 위해 프리뷰로 유지했으며, "곧" 정식 출시할 예정이라고 밝혔다[1]
주요 특징
- 제미나이 앱에서는 구글 AI 프로와 울트라 요금제에 더 높은 사용 한도로, 노트북LM에서는 프로와 울트라 사용자에게만 제공된다[1]
- 개발자와 기업은 AI 스튜디오의 제미나이 API, 안티그래비티, 버텍스 AI와 제미나이 엔터프라이즈에서 프리뷰로 이용할 수 있다[1]
- 구글의 시연에서는 손동작 추적으로 조종하고 생성형 음악이 깔리는 인터랙티브 3D 찌르레기 군무를 코드로 구현했다[1]
벤치마크[3]
| 벤치마크 | Gemini 3.1 Pro | Gemini 3 Pro | Sonnet 4.6 | Opus 4.6 | GPT-5.2 | GPT-5.3-Codex |
|---|---|---|---|---|---|---|
| Humanity's Last Exam (학술 추론, 전체 세트 텍스트+멀티모달, 도구 미사용) | 44.4% | 37.5% | 33.2% | 40.0% | 34.5% | — |
| Humanity's Last Exam (학술 추론, 전체 세트 텍스트+멀티모달, 검색(블록리스트) + 코드) | 51.4% | 45.8% | 49.0% | 53.1% | 45.5% | — |
| ARC-AGI-2 (추상 추론 퍼즐, ARC Prize 검증) | 77.1% | 31.1% | 58.3% | 68.8% | 52.9% | — |
| GPQA Diamond (과학 지식, 도구 미사용) | 94.3% | 91.9% | 89.9% | 91.3% | 92.4% | — |
| Terminal-Bench 2.0 (에이전트 터미널 코딩, Terminus-2 하니스) | 68.5% | 56.9% | 59.1% | 65.4% | 54.0% | 64.7% |
| Terminal-Bench 2.0 (에이전트 터미널 코딩, 자체 보고 최고 기록 하니스) | — | — | — | — | 62.2% | 77.3% |
| SWE-Bench Verified (에이전트 코딩, 단일 시도) | 80.6% | 76.2% | 79.6% | 80.8% | 80.0% | — |
| SWE-Bench Pro (Public) (다양한 에이전트 코딩 과제, 단일 시도) | 54.2% | 43.3% | — | — | 55.6% | 56.8% |
| LiveCodeBench Pro (Codeforces, ICPC, IOI의 경쟁 코딩 문제, Elo) | 2887 | 2439 | — | — | 2393 | — |
| SciCode (과학 연구 코딩) | 59% | 56% | 47% | 52% | 52% | — |
| APEX-Agents (장기 전문 업무) | 33.5% | 18.4% | — | 29.8% | 23.0% | — |
| GDPval-AA Elo (전문가 업무) | 1317 | 1195 | 1633 | 1606 | 1462 | — |
| τ2-bench (에이전트 및 도구 사용, 리테일) | 90.8% | 85.3% | 91.7% | 91.9% | 82.0% | — |
| τ2-bench (에이전트 및 도구 사용, 통신) | 99.3% | 98.0% | 97.9% | 99.3% | 98.7% | — |
| MCP Atlas (MCP를 이용한 다단계 워크플로) | 69.2% | 54.1% | 61.3% | 59.5% | 60.6% | — |
| BrowseComp (에이전트 검색, 검색 + Python + 브라우징) | 85.9% | 59.2% | 74.7% | 84.0% | 65.8% | — |
| MMMU-Pro (멀티모달 이해 및 추론, 도구 미사용) | 80.5% | 81.0% | 74.5% | 73.9% | 79.5% | — |
| MMMLU (다국어 질의응답) | 92.6% | 91.8% | 89.3% | 91.1% | 89.6% | — |
| MRCR v2 (8-needle) (긴 컨텍스트 성능, 128k(평균)) | 84.9% | 77.0% | 84.9% | 84.0% | 83.8% | — |
| MRCR v2 (8-needle) (긴 컨텍스트 성능, 1M(포인트와이즈)) | 26.3% | 26.3% | — | — | — | — |
참고자료 3신뢰도 85%종합 신뢰도: 85%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 3건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-1-problog.google· 게시 2026년 9월 30일· 시작 2026년 2월 19일 ✓· 점수의 41%
구글의 게시글 "Gemini 3.1 Pro: A smarter model for your most complex tasks"는 2026년 2월 19일자이며, 그날 개발자, 기업, 일반 소비자에게 순차 제공된다고 밝혔다.
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· 추가 2026년 9월 30일· 점수의 41%
The Wikipedia article lists Gemini 3.1 Pro as released in preview on 19 February 2026.
- [3]95%Gemini 3.1 Pro - Model Carddeepmind.google· 게재 2026년 2월 19일· 점수의 17%
DeepMind's model card gives the benchmark table against the model's predecessor and named rivals.
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.