- 시작
- 2026년 5월 19일신뢰도 95%deepmind.google 제공
제미나이 3.5 플래시 출시
원문에서 자동 번역됨
원본 제목: Gemini 3.5 Flash Released
구글이 I/O 2026에서 코딩과 자율 에이전트 분야 역대 최강 모델이라는 제미나이 3.5 플래시를 공개했다. 구글은 거의 모든 벤치마크에서 제미나이 3.1 프로를 앞선다고 밝혔다.
- 구글은 2026년 5월 19일 I/O에서 제미나이 3.5 플래시를 출시했으며, 코딩과 자율 에이전트 분야에서 지금까지 가장 강력한 모델이라고 밝혔다[1]
- 코라이 카부쿠오을루는 "거의 모든 벤치마크에서 최신 프런티어 모델인 3.1 프로를 능가한다"며, 다른 프런티어 모델보다 4배 빠르고 최적화 버전은 같은 품질에서 12배 빠르다고 말했다[1]
- 구글 안티그래비티와 함께 개발됐으며, 시연에서는 에이전트들이 운영체제 전체를 밑바닥부터 만들어냈다. 구글은 같은 날 독립형 데스크톱 앱 안티그래비티 2.0도 내놨다[1]
- 구글은 곧 나올 3.5 프로가 '오케스트레이터'로서 플래시를 하위 에이전트로 부리게 될 것이며, 3.5에는 사이버 및 CBRN 안전장치가 강화됐다고 밝혔다[1]
주요 특징
- Terminal-bench 2.1 76.2%(3 플래시 58.0%), SWE-Bench Pro 55.1%, 컴퓨터 사용 능력을 보는 OSWorld-Verified 78.4%[3]
- MCP Atlas 83.6%, 지식 업무 GDPval-AA 1656 Elo, CharXiv Reasoning 84.2%, ARC-AGI-2 72.1%[3]
- 몇 시간 동안 자율적으로 작동할 수 있으며, 의사결정 지점에서는 멈추고 사용자 입력을 요청한다[1]
벤치마크[3]
| 벤치마크 | Gemini 3.5 Flash | Gemini 3 Flash | Gemini 3.1 Pro | Claude Sonnet 4.6 | Claude Opus 4.7 | GPT-5.5 |
|---|---|---|---|---|---|---|
| Terminal-bench 2.1 (에이전트 터미널 코딩, Terminus-2 하니스) | 76.2% | 58.0% | 70.3% | — | 66.1% | 78.2% |
| SWE-Bench Pro (Public) (다양한 에이전트 코딩 과제, 단일 시도) | 55.1% | 49.6% | 54.2% | — | 64.3% | 58.6% |
| MCP Atlas (MCP를 이용한 다단계 워크플로) | 83.6% | 62.0% | 78.2% | 69.5% | 79.1% | 75.3% |
| Toolathlon (실제 환경의 범용 도구 사용) | 56.5% | 49.4% | — | — | — | 55.6% |
| OSWorld-Verified (에이전트 컴퓨터 사용) | 78.4% | 65.1% | 76.2% | 72.5% | 78.0% | 78.7% |
| Finance Agent v2 (금융 분석 및 의사결정) | 57.9% | 42.6% | 43.0% | 51.0% | 51.5% | 51.8% |
| GDPval-AA (경제적 가치가 있는 지식 업무, Elo) | 1656 | 1204 | 1314 | 1676 | 1753 | 1769 |
| CharXiv Reasoning (복잡한 차트에서의 정보 종합, 도구 미사용) | 84.2% | 80.3% | 83.3% | 72.4% | 82.1% | 84.1% |
| MMMU-Pro (멀티모달 이해 및 추론, 도구 미사용) | 83.6% | 81.2% | 80.5% | 74.5% | 75.2% | 81.2% |
| Blueprint-Bench 2 (에이전트 공간 추론, 정규화 점수) | 33.6% | 0.0% | 26.5% | 6.7% | 24.5% | 36.2% |
| MRCR v2 (8-needle) (긴 컨텍스트 성능, 128k(평균)) | 77.3% | 67.2% | 84.9% | 84.9% | 59.3% | 94.8% |
| MRCR v2 (8-needle) (긴 컨텍스트 성능, 1M(포인트와이즈)) | 26.6% | 22.1% | 26.3% | — | — | — |
| Humanity’s Last Exam (학술 추론, 전체 세트 텍스트+멀티모달) | 40.2% | 33.7% | 44.4% | 33.2% | 46.9% | 41.4% |
| ARC-AGI-2 (추상 추론 퍼즐) | 72.1% | 33.6% | 77.1% | 58.3% | 75.8% | 84.6% |
참고자료 3신뢰도 85%종합 신뢰도: 85%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 3건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%techcrunch.com/2026/05/19/with-gemini-3-5-flash-google-bets-its-next-ai-wave-on-agents-not-chatbotstechcrunch.com· 게시 2026년 9월 30일· 시작 2026년 5월 19일· 점수의 39%
테크크런치는 구글이 화요일인 2026년 5월 19일 연례 개발자 콘퍼런스 I/O에서 제미나이 3.5 플래시를 출시했다고 보도했으며, 구글 딥마인드의 3.5 플래시 모델 카드도 같은 날 공개됐다.
- [2]75%Gemini (language model) - Wikipediaen.wikipedia.org· 추가 2026년 9월 30일· 점수의 39%
The Wikipedia article lists Gemini 3.5 Flash as released on 19 May 2026, based on Gemini 3 Flash.
- [3]95%Gemini 3.5 Flash - Model Carddeepmind.google· 게재 2026년 5월 19일· 시작 2026년 5월 19일 ✓· 점수의 23%
DeepMind's model card, published 19 May 2026, gives the benchmark results against Gemini 3 Flash, 3.1 Pro, Claude Sonnet 4.6, Claude Opus 4.7 and GPT-5.5.
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.