- 시작
- 2026년 9월 23일신뢰도 90%출처 제공
Gemini 3.8 Flash TTS·3.8 Flash-Lite TTS 출시
원문에서 자동 번역됨
원본 제목: Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS Released
- Google은 2026년 9월 23일 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 “지금까지 가장 표현력이 풍부한 오디오 생성 모델”로 소개했다. Flash TTS는 창작 연출과 캐릭터 디자인용이며, Flash-Lite TTS는 대량이면서 비용 효율적인 더빙과 음성 에이전트용이다.[1]
- Flash TTS는 100개 이상의 언어와 방언으로 자연어 프롬프트를 통해 새로운 목소리를 만들어내고, 2,000개 이상의 기성 목소리를 제공하며, 소유자의 녹음된 구두 동의가 기준 화자와 일치하면 30초 샘플로 목소리를 복제할 수 있다.[1]
- 두 모델 모두 속도, 감정, 억양에 대한 줄 단위 지시를 받아들이고, 몇 시간에 걸친 오디오에서도 목소리를 안정적으로 유지하며, 하나의 대본으로 2인 화자 장면을 구성하고, <laughs>, <sigh> 같은 큐(cue)와 “mhm” 같은 맞장구 소리도 표현한다.[1]
- 두 모델은 Gemini API와 Google AI Studio에서 배포됐으며, Flash TTS는 Gemini Notebook에, Flash-Lite TTS는 Google Vids에도 도입됐다. Gemini Enterprise 접근은 곧 제공될 예정이다.[1][5]
- Gemini API 변경 로그는 이번 출시를 9월 22일자로 기록하고 있으며, 새로운 Voices 엔드포인트도 함께 추가됐다. Flash-Lite TTS는 Gemini 3.1 Flash TTS 프리뷰를 대체한다.[2]
- AI Studio의 목소리 복제 기능은 영국, EEA(유럽경제지역), 인도, 텍사스주, 일리노이주에서는 차단된다.[5]
주요 특징
- Hume AI의 Voice Design Benchmark 종합 1위(71.4점)이자 억양 모델링 부문 1위(60.8점)를 차지했다. Flash와 Flash-Lite는 Hume의 Overall Quality Index에서 각각 1위와 2위를 차지했지만, Hume의 개별 목소리 품질 항목에서는 ElevenLabs가 더 높은 점수를 받았다.[1][5]
- Flash TTS는 2026년 12월 31일까지 텍스트 입력 토큰 100만 개당 0.50달러, 오디오 출력 토큰 100만 개당 9.00달러(10초당 약 0.00225달러)이며, 2027년 1월 1일부터는 각각 1.00달러와 18.00달러로 두 배가 된다. Flash-Lite TTS는 0.50달러와 6.00달러이며 이후 1.00달러와 12.00달러로 오른다.[3]
- Gemini API에서 텍스트 입력은 최대 8,192토큰, 출력은 최대 1만 6,384토큰까지 지원한다.[4]
- 모든 클립에는 SynthID 워터마크가 삽입되며, 복제된 목소리에는 C2PA 크리덴셜도 함께 부여된다.[1][5]
- 이 모델을 도입하는 파트너로는 Figma, HeyGen, Wondercraft, 99.co, Ollang이 있다.[1]
참고자료 6신뢰도 87%종합 신뢰도: 87%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 6건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speechblog.google· 게시 2026년 9월 28일· 시작 2026년 9월 23일 ✓· 점수의 17%
Google[2][3][4]의 게시물은 “2026년 9월 23일”로 날짜가 표시돼 있으며 두 모델 모두 “오늘부터 배포된다”고 밝혔다. The Next Web[6]은 “Google이 수요일 Gemini 3.8 Flash TTS와 Gemini 3.8 Flash-Lite TTS를 출시했다”고 보도했다. Gemini API 변경 로그는 일반 이용(GA) 시점을 하루 앞선 9월 22일로 기록했다.
- [2]85%Release notes | Gemini APIai.google.dev· 추가 2026년 9월 28일· 점수의 17%
The Gemini API changelog under September 22, 2026 lists both models as generally available with the new Voices endpoint, voice design, voice replication and an extended library of 150+ voices, and says Flash-Lite TTS replaces gemini-3.1-flash-tts-preview.[1]
- [3]85%Gemini Developer API pricingai.google.dev· 추가 2026년 9월 28일· 점수의 17%
Flash TTS costs $0.50 per million text input tokens and $9.00 per million audio output tokens through 31 December 2026, then $1.00 and $18.00; Flash-Lite TTS $0.50 and $6.00, then $1.00 and $12.00.[1]
- [4]85%Gemini 3.8 Flash TTS | Gemini APIai.google.dev· 추가 2026년 9월 28일· 점수의 17%
The API model page for gemini-3.8-flash-tts: text in, audio out, an 8,192-token input limit and 16,384 output tokens (Gemini API serving limit), latest update September 2026.[1]
- [5]85%Gemini can now clone your voice and perform scripts like an actorandroidauthority.com· 게재 2026년 9월 24일· 점수의 16%
Android Authority on the rollout to Gemini Notebook and Google[2][3][4] Vids; it notes ElevenLabs still scored higher in Hume's individual voice-quality and human-like-variation categories, and that AI Studio voice replication is blocked in the UK, the EEA, India, Texas and Illinois.
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.