- Début
- 23 sept. 2026CONFIANCE 90 %selon la source
Sortie de Gemini 3.8 Flash TTS et 3.8 Flash-Lite TTS
Traduit automatiquement de l’original
Titre original: Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS Released
- Google a présenté Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS le 23 septembre 2026 comme « nos modèles de génération audio les plus expressifs à ce jour » : Flash TTS pour la direction artistique et la création de personnages, Flash-Lite TTS pour le doublage à fort volume et économique ainsi que pour les agents vocaux[1]
- Flash TTS crée de nouvelles voix à partir d'invites en langage naturel dans plus de 100 langues et dialectes, propose plus de 2 000 voix prêtes à l'emploi, et peut reproduire une voix à partir d'un échantillon de 30 secondes une fois que le consentement verbal enregistré du propriétaire correspond à la voix de référence[1]
- Les deux modèles acceptent des indications ligne par ligne sur le rythme, l'émotion et l'accent, conservent une voix stable sur des heures d'audio, mettent en scène des dialogues à deux voix à partir d'un seul script, et rendent des indices comme <laughs>, <sigh> et des interjections telles que « mhm »[1]
- Ils ont été déployés dans l'API Gemini et Google AI Studio, Flash TTS étant disponible dans Gemini Notebook et Flash-Lite TTS dans Google Vids ; l'accès via Gemini Enterprise arrivera prochainement[1][5]
- Le journal des modifications de l'API Gemini répertorie cette sortie au 22 septembre, avec un nouveau point de terminaison Voices ; Flash-Lite TTS remplace l'aperçu de Gemini 3.1 Flash TTS[2]
- La reproduction de voix dans AI Studio est bloquée au Royaume-Uni, dans l'EEE, en Inde, au Texas et en Illinois[5]
Caractéristiques notables
- Premier au classement général du Voice Design Benchmark de Hume AI (71,4) et premier en modélisation d'accent (60,8) ; Flash et Flash-Lite occupent la première et la deuxième place de l'Overall Quality Index de Hume, bien qu'ElevenLabs ait obtenu de meilleurs scores dans les catégories individuelles de qualité vocale de Hume[1][5]
- Flash TTS coûte 0,50 $ par million de jetons de texte en entrée et 9,00 $ par million de jetons d'audio en sortie (environ 0,00225 $ pour 10 secondes) jusqu'au 31 décembre 2026, avant de doubler à 1,00 $ et 18,00 $ à partir du 1er janvier 2027 ; Flash-Lite TTS coûte 0,50 $ et 6,00 $, puis passe à 1,00 $ et 12,00 $[3]
- Une entrée texte allant jusqu'à 8 192 jetons et jusqu'à 16 384 jetons de sortie sur l'API Gemini[4]
- Chaque extrait porte un filigrane SynthID, et les voix reproduites portent également des identifiants C2PA[1][5]
- Parmi les partenaires qui intègrent ces modèles figurent Figma, HeyGen, Wondercraft, 99.co et Ollang[1]
Références 6CONFIANCE 87 %Confiance globale: 87%Dans quelle mesure la source et les références du pin étayent ses dates.Moyenne pondérée de la fermeté avec laquelle 6 références, source comprise, étayent les heures de début et de fin de l’épingle ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récenteAfficher toutes les épingles à 75 % de confiance ou plus
La première entrée est toujours la source de l’épingle. La confiance globale est une moyenne pondérée de la fermeté avec laquelle chaque référence étaye les heures de début et de fin retenues ci-dessus ; une référence compte moitié moins pour chaque tranche de 180 jours d’ancienneté par rapport à la plus récente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speechblog.google· Publié le 28 sept. 2026· Début 23 sept. 2026 ✓· 17 % du score
L'article de Google[2][3][4] est daté du '23 sept. 2026' et dit que les deux modèles 'sont déployés dès aujourd'hui' ; The Next Web[6] rapporte que 'Google a lancé Gemini 3.8 Flash TTS et Gemini 3.8 Flash-Lite TTS mercredi'. Le journal des modifications de l'API Gemini situe la disponibilité générale un jour plus tôt, au 22 septembre.
- [2]85%Release notes | Gemini APIai.google.dev· Ajouté le 28 sept. 2026· 17 % du score
The Gemini API changelog under September 22, 2026 lists both models as generally available with the new Voices endpoint, voice design, voice replication and an extended library of 150+ voices, and says Flash-Lite TTS replaces gemini-3.1-flash-tts-preview.[1]
- [3]85%Gemini Developer API pricingai.google.dev· Ajouté le 28 sept. 2026· 17 % du score
Flash TTS costs $0.50 per million text input tokens and $9.00 per million audio output tokens through 31 December 2026, then $1.00 and $18.00; Flash-Lite TTS $0.50 and $6.00, then $1.00 and $12.00.[1]
- [4]85%Gemini 3.8 Flash TTS | Gemini APIai.google.dev· Ajouté le 28 sept. 2026· 17 % du score
The API model page for gemini-3.8-flash-tts: text in, audio out, an 8,192-token input limit and 16,384 output tokens (Gemini API serving limit), latest update September 2026.[1]
- [5]85%Gemini can now clone your voice and perform scripts like an actorandroidauthority.com· Publié le 24 sept. 2026· 16 % du score
Android Authority on the rollout to Gemini Notebook and Google[2][3][4] Vids; it notes ElevenLabs still scored higher in Hume's individual voice-quality and human-like-variation categories, and that AI Studio voice replication is blocked in the UK, the EEA, India, Texas and Illinois.
Suggérer une correction
Il manque quelque chose ou une erreur s'est glissée ? Dites-le avec vos mots : un lien qui étaye cette épingle, une autre date de début ou de fin et pourquoi, ou une information absente ou erronée. L'IA la vérifie au regard des sources de l'épingle, en cherche de meilleures et ajoute toute page qui vous donne raison. Les sources de l'épingle restent celles qui comptent le plus. L'IA regarde aussi les images : une image qui montre autre chose, ou qui le montre mal, passe en dernier ou est remplacée.