- Inicio
- 23 sept 202690% DE CONFIANZAsegún la fuente
Google lanza Gemini 3.8 Flash TTS y 3.8 Flash-Lite TTS
Traducido automáticamente del original
Título original: Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS Released
- Google presentó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS el 23 de septiembre de 2026 como "nuestros modelos de generación de audio más expresivos hasta la fecha": Flash TTS para dirección creativa y diseño de personajes, Flash-Lite TTS para doblaje y agentes de voz de alto volumen y coste eficiente[1]
- Flash TTS crea nuevas voces a partir de prompts en lenguaje natural en más de 100 idiomas y dialectos, ofrece más de 2.000 voces ya hechas, y puede replicar una voz a partir de una muestra de 30 segundos una vez que el consentimiento verbal grabado del propietario coincide con el hablante de referencia[1]
- Ambos aceptan indicaciones línea por línea sobre ritmo, emoción y acento, mantienen una voz estable a lo largo de horas de audio, montan escenas de dos interlocutores a partir de un solo guion, y reproducen señales como <laughs>, <sigh> y muletillas como "mhm"[1]
- Se implementaron en la API de Gemini y Google AI Studio, con Flash TTS en Gemini Notebook y Flash-Lite TTS en Google Vids; el acceso de Gemini Enterprise llegará próximamente[1][5]
- El registro de cambios de la API de Gemini incluye el lanzamiento con fecha del 22 de septiembre, con un nuevo endpoint Voices; Flash-Lite TTS sustituye a la vista previa de Gemini 3.1 Flash TTS[2]
- La replicación de voz de AI Studio está bloqueada en el Reino Unido, el EEE, India, Texas e Illinois[5]
Características destacadas
- Primero en general en el Voice Design Benchmark de Hume AI (71,4) y primero en modelado de acentos (60,8); Flash y Flash-Lite ocupan el primer y segundo lugar en el Overall Quality Index de Hume, aunque ElevenLabs obtuvo puntuaciones más altas en las categorías individuales de calidad de voz de Hume[1][5]
- Flash TTS cuesta 0,50 $ por millón de tokens de texto de entrada y 9,00 $ por millón de tokens de audio de salida (unos 0,00225 $ por 10 segundos) hasta el 31 de diciembre de 2026, duplicándose a 1,00 $ y 18,00 $ a partir del 1 de enero de 2027; Flash-Lite TTS cuesta 0,50 $ y 6,00 $, subiendo a 1,00 $ y 12,00 $[3]
- Entrada de texto de hasta 8.192 tokens y hasta 16.384 tokens de salida en la API de Gemini[4]
- Cada clip lleva una marca de agua SynthID, y las voces replicadas también llevan credenciales C2PA[1][5]
- Entre los socios que integran los modelos están Figma, HeyGen, Wondercraft, 99.co y Ollang[1]
Referencias 687% DE CONFIANZAConfianza general: 87%Hasta qué punto la fuente y las referencias del pin respaldan sus fechas.Media ponderada de la firmeza con la que 6 referencias, incluida la fuente, respaldan las horas de inicio y fin del pin; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más recienteMostrar todos los pines con un 75% de confianza o más
La primera entrada es siempre la fuente del pin. La confianza global es una media ponderada de la firmeza con la que cada referencia respalda las horas de inicio y fin usadas arriba; una referencia cuenta la mitad por cada 180 días que sea más antigua que la más reciente.
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-text-to-speechblog.google· Publicado el 28 sept 2026· Empieza 23 sept 2026 ✓· 17% de la puntuación
La publicación de Google[2][3][4] está fechada el "23 de septiembre de 2026" y dice que ambos modelos "se están implementando a partir de hoy"; The Next Web[6] informa que "Google lanzó Gemini 3.8 Flash TTS y Gemini 3.8 Flash-Lite TTS el miércoles". El registro de cambios de la API de Gemini registra la disponibilidad general un día antes, con fecha del 22 de septiembre.
- [2]85%Release notes | Gemini APIai.google.dev· Añadido el 28 sept 2026· 17% de la puntuación
The Gemini API changelog under September 22, 2026 lists both models as generally available with the new Voices endpoint, voice design, voice replication and an extended library of 150+ voices, and says Flash-Lite TTS replaces gemini-3.1-flash-tts-preview.[1]
- [3]85%Gemini Developer API pricingai.google.dev· Añadido el 28 sept 2026· 17% de la puntuación
Flash TTS costs $0.50 per million text input tokens and $9.00 per million audio output tokens through 31 December 2026, then $1.00 and $18.00; Flash-Lite TTS $0.50 and $6.00, then $1.00 and $12.00.[1]
- [4]85%Gemini 3.8 Flash TTS | Gemini APIai.google.dev· Añadido el 28 sept 2026· 17% de la puntuación
The API model page for gemini-3.8-flash-tts: text in, audio out, an 8,192-token input limit and 16,384 output tokens (Gemini API serving limit), latest update September 2026.[1]
- [5]85%Gemini can now clone your voice and perform scripts like an actorandroidauthority.com· Publicado el 24 sept 2026· 16% de la puntuación
Android Authority on the rollout to Gemini Notebook and Google[2][3][4] Vids; it notes ElevenLabs still scored higher in Hume's individual voice-quality and human-like-variation categories, and that AI Studio voice replication is blocked in the UK, the EEA, India, Texas and Illinois.
Sugerir una corrección
¿Falta algo o hay un error? Dilo con tus palabras: un enlace que respalde este pin, otra fecha de inicio o fin y por qué, o un dato que falta o está mal. La IA lo contrasta con las fuentes del pin, busca otras mejores y añade cualquier página que te dé la razón. Las fuentes del propio pin siguen contando más. La IA también mira las imágenes: una que muestra otra cosa, o la muestra mal, pasa al final o se sustituye.