- 开始
- 2026年9月15日可信度 90%来自来源
Gemini 3.8 Live 与 3.8 Live Extended Thinking 发布
由原文自动翻译
原标题: Gemini 3.8 Live and 3.8 Live Extended Thinking Released
- 谷歌于 2026 年 9 月 15 日推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,称其为“我们迄今最先进的实时对话模型”:3.8 Live“为规模化和成本效率而打造”,Extended Thinking 则“面向高复杂度任务,具备更强的智能和多步推理能力”[1]
- Extended Thinking“能够边推理边说话”,会先给出诸如“让我核实一下……”之类的提示,并在多步任务于后台运行时同步讲述进展[1]
- 3.8 Live 能以近乎实时的速度读取视觉输入,可在对话过程中检测并切换所支持的 97 种语言,并能在工具调用和 API 调用于后台完成期间继续对话[1]
- 两款模型均已面向 Gemini API 和 Google AI Studio 的开发者推出,并以私密预览形式向 Gemini Enterprise 的企业用户开放;3.8 Live 已在 Search Live 中上线,Extended Thinking 则已在 Gemini Live、Docs Live、Gmail Live 和 Keep Live 中上线[1][5]
- 这两款模型接续了 3 月发布的 Gemini 3.1 Flash Live[5]
- 9 月 24 日,谷歌在 Gemini Enterprise 中为 3.8 Live 新增了 Live Avatar 功能,这是一种近乎实时的视频化身[4]
值得关注的功能
- Extended Thinking 在 Artificial Analysis 的语音到语音质量指数上位居榜首(82.6 分),在 τ-Voice 上得分 68.6%,在 Sierra 的 τ-Voice-banking 基准上得分 35.1%,在 Big Bench Audio 上得分 97.7%;3.8 Live 在 Speech Agent Arena 中排名第二[1]
- 每百万 token 价格:文本输入 0.75 美元,音频输入 3.00 美元,图像或视频输入 1.00 美元;文本输出 4.50 美元,音频输出 12.00 美元——大约相当于每分钟音频输入 0.005 美元、输出 0.018 美元[3]
- 支持音频、图像、视频和文本输入,输入上限为 131,072 个 token,输出上限为 65,536 个 token,并支持异步函数调用和 Google 搜索事实核验(grounding)[2]
- 基于 Gemini 3 Pro 构建,知识截止日期为 2025 年 1 月[6]
- 所有生成的音频都带有难以察觉的 SynthID 水印[1]
- 包括 Agora、LangChain、LiveKit、Pipecat 和 Vercel 等语音平台均通过 Gemini Live API 支持该模型,Salesforce、Genspark 和 Lumeris 是首发合作伙伴[1]
参考资料 6可信度 87%总体可信度: 87%该图钉的来源和参考资料对其日期的支持程度。包括来源在内的 6 份资料对图钉开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半显示所有可信度不低于 75% 的图钉
第一项始终是图钉的来源。总体可信度是各份资料对上方所用开始和结束时间支持程度的加权平均;资料每比最新的一份旧 180 天,权重减半。
- [1]90%blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-8-live-gemini-3-8-live-extended-thinkingblog.google· 发布于 2026年9月28日· 开始 2026年9月15日 ✓· 占评分 17%
谷歌博文日期为“2026 年 9 月 15 日”,文中写道:“3.8 Live 从今天起开始推出”;9to5Google[5] 同日的报道称“谷歌今天宣布推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking”,Gemini API 更新日志也将两者的正式发布日期列为 9 月 15 日。
- [2]90%Gemini 3.8 Live Extended Thinking | Gemini APIai.google.dev· 添加于 2026年9月28日· 占评分 17%
The API model page for gemini-3.8-live-extended-thinking: text, image, audio and video in, text and audio out, 131,072 input and 65,536 output tokens, asynchronous function calling and search grounding supported, latest update September 2026.[1]
- [3]85%Gemini Developer API pricingai.google.dev· 添加于 2026年9月28日· 占评分 17%
The pricing page lists Gemini 3.8 Live and 3.8 Live Extended Thinking together: $0.75 text, $3.00 audio and $1.00 image/video input and $4.50 text and $12.00 audio output per million tokens, or about $0.005 and $0.018 a minute of audio.[1]
- [4]75%Introducing Gemini 3.8 Live with Live Avatarblog.google· 发表于 2026年9月24日· 占评分 17%
Google's[2][3] follow-up post of 24 September adds Live Avatar to 3.8 Live, pairing the voice model with near real-time video of a speaking persona, available in Gemini Enterprise.
- [5]90%Gemini 3.8 Live Extended Thinking powers Gemini Live, Gmail, & Keep9to5google.com· 发表于 2026年9月15日· 开始 2026年9月15日· 占评分 16%
9to5Google's same-day report by Abner Li that Google[2][3] "today announced" both models, following 3.1 Flash Live in March; it repeats the benchmark claims and says Extended Thinking powers Gmail Live, Docs Live and Keep Live and is rolling out to Gemini Live, while 3.8 Live powers Search Live.
建议更正
有遗漏或错误吗?用你自己的话说明:能佐证此图钉的链接、不同的开始或结束日期及理由,或缺失、有误的信息。AI 会对照此图钉的来源进行核实,搜索更好的来源,并添加任何支持你说法的页面。图钉自身的来源仍然最重要。AI 也会查看图片:显示的是别的东西或显示效果差的图片会被移到后面或替换。