Gemini 3.8 Live 上手实测 2026:语音 AI 学会「边想边说」,国内怎么用
海外梯子

9 月 15 日,Google 静悄悄上线了两款实时语音模型:Gemini 3.8 LiveGemini 3.8 Live Extended Thinking。没有发布会,只有一篇博客加 API 文档更新。

但这次值得写,不是因为它跑分又高了一点,而是因为它动手拆掉了一个存在很久的尴尬:语音 AI 要么接话快但不会做事,要么会做事但接不上话。

用过语音助手的人都有这个体验——你问它「帮我查下明天飞上海的航班,顺便看看附近酒店」,它沉默三秒,然后回你一句「好的,正在为您查询」。这三秒里你不知道它在思考、在查、还是已经掉线了。Google 自己在 Live API 文档里把这个问题写得很直白:文字界面可以显示「正在处理」,语音通话里的几秒沉默什么都传达不了。

这篇文章讲四件实在事:它改了什么、数据到底什么水平、普通人怎么用上、以及国内用户真正的门槛在哪。

太长不看

关注点结论
发布时间2026 年 9 月 15 日(美国时间),Google 官方博客 + API 开放
最大变化推理与对话并行:模型可以「边说话边在后台干活」,不用等工具返回才开口
两个版本Live 走低延迟规模化;Extended Thinking 加后台多步推理,适合复杂任务
关键数据Speech to Speech 榜 82.6 分登顶(领先 GPT-Live-1 1.1 分);电信场景通过率 84%;银行场景 35.1% 破纪录
成本基础版 $0.84/小时(行业最低),增强版 $3.50/小时(GPT-Live-1 为 $5.83/小时)
谁能用开发者走 Gemini API / AI Studio;企业走 Gemini Enterprise;普通用户目前只能从 Search Live 试
国内门槛不在账号,在链路——实时语音对延迟、抖动、丢包的敏感度比文字高一档

一、语音 AI 卡在哪:不是不够聪明,是它不敢边听边想

先把老架构摊开看。传统语音助手是一条串行的三级流水线:

语音识别(ASR)→ 文本模型推理 → 语音合成(TTS)

这条链路的延迟是相加关系。单看每一环都不算慢——ASR 三百毫秒、模型四百毫秒、TTS 七百毫秒——但串起来,从你松口到听见回答,一两秒就出去了;如果中间还要调用外部工具查数据,那几秒等待全落在「沉默」上。

更麻烦的是,一旦对话变成串行,模型就没法处理「边听边想」。你说完它才开始处理,它回话时你的插话它听不进去,你中途改主意它也来不及反应。

这就是语音 Agent 长期落地不好的根因:它被做成了一个一次只干一件事的系统,而真实对话是好几件事同时发生的。

二、这次改的是结构:从「三级流水线」到「一条持续连接」

Gemini 3.8 Live 系列的做法是把语音理解、推理、语音生成和工具调用,全部放进同一个持续运行的连接里,而不是让它们排队。

具体表现是什么?Live API 文档举的例子很清楚:让助手比较航班和酒店,它可以分别发起查询、在查询过程中继续跟你对话,而不是等所有接口都返回了才第一次开口。任务执行期间它还能口头报告进度——「航班查到了三班,酒店还在看」——最后再给结论。

这中间有个容易被忽略的机制:Extended Thinking 在后台规划任务、异步调用工具,前台同时先给一句「我来查一下」垫住。沟通感和执行效率不再是二选一。

但它也带来一个新问题,而且这个问题会直接落到开发者头上:判断「一轮对话结束了没有」的方式变了。

老的实时语音模型,说完一段话这轮就算结束;现在后台任务可能还在跑,用户随时可能插话、改口、甚至让几秒前启动的任务瞬间失去意义。于是系统要处理的东西变成:并发任务怎么排、旧结果还成不成立、打断之后要不要回滚。这不是调快一点就能绕过去的事。

三、两个版本怎么选

维度Gemini 3.8 LiveGemini 3.8 Live Extended Thinking
定位低延迟、规模化部署,多数实时语音场景的默认选择需要多步骤推理、调用多个工具的复杂任务
核心能力语音 + 图片/视频近实时理解、工具调用、Google Search Grounding在实时之上加后台思考,前台对话不中断
适合场景客服、车载、日常助手、并发量大的语音入口行程规划、金融与交易类操作、跨系统任务编排
上下文131,072 输入 Token / 65,536 输出 Token同左
价格$0.84/小时$3.50/小时

怎么选其实一句话:用户说话时你要马上有回应 → 基础版;用户让你“顺便把事办了” → 增强版。 很多产品最后是混着用的:日常对话走基础版,识别到复杂意图再切增强版。

四、82.6 分是什么概念

第三方机构 Artificial Analysis 的语音对话质量综合指数(Speech to Speech Index)里,Extended Thinking 拿下 82.6 分,第二名是 OpenAI 的 GPT-Live-1,差 1.1 分。

差距不大,但有个纵向对比更有意思:Google 上一代 3.1 系列在同一个榜上不到 72 分。也就是说这一代提升在 10 分以上,而语音这类榜单越往高分越难涨。

另外两组专项数据:

  • τ-Voice 电信场景通过率 84%,比对手领先 4 个百分点。电信客服是语音 Agent 最苛刻的落地场景之一——查余额、改套餐、报故障都要准确调用系统,说错一步就要转人工。
  • τ³-Banking 银行场景通过率 35.1%,创下该测试的新纪录。注意这个数字本身只有 35%,看着不高,但它衡量的是「多轮对话里自主完成银行业务操作」的端到端成功率,属于行业普遍很低的硬骨头指标——大家普遍在百分之十几到二十几徘徊。

这些指标怎么读?语音榜不是比谁延迟低,而是比“该接话时接得上、该做事时做得成”这两件事同时成立的比例。 单点延迟再低,任务办不成也是白搭。

五、成本:$0.84 和 $3.50 每小时

基础版处理成本 0.84 美元/小时,官方称行业最低;增强版 3.50 美元/小时,对比 GPT-Live-1 的 5.83 美元便宜了四成。

这里有个计费逻辑值得单独说:语音模型按“连接时长”收费,不是按 Token。 文本 API 用多少付多少,语音则是你占着这条实时连接多久,就按小时往上报。这意味着成本控制的重心和文本完全不同——客服系统里没人说话的那几分钟、用户挂机没断连的那些时间,都在计费。做产品的人如果按文本 API 的直觉去估预算,很容易翻车。

还有一点:上面这些价格只覆盖模型调用。真要跑起来,链路成本、音频编解码、前端设备全都要单算。

六、两个容易被忽略的细节

97 种语言自动检测与切换。 对跨境客服、多语种直播这类场景是实打实的升级——过去要么预选语言,要么让用户手动切,现在是聊着聊着切语言,模型自己跟上。

音频输出嵌入 SynthID 水印。 生成的每一段音频都带可追溯标记。这件事对做内容的人意义比对开发者大:以后拿 AI 生成的语音做节目、做配音、做客服录音,来源是可被识别的。合规方向上这是好事,但也意味着“用 AI 声音冒充真人”这条路越来越窄。

生态侧,Google 同时公布了 Salesforce、ServiceNow 等合作方,方向很明确:往企业工作流里扎。

七、怎么用上:四条入口

你的身份入口说明
开发者Gemini API / Google AI Studio已开放,AI Studio 里可以直接试语音对话
企业用户Gemini Enterprise抢先体验,后续扩展到 Gemini Enterprise for Customer Experience
普通用户Search Live目前最接近“打开就能用”的入口,直接体验实时语音对话
想接进自己产品的团队Live API官方示例、异步函数调用、音频流处理都在文档里

对国内用户来说,这三条路最后都指向同一件事:一个能正常登录的 Google 账号,加一条稳得住的国际链路。 前一条相对好解决,后一条才是决定体验的那一环。

八、国内用户真正的门槛:语音比文字更吃链路

这部分是我自己踩过之后最想讲清楚的。

很多人以为「能打开网页就能用语音」,实际差距比想象大。原因是这四件事:

第一,语音是持续占着出口的负载。 文字对话一次请求几百毫秒就结束了,链路短、要求松;语音一次连接几分钟到几十分钟,全程双向音频流不停。这跟下载大文件是同一类负载——占得久,中途出问题的机会就多。

第二,延迟的体感阈值完全不同。 网页慢 300 毫秒你毫无感觉;语音里 300 毫秒的空白,人耳立刻判定“它卡住了”。而跨境访问本身单程往返延迟就有 200~300 毫秒,再叠加模型推理和设备处理,很容易跨过那条让人不舒服的线。

第三,抖动比平均延迟更致命。 平均延迟好看但忽高忽低的链路,表现是声音断续、句子被切碎、你和 AI 互相打断。听感上就像对面嗓子突然坏了。

第四,语音包丢了不能靠重传等回来。 文字传输出错可以重传,慢一点没关系;实时音频等不起——前端只能靠补偿算法硬撑,超过阈值就直接掉词、变成机械音。

结论很反直觉但很实在:如果你打算长期用实时语音类的 AI,挑一条稳的线路比挑一条快的线路重要。 峰值测速跑得再漂亮,晚八点抖成一片照样废。

三个硬指标和自查方法

指标什么水平算能用怎么测
往返延迟稳定在 200 毫秒以内,波动别超过 50 毫秒同时 ping 目标服务,连测 2-3 分钟看最大值,不只看平均值
丢包率低于 1%常规测速工具看丢包;跨境线路晚高峰复测一次
抖动越小越好,明显忽高忽低就是不行看 ping 输出的 mdev / 标准差,比平均延迟更能说明问题

测的时候有个细节:一定要在你真正会用语音的时段测。 白天测出来一片绿,晚上八点开语音对话就开始断续,这是最常见的情况。

移动网络下还有额外一层:手机在 4G/5G 和 Wi-Fi 之间切换时,连接会重建,语音对话直接断一截。真要用语音跑长任务,尽量固定在 Wi-Fi 环境。

如果你发现某些程序压根不走代理(语音客户端、桌面 App 最容易有这问题),可以看 TUN 模式完全指南;不确定自己该选哪类线路,IEPL、IPLC 与中转的区别这篇讲得最清楚。

九、什么时候别用语音

语音能做的事变多了,但不代表所有事都该用语音。这几种情况用文字更划算:

  • 要精确数字、地址、单号 —— 语音识别错一个字符,就要来回确认三遍,文字一眼就能核对
  • 要在办公室、通勤地铁上用 —— 你的对话内容等于公放,尤其是让 AI 查工作数据的时候
  • 要读长材料、深度对比 —— 语音适合交互,不适合承载信息密度,长文档还是看
  • 链路本身不稳的时候 —— 文字有重试余量,慢一秒你还能忍;语音慢一秒就已经毁了一句对话

十、选线路:五家怎么挑

实时语音的选型逻辑和下载、流媒体都不一样,它排第一的不是带宽,是稳定与低延迟。按这个标准排下来:

你的情况首选备选为什么
长时间开着语音对话、链路容易抖光速云飞猫云IEPL专线 多路复用抗丢包,一路不稳立刻切到可用路径
对延迟最敏感、要求接话跟手飞猫云光速云自有机房 IEPL 专线,不走公共互联网路径,延迟更短更可控
登录 Google 账号、长期养账号环境飞猫云MESLIEPL + 住宅 IP,登录环境稳定,不容易触发风控
手机、电脑、平板多端同时用SS-ID光速云IEPL 网关,一次配置全设备走线路,5 设备起
只想低成本试水、当备用微风网络MESL¥6.99 起入门,全球 80+ 地区,缺的只是关键时刻能顶上

光速云是我自己长期在用的主力。它的 IEPL专线 多路复用在语音这种持续双向流上最对症——链路一抖就切路径,听感上就是句子不断。200GB 流量八折后月付 ¥15.92,不限设备数,手机和电脑同时挂着不抢名额。👉 查看光速云深度评测

飞猫云自有机房 IEPL,年付折合月付 ¥16.6。专线的价值在实时对话里比在网页浏览里明显得多:延迟低且稳,你插话它接得住,不会出现那种「说完等半天」的空白。👉 查看飞猫云深度评测

飞猫云走 IEPL 加住宅 IP,¥16.8。语音 AI 的使用往往伴随账号登录,而 Google 对异常登录环境的判定看的是出口 IP 类型,不是你的网速。一个干净的住宅 IP 环境,比多买几十兆带宽实用。👉 查看飞猫云深度评测

三个常用组合,按需求直接抄:

  • 主用 + 备用:光速云 ¥15.92 + 微风网络 ¥6.99 = ¥22.91,日常语音对话走主力,主力出问题时备用线顶上
  • 低延迟优先:飞猫云 ¥16.6 + 飞猫云 ¥16.8 = ¥33.4,一路管接话跟手,一路管账号环境
  • 全设备铺开:飞猫云 ¥16.8 + SS-ID ¥20 = ¥36.8,家里所有设备一次配好

FAQ

Q:普通用户想试试,要花多少钱? A:模型本身按小时计费(基础版 $0.84/小时),普通用户目前最省事的入口是 Search Live。真要用得久,成本主要落在订阅和链路上,不是模型调用。

Q:语音对话一小时大概多少流量? A:音频流本身不大,几十 KB/s 级别就够——它不需要大带宽,需要的是全程不断。所以别用「测速多少兆」来判断语音能不能用,要看延迟和丢包。

Q:和 ChatGPT 的语音模式比,怎么选? A:两条路线不同。OpenAI 的 GPT-Live-1 是全双工语音,复杂推理交给后端 GPT-6 Astra 这类文本模型处理;Gemini 3.8 Live 是把推理直接放进同一条实时连接。日常闲聊两者都够;要一边聊一边跑多步任务,Gemini 这次的异步工具调用更贴近这个场景。之前的 ChatGPT GPT-Live 语音模式指南 可以对着看。

Q:手机上能用吗? A:能。但移动网络下切换基站、Wi-Fi 与蜂窝互切时连接会重建,语音会断一截。要跑长任务建议固定在 Wi-Fi,并挑一条稳的线路。

Q:它和 Gemini 3.8 Flash 是什么关系? A:不是一回事。Flash 是文本与智能体主力模型,Live 系列专攻实时语音。想了解 3.8 这一代模型整体到什么水平,可以看 Gemini 3.8 Flash 上手教程

Q:语音 AI 会不会取代文字? A:不会。语音解决的是「边聊边把事办了」,文字解决的是「把信息准确记下来」。两者负载特征完全不同,选型上也是两套标准。

写在最后

Gemini 3.8 Live 这次做的事,往小了说是把语音体验修顺了一些,往大了说是把语音 Agent 从「能聊天」推向「能干活」。

但对国内用户来说,模型变强的收益能不能拿到手,很大程度取决于一条常被忽略的变量:你脚下这条链路稳不稳。 语音是最不宽容的负载——它不给重试的机会,也没有「等一下」的余地。

所以如果你打算认真用这一类工具,先把三个数字测出来:延迟、丢包、抖动。这三个数字干净,语音体验自然就上来了;哪一项不干净,换模型也救不了。

延伸阅读:IEPL专线 多路复用原理网络测速怎么看:延迟、丢包与晚高峰实测网络加速客户端设置教程