AIHub

Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战

进阶约 13 分钟读完2026-09-25#Gemini#Google#Live API#实时语音#数字人#多模态#Agent
Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战

多模态实时交互的竞争,9 月进入了「有声有脸」阶段。

9 月 15 日,谷歌 DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时语音模型;9 月 24 日,谷歌又在 Gemini Enterprise 正式上线 Gemini 3.8 Live with Live Avatar——在原生实时对话模型上叠加低延迟流式视频,数字人有了口型同步、自然表情和流畅的轮流对话,支持 97 种语言语音到语音,还能在对话中途异步调用工具、后台取数而不打断交流,输出内容全部嵌入 SynthID 水印。

从纯语音到实时形象,这一步直接关系企业级 AI 客服、虚拟导览、在线教育等场景的落地形态。本文讲清:两款底层模型怎么选、Live API 怎么接、按小时计费的成本怎么算、数字人上线前要过哪几关。

一、先分清两款模型:速度和成本,还是推理深度

两个模型都建立在 Gemini 3 Pro 底座上,但定位截然不同:

项目 Gemini 3.8 Live Gemini 3.8 Live Extended Thinking
定位 规模化、低延迟、低成本 边思考边说话,多步骤复杂任务
推理 快速响应 推理与发言并行,用「让我确认一下…」自然过渡
榜单成绩 语音对语音第一梯队 82.6%,Artificial Analysis Speech-to-Speech 榜首(压过 OpenAI GPT-Live-1)
接入渠道 Gemini API、Google AI Studio、Search Live Gemini Live 应用;Pro/Ultra 用户的 Docs、Gmail、Keep
典型场景 客服、导览、语音助手 实时编程陪聊、多步任务执行、复杂排查

选型原则一句话:用户等你回话的选 Live,用户等你把事办成的选 Extended Thinking。 数字人前台(Live Avatar 当前所在的 Gemini Enterprise)走的是前者,因为要的是低延迟和表情、口型的流式同步。

二、Live Avatar 到底新在哪

不是「语音模型 + 一张会动的脸」的简单拼装,三个工程点值得注意:

  1. 口型同步(lip-sync)在模型侧完成:音频与面部视频由同一模型流式生成,避免了「音频管线 + 面部驱动管线」拼接常见的延迟累积和口型漂移。
  2. 流畅轮替(turn-taking):模型能判断用户是在停顿还是真的说完了,打断处理也内建——这两点恰是上一代语音 Agent 最常被吐槽的地方。
  3. 后台工具调用不打断对话:对话中说「我查一下库存」,模型边播报进度边异步执行 API 调用,取到数据后自然衔接,不会长时间冷场。

加上 97 种语言对话中自动切换(中英混说不用手动切语言),输出全部带 SynthID 水印,合规审计有抓手。

三、API 接入:一段 WebSocket 双向流代码

Live API 的核心是双向流式会话:客户端持续推音频帧,服务端持续推音频(和 Avatar 视频)帧,中途可插入工具调用。以 Node.js 为例(使用官方 @google/genai SDK):

import { GoogleGenAI, Modality } from "@google/genai";

const ai = new GoogleGenAI({ apiKey: process.env.GEMINI_API_KEY });

// 建立双向流式会话:语音输入 -> 语音输出 + 工具调用
const session = await ai.live.connect({
  model: "gemini-3.8-live-avatar",
  config: {
    responseModalities: [Modality.AUDIO, Modality.VIDEO],
    systemInstruction:
      "你是门店导购数字人。查库存等耗时操作先用自然语言告知用户," +
      "再异步调用工具,拿到结果后继续对话。",
    // 声明可异步调用的工具
    tools: [{ functionDeclarations: [checkStockFn] }],
    speechConfig: {
      languageConfig: { languages: ["zh-CN", "en-US"] }, // 97 种语言可混说
    },
  },
  callbacks: {
    onmessage: (msg) => {
      if (msg.serverContent?.modelTurn) {
        playAudioAndVideo(msg.serverContent.modelTurn); // 低延迟播放
      }
      if (msg.toolCall) {
        runToolAndRespond(msg.toolCall); // 后台执行,结果回注会话
      }
    },
  },
});

// 持续推送用户麦克风音频
mic.on("data", (pcm) => session.sendRealtimeInput({
  audio: { data: pcm.toString("base64"), mimeType: "audio/pcm;rate=16000" },
}));

不想从零搭音视频管线,可以直接在 LiveKit、Pipecat、Vercel、声网(Agora)、Fishjam 等框架里选 Gemini 作为模型后端——这些平台 9 月 15 日当天就宣布完成适配,框架帮你处理音频采集、打断检测和 Avatar 渲染。

四、成本账:按小时算,不按 Token 算

语音模型不按百万 Token 计价,而是按音频时长计费。Gemini 3.8 Live 的公开口径约合 $1.38 / 小时音频,Extended Thinking 版更高。两个换算能帮你估价:

  • 一路 7×24 客服:$1.38 × 24 × 30 ≈ $994 / 月(一路并发)——对比人工坐席这是一个数量级的差距,但注意这是模型费,不含 TTS/ASR 传统链路的隐性成本(因为根本没有这条链路了)。
  • 一分钟对话约 $0.023:按平均通话 3 分钟算,单次对话成本约 7 美分。做 C 端语音产品可以按这个数算毛利。

另外两点省钱的:会话上下文缓存复用(同一用户连续对话不用重传系统提示与商品库),以及 Live 与 Extended Thinking 分场景混用——简单问答走 Live,只有触发复杂任务时升级,账单立刻好看很多。

五、上线前的四道检查清单

  1. 延迟预算:端到端(用户说完到数字人开口)目标压在 800ms 内,网络层尽量就近接入,音频用 16kHz PCM 减少编解码耗时。
  2. 打断体验:实测各种「半句话打断」场景,确认轮替判断不会抢话或死等;这是语音 Agent 口碑的生命线。
  3. 工具调用的兜底话术:后台 API 超时时数字人不能干等,要提前写好「系统有点忙,我先给您介绍另一款」类的过渡语。
  4. 水印与合规:SynthID 已内嵌,但面向用户的场景仍需在界面明示「AI 数字人」,金融、医疗场景先过内部合规评审。

常见问题

Q:个人开发者能玩 Live Avatar 吗? 底层 Gemini 3.8 Live 通过 Gemini API 和 AI Studio 对所有人开放,可以先做纯语音 Agent;Live Avatar(带脸的形态)当前在 Gemini Enterprise 提供,企业版先行。

Q:和 OpenAI 的 GPT-Live-1 比怎么选? 看榜单和钱:Extended Thinking 82.6% 登顶 Speech-to-Speech 榜单,而谷歌明确打出了「同级能力的几分之一价格」。如果你的场景强依赖 Google 生态(Workspace、Search Live),Gemini 的整合优势更直接。

Q:97 种语言包括中文吗?需要单独配置吗? 包括。开启多语言后模型自动检测并中途切换,中英混说也不需要手动切换,方言口音的识别率官方称有显著提升。

小结

Gemini 3.8 Live 数字人上线,标志着实时多模态交互从「听得见」走向「看得见」:口型同步、自然轮替、后台工具调用三件事在模型侧一次解决,按小时计价的成本结构也让 7×24 数字员工第一次有了清晰的算账方式。先用 Live API 把纯语音链路跑通,再评估 Enterprise 的 Avatar 形态——这是普通开发者风险最低的切入路径。

相关教程

Gemini 3.8 Live 数字人上线:97 种语言实时对口型,语音 Agent 从「有声」到「有脸」的接入实战 | AIHub