ITCOW牛新网 9月16日消息,当地时间9月15日,谷歌正式发布两款全新实时语音对话大模型Gemini 3.8 Live、Gemini 3.8 Live Extended Thinking,官方称其为目前旗下能力最强的实时对话模型,在并行推理与交互智能化上实现升级。

Gemini 3.8 Live

两款模型定位形成差异化,Gemini 3.8 Live主打成本优势,适合大规模商业部署,兼顾对话流畅度与视觉理解;Extended Thinking版本面向高难度复杂任务,强化多步骤推理能力,在多项语音基准测试当中拿到靠前名次。其中Extended Thinking拿下语音对语音质量指数总榜第一,多项音频推理测试取得亮眼得分。

交互能力层面,Gemini 3.8 Live可以近实时处理画面输入,对话过程中自动识别、切换97种语言,还能够在后台调用工具与API,不会打断当前语音对话。Extended Thinking实现推理与语音输出同步进行,处理复杂任务时可以向用户同步后台处理进度,用自然话术反馈思考过程。

安全方面,该系列模型输出的AI音频全部嵌入SynthID隐形水印,便于识别AI生成音频,防范虚假信息传播。

开发者可通过Gemini Live API完成应用搭建,谷歌已经和声网、LiveKit等平台达成适配,同时联动多家企业推进行业落地。目前两款模型已经开放推送,开发者可在API与AI Studio体验;企业用户可通过Gemini Enterprise抢先试用,普通用户分别可在Search Live、Gemini Live当中体验对应能力,部分Workspace、Gmail等功能仅限对应订阅用户开放。