ITCOW牛新网 8月27日消息,在Gemini 3.5 Pro尚未发布的情况下,谷歌推出同系列Gemini 3.5 Transcribe语音转文本模型。该模型不只做简单语音转写,可自动删除“嗯”“呃”等口头禅,还能处理说话人说错随即自我更正的内容,输出整洁通顺文本。

性能对比前代Chirp 3引擎:转录整体速度提升约70%,实时语音场景错误率降至5.5%,Chirp 3为7.32%。模型支持85种语言,预录音频最多识别3位说话人,还可导入自定义词汇表识别专业术语。

该模型现已用于Pixel11的Gboard键盘Rambler功能,后续将登陆谷歌更多产品服务。需要注意,AI会改写润色原始口语,不适合需要一字不差留存原话的场景。