ITCOW牛新网 9月11日消息,OpenAI正式把GPT‑Live‑1实时语音模型对外开放API接口,开发者可以基于该模型搭建各类低延迟实时语音应用,支持全双工对话,能够一边收听用户语音一边输出回答,妥善处理对话中途打断、停顿以及环境背景噪音。

OpenAI将GPT‑Live‑1接入API

该模型把语音理解和语音输出整合在同一套体系内部,不再走传统语音转文字、大模型处理、文字转语音的串联链路,有效降低交互延迟。复杂推理、工具调用的任务,可以交给后端文本模型完成。开发者借助系统提示词,能够调整AI说话的语气、语速与对话风格,还可以自由选择后端模型、工具集与智能体框架。模型自带原生语音转写、字母数字识别、关键词偏置、轮次检测等能力,适配电话业务场景,可用来打造客服、餐厅预订这类电话语音智能体,还可以对接企业内部系统,完成业务操作,必要的时候转接人工坐席。

从前期合作项目的实际测试结果来看,语言学习平台使用该模型后,学习者思考停顿阶段被误打断的次数相比旧的轮次系统下降接近八成;医疗服务平台借助它,直接删减约2.3万行业务代码,大幅缩减开发工作量。对比测试显示,GPT‑Live‑1在全双工基准测试当中得分比GPT‑Realtime‑2.1高出30个百分点,搭配GPT‑6 Astra中等推理强度时,在端到端语音智能体任务测试中拿到第一名。

计费层面,GPT‑Live‑1前端语音层按每分钟0.05美元收费,后端模型与工具调用的开销需要另外计算。官方同步新增十二款合成语音音色,后续还会持续扩充语音种类与语言覆盖范围。