ITCOW牛新网 7月29日消息,OpenAI 今日在 X 平台官宣上线两款专用语音转录模型 GPT-Live-Transcribe 与 GPT-Transcribe,并同步开放 API 调用入口,把“听懂真实世界音频”从通用大模型的附带能力拆成独立计费的产品线。两款模型分工明确:前者为低延迟实时场景而生,后者面向已录制音频与批量异步任务优化,共同替换掉此前 Whisper 系列在部分生产环境里的位置。

OpenAI 推出 GPT-Live-Transcribe 与 GPT-Transcribe 双转录模型

据ITCOW牛新网了解,计费按分钟切割得很细——GPT-Live-Transcribe 每分钟 0.017 美元(约 0.12 元人民币),GPT-Transcribe 每分钟 0.0045 美元(约 0.03 元人民币),实时通道单价约为异步通道的 3.8 倍,价差对应低延迟工程成本。官方强调新模型在上下文理解、重口音识别、专业术语与数字短语抓取、强背景噪声下的语音分离上均显著优于旧代,不再把“转录”当成纯声学任务,而是借语义上下文做自由形式纠错。

在 Context Aware ASR 基准里,GPT-Transcribe 引入上下文后语义准确率从 41.6% 抬到 45.2%;Common Voice 22 种语言错误率压到 19.27%,远低于 Whisper-1 的 40.37%;真实世界录音九语种错误率 8.98%,同样把 Whisper-1 的 15.21% 甩在身后。

从直播字幕、会议同传、客服语音归档到多语种媒体转写,OpenAI 正把语音入口的“准确”与“即时”拆成两张 API 账单,也让 Whisper 的开源遗产逐步退居边缘、由闭源专用模型承接高价值生产负载。