ITCOW牛新网 9月18日消息,阿里千问推出全新原生全模态模型Qwen3.8‑Omni‑Flash,已上线千问AI平台,可统一处理文本、图片、音频、视频,上下文窗口可达100万Token,百万Token图文音视频输入定价0.8元。

阿里千问发布Qwen3.8‑Omni‑Flash原生全模态大模型,支持百万Token图文音视频输入

对比上一代Qwen3.5‑Omni‑Plus,30项评测平均得分提升超26%;音视频智能体、代码、长任务测试提升明显。官方称音视频综合能力接近Gemini 3.8 Flash,音频表现实现超越;API成本大幅下调,每小时音频输入价格降幅超98%,音视频输入降幅超93%。

阿里千问发布Qwen3.8‑Omni‑Flash原生全模态大模型,支持百万Token图文音视频输入

配套开源Qwen‑MM‑Plugins、Qwen‑Live Harness组件,支撑长音视频按需感知、工具调用与实时全模态交互。业务场景覆盖:最长一小时会议音视频解析,做说话人区分、纪要、待办梳理;短剧翻译配音、MV生成、完整长电影AI解说;还可以自主做小模型微调优化、把数小时视频导出PDF图文笔记、从演示视频提炼可复用Agent技能。

同步推出Qwen3.8‑Omni‑Flash‑Realtime实时版本,支持音视频流实时响应、工具调用;实现“听声辨位”,结合视觉与空间音频判断声源方位距离,也支持带口音口语实时陪练。 在Agent模式下,该模型处理视频任务Token消耗下降约45.7%。目前该模型通过API对外提供服务。