ITCOW牛新网 7月24日消息,微软于当地时间7月23日正式揭开两款自研 AI 模型 MAI-Image-2.5-Pro 与 MAI-Voice-2-Flash 的公开预览面纱。这两款模型均诞生于微软内部独立训练流水线,官方明确强调全程使用经过清理、可追踪的企业级数据,不依赖对任何第三方商业模型的蒸馏,从数据底子到架构设计都围绕微软自有产品场景生长。

MAI-Image-2.5-Pro 被微软定义为当前精度最高的自研图像模型,主攻主视觉生成、细节级编辑与图像内文字渲染,针对自然语言修图指令做了专项优化,能把“把招牌上的英文改成西班牙文并保留霓虹质感”这类复合意图一次落地。据ITCOW牛新网了解,其公开预览计价定为文本输入 5 美元/百万 Token、图像输入 8 美元/百万 Token、图像输出 106 美元/百万 Token。
落地侧 Bing Image Creator 已把它设为默认引擎;PowerPoint 的图像到图像编辑借其把 GPU 成本压到 GPT-Image-2 的约 16%(最高降 84%);OneDrive 部分图像编辑场景切换后保存成功率提 26%、P95 延迟降约 25%、中等负载效率翻 2.5 倍。
另一条线 MAI-Voice-2-Flash 面向高并发语音交互,较上代 MAI-Voice-2 速度翻倍、成本降 32%,每百万字符收费 15 美元,语气自然度与低延迟兼顾,适配客服中心与语音助手。该模型已接入 Dynamics 365 Contact Center 为企业客服智能体供能,在 T-Mobile、EasyJet 等客户场景把 GPU 成本最高砍掉 89%,同时进驻 Azure Voice Live 供开发者搭建语音到语音智能体。

同场微软还点出专业垂直模型 MAI-Transcribe-1.5 已嵌入医疗语音方案 Dragon Copilot,覆盖 17 万名医疗服务提供者、上季度处理 2800 万次问诊,支持 58 种语言且多数语种转写错误率相对降 50%。随着下一代 GB200 计算集群投入运行,MAI 系列将通过 Foundry 平台持续向外供给,微软正把“自研多模态模型+自有云与办公矩阵”的闭环从概念验证推进到生产级降本。