ITCOW牛新网 7月21日消息,阿里巴巴今日推出 Qwen‑Image 系列的第三代图像生成基础模型——Qwen‑Image‑3.0。与前两代分别强调“准”和“准多齐美真”不同,这一代的核心主线被浓缩为一个“实”字,即从追求画面好看转向解决实际工作中的复杂可视化需求,让图像生成真正成为可落地的生产力工具。

据ITCOW牛新网了解,Qwen‑Image‑3.0 的“实”具体体现在内容丰实、细节真实与知识厚实三个维度。在内容层面,模型将可接受指令长度提升至最大 4.5k token,能够一次性生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的知识图解、复杂 UI 界面甚至报纸试卷等密集版面,无需多图拼接。

官方展示的一张由模型单次生成的九宫格图便耗费约 3.7k token,精准刻画了隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、医学图解、群论定理、银行内控信息及细胞 DNA 对比等九类异质内容,且各格子间布局有序、互不干扰,展现出极强的语义并置与空间控制能力。

纵深上则支持多层界面嵌套渲染,可用一条指令实现从 VSCode 编程界面到千问聊天、社交通讯再到手冲咖啡海报的“画中画中画”逻辑递进。

细节真实方面,Qwen‑Image‑3.0 将微观渲染精度推至新高度,支持 10px 小字清晰可辨,毛孔、发丝及物体纹理纤毫毕现,逼近摄影级质感。无论是整页代数几何学术论文的 LaTeX 复杂公式(上标、下标、花括号、分数线及多行对齐),还是书页上模拟高中生风格的红色手写批注(下划线、波浪线、圈画与箭头评语),亦或是人像肌肤与器物表面处理,均能在微小尺度下保持极高可读性。模型还具备古画修复能力,可在保持原作笔触、水墨渐变与构图平衡的前提下补全缺失部分并去除霉斑破损。



知识厚实则回答了“能画多广”的问题。新模型原生支持 12 国语言与 20 多款字体渲染,覆盖 100 多种艺术风格及主流网页、游戏、直播等仿真 UI 界面,背后依托对世界知识的深度理解。

例如可结合真实昆虫照片生成带分类学信息、形态标注、放大细节与比例尺的学术级信息图,也能精准输出西班牙语等多语种商业海报。


目前 Qwen‑Image‑3.0 已在阿里云百炼与千问 AI 平台开通 API 邀测,Qwen Studio 和千问 APP 也即将上线免费体验,有望在多语言产品设计、教育课件、电商素材及科研配图等高价值场景中降低生产成本并提升交付效率。