Qwen-Image-3.0 发布:主打复杂版面、小字渲染与多语言图像生成

Qwen-Image-3.0 发布,重点提升复杂版面、小字、公式、多语言和 UI 图像生成能力。

原文标题:Qwen-Image-3.0:落字成画,字字如印

原文作者:阿里云开发者

冷月清谈:

阿里云推出 Qwen-Image 系列第三代图像生成基础模型 Qwen-Image-3.0,重点从“好看”转向“好用”。新版本强调三类能力:一是内容丰实,支持最长 4.5k token 输入,可一次性生成包含多主题、多图表、多文字的复杂版面,如九宫格信息图、教学 PPT、试卷和漫画分镜;二是细节真实,能够渲染 10px 小字、复杂公式、论文排版、手写批注、人像毛孔发丝和物体纹理,并支持古画修复等高精度场景;三是知识厚实,覆盖 12 种语言、100+ 艺术风格以及网页、游戏、直播、编程工具等 UI 仿真能力。官方称该模型面向设计、教育、内容创作、电商、学术配图等生产力场景,目前已在阿里云百炼、千问 AI 平台开放 API 邀测,Qwen Studio 和千问 APP 也将提供体验。

怜星夜思:

1、Qwen-Image-3.0 这种强调“小字和复杂版面”的图像模型,会不会真的改变海报、课件、试卷这类内容的制作流程?
2、文章里提到可生成论文页、医学图解、昆虫分类图等内容,这类“看起来很专业”的图片应该怎么避免误导?
3、如果图像模型已经能做 UI 仿真、游戏界面、直播界面,未来设计师的价值会更偏向哪里?
4、4.5k token 输入听起来很强,但对普通用户来说,写超长提示词真的现实吗?

原文内容

AI图像生成模型的进步有目共睹——画面越来越精致,风格越来越多元。但当需求从"生成一张好看的图"转向"完成一项实际工作"时,局限随之显现:模型能生成一张惊艳的写实人像,却难以渲染一份排版精确的数学试卷、一页公式复杂的学术论文,或是去修复破损的古画。


一张图,能不能从"好看"真正走向"好用"?今天,给出我们的答案。


我们正式推出 Qwen-Image-3.0,Qwen-Image 系列的第三代图像生成基础模型。如果说 Qwen-Image-1.0 的关键词是 "准",Qwen-Image-2.0 的关键词是 "准 多 齐 美 真",那么 Qwen-Image-3.0 的核心主线只有一个字——""

这个""体现在三个维度:

  • 内容丰实支持最大 4.5k token 输入,轻松生成报纸、分镜、试卷等复杂版面。

  • 细节真实支持 10px 小字精准渲染,毛孔、发丝细节生动还原,逼真的微观级刻画。

  • 知识厚实支持12国语言原生渲染,主流网页、游戏、直播等界面仿真,拥有丰富的世界知识。

一言以蔽之,Qwen-Image-3.0 不只是在追求"好看",更在追求“好用”——让图像生成真正成为可落地的生产力工具。

现在,阿里云百炼、千问AI平台已开通API邀测,Qwen Studio和千问APP也即将上线供免费体验。

内容丰实:能画多复杂?

内容可横展:知识九宫格

这是一张由Qwen-Image-3.0准确渲染的数学PPT,包括空间关系、数学符号、定理描述等等这些丰富的视觉内容,有着合理的排版和相对位置关系。

而这只是Qwen-Image-3.0真实能力的“1/9”,因为这张图事实上只是Qwen-Image-3.0生成的一个复杂9宫格图片中的一个格子。让我们看原图:

上面整张图是Qwen-Image-3.0一次性生成的,而非多个图片拼接而成。这张图片难度在于,每个格子都是一张复杂信息图,如果要精准的描述完整的九宫格,整整需要3.7k个token。


这3.7k token需要完整的刻画隧道安全漫画、空间几何教学、《出师表》文体分析、物理抛体运动、生物寄生虫科普、右胸疼痛医学图解、群论 Sylow 定理、银行内控管理信息图、以及细胞 DNA 结构对比——每一格都包含精确的中英文文字、公式、图表和漫画人物等等。


而这对于Qwen-Image-3.0来说依然轻松,因为Qwen-Image-3.0 将可接受的指令长度提升至 4.5k token,这意味着模型可以理解和渲染极其复杂、信息密集的视觉版面


这就是Qwen-Image-3.0"内容丰实"的一个重要特点:内容可横展(横向扩展)横展能力反映了模型语义并置与空间控制的实力——能够让多种概念在同一画面中有序布局、互不干扰地渲染。

内容有纵深:界面嵌套

横展能力考验的是"在一张画布上摆放多少个并列元素",纵深能力则考验模型的语义解构与逻辑嵌套——能否在一幅图中层层递进地渲染多个嵌套的界面。

以下示例用一条指令在一幅图中从外到内依次展示了:VSCode 编程界面 → 千问聊天界面 → 社交媒体聊天界面 → 手冲咖啡海报。每一层都保持了各自 UI 的真实风格与细节,形成了"画中画中画"的视觉纵深。

细节真实:能画多逼真?

如果说"内容丰实"解决的是"画多少"的问题,那么"细节真实"解决的是"画多细"的问题。Qwen-Image-3.0 在微观细节上的渲染精度达到了新的高度:10px 小字清晰可辨,毛孔与发丝纤毫毕现,肌肤质感逼近摄影级真实。

鲸鲨的知识图解

这是一张关于鲸鲨的知识图解,包含大量的文字和插图,而Qwen-Image-3.0能够准确渲染每个区域。

学术论文PDF

学术论文是小字渲染的极限测试场,模型完整渲染了一整页代数几何领域的学术论文,包含多行复杂公式推导。上标、下标、花括号、分数线、多行对齐等 LaTeX 排版元素均准确呈现,小字号下依然保持了极高的可读性。

笔记批注

模型在书页上叠加了逼真的红色手写批注——下划线、波浪线、圈画、箭头和简短评语,字迹自然流畅,完美模拟了高中生课堂笔记的风格。


人像摄影

在人像摄影中,模型也能够刻画非常细腻的纹理。

除人像之外,模型也能刻画其他物体的纹理细节。

古画修复

给定一幅破损或不完整的传统绘画,模型能够修复缺失的部分,同时保持原有的艺术风格和笔触。模型以与原画一致的笔法完成了鹰搏图的修复,保持了水墨渐变、羽毛质感和构图平衡,同时去除了霉斑和破损痕迹。

知识厚实:理解的知识边界有多广?

"内容丰实"回答了"能画多复杂","细节真实"回答了"能画多逼真",而"知识厚实"回答的是"能画多广"。Qwen-Image-3.0 拥有覆盖 12 国语言、多种字体、100+ 艺术风格和多种 UI 界面的渲染能力,其背后是模型对世界知识的深度理解。

西班牙语渲染

仿真UI界面

复杂信息图

模型结合强大的世界知识,基于真实图像生成一个复杂的信息图。模型在保留原始昆虫照片主体的同时,添加了分类学信息、形态标注、放大细节视图和比例尺等专业元素,生成了一张可以直接用于学术发表的研究配图。

总结

Qwen-Image-3.0 以"内容丰实、细节真实、知识厚实"三大特色为支撑,在多语言产品海报、复杂 UI 界面等高价值生产力场景中取得了显著突破。我们相信,随着图像生成模型能力的持续提升,它将在设计、内容创作、教育、电商等更多领域中释放出真正的生产力价值。

以上就是本次更新的主要内容,祝大家使用 Qwen-Image-3.0 愉快!

千问AI平台-Agent而生,驱动AI生产力
扫描下方二维码,直达千问AI平台体验

点击阅读原文即可体验!

针对“专业图片如何避免误导”:最简单的原则是,AI 负责视觉表达,人负责事实背书。尤其医学、法律、金融、论文公式这些场景,生成图不能直接当结论用,至少要有专业人员复核。

2 个赞

我觉得要加明显标注,比如“AI 生成示意图,非诊断依据”。现在很多人看到排版像论文、配图像教材,就默认它是真的,这个风险比画错一只手严重多了。

3 个赞

如果只是“帮我画个很像某某 App 的界面”,AI 会越来越快。但真正难的是“别像别人,还要好用,还要老板喜欢,还要开发做得出来”。这四件事叠一起,AI 也得沉默三秒。

2 个赞

长上下文的价值不一定是让人手写长 prompt,而是让模型能吃下更完整的材料。比如直接给一份产品说明书,让它生成发布会主视觉,这就比一句话生图实用很多。

3 个赞

提示词越长越像甲方需求文档:写的时候很感动,模型理解成什么就不好说了。所以后面真正重要的可能是结构化输入,而不是比谁 prompt 写得像小作文。

3 个赞