GenEvolve开源:图像生成从“写Prompt”走向工具编排智能体

GenEvolve将图像生成变成可学习的搜索、参考选择与生成约束编排流程。

原文标题:一句话生图要过时了?开源图像生成Agent进化出「工具编排」

原文作者:数据派THU

冷月清谈:

GenEvolve 是由港科广、美团、港科大、新加坡国立大学等团队提出的开放图像生成智能体框架,核心思路是把图像生成拆成一条可学习的“工具编排轨迹”:先理解用户需求,再调用文本搜索、图像搜索和生成知识查询,最后形成 prompt-reference program 交给底层生成器渲染。

它主要面向两类任务:一类依赖外部知识,如真实地标、公众人物、商品结构和事件线索;另一类依赖可校验的视觉约束,如文字、计数、布局、材质、属性绑定和美学质量。为训练智能体,团队构建了 GenEvolve-Data 与 GenEvolve-Bench,并通过 Teacher Agent 生成工具轨迹,再结合审计、渲染和过滤形成训练与评测数据。

训练上,GenEvolve 先用 SFT 学会基础工具调用,再通过 GRPO 强化更优轨迹,并引入“视觉经验自蒸馏”,把好轨迹与差轨迹的差异总结为决策经验,蒸馏进部署模型。实验显示,它在 Qwen-Image-Edit 和 Nano Banana Pro 等不同生成器上均能带来提升,说明其学习到的是可迁移的工具编排策略,而不只是单一模型的 prompt 技巧。

怜星夜思:

1、图像生成以后会不会真的从“拼Prompt”变成“搭工作流”?
2、GenEvolve这种先搜索再生成的方式,会不会让图像更真实,但也更容易引入版权或事实错误?
3、如果图像生成Agent能自己学会选参考图和写约束,设计师的价值会被削弱还是被放大?
4、这类图像生成Agent评测用KScore、WiScore够不够?大家更希望看到哪些评测指标?

原文内容

图片
来源:机器之心
本文约2500字,建议阅读5分钟
先搜索,再找参考,最后作画。


图像生成正在从「一句话生成一张图」,走向更接近真实创作流程的开放任务。

在实际使用中,用户常常不只是给出一个 prompt:他可能要求画面对齐某个地标、人物、商品或事件,也可能要求参考图身份一致、材质特殊、或者要求模糊的描述也能表达清楚。面对这些需求,单靠生成模型一次前向推理很难稳定完成。

近期,来自香港科技大学(广州)、美团、香港科技大学、新加坡国立大学等机构的研究团队提出 GenEvolve,一个面向开放图像生成的自我进化智能体框架。它将一次生成建模为一「工具编排轨迹」:智能体先理解请求,再调用搜索、图像检索和生成知识工具,最后把外部证据、视觉参考和硬约束整理成 prompt-reference program,交给不同底层生成器渲染。

  • 论文标题:GenEvolve: Self-Evolving Image Generation Agents via Tool-Orchestrated Visual Experience Distillation

  • 论文链接:https://arxiv.org/abs/2605.21605

  • 项目页面:https://ephemeral182.github.io/GenEvolve/

  • 代码链接:https://github.com/MeiGen-AI/GenEvolve

  • 模型权重:https://huggingface.co/MeiGen-AI/GenEvolve

  • 数据与评测:https://huggingface.co/datasets/MeiGen-AI/GenEvolve-Data-Bench


GenEvolve 使用同一套智能体策略,分别搭配开源 Qwen-Image-Edit 与强生成器 Nano Banana Pro。

从 prompt 到工具轨迹

GenEvolve 关注两类开放生成需求。第一类是 Knowledge-Anchored:生成结果依赖外部世界知识,例如真实建筑、公众人物、商品结构或事件线索。第二类是 Quality-Anchored:结果依赖可校验的视觉质量约束,例如文字、计数、布局、属性绑定、解剖、材质和美学。

为此,GenEvolve 给智能体配置三类工具:文本搜索 search (q) 用于补充事实证据;图像搜索 image_search (q) 用于获取视觉参考;生成知识查询 query_knowledge (skill) 用于激活内部对于文字渲染、空间布局、材质一致性等复杂需求所需要的技能。

因此,一次生成不再只是「写一个更长的 prompt」,而是多轮决策:搜什么、看哪张参考图、调用哪类生成知识、最终程序里必须写入哪些约束。

数据与评测

为了训练这样的智能体,研究团队构建了 GenEvolve-Data 和 GenEvolve-Bench。作者团队没有直接收集普通 prompt-image 对,而是从约 2 万条结构化 recipe 出发,覆盖实体、地标、产品、事件、文字、布局、计数、属性、解剖、材质、美学和创意转化等场景。

每个请求都会先交给 Teacher Agent 走一遍完整工具流程:查事实、找参考、调用生成知识、写出最终 prompt-reference program。之后,数据还要经过程序检查、VLM 审计、GT 图像渲染和视觉过滤,最后切分成 SFT 轨迹、自我进化样本和 对应的 benchmark。

GenEvolve-Data 数据闭环:从结构化 recipe 到工具轨迹、VLM 审计、GT 图像过滤,再切分为训练和评测视图。

自我进化:先筛出更好的轨迹

训练过程分为两步。

首先,GenEvolve 使用高质量 Teacher 轨迹对 Qwen3-VL-8B-Instruct 做 SFT 冷启动,让模型学会基本工具调用和程序写法。

随后进入自我进化的 Rollout 阶段:对同一请求采样多条 rollout,渲染成图像后由视觉判分器和文本判分器共同打分,并使用 GRPO 优化轨迹级奖励。

视觉经验自蒸馏:把「好在哪里」教给模型

仅有轨迹级奖励仍然不够。它能告诉模型「哪条轨迹更好」,却很难说明「好在哪里」。因此,GenEvolve 引入视觉经验自蒸馏:系统比较同一请求下的最优与最差轨迹,把差异总结成结构化 Decision Guide,例如该搜索什么、该选择哪类参考、该避免哪些失败写法。

接下来,这些经验只提供给训练阶段的 privileged teacher。Student 在同一批样本上仍然只看到普通输入,不直接读取经验库;teacher 则在 Decision Guide 的帮助下给出更好的 token 分布。我们再通过 token 级反向 KL,把 teacher 在关键决策 token 上的偏好蒸馏给 student。这样,模型学到的不是一条离线记忆,而是「看到类似请求时应该如何搜索、选参考、组织约束」的决策习惯。

这也是 GenEvolve 和只做 RL 打分优化的主要区别。GRPO 提供的是「哪条轨迹更值得强化」的方向,视觉经验自蒸馏提供的则是更细的 credit assignment:好轨迹到底好在工具计划、参考选择,还是最终 prompt-reference program 的某个约束写法。部署时,student 不需要再查 Decision Guide 或经验 buffer,经验已经被压进模型参数里。

GenEvolve 方法总览:智能体采样多条工具轨迹,比较最优与最差结果,将视觉经验蒸馏回部署模型。

实验结果

在自建的 GenEvolve-Bench 上,研究团队比较了主流直接生成模型和 agentic 工作流。当底层生成器固定为开源 Qwen-Image-Edit-2511 时,GenEvolve 的整体 KScore 达到 0.3663,超过 Gen-Searcher 的 0.3493;在更依赖事实和视觉细节的 Knowledge-Anchored 任务上,提升尤其明显。

当搭配更强的 Nano Banana Pro 渲染器时,GenEvolve 的 KScore 进一步提升到 0.5739,高于 Nano Banana Pro 裸生成的 0.5298。这说明 GenEvolve 学到的不是某个生成器上的 prompt trick,而是一套可以迁移到不同渲染器上的工具编排策略。

GenEvolve-Bench 主结果。GenEvolve 在开源生成器设置和强生成器设置下均取得稳定提升。

消融实验显示,未调优的 Qwen3-VL 工作流已经能利用工具入口,但结果不够稳定;SFT 提升工具调用和最终程序质量;GRPO 提供轨迹级优化信号;加入视觉经验自蒸馏后,模型在 Visual correctness、Knowledge-Anchored 和 Quality-Anchored 等关键维度上继续提升。

研究团队还在公开的 WISE 知识密集型图像生成基准上进行了外推评估。在不做 in-domain 微调的情况下,GenEvolve 使用 8B 开源策略与开源 Qwen-Image-Edit 渲染器,整体 WiScore 达到 0.82,超过 GPT-4o 的 0.80。

WISE 结果。GenEvolve 在开源生成器设置和强生成器设置下超过了之前的开源和闭源模型。

定性对比:橙色示例更依赖外部知识,蓝色示例更依赖内部生成技能。

小结

GenEvolve 的意义在于,它把开放图像生成从单次 prompt 优化,推进到可学习的工具编排过程。对于需要外部知识、参考图一致性和多重硬约束的任务,智能体不只是「调用工具」,而是在训练中学会如何把工具结果转化为有效的生成程序。

目前,GenEvolve 已开源模型、代码、数据与评测集。对于图像生成智能体、工具使用、视觉反馈强化学习和开放生成评测等方向,这套框架提供了一个可复现的起点。

作者与单位

论文作者包括 Sixiang Chen、Zhaohu Xing、Tian Ye、Xinyu Geng、Yunlong Lin、Jianyu Lai、Xuanhua He、Fuxiang Zhai、Jialin Gao、Lei Zhu,来自港科广、美团、港科大和新加坡国立大学。

编辑:文婧



关于我们

数据派THU作为数据科学类公众号,背靠清华大学大数据研究中心,分享前沿数据科学与大数据技术创新研究动态、持续传播数据科学知识,努力建设数据人才聚集平台、打造中国大数据最强集团军。




新浪微博:@数据派THU

微信视频号:数据派THU

今日头条:数据派THU



事实错误这块反而可能会减少一点,因为它不是闭着眼睛幻想,而是先查资料。但版权就比较麻烦了,尤其是公众人物、商品、艺术风格这些,一不小心就从“参考”滑到“复刻”。

3 个赞

关于“KScore、WiScore够不够”,我觉得不够,但已经比只看好不好看强很多。开放图像生成至少要分开评:事实正确、文字准确、构图合理、参考一致性、审美质量,不然一个总分很容易掩盖问题。

3 个赞

有点像 Excel 没让财务消失,反而让不会 Excel 的财务很难受。图像生成 Agent 也一样,设计师不会因为它消失,但不会用这类工具的人,竞争力可能会下降。

3 个赞

这个问题挺现实。我的看法是,搜索不是原罪,关键是系统怎么记录证据来源、怎么过滤不可用素材、怎么控制生成结果与参考图的相似度。否则以后甲方一句“像某某品牌海报”,乙方可能当场冒汗。

2 个赞

我最想看的是失败率和可控性。比如同一个需求生成十次,有几次文字写错?有几次人数错?有几次把地标画歪?平均分高但不稳定,落到生产里还是很难用。

3 个赞

不一定完全替代。Prompt 仍然是入口,但复杂任务里它会变成工作流的一部分。比如要画一个真实地标旁边的限定款商品,模型需要知道地标长什么样、商品结构是什么、画面里哪些不能乱编,这就不是堆形容词能解决的。

3 个赞

如果面向真实设计流程,我希望加一个“返工成本”指标。不是只看第一张图多漂亮,而是看从需求到可交付成品要改几轮。能少改三轮,对打工人来说比榜单多 0.02 分更有意义。

1 个赞

初级执行岗位可能会被冲击,比如单纯出十几版氛围图、改背景、换材质。但能做审美判断和需求拆解的人会更吃香,因为工具越强,越需要有人告诉它什么是“对的”。

1 个赞

关于“拼Prompt还是搭工作流”,我感觉就像拍照软件的发展:普通人按快门,专业摄影师调光、布景、后期。未来图像生成也可能是两层界面,表面一句话,底下自动跑一堆搜索、参考图和约束检查。

3 个赞