A²-Edit:用粗掩码也能完成跨类别参考图局部编辑

A²-Edit 支持任意物体与粗掩码参考图编辑,提升跨类别泛化和局部融合效果。

冷月清谈:

上海交通大学与上海创智学院团队提出 A²-Edit,面向参考图引导的图像局部编辑任务,重点解决两个落地难题:现有模型常局限于特定物体类别,以及过度依赖像素级精细掩码。A²-Edit 采用混合 Transformer 专家路由,在 Attention 与 FFN 中动态选择适合当前类别的专家分支,使服装、人像、动物、家具、建筑等不同对象能在统一框架下建模。团队还提出掩码退火训练策略,训练过程从精细分割掩码逐步过渡到噪声粗掩码和边界框,让模型学会根据上下文推断结构与边界。为支撑多类别训练,研究构建了 UniEdit-500K 数据集,覆盖八大类别、209 个细分类别。实验显示,A²-Edit 在多个基准和自建测试集上优于主流方法,尤其在粗掩码条件下保持较强鲁棒性。不过当前模型峰值显存约 42GB,部署成本仍较高,过大掩码或提示不足时也可能产生歧义。

怜星夜思:

1、如果图像编辑模型不再依赖精细掩码,普通用户的创作流程会发生多大变化?
2、A²-Edit 用专家路由处理不同物体类别,这种思路会不会成为多模态模型的常见路线?
3、参考图编辑在电商、影视、虚拟试穿里很有价值,但怎样避免被滥用于造假或侵权?
4、论文里提到峰值显存约 42GB,这类模型距离个人电脑本地使用还有多远?

原文标题:A2-Edit:突破物体类别与掩码精度限制,实现精准参考图编辑

原文作者:机器之心

原文内容


把参考图里的物体自然地「搬进」另一张照片,是电商商品合成、虚拟试穿、影视换脸与个性化创作的关键能力。真正落地却要跨过两道门槛:模型往往只擅长某一类物体,且高度依赖像素级精细掩码。


上海交通大学联合上海创智学院团队提出 A²-Edit,它以统一框架支持任意物体类别和任意精度掩码,通过混合 Transformer 专家路由、掩码退火训练及 50 万级多品类数据,让用户只需给出粗略区域,也能完成身份一致、结构完整、自然融合的参考图引导局部编辑。



  • 论文标题:A²-Edit: Precise Reference-Guided Image Editing of Arbitrary Objects and Ambiguous Masks

  • 论文链接:https://arxiv.org/abs/2603.10685

  • GitHub 仓库:https://github.com/huayu-zheng/A2Edit


参考图引导编辑的两道固有枷锁


参考图引导图像修复的目标,是把参考图中的主体语义迁移到目标图的指定区域,既保住主体身份,又与周围场景自然融合。该任务可控性强、落地价值高,却在真实使用中仍受到跨类别统一建模能力不足与精细掩码依赖严重两方面的制约。


首先,不同类别对象的编辑目标与表征需求存在显著差异:服装关注纹理一致,人像强调身份保持与形变合理,车辆、家具和建筑等刚性对象则更依赖几何结构、透视关系与材质属性的准确建模。然而现有方法通常采用单一共享参数路径处理不同类别输入,缺乏面向类别差异的动态建模与专门化机制,导致模型在跨类别场景中的性能下降。


数据侧同样存在局限性,品类分布高度同质,模型学不到通用表征。


其次,现有方法普遍要求高精度分割掩码来严格框定编辑区域,但真实场景中无论是用户手绘涂抹还是检测框自动生成,均难以获得与目标轮廓严格贴合的精细掩码。当输入掩码不够精确,模型性能通常显著下降,并容易产生边界伪影、内容泄漏、结构异常及背景破坏等问题。


专家路由 + 退火训练,架构层面双管齐下


A²-Edit 跳出「一条通路吃下所有品类」的旧范式,设计混合 Transformer 专家路由架构配合退火训练算法从架构层面解决模型跨类别统一建模能力不足的问题。



  • 混合 Transformer 专家路由,实现品类差异化建模


模型将传统混合专家架构的条件路由机制由仅作用于前馈网络(FFN)扩展至注意力模块(Attention)与前馈网络的联合建模,并在各 Transformer 层中嵌入混合 Transformer 块(MoTB)。门控网络根据输入特征所包含的语义信息与类别属性,自适应计算各专家的路由权重,从而动态选择与当前编辑对象相匹配的参数分支。


路由采用锚点引导策略(AGR):主干专家作为稳定的知识锚点始终保持激活;辅助专家则根据门控网络输出进行动态选择。每层只路由一次,Attention 与 FFN 共享同一组权重。推理时仅激活主干与少量辅助专家;面对分布外输入,门控网络还能按特征相似度组合专家,提升泛化稳定性。


  • 掩码退火训练策略,彻底摆脱精细掩码依赖


MATS 是在训练中逐级放宽掩码精度,引导模型从「依赖严格几何边界」转向「依靠上下文语义推理与内容生成」。


整个训练分为三个阶段:首先使用精细分割掩码学习基础编辑能力;随后通过形态学膨胀和 Perlin 噪声模拟真实用户的手绘误差;最后直接采用目标边界框进行训练,迫使模型依靠上下文推断目标的姿态、尺度和结构。


经过这样的渐进训练,模型面对粗掩码甚至检测框时依然能够生成自然、稳定的编辑结果。


  • UniEdit-500K:迄今覆盖最广的多品类编辑数据集


为支撑统一框架训练、破解数据同质化,团队自建 UniEdit-500K,共包含 50 万余组参考 — 目标图像对,覆盖服装、人像、动物、植物、配饰、家具、交通工具和建筑八大类别、209 个细分类别,是目前覆盖范围最广的多品类参考图编辑数据集之一。 



实验表现


研究团队在 VITON-HD、AnyInsertion 两大标准基准与自建 UniEdit 测试集上,对比 多种主流图像编辑方法,并同时评测精细掩码与粗掩码两种条件,量化指标与视觉效果均实现优势突破。


定量层面,A²-Edit 在 DINO-I、CLIP-I、LPIPS、FID 与 VLM 评分上均取得最优结果。从精细掩码切换到粗掩码时,多数基线明显退化,而 A²-Edit 的四项传统指标基本无损甚至提升,展现出突出的掩码鲁棒性。


由于 CLIP、DINO、LPIPS 等指标难以刻画边界瑕疵与局部一致性,团队额外引入基于视觉语言模型的评测协议,从边界质量、视觉真实感、局部一致性三个维度打分,A²-Edit 同样领先。24 位参与者的用户研究中,模型在与全部基线的两两比较里均获得更高偏好率。


用户研究结果:24 位参与者在与各基线的两两对比中对 A²-Edit 的偏好率


定性层面,全部使用手绘粗掩码测试。A²-Edit 则在服装、人像、宠物、建筑等多品类中稳定输出语义一致、结构完整的结果,服装保住版型与纹理,人像维持强身份一致性,建筑替换能妥善处理前后景融合。


手绘粗掩码下与多种图像编辑方法的定性对比


消融实验充分验证了各模块的必要性:移除 A²-Edit 框架,或退回仅在 FFN 加专家的常规 MoE,全品类生成质量与量化指标均明显下滑;移除 UniEdit-500K 后,细节生成与任务意图理解显著退化;MATS 若只用精细掩码训练,模型会过度贴合边界,面对粗掩码难以完成有效编辑。逐步加入增强粗掩码与边界框训练后,问题持续缓解


模型局限


从工程落地角度看,A²-Edit 仍有进一步轻量化空间:当前峰值显存约 42GB,部署门槛高于多数消费级显卡;当用户给出的掩码范围过大、同时缺少明确文本提示时,仅凭参考图和粗定位也可能出现多种合理解释。未来可继续从专家压缩、低比特部署、更强交互提示和长尾类别数据扩展等方向推进。


总结


A²-Edit 依托混合 Transformer 专家路由与掩码退火训练两项核心设计,并以 UniEdit-500K 提供多品类数据支撑,构建出一套面向任意物体类别、容忍不同掩码精度的统一参考图引导编辑方案。


它在保持主体身份与细节的同时降低了精细分割门槛,系统缓解了传统方法品类受限、掩码依赖和跨域失效等问题,为虚拟试穿、电商合成、影视制作、广告创意与个性化内容生产提供了更通用的技术路径。


© THE END

转载请联系本公众号获得授权

投稿或寻求报道:liyazhou@jiqizhixin.com

一句话:能把猫自然搬进宫殿,也能把老板自然搬进热搜。技术本身很酷,但平台治理和水印检测不跟上,迟早会出幺蛾子。

1 个赞

从工程角度看,专家路由也有麻烦:训练复杂、负载均衡难、部署不友好。A²-Edit 的方向挺对,但如果显存还是 42GB,离普通创作者桌面端使用还有距离。

3 个赞

我感觉短期还是云端为主。42GB 显存不是“稍微贵点”的问题,而是很多创作者根本没有这种硬件。除非后续能压到 12GB 或 16GB,才比较像大众工具。

1 个赞

这个问题有点像公司分部门。一个全能员工什么都懂一点,但真遇到建筑透视和人脸身份保持,还是得找专门同事。专家路由就是模型里的“找对人办对事”。

2 个赞

这个问题我站普通用户视角说一句:最大的变化是耐心成本下降。现在很多人不是不会画掩码,是画两次效果崩了就不想玩了。如果随手涂一下也能出图,那电商主图、头像、宠物合成之类的使用频率会高很多。

3 个赞

回答“距离个人电脑本地使用还有多远”:以 42GB 峰值显存看,普通消费级显卡基本没戏,至少需要高端工作站或云端推理。要进入个人电脑,可能需要模型蒸馏、量化、专家压缩和更高效的推理框架一起上。

1 个赞

42GB 这个数字对我来说翻译一下就是:我的电脑听完沉默了,风扇都不敢转。现阶段普通人还是等在线 Demo 或者集成到商业产品里更现实。

1 个赞

我觉得会流行,但不一定都叫专家路由。核心思想是“别让一个脑子同时精通所有工种”。图像编辑里,修脸、换衣、换车、换家具本来就是不同活儿,分几个专家很合理。

2 个赞

别忘了很多 AI 工具一开始也很吃显存,后来靠量化、LoRA、TensorRT、缓存优化慢慢下来了。A²-Edit 如果开源生态有人接手优化,说不定一年内就能看到低配版。

3 个赞