arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

腾讯混元、复旦等提出WithEveryone,10人群像身份覆盖率达97.3%

arXiv 2608.20336 cs · cs.CV

给出多张人物参考照,再要求AI把所有人放进同一张合影,人数一多就容易漏人、重复或贴上一张原脸。腾讯混元、复旦大学、香港大学联合提出WithEveryone,把身份、位置和姿态先做成结构化计划,再据此生成最多包含10个指定身份的群像。

论文在身份不重叠测试集上报告,WithEveryone覆盖了97.3%的请求身份,重复率为2.8%。目标场景中的人脸相似度由GPT-Image-2的0.462提高到0.499,直接复制参考脸造成的拼贴痕迹则从0.169降到0.055。

多人生成难在把“谁”放到正确位置

单人身份保持通常只需让生成结果像参考人物。群像同时多出一层对应关系:第3张参考照应该出现在画面左侧还是后排,哪个人拿手机,谁与谁相邻,都要在生成过程中保持一致。只把多个人脸特征一起送进模型,容易让不同身份互相污染。

WithEveryone把每个选中身份编码为带地址的Token。模型先理解文字要求和参考人物,再输出身份—布局计划,明确每个人的大致位置、身体框和姿态。布局被渲染成视觉条件后,图像生成阶段不必重新猜测人员分配。

WithEveryone先推理人物关系与布局,再生成多人合影

WithEveryone的流程把群像生成拆为推理、布局和生成三个阶段。

这种设计处理的是多人生成最常见的绑定错误。模型即使画出了足够数量的人脸,如果把两位人物的身份特征混在一起,或让同一个人出现两次,也不算完成请求。显式计划让数量、位置和身份能分别检查。

用标注人脸区域监督目标身份

多人训练还有一个难点:预测图里有多张脸,系统必须判断哪一张该与哪个参考身份比较。传统做法依赖人脸嵌入自动匹配,早期生成结果噪声大时,错误匹配会反过来干扰训练。

团队提出Layout-Grounded ID Loss,利用已标注的人脸区域直接监督预定身份,不再让模型从一组模糊人脸中自行配对。ID Representation Forcing还要求模型在合成整张图之前,为每个身份先形成单独预测,使身份信息不会在复杂场景中被背景和其他人物淹没。

论文展示的参考人物、布局规划与不同风格群像结果

同一组参考身份可被安排进自拍、室内合影和风格化群像,人物数量与位置由布局计划约束。

这套损失针对的是训练对应关系,并不等于系统完成了精确的人体编辑。服装、手部、遮挡和复杂姿态仍由图像生成器共同决定,论文的主要评价重点是身份覆盖、相似度、重复和复制痕迹。

97.3%覆盖率与2.8%重复率要一起看

身份覆盖率衡量请求中的人物是否都出现在结果里,重复率检查同一身份是否被错误生成多次。两项指标必须配合:只追求覆盖可能用重复脸凑人数,只追求低重复又可能直接漏掉难画的人。

在论文构建的身份不重叠基准上,WithEveryone达到97.3%覆盖率和2.8%重复率。目标—场景身份相似度为0.499,高于GPT-Image-2的0.462;复制粘贴伪影指标由0.169降至0.055,说明相似度提升没有主要依靠把参考头像原样贴进画面。

项目页对多人身份保持方案给出的动态对比

项目演示对比了多人身份保持效果,重点观察同一参考身份在合影中的保留情况。

这些数字来自论文设定的测试集和评价模型,不代表任意光照、年龄变化或极端遮挡下都能得到相同结果。人脸相似度也只是身份保持的一项代理指标,不能替代人工判断整张合影是否自然。

从群像生成走向可编辑的人员编排

显式布局让后续编辑有了清晰入口。用户可以在生成前调整谁站在前排、谁靠近镜头,或把某个身份移动到指定区域,而不必只靠反复改提示词碰运气。婚礼合影、影视预演和多人广告素材都存在这类人员编排需求。

项目页展示的多人风格化生成案例

项目页展示了同一群体在不同视觉风格中的生成结果。

下一步需要检验更复杂的身体互动、遮挡和连续镜头。静态图中保持一张脸,与视频里让多个人物在转身、远离镜头后仍保持身份,是不同难度的任务。布局计划若能继续约束时序位置,才可能扩展到多人视频和可控镜头调度。

项目页已经给出方法和案例,代码页面标注为将公开。当前成果仍是一篇研究论文,不能据此理解为腾讯已经上线面向公众的群像产品。

参考资料

https://arxiv.org/abs/2608.20336

http://doby-xu.github.io/WithEveryone/

http://github.com/Doby-Xu/WithEveryone/