arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

北大、商汤、浙大让AI看一组示例就学物理变化,覆盖74种图像变换

作者:arXivDaily编辑部 arXiv 2608.24119 cs · cs.AI · cs.CV

给AI一组“变化前—变化后”的图片,再给一张新图,让它照着示例完成同类编辑。现有视觉上下文学习擅长颜色、材质和外观迁移,却常忽略物体结构、相互作用和环境条件。北京大学、商汤研究院、浙江大学提出TransPhy,把任务拆成物理规则推断和结果渲染。

团队同时建立PhysVICL-74,包含74种物理变换、5240对源—目标图像,组合成近7.5万个训练与评估上下文。规则覆盖热物理、反应、几何、时间变化、机械过程和动作,并分别测试已见规则的新实例与训练中未见规则。

外观相似不等于物理变化正确

“把杯子变成红色”主要改像素外观;“让冰块融化”还要考虑材料、形状、容器和周围状态。同一变换不能机械复制示例区域:蜡烛融化、金属生锈、物体压缩或植物开花,对查询图中的位置和结果都有不同约束。

论文Figure 1:数据集覆盖热物理、反应、几何、时间、机械和动作六类变化,并要求模型从示例推断规则。

基准中的一组上下文由示例输入A、示例结果A′、查询图B和目标B′组成。团队先收集基础图像和规则实例,再使用图像生成模型补齐目标与新增实例,最后组成同规则、不同对象的配对。生成式数据扩大了覆盖面,也限定了结论:泛化成绩首先反映模型在该合成与整理流程内的迁移能力。

先写出目标状态,再进入生成器

TransPhy先让理解分支说明示例发生了什么,并为查询图写出具体目标状态。比如示例是固体融化,系统要判断查询对象是否应变小、摊开或进入容器,而不是只复刻颜色。这个中间描述把规则与查询场景绑定。

论文Figure 2:理解分支预测物理规则和查询目标状态,生成分支再依据局部变化线索合成B′。

生成阶段使用Token级混合专家。不同位置的Token可路由到不同专家,变化区域、交互区域和应保持不动的背景不必共享同一处理方式。路由由局部转变线索引导,避免整幅图都套上同一种效果。

已见规则与未见规则分开测

已见规则测试换新的物体和场景,未见规则测试训练中没有出现的变化。论文用规则遵循、查询内容保持和感知质量等指标比较VisualCloze、RelationAdapter、LoRWEB等方法;TransPhy在三类规则和未见规则设置中取得更好的综合表现。

论文Figure 3:左侧为已见规则迁移到新实例,右侧为训练中未见规则,不同方法输出与TransPhy对比。

定性例子包括融化、积雪、切开水果、材料变化、人物金属化和场景光效。图中可以观察规则是否迁移、主体是否保留,但单个案例不能证明74种规则都稳定;量化表格才汇总各分组结果。

论文路由分析:不同变化区域选择不同专家,局部框展示专家分工随示例与查询内容变化。

从基准编辑走向可控创作

示例驱动的物理编辑适合概念设计、教育演示和快速视觉预演:用户不必精确写出复杂提示词,只需给出一组希望复制的变化。进入生产工具前,还要让模型说明规则来源、标记变化区域,并在结果不符合物理条件时拒绝强行迁移。

PhysVICL-74把“看例子学变化”拆成可测任务,但数据中的生成式补全可能带来模型偏好。下一步需要加入真实拍摄的连续过程、更多材料参数和第三方人工评估,确认系统学到的是可迁移的状态变化,而非数据生成器留下的视觉模板。

对创作产品来说,还需要把“规则理解正确”和“画面生成好看”分开反馈。用户应能检查模型推断出的变化条件、保留区域与目标状态,再决定是否渲染;评估也应记录规则判断错误、主体保持失败和生成伪影,而不是只给一个综合分数。这样的分层接口更容易定位问题,也便于在高风险物理演示中阻止不合条件的编辑。

参考资料

https://arxiv.org/abs/2608.24119

https://arxiv.org/html/2608.24119

https://arxiv.org/pdf/2608.24119