arXivDaily arXiv每日学术速递 周一至周五更新
紧急更新!大量爬虫把网站搞的很不稳定,部分功能限制为登录后才能使用,如高级检索等

PAPERDAILY REPORTS

AI看一遍折纸视频,生成可执行程序,完整序列完成率100%

作者:arXivDaily编辑部 arXiv 2609.00377 cs · cs.AI · cs.CV · cs.GR

魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。

视频里的动作先变成几何操作

折纸教程通常只给连续画面,人能从手势和纸张变化中补出折线、翻转方向与层级关系,程序却需要精确的几何状态。FoldingAgent定义纸张几何和一组参数化折叠动作,让模型输出可以在物理模拟器中执行的步骤。

系统不会一次猜完整折痕图。它逐步读取关键帧,调用几何模拟、物理合理性检查、视觉检索和相似度比较工具,再决定下一步动作;每个中间状态都能保存、重新渲染和编辑。

图:PurelandFold视频中正在执行折叠动作的关键帧。

出错后回退,而不是带着误差继续

多步折纸最容易出现误差累积。论文案例中,智能体识别出一次翻转后模拟结果与视频不符,随后回退到更早的关键帧,重新检查几何状态并规划动作。外部判别器的成功率为88%,因此系统也不能把一次检查当成绝对正确。

FoldingAgent的优势来自工具循环和可回退状态,而不只是视觉语言模型本身。消融对比显示,直接预测静态折痕或只做单次判别更容易得到不可编译步骤;完整框架在序列完成、编译和视觉相似度上取得更好结果。

图:真实演示视频里的翻转动作关键帧。

100%完成率有明确数据边界

Table 1报告完整方法的序列完成率100%、编译成功率96%,并给出几何与视觉相似度指标。基准PurelandFold使用团队整理的折纸视频、真实几何和动作标签,任务限制在Pureland折纸规则,折叠动作比复杂曲面和多层穿插更可控。

因此,100%不能外推为所有网络折纸视频都能成功。真实教程可能有遮挡、快速手势、非方形纸张和难以观测的内层结构;模拟器中的物理合理也不保证现实纸张的厚度、摩擦和弹性完全一致。

图:论文图展示参数化折纸程序的编辑与重渲染结果。

下一步:可执行程序让教程可以被搜索和修改

一旦视频被转换为参数化程序,用户可以替换纸张尺寸、查看任意中间状态,或检查某条折痕如何影响后续步骤。类似方法也可用于装配、手工和实验演示,但前提是动作空间能被明确建模。

下一步需要扩展到更多折纸规则、不同拍摄角度和普通用户视频,并用真实执行验证模拟结果。程序还应记录每步置信度和回退原因,让低把握步骤进入人工确认,而不是在序列后段才发现几何已经无法恢复。

若要处理普通教程,系统还需自动选择关键帧。抽帧太少会漏掉折层变化,抽帧太密则增加重复推理和错误检查;关键帧选择应结合手部遮挡、纸张轮廓变化与动作完成信号,并允许用户补充被漏掉的步骤。

程序输出还可以带上几何约束,例如折线端点、角度范围、山折或谷折方向,以及当前哪些纸层一起移动。显式约束能帮助人类发现模型把可见表面误认成整张纸,也便于不同模拟器复现同一程序。

在教育场景中,可执行程序可以生成任意视角动画和逐步纠错,但不应隐藏原视频作者。项目页若提供教程来源、许可和对应程序,既方便核验,也能避免把人类创作的折法错误地归为模型原创。

还可以把程序与原视频并排播放,让系统逐步显示当前几何、下一动作和差异热区。用户在错误首次出现时就能修正折线或层级,避免整条序列重算;这种人机协作模式比追求完全自动更适合复杂教程的早期应用。

评测还可增加程序简洁度,同一折纸结果若需要大量不必要的回退和微小修正,虽然最终完成,仍不适合教学或自动执行。步骤数量、回退次数和人工确认时间应与完成率一起报告。

参考资料

https://arxiv.org/abs/2609.00377

https://maya-moriya.github.io/origami-page/