arXivDaily arXiv每日学术速递 周一至周五更新

PAPERDAILY REPORTS

苏黎世联邦理工造了100万张假文档,专治拍照弯曲和阴影

作者:arXivDaily编辑部 arXiv 2609.15503 cs · cs.CV · cs.GR

论文导读

苏黎世联邦理工学院发布SyntheticDoc,用物理模拟与路径追踪生成100万张高分辨率文档训练样本,覆盖弯曲、折叠、褶皱和复杂光照。数据同时给出UV图、法线、反照率与阴影等像素级标注;但它仍是合成数据,跨真实手机和纸张的表现要以实测为准。

手机拍纸,难点不只是透视

文档校正要把随手拍的纸恢复成平整扫描件。纸页可能向上卷、沿折痕弯、局部起皱,还会留下手影、环境光和纸张自身反射。过去十年,许多系统依赖Doc3D等较早数据集,但规模、分辨率和真实感逐渐限制了新模型。

论文图:程序化生成的书页褶皱与对应渲染外观。

真实采集很难获得精确真值:一张皱纸拍完后,几乎无法知道每个像素原本应落在平面哪里,也很难拆分材质颜色和照明。因此团队把纸张、相机和光源搬进模拟器,让每一步都可追踪。

先模拟纸张,再用虚拟相机拍

SyntheticDoc使用基于物理的模拟器生成纸面几何,让纸张自然下落、碰撞、弯曲或折叠;随后以路径追踪器渲染,模拟阴影、反射和复杂照明。内容不仅有普通书页,也覆盖发票、法律文件、论文、杂志与乐谱等版式。

论文图:发票内容被映射到曲面纸张,并保留可用于校正的精确几何标注。

每个样本都配有UV映射、法线、反照率和着色信息。模型因此能分别学习“纸面被几何拉弯”和“画面被光照染暗”,而不必只从最终彩色图猜测原因。训练集规模达到100万张,另有广泛验证与测试集合。

简单基线也能验证数据价值

作者在SyntheticDoc上训练一个相对简单的基线,同时评估文档展开和光照校正,并与现有先进方法比较。论文的重点不是宣称一个结构包打天下,而是证明更大、更准确的训练数据能推动两项任务,并提供统一比较基础。

论文图:SyntheticDoc样本展示纸面形变、纹理与照明的联合变化。

合成数据的优势是标注准确、条件可控,风险则是模拟器与现实之间仍有差距。不同手机镜头、运动模糊、屏幕翻拍、塑封纸和特殊印刷材质,未必都被现有生成过程覆盖。

丰富标注还有一个用途:研究者可以分别评价几何展开和照明恢复,而不是只看最终OCR正确率。即使文字识别看似成功,纸面边缘、色彩或阴影仍可能不适合归档和再印刷;分项真值能把这些问题单独量出来。

下一步是把假纸带进真实办公流

如果数据在真实扫描应用中稳定,最直接的用途是报销票据、档案数字化、移动OCR和辅助阅读。下一阶段应按设备、语言、纸张和光源拆分报告结果,并公开失败样例。数据与生成代码开放后,研究者也能针对本地票据或特殊纸材补充模拟条件,而不是重新人工采集百万张图。

参考资料

https://arxiv.org/abs/2609.15503

https://arxiv.org/html/2609.15503