arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

2026-06-26 至 2026-06-26 共收录 4
2606.27332 2026-06-26 cs.CV 新提交

RoPEMover: Depth-Aware Object Relocation via Positional Embeddings

RoPEMover: 通过位置嵌入实现深度感知的物体重定位

Ipek Oztas, Duygu Ceylan, Aybars Bugra Aksoy, Aysegul Dundar

机构 * Bilkent University(比尔肯大学) Brown University(布朗大学) Adobe Research(Adobe研究院)

AI总结 提出一种基于扩散Transformer位置表示(RoPE)的几何感知物体运动方法,通过深度感知的2D RoPE扩展实现3D空间位移,在合成数据与少量真实图像训练下,实现物体身份保持、遮挡区域生成及阴影光照一致更新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26410 2026-06-26 cs.CV 新提交

Neural Voxel Dynamics: Learning Implicit 3D Physics via Volumetric Feature Advection

神经体素动力学:通过体素特征平流学习隐式3D物理

Zican Wang, Niloy Mitra

机构 * University College London(伦敦大学学院) Adobe Research(Adobe研究院)

AI总结 提出自监督框架,将视频预测瓶颈从2D提升到3D体素潜在空间,通过体素特征平流学习隐式3D物理,无需显式物理引擎,实现异构现象的统一模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26384 2026-06-26 cs.CV 新提交

What Do Deepfake Benchmarks Measure? An Audit Using Frozen Self-Supervised Representations

深度伪造基准测试衡量了什么?使用冻结自监督表示进行审计

Samuel Pagon, Yixuan Shen, Vishal Asnani, Feng Liu

机构 * Department of Computer Science, Drexel University(德雷塞尔大学计算机科学系) Adobe Research(Adobe研究院)

AI总结 通过线性探针在通用自监督表示上逼近定制检测器性能,发现深度伪造基准测试主要衡量通用模态理解而非取证理解,并提出基准审计观点。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏