arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

NVIDIA(英伟达)

2026-03-16 至 2026-03-16 共收录 4
2603.13024 2026-03-16 cs.CV cs.AI cs.LG eess.IV

SAW: Toward a Surgical Action World Model via Controllable and Scalable Video Generation

SAW:通过可控且可扩展的视频生成实现手术动作世界模型

Sampath Rapuri, Lalithkumar Seenivasan, Dominik Schneider, Roger Soberanis-Mukul, Yufan He, Hao Ding, Jiru Xu, Chenhao Yu, Chenyan Jing, Pengfei Guo, Daguang Xu, Mathias Unberath

机构 * Johns Hopkins University(约翰霍普金斯大学) NVIDIA

AI总结 SAW通过四个轻量信号条件的视频扩散模型生成真实手术动作视频,解决手术AI和模拟中的数据稀缺、稀有事件合成及仿真到现实的差距问题,实现高时间一致性和视觉质量。

Comments The manuscript is under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05343 2026-03-16 cs.CV cs.AI

SpaceControl: Introducing Test-Time Spatial Control to 3D Generative Modeling

SpaceControl:引入测试时空间控制到3D生成建模

Elisabetta Fedele, Francis Engelmann, Ian Huang, Or Litany, Marc Pollefeys, Leonidas Guibas

机构 * ETH Zurich(苏黎世联邦理工学院) Stanford University(斯坦福大学) USI Lugano(卢塞恩大学) Technion(技术学院) NVIDIA(英伟达)

AI总结 本文提出SpaceControl,一种无需训练的测试时空间控制方法,支持多种几何输入,提升3D生成建模的几何精确度与视觉质量。

Comments Project page: https://spacecontrol3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12516 2026-03-16 cs.LG physics.flu-dyn

Learning Pore-scale Multiphase Flow from 4D Velocimetry

从4D速度测距学习孔隙尺度多相流

Chunyang Wang, Linqi Zhu, Yuxuan Gu, Robert van der Merwe, Xin Ju, Catherine Spurin, Samuel Krevor, Rex Ying, Tobias Pfaff, Martin J. Blunt, Tom Bultreys, Gege Wen

机构 * Department of Earth Science and Engineering, Imperial College London(帝国理工学院伦敦地球科学与工程系) Department of Geology, Ghent University(根特大学地质系) Department of Energy Science and Engineering, Stanford University(斯坦福大学能源科学与工程系) Department of Computer Science, Yale University(耶鲁大学计算机科学系) NVIDIA

AI总结 本文提出一种多模态学习框架,通过4D微速度测距数据直接推断多相孔隙流,结合图网络模拟和3D U-Net,实现快速预测,为地下碳和氢存储提供高效工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15369 2026-03-16 eess.IV cs.AI

OpenVision 3: A Family of Unified Visual Encoder for Both Understanding and Generation

OpenVision 3: 一种用于理解和生成的统一视觉编码器家族

Letian Zhang, Sucheng Ren, Yanqing Liu, Xianhang Li, Zeyu Wang, Yuyin Zhou, Huaxiu Yao, Zeyu Zheng, Weili Nie, Guilin Liu, Zhiding Yu, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克ruz分校) JHU(约翰霍普金斯大学) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

AI总结 本文提出OpenVision 3,通过统一视觉表示实现图像理解和生成。核心架构将VAE压缩的图像潜在特征输入ViT编码器,同时训练其输出以支持重建和语义学习,从而在共享潜在空间中实现良好泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏