arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-05-20 至 2026-05-20 共收录 6
2605.20085 2026-05-20 cs.CV

Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation

基于空间提示的视觉轨迹预测用于目视操控

Yifan Li, Xinyu Zhou, Yunhao Ge, Yu Kong

机构 * Michigan State University(密歇根州立大学) NVIDIA Research(英伟达研究)

AI总结 本文提出了一种新的视觉轨迹预测方法SP-VTP,通过空间提示定义任务目标,结合任务编码器、观察编码器和轨迹生成器,提升了跨场景的目视操控轨迹预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19786 2026-05-20 cs.CV

Fast 4D Mesh Generation by Spatio-Temporal Attention Chains

通过时空注意力链实现快速的4D网格生成

Dvir Samuel, Yuval Atzmon, Gal Chechik, Yoni Kasten

机构 * NVIDIA Research(NVIDIA研究)

AI总结 本文提出一种无需训练的4D网格生成方法,通过时空注意力链加速生成并提升时间对应质量,能够在9秒内生成4D网格,实现13倍速度提升,且能处理长达16倍的视频序列,同时在2D物体跟踪和4D跟踪任务中表现出色,还支持可靠的相机估计。

Comments https://research.nvidia.com/labs/par/fast4dmesh/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18739 2026-05-20 cs.CV cs.DC

LongLive-2.0: An NVFP4 Parallel Infrastructure for Long Video Generation

LongLive-2.0: 一个基于NVFP4的长视频生成并行基础设施

Yukang Chen, Luozhou Wang, Wei Huang, Shuai Yang, Bohan Zhang, Yicheng Xiao, Ruihang Chu, Weian Mao, Qixin Hu, Shaoteng Liu, Yuyang Zhao, Huizi Mao, Ying-Cong Chen, Enze Xie, Xiaojuan Qi, Song Han

机构 * NVIDIA

AI总结 本文提出LongLive-2.0,一个基于NVFP4的并行基础设施,用于长视频生成的整个训练和推理流程,解决了速度和内存瓶颈问题。通过引入序列并行自回归训练方法,结合NVFP4精度,显著降低了GPU内存消耗并加速了训练过程。同时,该系统能够将扩散模型转换为长视频生成的自回归扩散模型,并在不同GPU架构上实现了高效的推理和训练。

Comments Code, model, and demos are available at https://github.com/NVlabs/LongLive

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19565 2026-05-20 physics.flu-dyn cs.LG

HiLiftAeroML: High-Fidelity Computational Fluid Dynamics Dataset for High-Lift Aircraft Aerodynamics

HiLiftAeroML:高保真计算流体力学数据集用于高升力飞机气动性能

Neil Ashton, Adam Clark, Liam Heidt, Christopher Ivey, Sanjeeb Bose, Rahul Agrawal, Konrad Goc, Rishi Ranade, Corey Adams, Peter Sharpe, Sheel Nidhan, Semit Akkurt, Daniel Leibovici, Jean Kossaifi

机构 * nvidia

AI总结 本文介绍了一个首个开源的高保真计算流体力学数据集,用于AI代理模型开发,该数据集包含1800个样本,源自180种几何变体和10个攻角的NASA通用研究模型(CRM)几何体,用于AIAA高升力预测工作坊系列。该数据集的创新之处在于使用GPU加速的高保真显式壁模式LES方法进行每个模拟,使用300M到500M的适应性网格,以确保在已知的稳态RANS方法在飞行包线部分的挑战下尽可能高的精度。整个数据集(几何体、时间平均体积和表面变量以及积分力)免费提供,带有宽松的开源许可(CC-BY-4.0)。通过公开发布此数据,我们旨在加速航空航天工业中AI代理建模的研究与开发。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24470 2026-05-20 cs.RO cs.AI

Foundation models on the bridge: Semantic hazard detection and safety maneuvers for maritime autonomy with vision-language models

桥梁上的基础模型:基于视觉-语言模型的语义危险检测与安全操作用于海上自主性

Kim Alexander Christensen, Andreas Gudahl Tufte, Alexey Gusev, Rohan Sinha, Milan Ganai, Ole Andreas Alsos, Marco Pavone, Martin Steinert

机构 * Dept. of Mechanical and Industrial Engineering, NTNU(机械与工业工程系,挪威科技大学) Dept. of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) NVIDIA Research(NVIDIA研究)

AI总结 本文提出了一种基于视觉-语言模型的语义危险检测与安全操作方法,用于满足IMO草案MASS代码对海上自主船舶的要求,通过快速-慢速异常管道和短时间范围的人类可覆盖回退操作来实现,在40个港口场景中验证了该方法的性能。

Comments 17 pages without bibliography or appendix. The main paper has 16 figures. Paper webpage can be found at https://kimachristensen.github.io/bridge_policy/

Journal ref Ocean Engineering 359, Part 3 (2026), Article 124646

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.09203 2026-05-20 cs.CV cs.RO

3D Modeling and Automated Measurement of Concrete Cracks via Segment Anything Refinement and Visual Inertial LiDAR Fusion

通过段落任何精修和视觉惯性LiDAR融合进行混凝土裂缝的3D建模与自动测量

Pengru Deng, Jiapeng Yao, Chun Li, Su Wang, Xinrun Li, Varun Ojha, Xuhui He

机构 * School of Civil Engineering(土木工程学院) Central South University(中南大学) Hunan Provincial Key Laboratory for Disaster Prevention and Mitigation of Rail Transit Engineering Structures(湖南省铁路工程结构灾害预防与 mitigation 工程结构重点实验室) Nvidia School of Computing(计算学院) Newcastle University(新castle大学)

AI总结 本文提出了一种结合计算机视觉技术和多模态同时定位与建图(SLAM)的创新框架,用于二维裂缝检测、三维重建和三维自动裂缝测量,解决了现有方法在适应性和鲁棒性方面的不足,特别是在处理曲线或复杂几何形状时的挑战。

Comments Title and author list updated

Journal ref Computer-Aided Civil and Infrastructure Engineering, Volume 45, 2026, 100019, ISSN 1093-9687

详情

展开后加载摘要…

URL PDF HTML 收藏