Spatially Prompted Visual Trajectory Prediction for Egocentric Manipulation
基于空间提示的视觉轨迹预测用于目视操控
机构 * Michigan State University(密歇根州立大学) ; NVIDIA Research(英伟达研究)
AI总结 本文提出了一种新的视觉轨迹预测方法SP-VTP,通过空间提示定义任务目标,结合任务编码器、观察编码器和轨迹生成器,提升了跨场景的目视操控轨迹预测性能。
大厂专区
基于空间提示的视觉轨迹预测用于目视操控
机构 * Michigan State University(密歇根州立大学) ; NVIDIA Research(英伟达研究)
AI总结 本文提出了一种新的视觉轨迹预测方法SP-VTP,通过空间提示定义任务目标,结合任务编码器、观察编码器和轨迹生成器,提升了跨场景的目视操控轨迹预测性能。
通过时空注意力链实现快速的4D网格生成
机构 * NVIDIA Research(NVIDIA研究)
AI总结 本文提出一种无需训练的4D网格生成方法,通过时空注意力链加速生成并提升时间对应质量,能够在9秒内生成4D网格,实现13倍速度提升,且能处理长达16倍的视频序列,同时在2D物体跟踪和4D跟踪任务中表现出色,还支持可靠的相机估计。
LongLive-2.0: 一个基于NVFP4的长视频生成并行基础设施
机构 * NVIDIA
AI总结 本文提出LongLive-2.0,一个基于NVFP4的并行基础设施,用于长视频生成的整个训练和推理流程,解决了速度和内存瓶颈问题。通过引入序列并行自回归训练方法,结合NVFP4精度,显著降低了GPU内存消耗并加速了训练过程。同时,该系统能够将扩散模型转换为长视频生成的自回归扩散模型,并在不同GPU架构上实现了高效的推理和训练。
Comments Code, model, and demos are available at https://github.com/NVlabs/LongLive
HiLiftAeroML:高保真计算流体力学数据集用于高升力飞机气动性能
机构 * nvidia
AI总结 本文介绍了一个首个开源的高保真计算流体力学数据集,用于AI代理模型开发,该数据集包含1800个样本,源自180种几何变体和10个攻角的NASA通用研究模型(CRM)几何体,用于AIAA高升力预测工作坊系列。该数据集的创新之处在于使用GPU加速的高保真显式壁模式LES方法进行每个模拟,使用300M到500M的适应性网格,以确保在已知的稳态RANS方法在飞行包线部分的挑战下尽可能高的精度。整个数据集(几何体、时间平均体积和表面变量以及积分力)免费提供,带有宽松的开源许可(CC-BY-4.0)。通过公开发布此数据,我们旨在加速航空航天工业中AI代理建模的研究与开发。
桥梁上的基础模型:基于视觉-语言模型的语义危险检测与安全操作用于海上自主性
机构 * Dept. of Mechanical and Industrial Engineering, NTNU(机械与工业工程系,挪威科技大学) ; Dept. of Aeronautics and Astronautics, Stanford University(航空航天工程系,斯坦福大学) ; Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; NVIDIA Research(NVIDIA研究)
AI总结 本文提出了一种基于视觉-语言模型的语义危险检测与安全操作方法,用于满足IMO草案MASS代码对海上自主船舶的要求,通过快速-慢速异常管道和短时间范围的人类可覆盖回退操作来实现,在40个港口场景中验证了该方法的性能。
Comments 17 pages without bibliography or appendix. The main paper has 16 figures. Paper webpage can be found at https://kimachristensen.github.io/bridge_policy/
Journal ref Ocean Engineering 359, Part 3 (2026), Article 124646
通过段落任何精修和视觉惯性LiDAR融合进行混凝土裂缝的3D建模与自动测量
机构 * School of Civil Engineering(土木工程学院) ; Central South University(中南大学) ; Hunan Provincial Key Laboratory for Disaster Prevention and Mitigation of Rail Transit Engineering Structures(湖南省铁路工程结构灾害预防与 mitigation 工程结构重点实验室) ; Nvidia ; School of Computing(计算学院) ; Newcastle University(新castle大学)
AI总结 本文提出了一种结合计算机视觉技术和多模态同时定位与建图(SLAM)的创新框架,用于二维裂缝检测、三维重建和三维自动裂缝测量,解决了现有方法在适应性和鲁棒性方面的不足,特别是在处理曲线或复杂几何形状时的挑战。
Comments Title and author list updated
Journal ref Computer-Aided Civil and Infrastructure Engineering, Volume 45, 2026, 100019, ISSN 1093-9687