arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-07-17 至 2026-07-17 共收录 5
2607.15275 2026-07-17 cs.RO cs.AI cs.LG 新提交

RoboTTT: Context Scaling for Robot Policies

RoboTTT:机器人策略的上下文扩展

Yunfan Jiang, Yevgen Chebotar, Ruijie Zheng, Fengyuan Hu, Yunhao Ge, Jimmy Wu, Tianyuan Dai, Scott Reed, Li Fei-Fei, Yuke Zhu, Linxi "Jim" Fan

机构 * NVIDIA(英伟达公司) Stanford University(斯坦福大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。

Comments Project website: http://research.nvidia.com/labs/gear/robottt/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14203 2026-07-17 cs.GR cs.AI cs.CV 新提交

Instant NuRec: Feed-Forward 3D Gaussian Reconstruction for Driving Scene Simulation

即时NuRec:用于驾驶场景模拟的前馈3D高斯重建

NVIDIA, :, Jiahui Huang, Jiawei Ren, Michal Tyszkiewicz, Bjoern Haefner, Michael Shelley, Xin Kang, Seung Wook Kim, Ning Xu, Qi Wu, Janick Martinez Esturo, Shengyu Huang, Nick Schneider, Laura Leal-Taixe, Zan Gojcic, Sanja Fidler

机构 * NVIDIA

AI总结 针对自动驾驶3D模拟平台中神经模拟方法存在的速度慢和需逐场景调整问题,提出即时NuRec这一前馈神经重建模型,可快速将多视图驾驶日志转为3DGS世界,在数据集上PSNR表现出色,还能用于闭环模拟。

Comments Project Page: https://research.nvidia.com/labs/sil/projects/instant-nurec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12121 2026-07-17 cs.DC cs.LG 版本更新

FlashDiff: Efficient Regional Execution and Scheduling for Diffusion Model Serving

FlashDiff:用于扩散模型服务的高效区域执行与调度

Yaqi Qiao, Ping He, Songrun Xie, Ayush Barik, Chensong Zhang, Zhengzhong Tu, Fan Lai

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Vanderbilt University(范德比大学) HKUST(香港科技大学) NVIDIA(英伟达) Texas A&M University(德克萨斯农工大学)

AI总结 研究针对扩散模型服务效率低的问题,提出FlashDiff系统,通过自适应区域执行和调度,利用扩散细化特性及三种机制,有效降低端到端服务延迟,提高吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29814 2026-07-17 cs.CV 版本更新

Nemotron-Labs-Diffusion-Image: Advancing Masked Discrete Diffusion for High-Resolution Image Synthesis

Nemotron-Labs-Diffusion-Image:推进掩码离散扩散用于高分辨率图像合成

Shufan Li, Greg Heinrich, Hanrong Ye, Yonggan Fu, Aditya Grover, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA

AI总结 提出Nemotron-Labs-Diffusion-Image模型,通过令牌编辑机制和分组交叉熵目标解决掩码离散扩散模型的自校正缺失和训练信号稀疏问题,实现高分辨率文本到图像合成。

Comments 23 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.18242 2026-07-17 cs.CV 版本更新

GSVisLoc: Generalizable Visual Localization for Gaussian Splatting Scene Representations

GSVisLoc:用于高斯喷溅场景表示的通用视觉定位

Fadi Khatib, Dror Moran, Guy Trostianetsky, Yoni Kasten, Meirav Galun, Ronen Basri

机构 * Weizmann Institute of Science(魏茨曼科学研究所) NVIDIA(英伟达)

AI总结 GSVisLoc是用于3D高斯喷溅场景表示的视觉定位方法,通过匹配3D高斯生成的场景特征与图像特征来估计相机位姿,分三步进行,无需修改、再训练或额外图像,在标准基准上性能优且能有效推广到新场景。

Comments Accepted to ICCV 2025 Workshops (CALIPOSE). Project page: https://gsvisloc.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏