SANA-WM: Efficient Minute-Scale World Modeling with Hybrid Linear Diffusion Transformer
SANA-WM:高效分钟级世界建模的混合线性扩散变换器
机构 * NVIDIA(英伟达)
AI总结 SANA-WM通过混合线性注意力、双分支相机控制等设计,实现高效分钟级视频生成,提升效率与视觉质量。
Comments https://nvlabs.github.io/Sana/WM/
大厂专区
SANA-WM:高效分钟级世界建模的混合线性扩散变换器
机构 * NVIDIA(英伟达)
AI总结 SANA-WM通过混合线性注意力、双分支相机控制等设计,实现高效分钟级视频生成,提升效率与视觉质量。
Comments https://nvlabs.github.io/Sana/WM/
通过推理时间引导进行组合视频生成
机构 * Tel-Aviv University(特拉维夫大学) ; Bar Ilan University(巴伊兰大学) ; NVIDIA Research(NVIDIA研究)
AI总结 本文提出CVG方法,通过利用交叉注意力图中的空间时间接地信号,提升冻结文本到视频模型的组合忠实度,无需修改模型结构或微调生成器。
MemLens:大型视觉-语言模型多模态长期记忆的基准测试
机构 * CSE Deparment, HKUST(香港科技大学计算机科学与工程系) ; CUHK(香港大学) ; OmniMemory (Shenzhen) Intelligent Technology Co., Ltd.(深圳奥米克记忆科技有限公司) ; NVIDIA AI Technology Center (NVAITC), NVIDIA, Santa Clara, USA(英伟达AI技术中心(NVAITC),英伟达,美国圣克拉拉)
AI总结 MemLens基准测试评估大型视觉-语言模型在多模态多会话对话中的长期记忆能力,通过789个问题测试五种记忆能力,揭示长上下文模型和记忆增强代理的优缺点,推动混合架构发展。
Comments Work in progress
G-SHARP:高斯手术硬件加速实时流程
机构 * NVIDIA ; Northwell Health(北well健康)
AI总结 本文提出G-SHARP,一种兼容商业应用的实时手术场景重建框架,用于需要快速准确3D建模的微创手术。该框架基于GSplat可微高斯光栅化器,实现了原理上的变形建模和鲁棒遮挡处理,适用于EndoNeRF基准测试。
通过基于LLM的多智能体系统优化PyTorch推理
机构 * NVIDIA Corporation(NVIDIA公司) ; Microsoft Corporation(微软公司) ; Ansel et al. ( 2024 )(Ansel等人(2024)) ; Sabne ( 2020 )(Sabne(2020)) ; Kerr et al. ( 2017 )(Kerr等人(2017)) ; Tillet et al. ( 2019 )(Tillet等人(2019)) ; Spector et al. ( 2024 )(Spector等人(2024)) ; Ouyang et al. ( 2025 )(Ouyang等人(2025)) ; Lange et al. ( 2025a(Lange等人(2025a;b)) ; b )(Li等人(2025)) ; Li et al. ( 2025 )(METR(2025)) ; METR ( 2025 )(Andrews和Witteveen(2025)) ; Andrews and Witteveen ( 2025 )(Baronio等人(2025)) ; Baronio et al. ( 2025 )(Novikov等人(2025)) ; Novikov et al. ( 2025 )(Wei等人(2025)) ; Wei et al. ( 2025 )(Sharma(2025)) ; Sharma ( 2025 )
AI总结 本文提出基于LLM的多智能体系统用于优化PyTorch推理,发现exploit策略与error-fixing智能体结合效果最佳,实现2.88倍速度提升。
SVAG-Bench:多实例时空视频动作定位的大规模基准
机构 * LMU Munich(慕尼黑大学) ; MCML ; Technical University of Munich(慕尼黑技术大学) ; University of Zurich(苏黎世大学) ; University of Oxford(牛津大学) ; Amazon(亚马逊) ; NVIDIA(英伟达)
AI总结 SVAG-Bench通过多实例整合任务,评估模型在复杂场景中对动作的时空定位能力,包含688个视频和19590个注释,支持细粒度评估多主体歧义消除和动作组合性。
Robometer:通过轨迹比较扩展通用机器人奖励模型
机构 * Univ. of Southern California(南加州大学) ; UT Dallas(德克萨斯大学达拉斯分校) ; MIT(麻省理工学院) ; Indep. Researcher(独立研究员) ; Univ. of Washington(华盛顿大学) ; Ai2 ; NVIDIA(英伟达)
AI总结 Robometer通过结合轨迹内进步监督与轨迹间偏好监督,提升大规模机器人数据集中的奖励模型学习能力,实现更通用的奖励函数和更好的机器人学习性能。
Comments 33 pages, 17 figures
Journal ref RSS 2026