3D-Layout-R1: Structured Reasoning for Language-Instructed Spatial Editing
3D-Layout-R1: 为语言指导的空间编辑进行结构化推理
机构 * NVIDIA ; UMass Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。
大厂专区
3D-Layout-R1: 为语言指导的空间编辑进行结构化推理
机构 * NVIDIA ; UMass Amherst(马萨诸塞大学阿默斯特分校)
AI总结 本文提出一种结构化推理框架,通过场景图推理实现文本条件下的空间布局编辑,提升空间关系的可解释性和控制性,并在布局编辑基准测试中取得显著改进。
视频内容定制中的首帧至关重要
机构 * University of Maryland(马里兰大学) ; USC(南加州大学) ; MIT(麻省理工学院) ; NVIDIA(NVIDIA公司)
AI总结 本文揭示视频生成模型将首帧视为概念记忆缓冲区,通过少量训练示例实现鲁棒且通用的视频内容定制。
Comments Accepted to CVPR 2026
用于参数高效多任务学习的频率切换机制
机构 * National Cheng Kung University(国立成功大学) ; NVIDIA Research(NVIDIA研究)
AI总结 本文提出Free Sinewich框架,通过频率切换实现近零成本权重调节,结合Sine-AWB层和轻量Clock Net,在密集预测基准中实现性能与效率的最优平衡。
Comments Accepted to CVPR 2026
InfoTok: 通过信息论压缩实现自适应离散视频分块器
机构 * NVIDIA ; Stanford University(斯坦福大学) ; National University of Singapore(新加坡国立大学)
AI总结 本文提出InfoTok框架,通过信息论压缩实现视频分块的自适应优化,实验证明在不损失性能的情况下,压缩率提升2.3倍,节省20%的token。
统一的生成-细化规划:连接引导流匹配与基于模型的预测控制以实现社交导航
机构 * University of Washington(华盛顿大学) ; NVIDIA(英伟达)
AI总结 本文提出一种结合奖励引导条件流匹配与模型预测路径积分的统一生成-细化框架,以提升社交导航中安全、任务性能和计算时间的平衡。
上下文制图:迈向大型语言模型系统中上下文空间的结构化治理
机构 * NVIDIA(英伟达) ; Research Division Cartography, TU Wien(地图研究部,维也纳技术大学)
AI总结 本文提出Context Cartography框架,通过定义三区模型和七种制图操作,系统治理上下文空间的结构与信息流动,验证其在实际系统中的有效性。
Comments 31 pages, 2 figures