One Demonstration, Many Objects: Generalizing Manipulation via Local Contact Geometry
一个演示,多个物体:通过局部接触几何泛化操作任务
机构 * Stanford University(斯坦福大学)
AI总结 提出DemoMimic策略,以接触点局部几何为核心,结合接触中心奖励,在16个物体、4个任务上实现71%操作成功率,提升了跨物体泛化能力与现实迁移性能。
作者
Computer Vision
一个演示,多个物体:通过局部接触几何泛化操作任务
机构 * Stanford University(斯坦福大学)
AI总结 提出DemoMimic策略,以接触点局部几何为核心,结合接触中心奖励,在16个物体、4个任务上实现71%操作成功率,提升了跨物体泛化能力与现实迁移性能。
TrAct:通过视觉轨迹连接机器人控制与视觉预测
机构 * University of Michigan(密歇根大学) ; Stanford University(斯坦福大学)
AI总结 TrAct是基于世界模型的机器人决策框架,以视觉轨迹为控制与预测的中间接口,在LIBERO-INTEGRAL基准和Franka任务上,相较基线π₀.5显著提升了操作成功率与视频预测质量。
SimFoundry: 用于策略学习和评估的模块化自动化场景生成
机构 * NVIDIA ; Georgia Institute of Technology(佐治亚理工学院) ; Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of Toronto(多伦多大学)
AI总结 提出SimFoundry系统,从视频零样本构建仿真场景,支持对象、场景和任务编辑,生成数字孪生与数字表亲,提升策略在真实世界的泛化能力,实验显示仿真评估与真实性能高度相关。
高阶光子节环半金属中的反手性铰链态
AI总结 研究在三维旋磁光子晶体高阶节环半金属中观察反演手性铰链态,通过近场扫描测量发现其单向传播及鲁棒传输特性,空间位置可重构,还观察到相关表面态,扩展了反演手性态并有望用于光子路由。
用于统一世界建模的掩码视觉动作
机构 * Stanford University(斯坦福大学) ; University of Maryland, College Park(马里兰大学帕克分校) ; Harvard University(哈佛大学)
AI总结 研究如何将动作传达给视频模型用于机器人世界建模,提出掩码视觉动作这一像素空间控制接口,经微调后单个检查点在多场景和实施例中表现出色,在下游操作中能辅助策略评估、改进决策和支持逆建模。
Comments Project webpage: https://masked-visual-actions.github.io
RoboTTT:机器人策略的上下文扩展
机构 * NVIDIA(英伟达公司) ; Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 研究提出RoboTTT,将测试时训练集成到机器人基础模型,通过序列动作强制和截断反向传播扩展视觉运动上下文到8K时间步长,解锁新能力,提升多任务性能,证明上下文长度是机器人基础模型新扩展轴。
Comments Project website: http://research.nvidia.com/labs/gear/robottt/
通过场景自我探索进行视图规划
机构 * Northwestern University(西北大学) ; University of Washington(华盛顿大学) ; Microsoft(微软) ; University of Oxford(牛津大学) ; Stanford University(斯坦福大学)
AI总结 提出ViewSuite基准测试揭示VLM在多步视图规划中的不足,并设计迭代框架通过自我探索和视图图蒸馏将Qwen2.5-VL-7B的交互式视图规划准确率从2.5%提升至47.8%。
CaP-X: 用于基准测试和改进机器人操作编码智能体的框架
机构 * nvidia ; stanford(斯坦福大学) ; cmu(卡内基梅隆大学)
AI总结 提出CaP-X框架,通过CaP-Gym交互环境和CaP-Bench评估,发现编码智能体依赖人工抽象,但通过扩展测试时计算可提升鲁棒性,并推出无需训练的CaP-Agent0和强化学习CaP-RL。
T-Rex: 触觉反应灵巧操作
机构 * UC Berkeley(加州大学伯克利分校) ; NVIDIA(英伟达) ; Stanford(斯坦福大学) ; Panasonic(松下) ; La Sapienza University(罗马大学) ; ItalAI
AI总结 提出大规模触觉数据集和可变速率混合Transformer架构,在12项精细操作任务上平均成功率提升超30%。
Comments Project page: https://tactile-rex.github.io/
为什么自动化这个?探索机器人自动化愿望、投入时间与幸福感之间的相关性
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Stanford University(斯坦福大学) ; University of Pittsburgh(匹兹堡大学)
AI总结 本研究利用BEHAVIOR-1K等数据集,发现活动时间并非自动化偏好的强预测因子,而幸福感和痛苦感是最强指标,并揭示了性别和收入水平的差异。
Comments 26 pages, 14 figures
StereoPolicy:通过立体视觉改进机器人操作策略
机构 * Stanford University(斯坦福大学) ; Northwestern University(西北大学) ; Lambda, Inc(Lambda公司)
AI总结 该研究提出StereoPolicy,一种利用立体视觉提升机器人操作策略的框架,通过同步立体图像对增强几何推理,无需构建显式3D表示,在多个仿真和真实机器人任务中优于RGB、RGB-D、点云等基线方法。
GPIC:用于视觉生成的大型许可图像数据集
机构 * Stanford University(斯坦福大学) ; Radical Numerics ; University of Michigan(密歇根大学) ; Salesforce Research(Salesforce研究)
AI总结 提出GPIC,一个约28万亿像素的大型许可图像数据集,包含1亿训练样本,通过最先进的视觉语言模型标注,用于视觉生成建模研究。
Comments 25 pages; Dataset: https://huggingface.co/datasets/stanford-vision-lab/giant-permissive-image-corpus; Project website: https://gpic.stanford.edu
平移扭曲量子仿射代数的表示
AI总结 本文引入并研究平移扭曲量子仿射代数,通过平移Cartan-Drinfeld流给出其三角分解和分类,证明有理性和融合积,并分类有限维单模。
ESI-Bench: 迈向闭环感知-动作的具身空间智能
机构 * Stanford University(斯坦福大学) ; UCLA(加州大学洛杉矶分校) ; Northwestern University(西北大学)
AI总结 提出ESI-BENCH基准,通过主动探索(感知、移动、操作)在OmniGibson环境中评估具身空间智能,发现主动探索显著优于被动方法,失败主因是动作盲视而非感知弱,且模型存在元认知差距。
Comments https://esi-bench.github.io/
从试错中学习:具身大语言模型的反思式测试时规划
机构 * Stanford University(斯坦福大学) ; Northwestern University(西北大学)
AI总结 提出反思式测试时规划方法,通过行动中反思和行动后反思两种模式,结合回溯性反思,使具身智能体在测试时进行自我纠正和经验积累,显著提升长程任务性能。
HumanScore:在生成视频中评估人类动作的基准测试
机构 * Stanford University(斯坦福大学) ; Peking University(北京大学)
AI总结 本文提出HumanScore框架,通过六个可解释指标评估AI生成视频中人类动作的质量,揭示感知合理性与生物力学真实性的差距,并产生可靠的模型排名。
RAGEN-2:代理强化学习中的推理崩溃
机构 * Northwestern University(西北大学) ; UIUC(伊利诺伊大学厄巴纳-香槟分校) ; Independent(独立研究者) ; Imperial College London(伦敦帝国学院) ; Oxford University(牛津大学) ; University of Washington(华盛顿大学) ; Microsoft(微软) ; Stanford University(斯坦福大学)
AI总结 研究发现代理强化学习中推理稳定性受模板崩溃影响,通过引入互信息代理提升推理质量与任务表现。
MIRAGE:视觉理解的幻觉
机构 * Stanford University(斯坦福大学)
AI总结 研究揭示多模态AI系统在视觉-语言推理中的漏洞,指出模型能生成未提供图像的详细描述及推理,挑战现有假设,提出B-Clean作为公平评估方案。
IMPASTO:整合基于模型的规划与学习的动力学模型用于机器人油画复现
机构 * Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学)
AI总结 IMPASTO通过整合学习的动力学模型与基于模型的规划,实现机器人基于目标油画图像的复现,无需人类示范或精确模拟,提升复现精度。
MindCube:从有限视角构建空间心理模型
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; New York University(纽约大学) ; University of Washington(华盛顿大学)
AI总结 本文通过MindCube基准测试,探讨视觉语言模型能否从有限视角构建空间心理模型,提出'map-then-reason'方法提升模型性能,实现从37.8%到61.3%的准确率提升。
Comments The latest version includes an expanded discussion of scaffolding, along with updated data statistics and experimental results
粒子动力学快速适应用于广义变形物体移动操作
机构 * Stanford University(斯坦福大学) ; University of Texas at Austin(德克萨斯大学奥斯汀分校)
AI总结 本文提出RAPiD方法,通过学习视觉-运动策略和动态嵌入推理,实现变形物体移动操作的高成功率。
Comments 8 pages, ICRA 2026
MoMaGen: 为多步双臂移动操作生成演示数据以满足软约束和硬约束
机构 * Stanford University(斯坦福大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Amazon(亚马逊公司)
AI总结 MoMaGen通过解决双臂移动操作中的可达性和可见性问题,生成多样化数据集以提升模仿学习策略的训练效果。
Comments Project website: momagen.github.io. The first four authors contribute equally. Accpeted to International Conference on Learning Representations (ICLR 2026)
潜在强制:重新排列扩散轨迹以生成像素空间图像
机构 * stanford(斯坦福大学) ; umich(密歇根大学)
AI总结 本文提出潜在强制方法,通过重新排列扩散轨迹提升像素空间图像生成效率,实现端到端建模优势,取得ImageNet上的新突破。
Comments 8 pages, 6 figures
空间理论:基础模型能否通过主动探索构建空间信念?
机构 * Northwestern University(西北大学) ; Stanford University(斯坦福大学) ; University of Washington(华盛顿大学) ; Cornell University(康奈尔大学)
AI总结 本文提出空间理论,探讨基础模型通过主动探索构建空间信念的挑战,发现主动-被动差距、探索低效和信念惯性等问题。
Comments published at iclr 2026
宇宙射线增强暗物质的矿物检测
AI总结 利用古探测器探测宇宙射线增强暗物质,通过提高暗物质-质子散射截面的灵敏度实现对亚GeV暗物质的高效探测。
Comments 7 pages, 3 figures; Updated to match the submitted version and fixed some typos
VideoWeave:一种以数据为中心的高效视频理解方法
机构 * Stanford University(斯坦福大学) ; Microsoft Research(微软研究院) ; University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
AI总结 VideoWeave通过重新组织训练数据提升视频语言模型的数据效率,无需修改模型架构,实现更高准确率。
PointWorld: 为真实世界机器人操作扩展3D世界模型
机构 * Stanford University(斯坦福大学) ; NVIDIA(英伟达)
AI总结 PointWorld通过统一状态和动作的3D点流模型,实现了在真实世界中机器人操作的高效预测与控制,无需额外演示或训练。
Dream2Flow: 通过3D物体流连接视频生成与开放世界操控
AI总结 Dream2Flow通过3D物体流连接视频生成与开放世界操控,实现零样本操控不同类别的物体。
Comments Project website: https://dream2flow.github.io/
QuantiPhy:一种评估视觉-语言模型物理推理能力的定量基准
机构 * Stanford University(斯坦福大学)
AI总结 QuantiPhy通过定量评估视觉-语言模型的物理推理能力,揭示其在运动学属性推断中的数值准确性与定性合理性之间的差距。
利用GFlowNets发现潜在图以实现多样化的条件图像生成
机构 * Dept. of Computer Science, Stanford University(计算机科学系,斯坦福大学) ; Dept. of Psychiatry and Behavioral Sciences, Stanford University(精神病学与行为科学系,斯坦福大学) ; Dept. of Biomedical Data Science, Stanford University(生物医学数据科学系,斯坦福大学) ; Center for Intelligent Machines, McGill University(智能机器中心,麦吉尔大学) ; MILA - Quebec AI institute(魁北克人工智能研究所)
AI总结 Rainbow通过分解输入条件为多样化的潜在表示,利用GFlowNets生成多样化图像,提升条件图像生成的多样性和保真度。
Journal ref The 39th Annual Conference on Neural Information Processing Systems 2025