SPREAD: Spatial-Physical REasoning via geometry Aware Diffusion
SPREAD:通过几何感知扩散进行空间-物理推理
专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)
AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
SPREAD:通过几何感知扩散进行空间-物理推理
专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract)
AI总结 SPREAD通过图Transformer联合学习空间和物理关系,利用场景点云进行几何感知,整合可微指导实现碰撞避免和物理一致性,实验显示在空间关系和物理指标上达到SOTA。
在生成3D世界中扩展机器人视觉语言动作的强化学习
机构 * Horizon Robotics(地平线机器人)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出利用生成3D世界模型来提升机器人视觉语言动作模型的泛化能力,通过生成多样化的交互场景,提高模拟到现实的迁移效果,并展示在真实世界中的性能提升。
CUA-Suite:大规模人工标注的视频演示用于计算机使用代理
机构 * ServiceNow ; University of Waterloo(多伦多大学) ; Mila ; Université de Montréal(蒙特利尔大学) ; McGill University(麦吉尔大学) ; University of Oxford(牛津大学) ; National University of Singapore(新加坡国立大学)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 CUA-Suite通过提供连续高质量视频演示和密集标注,解决计算机使用代理训练中视频数据不足的问题,包含约55小时的专家视频和600万帧数据,支持多模态研究。
Comments Project Page: https://cua-suite.github.io/
视觉-语言模型在物理动态和意图推理上仍逊于人类表现
机构 * East China Normal University(东华大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Innovation Institute(上海创新研究院) ; University of Agder(阿格德大学)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出Teleo-Spatial Intelligence(TSI)以连接时空变化与目标导向结构,通过EscherVerse大规模开放世界资源评估,发现视觉-语言模型在开放世界中仍无法达到人类水平的意图推理能力。
FORWARD:在崎岖地形中操作的前送机数据集
机构 * Umeå University(乌梅亚大学) ; Swedish University of Agricultural Sciences(瑞典农业科学大学) ; Skogforsk, Swedish Forest Research Institute(森林研究所,瑞典)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文介绍了FORWARD数据集,包含在瑞典中部两个森林地区崎岖地形中操作的前送机的高分辨率多模态数据,用于开发森林机械的交通性、感知和自主控制算法。
Comments 33 pages, 24 figures
MessyKitchens: 密集接触的物体级3D场景重建
机构 * Mohamed bin Zayed University of Artificial Intelligence(莫扎德·本·扎耶德人工智能大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出MessyKitchens数据集和Multi-Object Decoder方法,提升复杂场景中物体级3D重建的精度与物理合理性。
FEEL(力增强的自我中心学习):一个用于物理动作理解的数据集
机构 * University of Maryland, College Park, USA(马里兰大学 College Park 分校)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 FEEL数据集结合了自定义压阻手套收集的力测量与自我中心视频,通过力驱动物理交互,用于接触理解与动作表征学习,取得最佳分割结果并提升跨任务迁移性能。
Comments 14 pages, 7 figures
超越帧级跟踪:一种基于轨迹的高效点云跟踪范式
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出基于轨迹的跟踪范式TrajTrack,通过隐式学习历史轨迹提升跟踪精度,实现高效且鲁棒的3D单目标跟踪。
Comments Acceptted in ICRA 2026
ESPIRE:一种用于视觉-语言模型具身空间推理的诊断基准
机构 * State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出ESPIRE基准,通过模拟环境评估视觉-语言模型在具身空间推理中的表现,改进了传统评估方法,实现了更细致的推理与行动分析。
SortScrews:一种用于实时螺钉分类的数据集和基线
机构 * University of Toronto(多伦多大学) ; Vector Institute(向量研究所) ; Project Neura ; UTMIST ; Amplimit
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文提出SortScrews数据集,用于解决工业自动化中螺钉分类问题,通过标准化采集设置获取6种螺钉类型和背景类图像,采用EfficientNet-B0和ResNet-18进行迁移学习,验证了在小数据集下可控采集条件下的有效学习能力。
MANSION: 多楼层语言到3D场景生成用于长周期任务
机构 * Tsinghua University(清华大学) ; AgiBot ; McGill University, MILA - Quebec AI Institute(麦吉尔大学,魁北克人工智能研究所)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 MANSION是首个多楼层语言驱动的3D场景生成框架,能生成真实可导航的建筑环境,支持跨楼层长周期任务的开发与评估,同时配套发布MansionWorld数据集和任务语义编辑代理,为空间推理和规划提供关键测试平台。
部署时学习机器人策略的可靠性
机构 * STANFORD UNIVERSITY(斯坦福大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文研究了如何通过部署时机制提升学习机器人策略的可靠性,提出运行时监控、数据驱动的可解释性框架及长周期任务执行方法,以应对部署中的分布偏移、误差叠加和复杂依赖性问题。
Comments Stanford University PhD dissertation, 2026. 182 pages, 37 figures. Available from Stanford Digital Repository
X-AVDT:用于鲁棒深度伪造检测的音频视觉交叉注意力
机构 * Visual Media Lab, KAIST(韩国科学技术院视觉媒体实验室)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 X-AVDT通过利用生成器内部的音频视觉一致性线索,提出了一种鲁棒且具有通用性的深度伪造检测方法,有效提升了检测性能。
Journal ref CVPR 2026
Pri4R: 通过特权4D表示学习视觉-语言-动作模型的世界动态
机构 * KAIST AI(韩国科学技术院人工智能研究中心) ; LG AI Research(LG人工智能研究) ; Yonsei University(延世大学) ; Seoul National University(首尔国立大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 Pri4R通过特权4D表示学习视觉-语言-动作模型的世界动态,提升操控任务性能
通过桥梁预训练生成模型实现改进的约束生成
机构 * University of British Columbia(不列颠哥伦比亚大学) ; Inverted AI
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出了一种通过桥梁预训练生成模型实现改进的约束生成方法,通过在可行区域内生成样本并保持现实感,实现了约束满足与采样质量之间的新平衡。
TimeWarp: 通过回顾过去评估网络代理
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 TimeWarp通过模拟变化的网络环境评估代理鲁棒性,提出TimeTraj算法提升计划收集效果
关于数据在开放集具身助益中的优势与劣势
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文研究了多模态基础模型在开放集辅助任务中的泛化能力,通过合成数据集评估模型在新用户行为和新配置中的表现,揭示了辅助数据集设计对模型性能的关键影响。
Tether: 基于对应驱动轨迹扭曲的自主功能性玩耍
机构 * University of Pennsylvania(宾夕法尼亚大学) ; University of California, Berkeley(加州大学伯克利分校) ; Dyna Robotics(Dyna机器人技术)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 Tether通过基于对应驱动的轨迹扭曲,实现从少量演示开始的自主多任务玩耍,生成高质量数据集并提升模仿策略性能。
Comments International Conference on Learning Representations (ICLR), 2026. Project website and code: https://tether-research.github.io
ConEQsA:并发与异步具身问题调度与回答
机构 * Software Engineering Institute, East China Normal University(东华大学软件工程学院) ; Department of Computer Science, Yale University(耶鲁大学计算机科学系) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) ; College of Connected Computing, Vanderbilt University(范德比大学连接计算学院)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 ConEQsA通过并发与异步机制提升具身问题回答的效率与响应能力
Comments 8 pages, 6 figures
V-MORALS: 基于视觉莫尔斯图的学得潜在空间中吸引区域估计
机构 * Viterbi School of Engineering, University of Southern California(美国南加州大学维特比工程学院) ; Automatic Control Laboratory, ETH Zürich(瑞士苏黎世联邦理工学院自动控制实验室)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 V-MORALS通过学习潜在空间生成莫尔斯图,实现无需全状态信息的吸引区域估计,适用于仅使用传感器数据的机器人系统分析。
硬件加速的生物与工程空气中超声系统几何模拟
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract)
AI总结 SonoTraceUE是一种基于Unreal Engine的高保真声学仿真框架,通过硬件加速的射线追踪和蒙特卡洛衍射模型,实现动态多材料环境中的实时声学传感模拟,用于生物声学研究和机器人闭环系统开发。
超越实体 haystack 中的针(针):环境、架构和训练考虑因素在长上下文推理中的应用
机构 * University of California, San Diego(加州大学圣地亚哥分校)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出 $\infty$-THOR 框架,通过长上下文推理任务和数据集提升实体 AI 的长期推理能力。
模拟现实世界:多模态生成模型的统一综述
机构 * Thrust of Artificial Intelligence, The Hong Kong University of Science and Technology (Guangzhou)(人工智能前沿技术研究所,香港科学与技术大学(广州)) ; Department of Computer Science and Engineering, The Hong Kong University of Science and Technology Hong Kong SAR(计算机科学与工程系,香港科学与技术大学香港特别行政区) ; MMLab, The Hong Kong University of Science and Technology(多模态实验室,香港科学与技术大学) ; School of Electronics and Communication Engineering, Shenzhen Campus of Sun Yat-sen University(电子与通信工程学院,中山大学深圳校区) ; The Chinese University of Hong Kong, Hong Kong, China(香港中文大学,香港,中国) ; Tsinghua University, Guangdong, China(清华大学,广东,中国) ; Bosch (China) Investment Co., Ltd., Shanghai, China(博世(中国)投资有限公司,上海,中国)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 本文首次系统性地统一研究了2D、视频、3D和4D生成,为多模态生成模型和现实世界模拟提供了统一框架的综述。
Comments Repository for the related papers at https://github.com/ALEEEHU/World-Simulator
Sim2real图像翻译实现从固定相机数据集的视角鲁棒策略
机构 * Institute of Robotics and Intelligent Machine(机器人与智能机器研究所) ; Georgia Institute of Technology(佐治亚理工学院)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 MANGO通过无配对图像翻译方法,从固定相机数据集生成视角鲁棒的机器人策略,显著提升现实任务中的视角适应能力。
OAT:有序动作标记化
专题命中 机器人数据与评测 :robot learning(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 OAT通过有序动作标记化方法,实现高压缩性和因果有序的标记空间,提升机器人动作生成的灵活性和性能。
LIBERO-X:用于视觉-语言-动作模型的鲁棒性检测仪
机构 * Meituan(美团) ; Beihang University(北京航空航天大学)
专题命中 机器人数据与评测 :manipulation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 LIBERO-X通过分层评估协议和多样化训练数据集,系统性地提升视觉-语言-动作模型的鲁棒性评估能力。
Comments 19 pages, 14 figures and 8 tables
基于三帧RGB扫描编码的实时2D激光雷达目标检测
机构 * Smart Systems Group, Institute of Engineering Hanze University of Applied Sciences, Groningen, The Netherlands
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本研究提出一种基于三帧RGB扫描编码的实时2D激光雷达目标检测方法,实现高效且隐私友好的嵌入式室内机器人感知。
Comments 6 pages, 6 figures, submitted to IEEE SAS 2026
单目手术工具姿态估计——在真实环境中
机构 * Faculty of Data and Decision Sciences, Technion - Israel Institute of Technology, Haifa, Israel(数据与决策科学学院,技术Ion-以色列理工学院,海法,以色列)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 本文提出了一种基于合成数据和真实数据的单目手术工具姿态估计框架,通过域适应和伪标签提升实际应用性能。
Comments Author Accepted Manuscript (AAM)
Journal ref Medical Image Analysis, 2025
FireFly-P:FPGA加速的脉冲神经网络可塑性用于鲁棒自适应控制
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract)
AI总结 FireFly-P是一种基于FPGA的脉冲神经网络可塑性加速器,通过高效硬件设计实现低功耗、低延迟的自适应控制
Comments 5 pages, 4 figures. Accepted for lecture presentation at the 2026 IEEE International Symposium on Circuits and Systems (ISCAS 2026)
3DGesPolicy: 基于动作控制的音素感知整体语义手势生成
机构 * The University of Osaka(大阪大学) ; Osaka Electro-Communication University(大阪电讯大学) ; Osaka University(大阪大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 3DGesPolicy通过基于动作控制的框架,结合音素感知和多模态信号融合,实现了更自然且高度语音对齐的整体语义手势生成。
Comments 13 pages, 5 figures