ScratchWorld: Evaluating If World Models Compute Executable Consequences
ScratchWorld: 评估世界模型是否计算可执行后果
专题命中 具身推理 :world model(title)
AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
ScratchWorld: 评估世界模型是否计算可执行后果
专题命中 具身推理 :world model(title)
AI总结 提出ScratchWorld基准,通过Scratch项目验证世界模型在稀疏变化环境中的状态预测、因果归因等能力,发现模型常忽略可执行规则,最高仅达13.8%的F1值。
高曲率翘曲几何中的卡鲁扎-克莱因引力子:一个新视角
专题命中 具身推理 :world model(abstract)
AI总结 本文在五维f(R)引力翘曲膜世界中,通过欧几里得路径积分求解引力子涨落的薛定谔方程,得到高曲率修正对KK引力子谱和耦合的影响,发现质量上移、截面压低而衰变宽度增强。
Comments 31 pages, 6 figures and 1 table
E-VLA:事件增强的视觉-语言-动作模型用于暗光和模糊场景
机构 * Zhejiang University(浙江大学) ; Ant Group(蚂蚁集团) ; Hunan University(湖南大学)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 E-VLA通过事件流中的运动和结构线索提升暗光和模糊场景下的操控鲁棒性,利用事件驱动感知增强视觉-语言-动作模型的性能。
Comments Accepted to ECCV 2026. Code and dataset will be available at https://github.com/JJayzee/E-VLA
LaMP: 以3D场景流作为潜在运动先验的视觉-语言-动作策略学习
机构 * Southeast University(东南大学) ; School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) ; Zhejiang University(浙江大学) ; Beihang University(北京航空航天大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV
AI总结 提出LaMP框架,通过门控融合将3D场景流作为潜在运动先验,对齐运动专家与动作专家,提升VLA策略在复杂空间交互中的鲁棒性,在LIBERO等基准上取得最高平均成功率。
Comments Accepted to ECCV2026
MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽
机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) ; College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。
Comments Accepted as main conference paper at ACL 2026
重新审视视觉-语言-动作模型中的参数冗余:从VLM到VLA适配的见解
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Chinese Academy of Sciences(中国科学院大学) ; School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学与工程学院) ; School of Computer Science, The University of Sydney(悉尼大学计算机科学学院)
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO
AI总结 通过分析VLM到VLA适配中参数差异的空间分布,设计多模块联合剪枝方案,在无需微调恢复的情况下减少12%-30%参数并保持约90%性能。
Comments 22 pages, 3 figures, ECCV 2026 Conference
Z-1: 面向视觉-语言-动作模型的高效强化学习
机构 * Zioneer Robot Team(Zioneer机器人团队)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出Z-1框架,结合共享前缀生成、树状轨迹分支、完成感知奖励校准和选择性联合训练,通过GRPO策略在24个RoboCasa任务上平均成功率80.6%,较SFT提升13.2%。
面向强化学习的阶段转换密集奖励建模
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Zerith Robotics
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出阶段转换密集奖励(STDR)框架,利用专家视频学习任务阶段结构,提供阶段转换和阶段内进展两种密集奖励信号,结合OOD检测和抓取调节模块,提升机器人操作任务的样本效率和成功率。
Comments 8 pages,3 figures
HydroGym:流体动力学的强化学习平台
机构 * University of Washington(华盛顿大学) ; AI Institute in Dynamic Systems, University of Washington(华盛顿大学人工智能研究所) ; RWTH Aachen University(亚琛工业大学) ; Inha University(仁荷大学) ; University of Michigan(密歇根大学) ; KTH Royal Institute of Technology(瑞典皇家理工学院) ; Technical University of Munich(慕尼黑工业大学) ; Arts et Métiers Institute of Technology(国立高等工程技术学校) ; CNAM(法国国立工艺学院) ; DynFluid, HESAM Université(HESAM大学流体动力学实验室) ; Munich Institute of Integrated Materials, Energy and Process Engineering, Technical University of Munich(慕尼黑工业大学综合材料、能源与工艺工程研究所) ; JARA Center for Simulation and Data Science, RWTH Aachen University(亚琛工业大学JARA模拟与数据中心) ; MediaTek Research(联发科技研究中心) ; German Center for Neurodegenerative Diseases(德国神经退行性疾病中心)
专题命中 模仿学习与强化学习 :robotics(abstract);manipulation(abstract);分类 cs.AI、cs.LG
AI总结 提出HydroGym,一个求解器无关的强化学习平台,提供61+个已验证的流场环境,支持多种后端,RL智能体发现鲁棒控制原理,并实现零样本迁移,显著降低探索成本。
基于安全盾牌强化学习的高速度视觉飞行在杂乱环境中
机构 * Institute of Cyber-Systems and Control, College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院工业控制技术研究所) ; Differential Robotics(微分机器人)
专题命中 模仿学习与强化学习 :navigation(abstract);robotics(comments,journal_ref);分类 cs.RO
AI总结 提出一种结合模型安全机制的端到端强化学习框架,通过物理信息奖励和实时安全滤波器实现高速飞行与严格避障,在杂乱环境和森林中速度达7.5 m/s。
Comments Published in IEEE Robotics and Automation Letters
Journal ref IEEE Robotics and Automation Letters, 2026
基于失败的深度强化学习智能体测试方法
专题命中 模仿学习与强化学习 :robotic(abstract)
AI总结 针对深度强化学习智能体测试中奖励信号失效的问题,提出一种基于任务失败洞察的黑盒测试方法PRT,通过优先测试高难度任务来提升故障检测效率,在四个基准上测试成本降低超50%。
Comments 22 pages
通过强化学习实现归巢
专题命中 模仿学习与强化学习 :navigation(abstract)
AI总结 提出强化学习框架模拟连续二维域中的自适应归巢,发现平均归巢时间随旋转扩散强度呈非单调变化,且RL智能体比主动布朗粒子更快、更定向。
基于多模态语音、手势和音乐的LLM驱动交互式机器人动作合成
机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究院)
专题命中 人机交互与遥操作 :robotic(title,abstract);robotics(abstract);分类 cs.RO、cs.AI
AI总结 提出利用大语言模型融合语音、手势和音乐节拍等多模态输入,合成复杂机器人动作序列的框架,实现更自然的人机交互。
Comments IROS 2025 Workshop on Action and Interaction: Humans and Robots in Collaboration
SpatialUAV:低空无人机感知、协作与运动的空间智能基准
机构 * IEEE
专题命中 人机交互与遥操作 :navigation(abstract);分类 cs.AI、cs.CV
AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。
Comments 10 pages, 7 figures
OopsieVerse: 一个具有损伤感知仿真的机器人操作安全基准
机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中 机器人数据与评测 :manipulation(title,abstract);navigation(abstract);robotic(abstract);分类 cs.RO
AI总结 提出OopsieVerse框架,通过DamageSim检测和量化接触力、温度等损伤信号,在OmniGibson和RoboCasa仿真器中实现损伤感知,用于安全策略学习与评估。
Comments Project website: https://robin-lab.cs.utexas.edu/oopsieverse/. The first two authors contributed equally; order decided by dice roll. Accepted to Robotics: Science and Systems (RSS 2026)
基于物理的机器人交互的遮挡鲁棒多对象解耦
机构 * Pengcheng Laboratory(鹏城实验室) ; Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)
专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.CV
AI总结 提出一种无掩码方法,从稀疏遮挡视角实现无损多对象3D重建,通过MPM模拟实现物理合理的机器人交互,核心是利用联合SDS过程结合扩散先验实现对象解耦。
Comments 7 pages, 6 figures
MultiUAV-Plat:面向多无人机协同任务规划的LLM平台、基准测试与框架
机构 * National Key Laboratory of Information Systems Engineering, National University of Defense Technology(国防科技大学信息系统工程国家重点实验室)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出MultiUAV-Plat平台与基准测试,以及Agent4Drone框架,通过LLM驱动的工具交互实现多无人机协同任务规划,在任务通过率等指标上显著优于基线方法。
可扩展的全身运动迁移:基于隐式动力学运动重定向
机构 * HKUST(GZ)(香港科技大学(广州)) ; ETH Zurich(苏黎世联邦理工学院) ; Zhejiang University(浙江大学) ; Xiaomi Robotics Lab(小米机器人实验室)
专题命中 机器人数据与评测 :robotics(abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 提出隐式动力学运动重定向(IKMR),利用骨架图卷积双自编码器将人体与机器人运动映射到共享拓扑潜空间,结合物理信息精炼实现高速、鲁棒的运动数据转换,解决噪声与计算瓶颈。
Comments RSS 2026 Workshop. Webpage: https://cybercal.github.io/webpage.ikmr
一视频一世界:将单目视频转化为物理4D场景
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; SparcAI Inc(SparcAI公司) ; University of Science and Technology of China(中国科学技术大学) ; The Hong Kong Polytechnic University(香港理工大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Nanyang Technological University(南洋理工大学) ; Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)
专题命中 机器人数据与评测 :embodied AI(abstract);world model(abstract);分类 cs.CV
AI总结 提出OVOW,首个无需训练的系统,从单目视频重建实例级、可仿真的4D网格场景,通过视觉语言模型发现实例、类别感知重建、迭代优化恢复尺度与位姿、物理装配确保接触支撑,并建立结构化视频到4D评估基准。
Comments Accepted by ECCV 2026. Project Page: https://OneVideoOneWorld.github.io/
CasaMaestro:用于房屋级3D重建的多视角全景图
机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院AutoLab)
专题命中 机器人数据与评测 :embodied AI(abstract);navigation(abstract);分类 cs.CV
AI总结 提出CasaMaestro模型,仅需20-50张稀疏多视角室内全景图,即可直接预测度量深度和相机位姿,实现全屋快速点云重建,是首个支持房屋级重建的多视角全景模型。
Comments Accepted to ECCV2026
RCT:用于触觉泛化的机器人采集触觉-视觉-语言数据集
机构 * ScaDS.AI, TU Dresden(德累斯顿工业大学ScaDS.AI) ; LASR Lab, TU Dresden(德累斯顿工业大学LASR实验室)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 提出RCT数据集,包含机器人按压122种工业材料采集的触觉数据,通过接触序列划分暴露了材料泛化难题,为触觉感知提供基准。
MECoBench:具身环境中多模态智能体协作的系统研究
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 机器人数据与评测 :embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 提出MECoBench基准,通过多任务、多结构、多模式的实验,系统研究多模态大模型在具身环境中的协作机制,发现协作能提升任务完成度但需平衡收益与复杂度,通信是关键,且协作增强鲁棒性。
Comments Project website: https://q-i-n-g.github.io/MECoBench-Website/
实时无源目标检测
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.AI、cs.CV
AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。
Comments Accepted to ECCV 2026
基于结构化自回归建模的长期交通仿真
机构 * The University of Hong Kong(香港大学)
专题命中 机器人数据与评测 :world model(abstract);分类 cs.RO、cs.AI
AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。
Comments ECCV 2026 Accepted
利用真实世界故障记录生成自动驾驶系统测试场景
机构 * Massachusetts Institute of Technology(麻省理工学院)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI
AI总结 提出一种基于LLM的场景生成流程,利用历史故障记录中的分类和上下文信息,生成多样化测试场景,在Metadrive模拟器上验证了方法的准确性和多样性。
Comments 9 pages, Appendix included. Paper accepted and presented at NeuS 2026
大语言模型漏洞的生命周期与应用栈调查:攻击、风险、防御与开放问题
机构 * Worcester Polytechnic Institute(伍斯特理工学院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.AI
AI总结 本文通过生命周期与应用栈视角系统化梳理大语言模型系统的漏洞,涵盖数据收集、预训练、对齐、供应链、检索、推理、工具执行和部署等阶段,分析攻击、风险与防御,并提出安全研究议程。
FalconApp:通过自动标注的合成数据实现端到端感知的快速iPhone部署
机构 * Department of Electrical and Computer Engineering, University of Illinois at Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校电子与计算机工程系)
专题命中 机器人数据与评测 :robotics(abstract);分类 cs.RO
AI总结 FalconApp通过自动标注的合成数据实现端到端感知的快速iPhone部署,利用手机拍摄的刚体对象生成感知模块,实现遮挡检测和6自由度姿态估计,实验显示其在模拟和现实评估中姿态精度优于PnP基线。
用于分区端口-哈密顿系统并行仿真的早期可终止节能迭代耦合
机构 * School of Mechanical Engineering, Shanghai Jiao Tong University(上海交通大学机械与动力工程学院)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO
AI总结 针对并行仿真中分区耦合可能注入虚假能量的问题,提出基于Douglas-Rachford分裂的早期可终止节能耦合接口,利用Fejér单调性提供算法耗散,保证离散无源性并收敛到整体离散化。
血管化机器人躯体中的生成
专题命中 其他机器人 :robotic(title,abstract);robotics(abstract);分类 cs.RO
AI总结 本文提出了一种通过动态材料重构实现机器人身体内在功能适应和发展的方法,通过利用流体ics重构材料界面,实现基于环境提示的传感器生成,展示了在血管化机器人复合材料中通过光聚合物化实现材料级功能重构的可行性。
Comments Supplementary Files currently unavailable online. Please contact the First Author to request any Supplementary Files; Version 3 - revision
UnfoldArt: 从文本或图像零样本恢复完整关节式3D物体
机构 * Technical University of Munich(慕尼黑工业大学) ; Mohamed Bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中 其他机器人 :robotics(abstract);embodied AI(abstract);分类 cs.CV
AI总结 提出首个辩论驱动代理方法,结合视觉语言模型和视频生成先验,从文本或图像零样本重建关节式3D物体的结构、运动与隐藏几何。
Comments Project page: https://aminebdj.github.io/unfoldart