BLADE: Better Language Answers through Dialogue and Explanations
BLADE:通过对话和解释提升语言答案
机构 * University of Florida(佛罗里达大学)
专题命中 具身导航 :navigation(abstract)
AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。
Comments Contains 7 figures
视觉与机器人
机器人、具身智能、机器人学习、操作、导航和具身世界模型。
BLADE:通过对话和解释提升语言答案
机构 * University of Florida(佛罗里达大学)
专题命中 具身导航 :navigation(abstract)
AI总结 BLADE通过引导学习者接触相关教学资源而非直接提供答案,提升学生对课程资源的导航能力和概念理解。
Comments Contains 7 figures
从世界模型到世界动作模型:面向机器人学的简明教程
专题命中 具身推理 :robotics(title,abstract);world model(title,abstract);robotic(abstract);分类 cs.RO、cs.AI
AI总结 本教程提出世界模型作为动作条件预测模型的设计空间视图,分类为观测空间和状态空间模型,并引入世界动作模型,总结四种代表性范式,为具身预测与控制提供结构化分类。
Comments Project page: https://clearlab-sustech.github.io/WorldModelSurvey/
具身智能工业机器人:框架与技术
专题命中 具身推理 :robotics(title,abstract);world model(abstract);分类 cs.RO
AI总结 本文提出了一种新的基于知识的具身智能工业机器人框架,旨在提升工业机器人在复杂环境中的智能水平和应用潜力。
Comments 70 pages, 13 figures. The associated project can be found at https://github.com/jackyzengl/EIIR
Journal ref Journal of Manufacturing Systems 88 (2026) 158-189
更好的槽,更好的世界:以对象为中心的世界模型中的表示质量与鲁棒性
专题命中 具身推理 :world model(title,abstract);分类 cs.AI、cs.CV、cs.LG
AI总结 该研究通过受控实验分析以对象为中心的世界模型,发现槽质量与规划成功率正相关,槽绑定良好时可减少辅助输入,且在分布偏移下其鲁棒性优于LeWM,预训练特征是鲁棒性关键因素。
Comments Published at Model-Based RL in the Era of Generative World Models Workshop at RLC 2026
世界令牌:通过训练时世界建模增强具身策略
机构 * JIUTIAN Research(九天研究院) ; Zhongguancun Academy(中关村学院)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO、cs.CV
AI总结 本文提出World Tokens架构,通过训练时的World Adapter衔接视觉-语言理解、世界动态建模与动作生成,在保持高效部署的同时提升具身策略性能,在多个基准测试中取得优异结果。
驾驶世界模型如何能进行反事实预测?
机构 * Purdue University(普渡大学) ; Bosch Center for Artificial Intelligence(博世人工智能中心)
专题命中 具身推理 :world model(title,abstract);分类 cs.CV
AI总结 本文指出驾驶世界模型的反事实预测目标与直接动作条件预测存在根本差距,构建基准验证该问题,并提出简单无训练流程提升反事实预测效果,呼吁开发更好的相关方法。
VIScore:诊断潜在世界模型中与规划相关的质量
机构 * Altos Labs(阿尔托斯实验室) ; Brown University(布朗大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.RO
AI总结 该研究针对潜在世界模型规划成功率与潜在空间属性脱节的问题,提出VIScore指标,覆盖编码器、预测器、规划器,在跨任务场景下斯皮尔曼相关性超0.75,可更好解释规划成功率。
通过可执行模型理解人类行为
机构 * School of Informatics The University of Edinburgh(信息学院爱丁堡大学)
专题命中 具身推理 :world model(title,abstract);分类 cs.AI
AI总结 本文提出EXACT语言,通过可执行神经符号模型分析人类动作,提升动作分割和异常检测的效率与直观性。
Comments Accepted in ECCV2026 Workshop
具身融合智能体:以人为中心的智能体人工智能新范式
机构 * Université de Montréal(蒙特利尔大学) ; Mila – Quebec Artificial Intelligence Institute(米拉-魁北克人工智能研究所) ; Institute of Advanced Intelligence and Computing (IAIC), A*STAR(新加坡科技研究局高级智能与计算研究所) ; Nanjing Medical University(南京医科大学) ; Nanjing University(南京大学) ; Renmin University of China(中国人民大学) ; University of Cambridge(剑桥大学) ; University of Oxford(牛津大学) ; Tsinghua University(清华大学) ; National University of Singapore(新加坡国立大学) ; The Hong Kong University of Science and Technology(香港科技大学) ; The Hong Kong Polytechnic University(香港理工大学) ; Southern University of Science and Technology(南方科技大学) ; Southeast University(东南大学) ; University of Glasgow(格拉斯哥大学) ; Nanyang Technological University(南洋理工大学)
专题命中 具身推理 :world model(abstract,abstract_cn);embodied agent(abstract);分类 cs.AI
AI总结 该研究提出以人为中心的 Combodied Agents 新范式,整合多类智能体能力形成闭环,聚焦人类状态轨迹建模,推动智能体 AI 从任务完成转向人类持续福祉。
Comments 38 pages, 6 figures, 10 tables
4D-WAM:通过轨迹场将时空感知注入世界动作模型
专题命中 具身推理 :world model(abstract);robotic(abstract);分类 cs.RO
AI总结 本研究提出模型无关的4D-WAM,通过运动对齐与目标对齐两个互补目标,将3D轨迹场的时空知识注入世界动作模型,在多基准实验中显著提升了模型的空间理解等多项性能。
DreamFly:面向空中视觉语言导航的因果记忆与后退时域扩散规划
机构 * School of Electronic Information Engineering, Xi’an Technological University(西安工业大学电子信息工程学院) ; School of Computer Science and Engineering, Xi’an Technological University(西安工业大学计算机科学与工程学院)
专题命中 机器人基础模型 :navigation(title,abstract);embodied agent(abstract);分类 cs.AI、cs.CV
AI总结 DreamFly是基于Dream-VLA的扩散式空中VLN框架,通过因果记忆、后退时域扩散规划和LiteStop解耦终止,在OpenFly基准上显著优于对比方法。
Comments 24 pages, 6 figures, 3 tables
基于最少数据的通用机器人策略适配
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 机器人基础模型 :robot learning(abstract);robot policy(abstract);分类 cs.RO、cs.LG
AI总结 本文提出MiDAS算法,结合离线行为克隆与在线强化学习,实现机器人策略仅用1次演示即可完成任务适配,性能优于基线且能泛化,为机器人自主学习提供可行方案。
G0.5:用于机器人推理与动作的单自回归流
机构 * Galaxea(星系科技(Galaxea))
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.AI
AI总结 本文提出G0.5,一种单自回归流的VLA模型,通过三个关键组件实现推理与动作统一,在7项基准中超越现有最优模型,展现出良好的泛化与指令跟随能力。
VANE:通过未来视觉表示预测实现视觉-语言-动作模型的可靠测试时训练
机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Li Auto Inc.(理想汽车)
专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV
AI总结 本文提出VANE框架,通过条件提示自适应、未来视觉后果学习及候选更新隔离评估的方法,提升VLA策略在闭环操纵中的可靠性,在SimplerEnv WidowX上将平均成功率提高3.2个百分点。
SOMA:通过上下文适应提升视觉-语言-动作模型鲁棒性的战略编排与内存增强系统
专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO
AI总结 SOMA通过对比双记忆检索增强生成(RAG)、归因驱动大语言模型(LLM)编排器和可扩展模型上下文协议(MCP)干预,提升视觉-语言-动作模型在分布外任务中的鲁棒性,实验表明其在长周期任务链中提升了89.1%的绝对成功率。
Comments 8 pages, 10 figures, 4 tables. Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Project page and source code: https://github.com/LZY-1021/RoboHarness
基于稀疏离线到在线强化学习从SMPC演示中学习移动操作
机构 * RAI Institute(RAI研究所) ; Technical University of Munich(慕尼黑工业大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 模仿学习与强化学习 :manipulation(title,abstract);分类 cs.RO、cs.AI
AI总结 本研究利用仿真中SMPC生成的离线数据,结合稀疏奖励训练离策略RL智能体,整合动态稳定性控制器,实现机器人移动操作技能的仿真到真实迁移,性能超越原最优控制方法。
基于技能-工具链进化的自演化具身智能体
机构 * Microsoft Research(微软研究院) ; Northeastern University(东北大学)
专题命中 模仿学习与强化学习 :embodied agent(title,abstract);分类 cs.RO
AI总结 提出免训练的SHAPER框架,通过演化技能与工具链实现冻结模型驱动的自演化具身智能体,在VLABench等数据集上验证其适配优势。
基于重分配的代价推断改进稀疏安全离线强化学习
机构 * University of the Witwatersrand(威特沃特斯兰德大学)
专题命中 模仿学习与强化学习 :manipulation(abstract);robotic(abstract);分类 cs.AI、cs.LG
AI总结 针对安全离线强化学习中稀疏轨迹级停止反馈问题,提出RCI框架转换为密集每步代价,经理论证明转换无损,实验在两类任务上违规率更低且鲁棒性好。
Comments Accepted at the 1st IJCAI Workshop on Safe Physical AI (SPAI 2026), affiliated with IJCAI/ECAI 2026
基于骨骼动作预测与关节级性能评估的自主远程康复
机构 * Institute of Systems and Robotics(系统与机器人研究所) ; University of Coimbra(科英布拉大学)
专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.CV、cs.LG
AI总结 本文提出一种基于骨骼动作预测与关节级性能评估的双模块远程康复系统,其动作分类与预测模块在对应基准上表现优异,为自主反馈式远程康复提供了新方案。
Comments Accepted at IEEE RO-MAN2026
AI时代提升智能制造劳动力准备度的概念框架
专题命中 人机交互与遥操作 :robotics(abstract);分类 cs.AI
AI总结 针对AI时代智能制造劳动力能力缺口,本文提出含九个阶段、四个支柱的WRL框架,经89个顶点项目验证可诊断能力差距,为教育等领域提供循证工具,未来将校准支柱权重并测试信效度。
Comments 30 pages, 11 figures, submission for ASEE Journal of Engineering Education
智能轮椅人机交互中的运动变异性与用户体验
机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院) ; Université de Sherbrooke(谢布鲁克大学)
专题命中 人机交互与遥操作 :robotic(abstract);分类 cs.RO
AI总结 该研究在智能轮椅共享控制场景中,提出保留自然运动结构的支持自主辅助策略,发现其在任务表现相当的情况下,能提升用户感知自主感与有用性,凸显设计辅助机器人需尊重人类运动结构的重要性。
Comments 15 pages, 7 figures
DaViNCi:面向包含连续动作与动态元素的户外视觉语言导航的数据集
机构 * Shanghai Jiao Tong University(上海交通大学)
专题命中 机器人数据与评测 :navigation(title,abstract);分类 cs.RO
AI总结 本文提出首个同时包含连续动作与动态元素的户外视觉语言导航数据集DaViNCi,通过实验验证其挑战性,为推动户外VLN向更真实环境发展提供实用支撑。
迈向具身智能体的管控
专题命中 机器人数据与评测 :embodied agent(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。
Comments Project page: https://eit-hai.github.io/thea
冗余驱动机器人系统中载荷分布的通用理论
专题命中 机器人数据与评测 :robotic(title,abstract);分类 cs.RO;robotics(comments)
AI总结 本文提出冗余驱动机器人系统中载荷分布的通用理论,推导了高效力合成与分析解,并指出现有方法的不足,通过示例展示改进效果。
Comments 23 pages, 15 figures. Submitted to The International Journal of Robotics Research
视觉推理引导的光场遮挡去除
机构 * Johannes Kepler University(约翰·开普勒大学)
专题命中 机器人数据与评测 :navigation(abstract);robotic(abstract);分类 cs.CV
AI总结 提出结合光场积分与视觉语言模型的框架,通过多视图融合和语义先验恢复被遮挡场景,在合成和真实数据上取得最优性能。
3D场景生成:一项综述
机构 * S-Lab, Nanyang Technological University, Singapore(南洋理工大学S实验室)
专题命中 机器人数据与评测 :robotics(abstract);embodied AI(abstract);分类 cs.CV
AI总结 本综述系统梳理3D场景生成的四大范式方法,分析其技术基础与挑战,展望物理感知生成等方向,为该领域发展提供参考。
Comments Accepted by IJCV. Project Page: https://github.com/hzxie/Awesome-3D-Scene-Generation
从提示到道路:基于大语言模型的代理行为树生成框架用于自动驾驶车辆
机构 * Computer Science & Engineering Department, German University in Cairo (GUC), Egypt(德国亚历山大·冯·洪堡大学(开罗分校)计算机科学与工程系,埃及) ; C-DRiVeS Lab: Cognitive Driving Research in Vehicular Systems, Cairo, Egypt(认知驾驶系统实验室(车辆系统中的认知驾驶研究),开罗,埃及) ; IAV GmbH, Berlin, Germany(IAV GmbH,柏林,德国)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.RO、cs.AI、cs.CV
AI总结 本文提出了一种基于大语言模型和多模态视觉模型的代理行为树生成框架,用于自动驾驶车辆在复杂环境中自适应导航。该框架通过链式符号提示评估场景关键性,通过上下文学习构建高层子目标,并通过生成器合成可执行的BT子树,实现了在CARLA+Nav2模拟中对突发障碍物(如道路堵塞)的成功绕行。
利用分层监督将基于RGB的基础模型重新用于热图像的深度估计
机构 * The University of Hong Kong(香港大学) ; Commonwealth Scientific and Industrial Research Organisation (CSIRO)(英联邦科学与工业研究组织)
专题命中 机器人数据与评测 :robotic(abstract);分类 cs.RO、cs.CV
AI总结 针对热图像深度估计中RGB基础模型分层表示利用不足的问题,提出RGB-HS框架,通过分层监督和基于图像质量的标记加权对齐,在基准上实现了有竞争力的性能。
Comments Accepted in IROS 2026
UniGround: 通过无训练场景解析实现通用三维视觉接地
机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科学与技术大学(广州)) ; Shanghai Normal University(上海师范大学)
专题命中 机器人数据与评测 :embodied AI(abstract);分类 cs.RO、cs.CV
AI总结 UniGround通过无训练的视觉和几何推理实现通用三维视觉接地,超越训练数据限制,在ScanRefer和EmbodiedScan上取得新突破。
Comments 30 pages,9 figures,11 tables
面向自动驾驶中渐进式GNSS欺骗检测的高阶液体证据编码
机构 * Faculty of Information Technology, Beijing University of Technology(北京工业大学信息学部)
专题命中 机器人数据与评测 :navigation(abstract);分类 cs.LG
AI总结 针对自动驾驶中渐进式GNSS欺骗难检测问题,提出因果高阶液体证据框架,在AV-GPS数据集子集上获最高F1分数,可快速检测正常到攻击的转变。