arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2026-08-31 至 2026-08-31 共收录 4 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 4 篇

2608.27609 2026-08-31 cs.RO cs.AI 新提交 73%

PHR-VLA: Planning Horizon Reasoning for Vision-Language-Action Models

PHR-VLA:面向视觉-语言-动作模型的规划视界推理

Davood Soleymanzadeh, Kaidi Zhang, Zhiyuan Zhang, Bihao Zhang, Xiao Liang, Yu She, Minghui Zheng

机构 * Texas A&M University(德克萨斯农工大学) Purdue University(普渡大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对现有视觉-语言-动作模型缺乏未来任务动态推理机制的问题,提出PHR-VLA框架,通过辅助未来头对齐潜在动态,提升了机器人操纵任务的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04208 2026-08-31 cs.RO cs.AI cs.LG 版本更新 67%

SCALE: Self-uncertainty Conditioned Adaptive Looking and Execution for Vision-Language-Action Models

SCALE: 基于自不确定性条件自适应观察与执行的视觉-语言-动作模型

Hyeonbeom Choi, Daechul Ahn, Youhan Lee, Taewook Kang, Seongwon Cho, Jonghyun Choi

机构 * Seoul National University(首尔国立大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.AI、cs.LG

AI总结 提出SCALE推理策略,利用自不确定性联合调节视觉感知和动作,无需额外训练或验证器,仅单次前向传播,提升VLA模型在模拟和真实环境中的鲁棒性。

Comments ICML 2026 Spotlight. Project page: this https URL (https://dcahn12.github.io/projects/scale/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28108 2026-08-31 cs.RO cs.CV 新提交 62%

DeicticVLA: Unifying Instruction Modes Based on Language and Deictic Gestures in a Single VLA

DeicticVLA:在单一视觉-语言-动作模型(VLA)中统一基于语言和指示手势的指令模式

Kango Yanagida, Tatsuya Aoki, Yuichiro Yoshikawa, Takato Horii

机构 * The University of Osaka(大阪大学) The University of Tokyo(东京大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO、cs.CV

AI总结 本研究提出DeicticVLA,将三种指令模式统一于单一VLA,经仿真与真实任务验证,其在未见场景和新类别下的表现优于仅用语言指令的模型,为相关设计提供指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04633 2026-08-31 cs.RO 版本更新 57%

Mind-VLA: Instruction-Aware Spatial Representation Alignment for Vision-Language-Action Models

Mind-VLA:面向视觉-语言-动作模型的指令感知空间表示对齐方法

Xingyu Ding, Yuzhong Zhao, Yang Wu, Chunhai Zhao, Chaoyang Zhao, Yifan Zhang, Jian Cheng

机构 * Nanjing University(南京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 机器人基础模型 :manipulation(abstract);分类 cs.RO

AI总结 本文针对现有VLA方法忽略指令指定目标物体3D几何的问题,提出Mind-VLA方法,通过对齐目标物体相关特征实现指令感知3D理解,在LIBERO、CALVIN及真实机器人遮挡任务上性能显著优于基线。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏