arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-24 至 2026-08-24 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 2 篇

2608.21031 2026-08-24 cs.RO 新提交 57%

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP:基于物理引导探索的代码即策略智能体

Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

机构 * National Taiwan University(台湾大学) NVIDIA Research(英伟达研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20478 2026-08-24 cs.RO 新提交 57%

EndoLIFT: Language-Disambiguated Latent-Conditioned Rectified Flow for Bidirectional Endoscopic Control

EndoLIFT:用于双向内镜控制的语言消歧潜在条件修正流

Chi Kit Ng, Yidong Zhang, Lui Siu Hing, Jinsong Lin, Tianchun Wu, Ho Yin Chim, Zhiqing Tang, Tao Yang, Huxin Gao, Trevor Yeung, Raymond Shing-Yan Tang, Hongliang Ren

机构 * The Chinese University of Hong Kong(香港中文大学) The Sixth Affiliated Hospital, Sun Yat-sen University(中山大学附属第六医院)

专题命中 动作表示与策略 :vision-language-action(abstract);分类 cs.RO

AI总结 EndoLIFT是一种视觉-语言-动作策略,通过结合语言意图条件与潜在条件修正流,解决双向内镜控制的意图混叠问题,在导航准确率、错误方向减少及多 phantom 试验中均取得显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏