arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-25 至 2026-08-25 共收录 33 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 动作表示与策略 1 篇

2608.22197 2026-08-25 cs.LG 新提交 79%

On the Capability Separation Between World-Model Policy Learning and Imitated World-Action Models

世界模型策略学习与模仿世界-动作模型之间的能力分离

Yang Yu

机构 * Nanjing University(南京大学)

专题命中 动作表示与策略 :action model(title,abstract);分类 cs.LG

AI总结 该研究对比了直接行为克隆策略等三类策略,明确世界-动作模型学习与直接行为克隆的能力差异,指出观测演示无法识别动作效果,干预可实现零遗憾值。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 机器人基础模型 1 篇

2608.22035 2026-08-25 cs.RO 新提交 57%

Ludi${}_{\scriptscriptstyle 0.1}$: An Agentic System for Socially Intelligent Robots

Ludi₀.₁:面向社交智能机器人的智能体系统

Wooseong Chung, William Cong, Jakub Dworakowski, Ethan Ewer, Tri Wahyu Guntara, Yeonwoo Jeong, Tianchong Jiang, Chaewon Kim, Hyunseo Kim, Jinwoo Kim, Jinyeon Kim, Yea-Seul Kim, Jack Kunde, Kangwook Lee, Sangheon Lee, Robert Nowak, Junha Roh

机构 * Ludo Robotics(乐动机器人)

专题命中 机器人基础模型 :robot foundation model(abstract);分类 cs.RO

AI总结 该研究提出Ludi₀.₁智能体系统,集成多技能与微调视觉语言模型,为社交智能机器人提供可行的人机协作方案,还可生成相关交互轨迹用于开发更融合的机器人基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 数据集与评测 1 篇

2608.22990 2026-08-25 cs.RO 新提交 77%

InstructMove: A Text-Indispensable Benchmark for Instruction-Following Manipulation

InstructMove:一种指令跟随操作的文本不可或缺基准

Mengao Zhao, Ziang Li, Chaodong Huang, Mengchen Ma, Haoyi Jiang, Yiwei Jin, Xinjie Wang, Yun Du, Xuewu Lin, Taojun Ding, Hongyu Xie, Jackson Jiang, Chunlei Yu, Kaihua Zhang, Lichao Huang, Liu Liu, Tianwei Lin, Zhizhong Su

机构 * Horizon Robotics(地平线机器人) WuwenAI(悟文智能) Southeast University(东南大学) Huazhong University of Science and Technology(华中科技大学)

专题命中 数据集与评测 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO

AI总结 针对现有操作基准无法充分检验机器人指令跟随能力的问题,提出文本不可或缺的InstructMove基准,将指令跟随分解为多环节,实验表明其可诊断视觉捷径且模拟数据能提升现实操作性能。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏