arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-02-03 至 2026-02-03 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. 部署与泛化 2 篇

2511.06356 2026-02-03 cs.LG cs.AI q-bio.BM 76%

Reaction Prediction via Interaction Modeling of Symmetric Difference Shingle Sets

通过对称差鳞片集的交互建模进行反应预测

Runhan Shi, Letian Chen, Gufeng Yu, Yang Yang

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学)

专题命中 部署与泛化 :action model(title);分类 cs.AI、cs.LG

AI总结 ReaDISH通过引入对称差鳞片编码和几何-结构交互注意力机制,提升了反应预测的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01067 2026-02-03 cs.RO 57%

A Systematic Study of Data Modalities and Strategies for Co-training Large Behavior Models for Robot Manipulation

对大型行为模型在机器人操作中协同训练数据模态和策略的系统研究

Fanqi Lin, Kushal Arora, Jean Mercat, Haruki Nishimura, Paarth Shah, Chen Xu, Mengchao Zhang, Mark Zolotas, Maya Angeles, Owen Pfannenstiehl, Andrew Beaulieu, Jose Barreiros

机构 * Toyota Research Institute, Cambridge MA(丰田研究院) Tsinghua University, Beijing, China(清华大学)

专题命中 部署与泛化 :vision-language-action(abstract);分类 cs.RO

AI总结 本文研究了机器人操作中协同训练不同数据模态和策略对行为模型性能的影响,发现视觉语言和跨身体数据显著提升泛化能力,而离散动作令牌无明显优势。

详情

展开后加载摘要…

URL PDF HTML 收藏