arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

2025-12-09 至 2025-12-09 共收录 3 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人基础模型 3 篇

2512.07582 2025-12-09 cs.RO 77%

See Once, Then Act: Vision-Language-Action Model with Task Learning from One-Shot Video Demonstrations

一次观看,随后行动:基于单次视频示范的任务学习视觉-语言-行动模型

Guangyan Chen, Meiling Wang, Qi Shao, Zichen Zhou, Weixin Mao, Te Cui, Minzhao Zhu, Yinan Deng, Luojie Yang, Zhanqi Zhang, Yi Yang, Hua Chen, Yufeng Yue

机构 * Beijing Institute of Technology(北京理工大学) LimX Dynamics

专题命中 机器人基础模型 :robotics(abstract);manipulation(abstract);robotic(abstract);分类 cs.RO

AI总结 ViVLA通过单次视频示范高效学习机器人操控任务,实现跨任务和跨身体的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03724 2025-12-09 cs.CV cs.RO 73%

PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA: 通过姿态条件化锚点注意力增强动作生成

Ziwen Li, Xin Wang, Hanlue Zhang, Runnan Chen, Runqi Lin, Xiao He, Han Huang, Yandong Guo, Fakhri Karray, Tongliang Liu, Mingming Gong

机构 * MBZUAI AI2 Robotics The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 机器人基础模型 :manipulation(abstract);robotic(abstract);分类 cs.RO、cs.CV

AI总结 PosA-VLA通过姿态条件化锚点注意力机制提升动作生成的精度和效率,适用于多样化的机器人任务和复杂环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00975 2025-12-09 cs.CV cs.LG cs.RO 67%

MM-ACT: Learn from Multimodal Parallel Generation to Act

MM-ACT: 从多模态并行生成中学习以行动

Haotian Liang, Xinyi Chen, Bin Wang, Mingkang Chen, Yitian Liu, Yuhao Zhang, Zanxin Chen, Tianshuo Yang, Yilun Chen, Jiangmiao Pang, Dong Liu, Xiaokang Yang, Yao Mu, Wenqi Shao, Ping Luo

机构 * Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) The University of Hong Kong(香港大学) University of Science and Technology of China(中国科学技术大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

专题命中 机器人基础模型 :robotic(abstract);分类 cs.RO、cs.CV、cs.LG

AI总结 MM-ACT通过多模态并行生成提升机器人任务执行能力,实现96.3%的成功率。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏