arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2025-11-12 至 2025-11-12 共收录 1 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 1 篇

2505.17685 2025-11-12 cs.CV 70%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);分类 cs.CV

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏