arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

世界模型

面向环境建模、时序预测、仿真规划、具身智能和自动驾驶的世界模型方法与应用。

共收录 6497 信号源:cs.AI, cs.LG, cs.CV, cs.RO, cs.MA

1. 自动驾驶 144 篇

2401.08045 2024-01-17 cs.CV 81%

Forging Vision Foundation Models for Autonomous Driving: Challenges, Methodologies, and Opportunities

Xu Yan, Haiming Zhang, Yingjie Cai, Jingming Guo, Weichao Qiu, Bin Gao, Kaiqiang Zhou, Yue Zhao, Huan Jin, Jiantao Gao, Zhen Li, Lihui Jiang, Wei Zhang, Hongbo Zhang, Dengxin Dai, Bingbing Liu

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

Comments Github Repo: https://github.com/zhanghm1995/Forge_VFM4AD

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15820 2026-07-20 cs.SE 新提交 80%

In the Driver's Seat: A Multi-Company Study on the Reality of Autonomous Driving System Testing

掌控全局:关于自动驾驶系统测试现状的多公司研究

Qunying Song, Yuan Gao, Johannes Betz, Dietmar Pfahl, Mohammad Reza Mousavi, Federica Sarro

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 针对自动驾驶系统测试复杂且缺乏标准的问题,通过对九家公司专家访谈,经主题分析总结行业测试情况、挑战与趋势,提出以证据为中心的闭环测试框架,为ADS测试提供指导并指明未来方向。

Comments 34 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.00911 2026-04-03 cs.SE 80%

Foundation Models for Autonomous Driving System: An Initial Roadmap

自动驾驶系统中的基础模型:初步路线图

Xiongfei Wu, Mingfei Cheng, Xiaoning Ren, Qiang Hu, Jianlang Chen, Yuheng Huang, Maxime Cordy, Yao Zhang, Xiaofei Xie, Lei Ma, Yves Le Traon

专题命中 自动驾驶 :world model(abstract);world models(abstract);world model(abstract);world models(abstract)

AI总结 本文探讨了基础模型在自动驾驶系统中的应用,分析了在基础设施、车载集成和实际部署三个维度中的现状、挑战和研究方向,旨在为构建安全可靠的自动驾驶系统提供指导。

Comments To appear in ACM Transactions on Software Engineering and Methodology (TOSEM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2106.12194 2021-07-06 cs.RO cs.LG 79%

Uncertainty-Aware Model-Based Reinforcement Learning with Application to Autonomous Driving

Jingda Wu, Zhiyu Huang, Chen Lv

专题命中 自动驾驶 :model-based reinforcement learning(title);environment model(abstract);model-based RL(abstract);分类 cs.LG、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15771 2026-03-18 cs.RO cs.AI 76%

CorrectionPlanner: Self-Correction Planner with Reinforcement Learning in Autonomous Driving

CorrectionPlanner:基于强化学习的自主驾驶自纠正规划器

Yihong Guo, Dongqiangzi Ye, Sijia Chen, Anqi Liu, Xianming Liu

机构 * Department of Computer Science, Johns Hopkins University, Baltimore, USA.(约翰霍普金斯大学计算机科学系)

专题命中 自动驾驶 :world model(abstract);world model(abstract);model-based reinforcement learning(abstract);分类 cs.AI、cs.RO

AI总结 本文提出CorrectionPlanner,通过自纠正机制在规划过程中生成安全动作,减少碰撞率,提升规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2005.03076 2020-05-12 cs.RO 74%

Guided Policy Search Model-based Reinforcement Learning for Urban Autonomous Driving

Zhuo Xu, Jianyu Chen, Masayoshi Tomizuka

专题命中 自动驾驶 :model-based reinforcement learning(title);model based RL(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12854 2026-08-20 cs.RO cs.AI cs.CV 版本更新 73%

BrainWAM: Action-Space Coordination of Semantic Priors and Predictive Dynamics for Autonomous Driving

BrainWAM:面向自动驾驶的语义先验与预测动力学的动作空间协调框架

Bing Zhan, Shuyao Shang, Shuo Lu, Yuan Xu, Zhao Wang, Yida Wang, Xueyang Zhang, Kun Zhan, Jiahao Gu

机构 * Institute of Automation, Chinese Academy of Sciences (CASIA)(中国科学院自动化研究所) Li Auto Inc.(理想汽车)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 该研究针对自动驾驶中语义与预测动力学的规划需求,提出BrainWAM框架,通过结构化动作空间协调及异步整流流推理,在NAVSIM数据集上实现最优性能,优于仅VLA或仅WAM方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25741 2026-03-31 cs.CV cs.AI cs.RO 73%

Vega: Learning to Drive with Natural Language Instructions

Vega:通过自然语言指令学习驾驶

Sicheng Zuo, Yuxuan Li, Wenzhao Zheng, Zheng Zhu, Jie Zhou, Jiwen Lu

机构 * Tsinghua University(清华大学) GigaAI

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO

AI总结 本文提出Vega模型,通过自然语言指令生成和规划,提升自动驾驶的灵活性和个性化水平,基于大规模驾驶数据集InstructScene进行实验验证。

Comments Code is available at https://github.com/zuosc19/Vega

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15843 2024-07-23 cs.CV cs.AI cs.RO 73%

CarFormer: Self-Driving with Learned Object-Centric Representations

Shadi Hamdan, Fatma Güney

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO

Comments Accepted to ECCV 2024, code and the pre-trained models can be found at https://kuis-ai.github.io/CarFormer/

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.12738 2019-04-30 cs.RO cs.AI cs.CV cs.NE 73%

Self Training Autonomous Driving Agent

Shashank Kotyan, Danilo Vasconcellos Vargas, Venkanna U

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23486 2026-08-26 cs.CV cs.RO 版本更新 71%

GeoWAM: Visual Geometry World Action Models for Autonomous Driving

GeoWAM:面向自动驾驶的视觉几何世界动作模型

Yiren Lu, Xin Ye, Jiaming Liu, Philip Jacobson, Jin Yao, Yi-chung Chen, Liam Merino, Dhruva Dixith Kurra, Min Cai, Tom Lampo, Yu Yin, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(优步自动驾驶实验室) Case Western Reserve University(凯斯西储大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 该研究提出 GeoWAM,一种用于自动驾驶的视觉几何世界动作模型,通过预训练预测未来场景几何来学习动力学,经评估其生成的驾驶策略比图像基方案更强,确立未来几何预测为自动驾驶有效预训练目标。

Comments Project page: https://yiren-lu.com/project_pages/geowam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15620 2026-07-20 cs.RO cs.AI 新提交 71%

AEGIS: Assay-Aware Protocol Validation and Runtime Monitoring for Open-Source Liquid Handling Robots

AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测

Priyanka V. Setty, Arvind Ramanathan, Ian Foster, Rick Stevens

机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08375 2026-07-10 cs.CV cs.AI 新提交 71%

WCog-VLA: A Dual-Level World-Cognitive Vision-Language-Action Model for End-to-End Autonomous Driving

WCog-VLA:用于端到端自动驾驶的双级世界认知视觉-语言-行动模型

Xuerun Yan, Zhexi Lian, Nuoheng Zhang, Shiyu Fang, Haoran Wang, Chen Lv, Jia Hu, Binyang Song

机构 * Tongji University(同济大学) Nanyang Technological University(南洋理工大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 针对现有视觉-语言-行动模型在自动驾驶中存在的局限,提出双级世界认知的WCog-VLA框架,语义层统一认知推理,生成层引入新模型加速推理,构建数据集,实验证明该模型在NAVSIM基准测试中达到最优分数。

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31209 2026-07-01 cs.AI cs.RO 新提交 71%

Long-term Traffic Simulation via Structured Autoregressive Modeling

基于结构化自回归建模的长期交通仿真

Lingyu Xiao, Zexin Feng, Xintao Yan

机构 * The University of Hong Kong(香港大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 提出RosettaSim框架,利用大规模序列模型的归纳偏置和统计先验,通过结构化自回归流建模场景拓扑、智能体状态和生成意图,实现短期准确与长期稳定仿真;并引入基于检索的交通评估(RTE)解决长期评估难题。

Comments ECCV 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11120 2026-06-10 cs.AI cs.CV 新提交 71%

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

Andrew Kang, Priya Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。

Comments CVPR 2026, CVSports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21139 2026-05-25 cs.CV cs.LG 71%

Distill to Think, Foresee to Act: Cognitive-Physical Reinforcement Learning for Autonomous Driving

蒸馏思考,预见行动:面向自动驾驶的认知-物理强化学习

Yang Wu, Qiang Meng, Zhaojiang Liu, Youquan Liu, Jian Yang, Jin Xie

机构 * NJU(南京大学) SJTU(上海交通大学) FDU(福建大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.LG、cs.CV

AI总结 提出CoPhy框架,通过蒸馏VLM知识到BEV编码器实现零推理成本的认知能力,并构建自回归BEV世界模型预测未来语义地图以提供可解释的物理沙盒,结合双奖励机制(物理奖励和安全约束、认知奖励和意图对齐)优化驾驶策略,在NAVSIM基准上取得最优结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22089 2026-05-22 cs.CV cs.AI 71%

LVDrive: Latent Visual Representation Enhanced Vision-Language-Action Autonomous Driving Model

LVDrive: 基于潜在视觉表征的视觉-语言-动作自动驾驶模型

Xiaodong Mei, Diankun Zhang, Hongwei Xie, Guang Chen, Hangjun Ye, Dan Xu

机构 * The Hong Kong University of Science and Technology(香港科技大学) Xiaomi EV(小米电动车)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.CV

AI总结 本文提出LVDrive,一种增强视觉-语言-动作能力的自动驾驶模型,通过引入未来场景预测任务,在高维潜在空间中学习语义丰富的场景表示,从而提升闭环驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05653 2026-05-19 cs.RO cs.MA 71%

EvoQRE: Modeling Bounded Rationality in Safety-Critical Traffic Simulation via Evolutionary Quantal Response Equilibrium

EvoQRE: 通过进化量化反应均衡建模安全关键交通仿真中的有限理性

Phu-Hoa Pham, Chi-Nguyen Tran, Duy-Minh Dao-Sy, Phu-Quy Nguyen-Lam, Trung-Kiet Huynh

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO、cs.MA

AI总结 本文提出EvoQRE框架,通过量化反应均衡和进化博弈动态建模安全关键交通交互,理论证明其在弱单调性假设下收敛到Logit-QRE,并在Waymo和nuPlan数据集上验证了其在真实性和安全指标上的优越性。

Comments This article is being withdrawn due to identified issues in the experimental evaluation and theoretical assumptions that may affect the validity of some reported conclusions. The authors plan to revise the methodology and provide a corrected version in future work.

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14908 2026-03-17 cs.RO cs.CV 71%

PerlAD: Towards Enhanced Closed-loop End-to-end Autonomous Driving with Pseudo-simulation-based Reinforcement Learning

PerlAD:基于伪模拟的强化学习在闭环端到端自动驾驶中的应用

Yinfeng Gao, Qichao Zhang, Deqing Liu, Zhongpu Xia, Guang Li, Kun Ma, Guang Chen, Hangjun Ye, Long Chen, Da-Wei Ding, Dongbin Zhao

机构 * School of Automation and Electrical Engineering, University of Science and Technology Beijing(北京科技大学自动化与电气工程学院) Xiaomi EV(小牛电动车) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

AI总结 PerlAD通过伪模拟强化学习方法解决闭环端到端自动驾驶中训练与现实需求不匹配的问题,利用向量空间构建伪模拟环境,结合预测世界模型和分层解耦规划器,实现高效训练和规划,实验表明其在Bench2Drive和DOS基准上均表现优异。

Comments Accepted by IEEE RA-L. Submitted: 2025.12.2; Revised: 2026.2.4; Accepeted: 2026.3.7

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24712 2026-01-06 cs.RO cs.AI 71%

LSRE: Latent Semantic Rule Encoding for Real-Time Semantic Risk Detection in Autonomous Driving

LSRE: 隐式语义规则编码用于自动驾驶中的实时语义风险检测

Qian Cheng, Weitao Zhou, Cheng Jing, Nanshan Deng, Junze Wen, Zhaoyang Liu, Kun Jiang, Diange Yang

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.AI、cs.RO

AI总结 LSRE通过隐式语义规则编码实现自动驾驶中的实时语义风险检测,以10 Hz速度提供高效准确的危险预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17685 2025-11-12 cs.CV 71%

FutureSightDrive: Thinking Visually with Spatio-Temporal CoT for Autonomous Driving

Shuang Zeng, Xinyuan Chang, Mengwei Xie, Xinran Liu, Yifan Bai, Zheng Pan, Mu Xu, Xing Wei, Ning Guo

机构 * Xi’an Jiaotong University(西安交通大学) Amap, Alibaba Group(阿里巴巴集团) DAMO Academy, Alibaba Group(阿里巴巴达摩院)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV;dynamics model(abstract)

Comments Accepted to NeurIPS 2025 as Spotlight Presentation. Code: https://github.com/MIV-XJTU/FSDrive

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19713 2025-09-10 cs.RO cs.CV 71%

Semi-SMD: Semi-Supervised Metric Depth Estimation via Surrounding Cameras for Autonomous Driving

Yusen Xie, Zhengmin Huang, Shaojie Shen, Jun Ma

机构 * Robotics and Autonomous Systems Thrust, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统方向,香港科学与技术大学(广州)) Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV、cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.01440 2025-06-19 cs.RO cs.LG 71%

Closed-Loop Long-Horizon Robotic Planning via Equilibrium Sequence Modeling

Jinghan Li, Zhicheng Sun, Yadong Mu

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.LG、cs.RO

Comments ICML 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.10249 2022-06-22 cs.HC cs.CL cs.CV cs.LG cs.SD eess.AS 70%

Incorporating Voice Instructions in Model-Based Reinforcement Learning for Self-Driving Cars

Mingze Wang, Ziyang Zhang, Grace Hui Yang

专题命中 自动驾驶 :model-based reinforcement learning(title);分类 cs.LG、cs.CV

Comments NeurIPS 2021 Workshop on Machine Learning for Autonomous Driving

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.08712 2022-05-27 cs.LG cs.RO 70%

CARNet: A Dynamic Autoencoder for Learning Latent Dynamics in Autonomous Driving Tasks

Andrey Pak, Hemanth Manjunatha, Dimitar Filev, Panagiotis Tsiotras

专题命中 自动驾驶 :latent dynamics(title);分类 cs.LG、cs.RO

Comments 13 pages, 14 figures, 8 tables, removed submission info, bios

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20111 2026-08-21 cs.RO cs.ET 新提交 69%

Planning-Oriented End-to-End Autonomous Driving: Architectures, Evaluation, and Emerging Paradigms

面向规划的端到端自动驾驶:架构、评估与新兴范式

Yanchen Guan, Xingcheng Liu, Bin Rao, Chengyue Wang, Guofa Li, Yunjian Li, Lishengsa Yue, Zhiyong Cui, Chengzhong Xu, Zhenning Li

机构 * University of Macau(澳门大学) Chongqing University(重庆大学) The Hong Kong University of Science and Technology(香港科技大学) Tongji University(同济大学) Beihang University(北京航空航天大学)

专题命中 自动驾驶 :world-model(abstract);world-model(abstract);分类 cs.RO

AI总结 本综述梳理了端到端自动驾驶从回归任务向面向规划系统的转变,沿四个维度整合方法,分析基准转变,指出需结合一致评估解读架构进展,并总结了多项开放性挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31226 2026-07-29 cs.CV 版本更新 69%

ForgeDrive: Bidirectional Cross-Conditioning for Unified Visual-Action Generation in Autonomous Driving

ForgeDrive: 自动驾驶中统一视觉-动作生成的双向交叉条件

Xuchang Zhong, He Zheng, Chenxu Zhao, Tianxiong Lv, Hangqi Fan, Bohua Wang, Yushan Liu, Li Gao, Zhihao Liao, Leigang Luo, Congyang Zhao, Yang Cai

机构 * Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 自动驾驶 :world-model(abstract);world-model(abstract);分类 cs.CV

AI总结 提出ForgeDrive统一自回归扩散框架,通过“先动作后想象”范式实现视觉与动作的双向交叉条件,解决级联误差问题,在NAVSIM上优于现有规划器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17521 2026-07-24 cs.RO 版本更新 69%

GeoWorldAD: Geometry World Action Model for Autonomous Driving

GeoWorldAD:用于自动驾驶的几何世界行动模型

Songyan Zhang, Jinyuan Tian, Hanbing Li, Daqi Liu, Hao Chen, Wenhui Huang, Fang Li, Guang Chen, Hangjun Ye, Long Chen, Kuiyuan Yang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Xiaomi EV(小米汽车) Zhejiang University(浙江大学) Harvard University(哈佛大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.RO

AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29374 2026-06-30 cs.CV cs.GR 69%

L2D2-GS: Learning to Densify for Feedforward Dynamic Gaussian Scene Reconstruction

L2D2-GS: 学习致密化以实现前馈动态高斯场景重建

Zetian Song, Chenming Wu, Junnan Liu, Chitian Sun, Liangliang He, Hangjun Ye, Jiaqi Zhang, Siwei Ma, Wen Gao

机构 * Xiaomi EV, Beijing(小米电动车,北京)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出L2D2-GS框架,将可泛化重建转化为迭代优化与致密化过程,通过自监督致密化策略和几何正则化机制,实现动态城市场景的高保真重建,在PandaSet和Waymo数据集上达到SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29286 2026-06-30 cs.CV 69%

ASTAD: Asymmetric Style Transfer for Synthetic-to-Real Adaptation in Autonomous Driving

ASTAD:自动驾驶中合成到真实适应的非对称风格迁移

Dingyi Yao, Xinqi Zhang, Lihui Peng, Jianming Hu, Danya Yao, Yi Zhang

机构 * Department of Automation, Tsinghua University(自动化系,清华大学)

专题命中 自动驾驶 :world model(abstract);world model(abstract);分类 cs.CV

AI总结 提出ASTAD任务,针对合成数据有标注而真实数据无标注的不对称性,设计无训练两阶段框架ASTModel,通过粗语义先验提取和动态精炼实现类一致风格迁移,显著提升下游感知性能并加速推理。

Comments Accepted for publication at the 19th European Conference on Computer Vision (ECCV 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏