SBEVNet: End-to-End Deep Stereo Layout Estimation
专题命中 端到端驾驶 :self-driving(abstract);BEV(abstract);分类 cs.CV
Comments WACV 2022
视觉与机器人
自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。
专题命中 端到端驾驶 :self-driving(abstract);BEV(abstract);分类 cs.CV
Comments WACV 2022
专题命中 端到端驾驶 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV
Comments 8 pages, 8 figures, included in the conference proceedings of the 2020 25th International Conference on Pattern Recognition (ICPR), 2021
Journal ref 2020 25th International Conference on Pattern Recognition (ICPR), 2021, pp. 699-706
专题命中 端到端驾驶 :autonomous driving(abstract);end-to-end driving(abstract);分类 cs.CV
Comments Presented at the ICML 2017 Workshop on Machine Learning for Autonomous Vehicles
StressDream: 引导视频世界模型实现鲁棒的策略评估与改进
机构 * Carnegie Mellon University(卡内基梅隆大学) ; NVIDIA Research(NVIDIA研究) ; University of Washington(华盛顿大学) ; Stanford University(斯坦福大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 提出StressDream方法,通过优化扩散视频世界模型的初始噪声,在推理时引导生成高影响且合理的未来场景,以支持鲁棒的策略评估与改进。
Comments Project page: https://junwon.me/StressDream/
闭环动态驾驶数据混合用于真实-合成协同训练
机构 * Li Auto(力汽车) ; HKUST(香港科技大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 本文提出了一种闭环动态数据混合方法,通过动态优化过程调整训练数据混合比例,以提升模型性能,解决了在有限预算下优化数据混合的关键问题。
端到端自主时代:从基于规则的驾驶转向大型驾驶模型
机构 * The Australian Centre for Robotics, School of Aeronautical, Mechanical and Mechatronic Engineering, The University of Sydney(澳大利亚机器人中心,航空航天、机械及机电工程学院,悉尼大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV
AI总结 本文探讨自动驾驶从模块化规则系统向端到端学习系统过渡,分析大型驾驶模型在复杂环境中的表现及行业影响。
通过事件相机缩小领域差距
机构 * School of Computer Science and Engineering, University of New South Wales(新南威尔士大学计算机科学与工程学院) ; School of Mechanical and Manufacturing Engineering, University of New South Wales(新南威尔士大学机械与制造工程学院) ; Escuela de Ingeniería, Universidad Central de Chile(智利中央大学工程学院)
专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI
AI总结 本文提出使用事件相机以解决昼夜光照差异带来的领域差距问题,展示其在不同光照条件下更稳定的性能和更优的跨领域表现。
Comments Accepted to Australasian Conference on Robotics and Automation (ACRA), 2025
机构 * University of Pisa(比萨大学) ; Huawei RAMS Lab(华为RAMS实验室) ; Technical University of Munich(慕尼黑技术大学) ; Technical University of Berlin(柏林技术大学) ; University of Manchester(曼彻斯特大学) ; University of Modena and Reggio Emilia(莫德纳和雷吉奥艾米利亚大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI
专题命中 端到端驾驶 :autonomous driving(abstract);LiDAR(abstract)
Comments This work has been submitted to the IEEE for possible publication
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI
Comments Project Page: https://recondreamer.github.io
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV
Comments Accepted to ITSC 2023. Code and datasets will be made available at https://github.com/zafirshi/PanoVPR
专题命中 端到端驾驶 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI
Comments ICRA 2023
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI
专题命中 端到端驾驶 :self-driving(abstract);LiDAR(abstract)
专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI
Comments IROS 2020 final version. arXiv admin note: text overlap with arXiv:1903.10995
专题命中 端到端驾驶 :end-to-end driving(abstract,comments);分类 cs.CV、cs.AI
Comments WOD Vision-based End-to-End Driving Challenge
DA-WAM:面向驾驶世界模型的决策对齐未来潜变量
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Leapmotor(零跑汽车) ; The Hong Kong University of Science and Technology(香港科技大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 DA-WAM 是统一预测表示学习等模块的驾驶世界模型框架,通过动作条件未来潜变量实现决策对齐,在 NAVSIM 数据集上达到最优性能,验证了关键组件的有效性。
LAIA数据集:智能汽车的标记注意力
机构 * Computer Vision Center(计算机视觉中心) ; Computer Science Department of Universitat Autònoma de Barcelona(巴塞罗那自治大学计算机科学系)
专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.CV、cs.AI
AI总结 研究针对自动驾驶端到端驾驶范式的可解释性挑战,提出LAIA数据集,通过CARLA模拟器收集含多种数据的驾驶数据,可用于训练注意力感知模型等多种应用,并用其比较人类与模型注意力以洞察模型行为。
Comments 11 pages, 12 figures, 3 tables. Dataset and supplementary information available from the project website. Added an author who was inadvertently omitted from the previous version. No changes to the scientific content
通过深度神经网络的自动化端到端优化和部署提高自主纳米无人机性能
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、eess.IV
AI总结 研究如何通过自动化端到端优化和部署DNN提高自主纳米无人机性能,聚焦PULP-Dronet在Crazyflie 2.1纳米无人机上的部署,实现内存占用减少、推理时间加速,提升了无人机在避障、自由飞行和车道跟随等方面的性能,还开源了相关软件设计。
Comments 16 pages, 8 figures, 5 tables. This paper has been accepted for publication in the IEEE Journal on Emerging and Selected Topics in Circuits and Systems (JETCAS) copyright 2021 IEEE
提前思考:多模态语言模型和世界模型中的预见智能
机构 * College of Software, Nankai University, China(南开大学软件学院) ; The University of Hong Kong, China(香港大学) ; NKIARI, Shenzhen Futian, China(NKIARI,深圳福田,中国) ; AAIS & VCIP, Nankai University, China(AAIS与VCIP,南开大学,中国) ; A*STAR Institute of Advanced Intelligence and Computing, Singapore(新加坡A*STAR先进智能与计算研究所)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 研究定义预见智能,引入FSU-QA数据集,对视觉语言模型在预见任务中全面研究,发现当前模型不足。该数据集可评估世界模型,增强预见推理,微调小模型能超大型先进模型,为开发下一代模型提供基础,还验证了评估协议。
Comments Accepted by ECCV 2026
视频生成模型作为世界模型:高效的范式、架构和算法
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学) ; Hong Kong Generative AI Research and Development Center(香港生成式人工智能研究与开发中心)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、eess.IV
AI总结 本文系统回顾了考虑效率的世界模拟视频生成框架,提出三维分类方法,展示提升效率对自动驾驶等应用的重要性,并指出高效视频生成向通用世界模拟器演进的关键性。
使用潜在空间生成世界模型减轻自动驾驶模仿学习中的协变量转移
机构 * NVIDIA
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 提出用潜在空间生成世界模型解决自动驾驶协变量转移问题,训练时利用世界模型减轻该问题,无需大量训练数据,还引入新感知编码器,实验显示相比之前有显著改进。
Comments 8 pages, 6 figures, original September 2024, accepted at ICRA 2025 Workshop "Robots in the Wild", for associated video file, see https://youtu.be/7m3bXzlVQvU
神经立体视频压缩与混合视差补偿
机构 * University of Electronic Science and Technology of China(电子科技大学) ; The University of Newcastle(纽卡斯尔大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、eess.IV
AI总结 本文提出混合视差补偿策略,结合显式像素位移与隐式交叉注意力机制,提升立体视频压缩性能。
RT-VLA:通过知识蒸馏实现实时视觉-语言-动作模型
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 提出RT-VLA,通过多级监督蒸馏将SimLingo模型的能力压缩至轻量学生模型,在保持竞争性能的同时将推理时间降低44.8倍(纯视觉模式)和7.9倍(视觉+语言模式),实现实时可解释的VLA自动驾驶。
QuickLAP: 为半自主代理快速语言-动作偏好学习
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 本研究提出QuickLAP,一种融合物理和语言反馈的贝叶斯框架,用于实时推断奖励函数,通过大规模语言模型提取奖励特征注意力掩码和偏好偏移,从而在半自主驾驶模拟器中将奖励学习误差降低70%,并通过用户研究验证其可理解性和协作性。
KG-ASG: 基于碰撞知识的闭环对抗场景生成与主支持属性
机构 * Guangdong Provincial Key Laboratory of Intelligent Transportation System, School of Intelligent Systems Engineering, Shenzhen Campus of Sun Yat-sen University(广东省智能交通系统重点实验室,智能系统工程学院,中山大学深圳校区)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 本文提出KG-ASG框架,通过碰撞知识引导和主支持属性,提高自动驾驶系统安全验证的对抗有效性、可解释性和可执行性。
意图驱动强化学习放大规划导向的强化学习
机构 * Li Auto(力 auto) ; Tsinghua University(清华大学) ; CUHK MMLab(香港大学MMLab)
专题命中 端到端驾驶 :end-to-end driving(abstract);分类 cs.RO、cs.CV
AI总结 本文提出DIAL框架,通过两阶段方法解决连续动作策略在偏好对齐中的模式崩溃问题,通过意图引导的采样扩展分布并提升性能。
Comments Project page: https://mind-omni.github.io/
机器人学习的世界模型:全面综述
机构 * Nanyang Technological University(南洋理工大学) ; University of California, Berkeley(加州大学伯克利分校) ; Stanford University(斯坦福大学) ; The University of Tokyo(东京大学) ; University of Oxford(牛津大学) ; Microsoft(微软公司) ; ETH Zurich(苏黎世联邦理工学院) ; Princeton University(普林斯顿大学) ; Harvard University(哈佛大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 综述从机器人学习角度系统回顾世界模型的快速发展,探讨其与机器人策略的耦合、作为强化学习模拟器的作用以及机器人视频世界模型的发展,总结关键范式与挑战。
Comments 43 pages, 6 figures
F3DGS:联邦3D高斯点云用于去中心化多智能体世界建模
机构 * University of North Texas(北德克萨斯大学) ; Budapest University of Technology and Economics(布达佩斯技术与经济大学)
专题命中 端到端驾驶 :LiDAR(abstract);分类 cs.RO、cs.CV
AI总结 F3DGS通过联邦学习实现去中心化多智能体3D重建,利用共享几何框架和可见性感知聚合解决部分观测问题,实现分布式优化。
Comments Accepted to the CVPR 2026 SPAR-3D Workshop
MMEdge: 通过流水线传感和编码加速设备端多模态推理
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 端到端驾驶 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 MMEdge提出一种基于流水线传感和编码的设备端多模态推理框架,通过细粒度传感和编码单元实现增量计算,结合轻量级时间聚合模块和自适应配置优化器,降低延迟并保持高精度。
Comments Code available at: https://github.com/HKUST-MINSys-Lab/MMEdge. Accepted by SenSys 2026