arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2025-12-01 至 2025-12-01 共收录 28 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 8 篇

2511.19221 2025-12-01 cs.CV cs.RO 84%

Percept-WAM: Perception-Enhanced World-Awareness-Action Model for Robust End-to-End Autonomous Driving

Percept-WAM:感知增强的环境感知-行动模型用于鲁棒的端到端自动驾驶

Jianhua Han, Meng Tian, Jiangtong Zhu, Fan He, Huixin Zhang, Sitong Guo, Dechang Zhu, Hao Tang, Pei Xu, Yuze Guo, Minzhe Niu, Haojie Zhu, Qichao Dong, Xuechao Yan, Siyuan Dong, Lu Hou, Qingqiu Huang, Xiaosong Jia, Hang Xu

机构 * Yinwang Intelligent Technology Co. Ltd.(亿网通智能科技有限公司) Fudan University(复旦大学)

专题命中 感知 :autonomous driving(title,abstract);BEV(abstract);分类 cs.RO、cs.CV

AI总结 Percept-WAM通过整合2D/3D场景理解能力,提升自动驾驶的感知与行动决策,实现端到端鲁棒性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23311 2025-12-01 cs.CV cs.AI cs.CL 62%

Toward Automatic Safe Driving Instruction: A Large-Scale Vision Language Model Approach

迈向自动安全驾驶指令:一种大规模视觉语言模型方法

Haruki Sakajo, Hiroshi Takato, Hiroshi Tsutsui, Komei Soda, Hidetaka Kamigaito, Taro Watanabe

机构 * Nara Institute of Science and Technology(奈良科学技术研究所) Teatis inc.(Teatis公司) Queensland university of technology(昆士兰理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种大规模视觉语言模型方法,用于生成安全驾驶指令,通过构建数据集并评估模型性能,展示了微调模型在自动驾驶安全中的应用与挑战。

Comments Accepted to MMLoSo 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 57%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22404 2025-12-01 cs.CV 57%

UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data

UAV-MM3D: 一种大规模合成基准,用于多模态数据下的无人机三维感知

Longkun Zou, Jiale Wang, Rongqin Liang, Hai Wu, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) University of Southern California(南加州大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 UAV-MM3D通过多模态合成数据提升无人机三维感知能力,提供高保真数据集和多任务基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22142 2025-12-01 cs.CV cs.SY eess.SY 57%

SemOD: Semantic Enabled Object Detection Network under Various Weather Conditions

SemOD:在各种天气条件下启用语义的对象检测网络

Aiyinsi Zuo, Zhaoliang Zheng

机构 * Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电气与计算机工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 SemOD通过引入语义信息提升多天气条件下物体检测性能,mAP提升1.47%-8.80%

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23440 2025-12-01 cs.LG cs.AR cs.DC stat.ML 50%

Accelerated Execution of Bayesian Neural Networks using a Single Probabilistic Forward Pass and Code Generation

利用单次概率前向传递和代码生成加速贝叶斯神经网络

Bernhard Klein, Falk Selker, Hendrik Borras, Sophie Steger, Franz Pernkopf, Holger Fröning

机构 * Heidelberg University(海德堡大学) Graz University of Technology(格拉茨技术大学)

专题命中 感知 :autonomous driving(abstract)

AI总结 本文提出一种基于概率前向传递和代码生成的方法,显著提升贝叶斯神经网络在嵌入式系统中的计算效率和部署性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22791 2025-12-01 cs.CR cs.LG 50%

An Efficient Privacy-preserving Intrusion Detection Scheme for UAV Swarm Networks

一种高效的隐私保护无人机蜂群网络入侵检测方案

Kanchon Gharami, Shafika Showkat Moni

机构 * Dept. of Electrical Engineering and Computer Science(电气工程与计算机科学系) Embry-Riddle Aeronautical University(埃姆布里-里德航空大学)

专题命中 感知 :trajectory planning(abstract)

AI总结 本文提出了一种高效的隐私保护无人机蜂群网络入侵检测方案,通过轻量级和联邦连续学习方法提升检测性能和隐私保护。

Comments This paper has been accepted for publication in the Proceedings of the 44th AIAA/IEEE Digital Avionics Systems Conference (DASC) 2025, where it received the Best Paper of Session Award

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22061 2025-12-01 cs.GT 50%

Aligning with Human Values to Enhance Interaction: An eHMI-Mediated Lane-Changing Negotiation Strategy Using Bayesian Inference

与人类价值观对齐以增强交互:一种使用贝叶斯推理的eHMI介导的变道协商策略

Boyao Peng, Linkun Liu

专题命中 感知 :autonomous driving(abstract)

AI总结 本文提出了一种使用贝叶斯推理的eHMI介导变道协商策略,通过善意欺骗提升交互效率和安全性,但同时也揭示了信任崩溃的伦理风险。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 6 篇

2511.22181 2025-12-01 cs.CV cs.AI cs.RO 87%

MTR-VP: Towards End-to-End Trajectory Planning through Context-Driven Image Encoding and Multiple Trajectory Prediction

MTR-VP: 通过基于上下文的图像编码和多轨迹预测实现端到端轨迹规划

Maitrayee Keskar, Mohan Trivedi, Ross Greer

机构 * Machine Intelligence, Interaction, and Imagination (Mi 3 ) Laboratory(机器智能、交互与想象实验室) University of California, Merced(加州大学默塞德分校) Laboratory for Intelligent & Safe Automobiles (LISA)(智能与安全汽车实验室) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 规划控制 :trajectory planning(title,abstract);autonomous driving(abstract);end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 MTR-VP通过基于上下文的图像编码和多轨迹预测实现端到端轨迹规划,利用交叉注意力提升规划性能。

Comments 8 pages, 3 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22865 2025-12-01 cs.RO cs.CV 86%

SUPER-AD: Semantic Uncertainty-aware Planning for End-to-End Robust Autonomous Driving

SUPER-AD:语义不确定性感知的端到端鲁棒自动驾驶规划

Wonjeong Ryu, Seungjun Yu, Seokha Moon, Hojun Choi, Junsung Park, Jinkyu Kim, Hyunjung Shim

机构 * KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 规划控制 :autonomous driving(title,abstract);BEV(abstract);trajectory planning(abstract);分类 cs.RO、cs.CV

AI总结 SUPER-AD通过语义不确定性感知和驾驶先验知识,提升端到端自动驾驶在复杂不确定性条件下的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22532 2025-12-01 cs.CV cs.AI 84%

CoT4AD: A Vision-Language-Action Model with Explicit Chain-of-Thought Reasoning for Autonomous Driving

CoT4AD: 一种具有显式推理链的视觉-语言-动作模型用于自动驾驶

Zhaohui Wang, Tengbo Yu, Hao Tang

机构 * Peking University(北京大学)

专题命中 规划控制 :autonomous driving(title,abstract);trajectory planning(abstract);分类 cs.CV、cs.AI

AI总结 CoT4AD通过引入显式推理链提升自动驾驶中的视觉-语言-动作模型的推理能力,实现更精确的因果推理和决策。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22043 2025-12-01 cs.RO cs.SY eess.SY 57%

SwordRiding: A Unified Navigation Framework for Quadrotors in Unknown Complex Environments via Online Guiding Vector Fields

SwordRiding:一种基于在线引导矢量场的四旋翼无人机在未知复杂环境中的统一导航框架

Xuchen Liu, Ruocheng Li, Bin Xin, Weijia Yao, Qigeng Duan, Jinqiang Cui, Ben M. Chen, Jie Chen

机构 * Pengcheng Laboratory, Shenzhen, Guangdong, China(鹏城实验室,深圳,广东,中国) School of Automation, Beijing Institute of Technology, Beijing, China(自动化学院,北京理工大学,北京,中国) School of Artificial Intelligence and Robotics, Hunan University(人工智能与机器人学院,湖南大学) Department of Control Science and Engineering, Harbin Institute of Technology(控制科学与工程学院,哈尔滨工业大学) National Key Laboratory of Autonomous Intelligent Unmanned Systems(自主智能无人系统国家重点实验室) Department of Mechanical and Automation Engineering, the Chinese University of Hong Kong, Hong Kong, China(机械与自动化工程系,香港中文大学,香港,中国)

专题命中 规划控制 :trajectory planning(abstract);分类 cs.RO

AI总结 SwordRiding提出了一种基于在线引导矢量场的四旋翼无人机统一导航框架,通过闭环导航提升在未知复杂环境中的实时适应性和鲁棒性。

Comments For an experimental demo, see https://www.youtube.com/watch?v=tKYCg266c4o. For the lemma proof, see https://github.com/SmartGroupSystems/GVF_close_loop_planning/blob/main/proofs.md

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22579 2025-12-01 math.OC 50%

Consistent inverse optimal control for discrete-time nonlinear stochastic systems

离散时间非线性随机系统的一致逆最优控制

Ziliang Wang, Han Zhang, Axel Ringh

专题命中 规划控制 :occupancy(abstract)

AI总结 本文提出了一种针对离散时间非线性随机系统的逆最优控制算法,通过求解凸优化问题实现一致性估计,并通过实验验证了其鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21900 2025-12-01 cs.LG q-bio.BM 50%

Beyond Atoms: Evaluating Electron Density Representation for 3D Molecular Learning

超越原子:评估电子密度表示在3D分子学习中的应用

Patricia Suriana, Joshua A. Rackers, Ewa M. Nowara, Pedro O. Pinheiro, John M. Nicoloudis, Vishnu Sresht

机构 * Prescient Design Genentech SSF(基因泰克SSF) Structural Biology(结构生物学)

专题命中 规划控制 :occupancy(abstract)

AI总结 本文评估了电子密度表示在3D分子学习中的有效性,发现其在低数据和大规模任务中优于基于原子的表示,提升了分子亲和力预测和量子属性建模的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. BEV与占用 3 篇

2412.14103 2025-12-01 cs.CV 57%

A Simple yet Effective Test-Time Adaptation for Zero-Shot Monocular Metric Depth Estimation

一种简单而有效的测试时适应方法用于零样本单目度量深度估计

Rémi Marsal, Alexandre Chapoutot, Philippe Xu, David Filliat

机构 * U2IS, ENSTA Paris Institut Polytechnique de Paris Palaiseau(U2IS,ENSTA巴黎理工学院帕莱索)

专题命中 BEV与占用 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出了一种基于3D点的测试时适应方法,用于提升零样本单目深度估计的精度和鲁棒性。

Comments Published at IROS 2025 https://ieeexplore.ieee.org/document/11247168

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS), pages 7858-7865

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18536 2025-12-01 quant-ph 50%

Quantum thermal rectification via state-dependent two-photon dissipation

通过状态依赖的双光子耗散实现量子热 rectification

M. Tahir Naseem

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本研究通过状态依赖的双光子耗散机制,在量子谐振子耦合热浴系统中实现热 rectification,并提出有效实现方案。

Comments Close to published version

Journal ref Quantum Science and Technology 11, 015011 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21855 2025-12-01 eess.SY cs.SY 50%

Automated Enumeration of Reconfigurable Architectures for Thermal Management Systems in Battery Electric Vehicles

电池电动车辆热管理系统可重构架构的自动枚举

Reihaneh Jahedan, Satya Peddada, Mark Jennings, Sunil Katragadda, James Allison, Nenad Miljkovic

专题命中 BEV与占用 :BEV(abstract)

AI总结 本研究提出了一种基于图建模的自动方法,用于枚举和模拟电池电动车辆热管理系统可重构架构,以优化性能、能耗和复杂性之间的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 激光雷达 4 篇

2509.06597 2025-12-01 cs.RO 79%

LiHRA: A LiDAR-Based HRI Dataset for Automated Risk Monitoring Methods

LiHRA:基于LiDAR的人机交互风险监测数据集

Frederik Plahl, Georgios Katranis, Ilshat Mamaev, Andrey Morozov

机构 * Proximity Robotics & Automation GmbH(近距机器人与自动化有限公司) Institute of Industrial Automation and Software Engineering, University of Stuttgart(工业自动化与软件工程学院,斯图加特大学)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO

AI总结 LiHRA数据集通过多模态数据支持人机交互风险监测方法的开发,提供高分辨率LiDAR数据和真实碰撞事件,用于训练和评估RM算法。

Comments Preprint of final paper that will appear in the Proceedings of the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22238 2025-12-01 cs.RO 79%

MLATC: Fast Hierarchical Topological Mapping from 3D LiDAR Point Clouds Based on Adaptive Resonance Theory

MLATC: 基于自适应共振理论的快速分层拓扑映射:从3D激光雷达点云

Ryosuke Ofuchi, Yuichiro Toda, Naoki Masuyama, Takayuki Matsuno

机构 * IEEE

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO

AI总结 MLATC通过分层结构和自适应机制提升大规模动态环境中的拓扑图构建效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16726 2025-12-01 cs.RO 79%

D-LIO: 6DoF Direct LiDAR-Inertial Odometry based on Simultaneous Truncated Distance Field Mapping

D-LIO:基于同时截断距离场映射的6自由度直接激光雷达-惯性里程计

Lucia Coto-Elena, J. E. Maese, L. Merino, F. Caballero

机构 * Service Robotics Laboratory, Universidad Pablo de Olavide(服务机器人实验室,帕布罗·德·奥拉维德大学)

专题命中 激光雷达 :LiDAR(title,abstract);分类 cs.RO

AI总结 D-LIO通过同时截断距离场映射实现6自由度直接激光雷达-惯性里程计,提升环境感知精度与实时性。

Comments 9 pages, 3 figures and 43 references

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 1, pp. 169-176, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21985 2025-12-01 eess.IV cs.CV cs.LG eess.SP 62%

Digital Elevation Model Estimation from RGB Satellite Imagery using Generative Deep Learning

利用生成深度学习从RGB卫星图像估计数字高程模型

Alif Ilham Madani, Riska A. Kuswati, Alex M. Lechner, Muhamad Risqi U. Saputra

机构 * Monash University Indonesia(莫纳什大学印度尼西亚分校)

专题命中 激光雷达 :LiDAR(abstract);分类 cs.CV、eess.IV

AI总结 本研究利用生成深度学习方法,通过RGB卫星图像生成数字高程模型,提升了在复杂地形中的应用效果。

Comments 5 pages, 4 figures, accepted at IGARSS 2025 conference

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 4 篇

2503.09464 2025-12-01 cs.GR cs.CV 83%

Hybrid Rendering for Multimodal Autonomous Driving: Merging Neural and Physics-Based Simulation

多模态自动驾驶的混合渲染:融合神经网络与基于物理的模拟

Máté Tóth, Péter Kovács, Réka Bencses, Zoltán Bendefy, Zoltán Hortsin, Balázs Teréki, Tamás Matuszka

机构 * aiMotive

专题命中 仿真评测 :autonomous driving(title,abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出混合渲染方法,结合神经网络与基于物理的模拟,提升自动驾驶模拟中新颖视角合成质量及实时渲染效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21925 2025-12-01 cs.RO 79%

OpenTwinMap: An Open-Source Digital Twin Generator for Urban Autonomous Driving

OpenTwinMap: 一种用于城市自动驾驶的开源数字孪生生成器

Alex Richardson, Jonathan Sprinkle

机构 * Vanderbilt University(范德比大学)

专题命中 仿真评测 :autonomous driving(title);LiDAR(abstract);分类 cs.RO

AI总结 OpenTwinMap是一种基于Python的开源框架,用于生成高保真的3D城市数字孪生,通过整合LiDAR和OSM数据,支持自动驾驶模拟和扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22466 2025-12-01 cs.CV 57%

RoadSceneBench: A Lightweight Benchmark for Mid-Level Road Scene Understanding

RoadSceneBench: 一个轻量级的中层道路场景理解基准

Xiyan Liu, Han Wang, Yuhu Wang, Junjie Cai, Zhe Cao, Jianzhong Yang, Zhen Lu

机构 * Baidu Inc(百度公司)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 RoadSceneBench提出一种轻量级基准,通过HRRP-T框架提升道路场景的视觉推理能力,实现结构一致性和时间一致性,推动自动驾驶感知发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21782 2025-12-01 physics.soc-ph cs.CY cs.MA 50%

CompARE: A Computational framework for Airborne Respiratory disease Evaluation integrating flow physics and human behavior

CompARE:用于空中呼吸系统疾病评估的计算框架,整合流体动力学和人类行为

Fong Yew Leong, Jaeyoung Kwak, Zhengwei Ge, Chin Chun Ooi, Siew-Wai Fong, Matthew Zirui Tay, Hua Qian, Chang Wei Kang, Wentong Cai, Hongying Li

专题命中 仿真评测 :occupancy(abstract)

AI总结 CompARE框架整合流体动力学与人类行为,揭示室内空气传播疾病风险的双峰分布,通过CFD、ML和ABM分析,提供通风设计和社交距离政策的量化见解。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 其他自动驾驶 3 篇

2511.22928 2025-12-01 cs.RO 79%

Seeing before Observable: Potential Risk Reasoning in Autonomous Driving via Vision Language Models

在可观察之前看见:通过视觉语言模型在自动驾驶中的潜在风险推理

Jiaxin Liu, Xiangyu Yan, Liang Peng, Lei Yang, Lingjun Zhang, Yuechen Luo, Yueming Tao, Ashton Yu Xuan Tan, Mu Li, Lei Zhang, Ziqi Zhan, Sai Guo, Hong Wang, Jun Li

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动系统学院,清华大学)

专题命中 其他自动驾驶 :autonomous driving(title,abstract);分类 cs.RO

AI总结 本文提出PotentialRiskQA数据集和PR-Reasoner框架,通过视觉语言模型提升自动驾驶中潜在风险的前瞻性推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12932 2025-12-01 cs.CV 57%

Text2Traffic: A Text-to-Image Generation and Editing Method for Traffic Scenes

Text2Traffic: 一种用于交通场景的文本到图像生成与编辑方法

Feng Lv, Haoxuan Feng, Zilu Zhang, Chunlong Xia, Yanfeng Li

机构 * Baidu(百度) School of Electronic and Information Engineering, Beijing Jiaotong University(北京交通大学电子与信息工程学院)

专题命中 其他自动驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种统一的文本驱动框架,通过可控掩码机制和多视角数据增强,提升交通场景中文本到图像生成与编辑的保真度和对齐性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11673 2025-12-01 cs.CV 57%

DINO-Foresight: Looking into the Future with DINO

DINO-Foresight: 用DINO展望未来

Efstathios Karypidis, Ioannis Kakogeorgiou, Spyros Gidaris, Nikos Komodakis

机构 * Archimedes, Athena Research Center(阿基米德研究所,雅典研究学院) National Technical University of Athens(雅典国立技术大学) University of Crete(克里特大学) IACM-Forth(福伊恩研究所)

专题命中 其他自动驾驶 :autonomous driving(abstract);分类 cs.CV

AI总结 DINO-Foresight通过在预训练视觉基础模型的语义特征空间中训练,实现了对未来动态的预测,提升了自动驾驶和机器人领域的环境理解能力。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏