arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

2026-01-19 至 2026-01-19 共收录 12 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 3 篇

2411.10962 2026-01-19 cs.CV 70%

V2X-Radar: A Multi-modal Dataset with 4D Radar for Cooperative Perception

V2X-Radar: 一种包含4D雷达的多模态数据集用于协作感知

Lei Yang, Xinyu Zhang, Jun Li, Chen Wang, Jiaqi Ma, Zhiying Song, Tong Zhao, Ziying Song, Li Wang, Mo Zhou, Yang Shen, Kai Wu, Chen Lv

机构 * School of Vehicle and Mobility, Tsinghua University(车辆与移动性学院,清华大学) Nanyang Technological University(南洋理工大学) CUMTB(中国交通车辆技术研究所) University of California, Los Angeles(加州大学洛杉矶分校) Beijing Jiaotong University(北京交通大学) ByteDance(字节跳动)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 V2X-Radar是首个包含4D雷达的多模态数据集,用于提升自动驾驶中的协作感知能力。

Comments NeurIPS 2025 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10819 2026-01-19 cs.CV 57%

A Unified 3D Object Perception Framework for Real-Time Outside-In Multi-Camera Systems

面向实时多相机系统的统一3D物体感知框架

Yizhou Wang, Sameer Pusegaonkar, Yuxing Wang, Anqi Li, Vishal Kumar, Chetan Sethi, Ganapathy Aiyer, Yun He, Kartikay Thakkar, Swapnil Rathi, Bhushan Rupde, Zheng Tang, Sujit Biswas

机构 * NVIDIA Corporation(英伟达公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种面向实时多相机系统的统一3D物体感知框架,通过优化的Sparse4D框架和生成式数据增强策略,实现了在大规模基础设施环境中的高效多目标跟踪与实时部署。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26741 2026-01-19 physics.ins-det 50%

Characterization of the H2M Monolithic CMOS Sensor

H2M单片CMOS传感器的特性分析

Rafael Ballabriga, Eric Buschmann, Michael Campbell, Raimon Casanova Mohr, Dominik Dannheim, Jona Dilg, Ana Dorda, Ono Feyens, Finn King, Philipp Gadow, Ingrid-Maria Gregor, Karsten Hansen, Yajun He, Lennart Huth, Iraklis Kremastiotis, Stephan Lachnit, Corentin Lemoine, Stefano Maffessanti, Larissa Mendes, Younes Otarid, Christian Reckleben, Sébastien Rettie, Manuel Alejandro del Rio Viera, Sara Ruiz Daza, Judith Schlaadt, Adriana Simancas, Walter Snoeys, Simon Spannagel, Tomas Vanat, Anastasiia Velyka, Gianpiero Vignola, Håkan Wennlöf

专题命中 感知 :occupancy(abstract)

AI总结 H2M单片CMOS传感器通过改进工艺和设计,实现了高检测效率和低噪声性能,适用于高精度粒子探测应用。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 规划控制 3 篇

2312.03543 2026-01-19 cs.CV cs.AI 76%

GPT-4 Enhanced Multimodal Grounding for Autonomous Driving: Leveraging Cross-Modal Attention with Large Language Models

GPT-4增强的多模态接地用于自动驾驶:利用跨模态注意力与大语言模型

Haicheng Liao, Huanming Shen, Zhenning Li, Chengyue Wang, Guofa Li, Yiming Bie, Chengzhong Xu

机构 * Univ City(大学城市)

专题命中 规划控制 :autonomous driving(title);分类 cs.CV、cs.AI

AI总结 本文提出了一种结合GPT-4的大语言模型的多模态接地框架,用于提升自动驾驶中的视觉理解和指令执行能力。

Journal ref Communications in Transportation Research 4 (2024) 100116

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16747 2026-01-19 cs.CV cs.AI cs.ET 62%

FollowGen: A Scaled Noise Conditional Diffusion Model for Car-Following Trajectory Prediction

FollowGen: 一种用于车距预测的缩放噪声条件扩散模型

Junwei You, Rui Gan, Weizhe Tang, Zilin Huang, Jiaxi Liu, Zhuoyu Jiang, Haotian Shi, Keshu Wu, Keke Long, Sicheng Fu, Sikai Chen, Bin Ran

专题命中 规划控制 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 FollowGen通过缩放噪声条件扩散模型,整合车与车交互和跟车动态,提升自动驾驶中车辆轨迹预测的准确性和合理性。

Comments arXiv admin note: text overlap with arXiv:2406.11941

Journal ref Communications in Transportation Research 5 (2025): 100215

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10849 2026-01-19 cs.MA 50%

Cooperative UAVs for Remote Data Collection under Limited Communications: An Asynchronous Multiagent Learning Framework

协同无人机在有限通信下的远程数据采集:一种异步多智能体学习框架

Cuong Le, Symeon Chatzinotas, Thang X. Vu

专题命中 规划控制 :trajectory planning(abstract)

AI总结 本文提出一种异步多智能体学习框架,用于解决有限通信下无人机协同数据采集的轨迹和带宽分配优化问题,提升能效和任务完成效率。

Comments Accepted to IEEE Transactions on Wireless Communications

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 端到端驾驶 1 篇

2601.11475 2026-01-19 cs.CV 79%

Generative Scenario Rollouts for End-to-End Autonomous Driving

生成场景回放用于端到端自动驾驶

Rajeev Yasarla, Deepti Hegde, Shizhong Han, Hsin-Pai Cheng, Yunxiao Shi, Meysam Sadeghigooghari, Shweta Mahajan, Apratim Bhattacharyya, Litian Liu, Risheek Garrepalli, Thomas Svantesson, Fatih Porikli, Hong Cai

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 端到端驾驶 :autonomous driving(title,abstract);分类 cs.CV

AI总结 GeRo通过自回归回放策略,结合规划与生成,提升自动驾驶系统的长期推理和多代理规划能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. BEV与占用 4 篇

2506.17004 2026-01-19 cs.CV 88%

A Synthetic Benchmark for Collaborative 3D Semantic Occupancy Prediction in V2X-Enabled Autonomous Driving

用于V2X赋能自动驾驶的协作3D语义占用预测合成基准

Hanlin Wu, Pengfei Lin, Ehsan Javanmardi, Naren Bao, Bo Qian, Hao Si, Manabu Tsukada

机构 * The School of Information Science and Technology, The University of Tokyo(信息科学与技术学系,东京大学) National Institute of Informatics(信息机构)

专题命中 BEV与占用 :autonomous driving(title,abstract);occupancy(title,abstract);分类 cs.CV

AI总结 本文提出用于V2X赋能自动驾驶的协作3D语义占用预测合成基准,通过高分辨率传感器和基线模型提升预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05961 2026-01-19 cs.CV 61%

FOF-X: Towards Real-time Detailed Human Reconstruction from a Single Image

FOF-X:从单张图像实现实时详细人体重建

Qiao Feng, Yuanwang Yang, Yebin Liu, Yu-Kun Lai, Jingyu Yang, Kun Li

机构 * College of Intelligence and Computing, Tianjin University(智能与计算学院,天津大学) Department of Automation, Tsinghua University(自动化系,清华大学) School of Computer Science and Informatics, Cardiff University(计算机科学与信息学院,卡迪夫大学) School of Electrical and Information Engineering, Tianjin University(电气与信息工程学院,天津大学)

专题命中 BEV与占用 :occupancy(abstract,comments);分类 cs.CV

AI总结 FOF-X通过傅里叶占用场实现从单张图像的实时详细人体重建,提升重建质量和鲁棒性。

Comments Extended journal version of our previous conference paper: FOF: Learning Fourier Occupancy Field for Monocular Real-time Human Reconstruction (arXiv:2206.02194)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10801 2026-01-19 cs.LG hep-ex physics.ins-det quant-ph 50%

Towards Tensor Network Models for Low-Latency Jet Tagging on FPGAs

面向FPGA上的低延迟喷注标记的张量网络模型

Alberto Coppi, Ema Puljak, Lorenzo Borella, Daniel Jaschke, Enrique Rico, Maurizio Pierini, Jacopo Pazzini, Andrea Triossi, Simone Montangero

机构 * Dipartimento di Fisica e Astronomia "Galileo Galilei", University of Padua(伽利略·伽利莱物理与天文学系,帕多瓦大学) PlanQC GmbH(PlanQC公司) Institute for Complex Quantum Systems, Ulm University(复杂量子系统研究所,乌尔姆大学) European Organization for Nuclear Research (CERN)(欧洲核子研究中心) Padua Quantum Technologies Research Center, University of Padua(帕多瓦量子技术研究中心,帕多瓦大学)

专题命中 BEV与占用 :occupancy(abstract)

AI总结 本文提出基于张量网络模型的低延迟喷注标记方法,利用FPGA实现高效推理,展现其在高能物理实时触发系统中的应用潜力。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12527 2026-01-19 cs.DS 50%

A Polylogarithmic Competitive Algorithm for Stochastic Online Sorting and TSP

一个对数平方竞争算法用于随机在线排序和TSP

Andreas Kalavas, Charalampos Platanos, Thanos Tolias

专题命中 BEV与占用 :occupancy(abstract)

AI总结 该研究提出了一种随机在线排序和TSP的对数平方竞争算法,显著提高了近似精度。

Comments To appear at STACS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 仿真评测 1 篇

2512.11574 2026-01-19 cs.CV 57%

Evaluating Foundation Models' 3D Understanding Through Multi-View Correspondence Analysis

通过多视角对应分析评估基础模型的3D理解

Valentina Lilova, Toyesh Chakravorty, Julian I. Bibo, Emma Boccaletti, Brandon Li, Lívia Baxová, Cees G. M. Snoek, Mohammadreza Salehi

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 仿真评测 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出一种无需微调的3D场景理解基准,评估基础模型在多视角下的3D推理能力,展示DINO编码器在大视角变化下的竞争力。

Comments NeurIPS 2025 UniReps workshop, to be published in PMLR

详情

展开后加载摘要…

URL PDF HTML 收藏