arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2604.25160 2026-04-29 physics.optics 67%

Target-depth sensing with metasurface-encoder integrated optoelectronic neural network

基于元表面编码器的光学电子神经网络深度传感

Shuo Wang, Deyu Zhu, Chenjie Xiong, Bin Hu, Chunqi Jin, Yu Wang, Chengjun Zou

专题命中 感知 :LiDAR(abstract,abstract_cn)

AI总结 本文提出一种集成元表面编码器的光学电子神经网络,通过双螺旋点扩散函数将3D信息压缩为2D图像,利用轻量级阴影ResNet网络实现目标分类和深度估计,实现实时目标跟踪。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20191 2026-04-29 cs.CV cs.AI cs.RO 67%

From Scene to Object: Text-Guided Dual-Gaze Prediction

从场景到物体:文本引导的双目预测

Zehong Ke, Yanbo Jiang, Jinhao Li, Zhiyuan Liu, Yiqian Tu, Qingwen Meng, Heye Huang, Jianqiang Wang

机构 * School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院) Cho Chun Shik Graduate School of Mobility, Korea Advanced Institute of Science and Technology(Cho Chun Shik 移动研究生院,韩国科学技术院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出双分支 gaze 预测框架,通过构建物体级数据集和改进模型架构,实现精准物体级注意力预测,提升语义推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24353 2026-04-28 cs.CV cs.AI cs.LG cs.RO 67%

ARETE: Attention-based Rasterized Encoding for Topology Estimation using HSV-transformed Crowdsourced Vehicle Fleet Data

ARETE: 基于注意力机制的栅格化编码用于使用HSV变换的众包车辆车队数据拓扑估计

Daniel Fritz, Dimitrios Lagamtzis, Michael Mink, Markus Enzweiler, Steffen Schober

机构 * Mercedes-Benz AG, Research \& Development, Sindelfingen, Germany Institute for Intelligent Systems, Esslingen University of Applied Sciences, Esslingen, Germany

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出ARETE方法,利用HSV变换的众包车辆数据生成高精度道路拓扑图,通过栅格化编码和注意力机制预测车道中心线和分隔线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05070 2026-04-08 cs.AI cs.CV cs.RO 67%

Part-Level 3D Gaussian Vehicle Generation with Joint and Hinge Axis Estimation

基于关节和铰链轴估计的部件级3D高斯车辆生成

Shiyao Qian, Yuan Ren, Dongfeng Bai, Bingbing Liu

机构 * University of Toronto(多伦多大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出生成可动画的3D高斯车辆框架,解决静态生成与可动画车辆模型间的差距,通过部件边 refinement 和运动学推理头预测关节位置和铰链轴。

Comments submitted to IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03325 2026-04-07 cs.CV cs.AI cs.RO 67%

Safety-Aligned 3D Object Detection: Single-Vehicle, Cooperative, and End-to-End Perspectives

安全对齐的3D目标检测:单车辆、协同和端到端视角

Brian Hsuan-Cheng Liao, Chih-Hong Cheng, Hasan Esen, Alois Knoll

机构 * DENSO AUTOMOTIVE Deutschland GmbH(电装汽车德国有限公司) Carl von Ossietzky University of Oldenburg(奥尔登堡大学) Technical University of Munich(慕尼黑工业大学)

专题命中 感知 :end-to-end driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文探讨了安全对齐的3D目标检测评估与优化,通过单车辆、协同和端到端视角,提出EC-IoU损失函数,改进安全关键检测性能,并在SparseDrive中验证安全感知强化对碰撞率降低和系统安全性的提升。

Comments 10 pages, 9 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27632 2026-03-31 cs.RO cs.AI cs.CV 67%

ContraMap: Contrastive Uncertainty Mapping for Robot Environment Representation

ContraMap:基于对比学习的机器人环境表示不确定性映射

Chi Cuong Le, Weiming Zhi

机构 * School of Computer Science and the Australian Centre for Robotics, University of Sydney(悉尼大学计算机科学学院与澳大利亚机器人中心)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 ContraMap通过对比学习方法,结合核基判别图和显式不确定性类,实现实时环境预测与空间不确定性估计,优于贝叶斯核图基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.11453 2026-03-17 cs.CV cs.AI cs.RO 67%

Beyond Frame-wise Tracking: A Trajectory-based Paradigm for Efficient Point Cloud Tracking

超越帧级跟踪:一种基于轨迹的高效点云跟踪范式

BaiChen Fan, Yuanxi Cui, Jian Li, Qin Wang, Shibo Zhao, Muqing Cao, Sifan Zhou

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出基于轨迹的跟踪范式TrajTrack,通过隐式学习历史轨迹提升跟踪精度,实现高效且鲁棒的3D单目标跟踪。

Comments Acceptted in ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16985 2026-03-05 cs.CV cs.AI cs.LG cs.RO 67%

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

极简多模态异常合成用于分布外检测与分割

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所) EPFL(苏黎世联邦理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出极简多模态异常合成方法Feature Mixing,通过理论支持提升OOD检测性能,实验表明其在多个数据集上达到最优效果,速度提升显著。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05299 2026-02-03 eess.SY cs.AR cs.CV cs.ET cs.RO cs.SY eess.IV 67%

ARCAS: An Augmented Reality Collision Avoidance System with SLAM-Based Tracking for Enhancing VRU Safety

ARCAS:一种基于SLAM跟踪的增强现实避障系统,用于提升VRU安全

Ahmad Yehia, Jiseop Byeon, Tianyi Wang, Huihai Wang, Yiming Xu, Junfeng Jiao, Christian Claudel

机构 * Department of Civil, Architectural, and Environmental Engineering, The University of Texas at Austin(德克萨斯大学奥斯汀分校土木、建筑与环境工程系) School of Architecture, The University of Texas at Austin(德克萨斯大学奥斯汀分校建筑学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 ARCAS通过融合激光雷达与SLAM跟踪,为行人提供实时AR避障,显著提升城市出行安全。

Comments 8 pages, 3 figures, 1 table, accepted for IEEE Intelligent Vehicles (IV) Symposium 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06978 2026-01-21 physics.optics 67%

Anti-Interference Diffractive Deep Neural Networks for Multi-Object Recognition

抗干扰衍射深度神经网络用于多目标识别

Zhiqi Huang, Yufei Liu, Nan Zhang, Zian Zhang, Qiming Liao, Cong He, Shendong Liu, Youhai Liu, Hongtao Wang, Xingdu Qiao, Joel K. W. Yang, Yan Zhang, Lingling Huang, Yongtian Wang

专题命中 感知 :autonomous driving(abstract);driving perception(abstract)

AI总结 本文提出抗干扰衍射深度神经网络,用于多目标识别,通过不同训练策略和物理网络实现高准确率分类。

Comments Complete manuscript, 28 pages, 13 figures

Journal ref Light: Science & Applications, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18419 2026-01-15 cs.CV cs.AI cs.RO 67%

A Multimodal Hybrid Late-Cascade Fusion Network for Enhanced 3D Object Detection

一种多模态混合后期级联融合网络用于增强的3D物体检测

Carlo Sgaravatti, Roberto Basla, Riccardo Pieroni, Matteo Corno, Sergio M. Savaresi, Luca Magri, Giacomo Boracchi

机构 * Politecnico di Milano(米兰理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出了一种多模态混合后期级联融合网络,通过结合RGB和3D激光雷达检测器,提升3D物体检测的性能,特别是在行人和自行车检测方面表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10975 2025-12-30 cs.RO cs.CV eess.IV 67%

GS-GVINS: A Tightly-integrated GNSS-Visual-Inertial Navigation System Augmented by 3D Gaussian Splatting

GS-GVINS: 一种集成GNSS-视觉-惯性导航系统的系统,结合3D高斯点分布

Zelin Zhou, Saurav Uprety, Shichuang Nie, Hongzhou Yang

机构 * Department of Geomatics Engineering, Shulich School of Engineering, University of Calgary(测绘工程系、谢里尔工程学院、卡尔加里大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 GS-GVINS是一种结合3D高斯点分布的GNSS-视觉-惯性导航系统,通过提升导航精度实现大规模户外导航。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03539 2025-12-12 cs.CV cs.RO eess.IV 67%

Panoramic Out-of-Distribution Segmentation

全景异常检测分割

Mengfei Duan, Yuheng Zhang, Yihong Cao, Fei Teng, Kai Luo, Jiaming Zhang, Kailun Yang, Zhiyong Li

机构 * School of Artificial Intelligence and Robotics and the National Engineering Research Center of Robot Visual Perception and Control Technology, Hunan University(人工智能与机器人学院和机器人视觉感知与控制技术国家工程研究中心,湖南大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、eess.IV

AI总结 本文提出全景异常检测分割任务及POS方法,通过文本引导的提示分布学习提升全景图像的异常检测与分割性能。

Comments Code and datasets will be available at https://github.com/MengfeiD/PanOoS

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02687 2025-11-20 cs.CV cs.AI cs.LG cs.RO 67%

Class-Aware PillarMix: Can Mixed Sample Data Augmentation Enhance 3D Object Detection with Radar Point Clouds?

Miao Zhang, Sherif Abdulatif, Benedikt Loesch, Marco Altmann, Bin Yang

机构 * Robert Bosch GmbH, Corporate Research(罗伯特·博世有限公司,企业研究) University of Stuttgart, Institute of Signal Processing and System Theory(斯图加特大学,信号处理与系统理论研究所)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 8 pages, 6 figures, 4 tables, accepted to 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2025). Code: https://github.com/boschresearch/CAPMIX

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08615 2025-11-13 cs.CV cs.IT cs.LG cs.RO eess.IV math.IT 67%

A Multi-Drone Multi-View Dataset and Deep Learning Framework for Pedestrian Detection and Tracking

Kosta Dakic, Kanchana Thilakarathna, Rodrigo N. Calheiros, Teng Joon Lim

专题命中 感知 :BEV(abstract);分类 cs.RO、cs.CV、eess.IV

Comments Introduction of the MATRIX Dataset, featuring synchronized footage from eight drones in an urban environment with comprehensive annotations for detection and tracking, available at https://github.com/KostaDakic/MATRIX/tree/main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05982 2025-11-11 cs.CV cs.AI cs.LG cs.RO 67%

Runtime Safety Monitoring of Deep Neural Networks for Perception: A Survey

Albert Schotschneider, Svetlana Pavlitska, J. Marius Zöllner

机构 * Institute for Applied Informatics and Formal Description Methods(应用信息学与形式描述方法研究所) Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 6 pages, 1 figure, 2 tables, accepted at IEEE SMC 2025 in Vienna, presented on 8th October 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22370 2025-10-28 cs.RO cs.AI cs.CV cs.LG cs.SE 67%

BLIP-FusePPO: A Vision-Language Deep Reinforcement Learning Framework for Lane Keeping in Autonomous Vehicles

Seyed Ahmad Hosseini Miangoleh, Amin Jalal Aghdasian, Farzaneh Abdollahi

机构 * Department of Electrical Engineering, Amirkabir University of Technology (Tehran Polytechnic)(电气工程系,阿米尔卡比尔技术大学(德黑兰理工大学))

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

Comments https://github.com/Amin-A96/BLIP-FusePPO-A-Vision-Language-Deep-Reinforcement-Learning-Framework-for-Lane-Keeping-in-Autonomous.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19001 2025-10-23 cs.CV cs.AI cs.RO 67%

Robust Driving QA through Metadata-Grounded Context and Task-Specific Prompts

Seungjun Yu, Junsung Park, Youngsun Lim, Hyunjung Shim

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14293 2025-10-17 cs.RO cs.AI cs.CV cs.LG 67%

Learning Human-Humanoid Coordination for Collaborative Object Carrying

Yushi Du, Yixuan Li, Baoxiong Jia, Yutang Lin, Pei Zhou, Wei Liang, Yanchao Yang, Siyuan Huang

机构 * Department of Electrical and Electronic Engineering, the University of Hong Kong(香港大学电子与电气工程系) State Key Laboratory of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) School of Computer Science and Technology, Beijing Institute of Technology(北京理工大学计算机科学与技术学院) Yuanpei College, Peking University(北京大学元培学院)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09945 2025-10-14 cs.CV cs.AI cs.HC cs.LG eess.IV 67%

Explainable Human-in-the-Loop Segmentation via Critic Feedback Signals

Pouya Shaeri, Ryan T. Woo, Yasaman Mohammadpour, Ariane Middel

机构 * Arizona State University(亚利桑那州立大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、eess.IV、cs.AI

Comments Submitted to a computer vision conference (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20107 2025-09-26 cs.CV cs.AI cs.LG cs.RO 67%

Hyperspectral Adapter for Semantic Segmentation with Vision Foundation Models

Juana Valeria Hurtado, Rohit Mohan, Abhinav Valada

机构 * Department of Computer Science, University of Freiburg(弗赖堡大学计算机科学系) Baden-Württemberg Stiftung gGmbH(巴登-符腾堡基金会) Bosch Research(博世研究)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06474 2025-09-25 cs.RO cs.AI cs.CV cs.MA cs.NI 67%

Edge-Enabled Collaborative Object Detection for Real-Time Multi-Vehicle Perception

Everett Richards, Bipul Thapa, Lena Mashayekhy

机构 * San Diego State University(圣地亚哥州立大学) University of Delaware(特拉华大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

Comments This paper has been accepted to IEEE EDGE 2025. The final version will be published in IEEE Xplore later this year

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03462 2025-09-04 cs.AI cs.CV cs.RO 67%

sam-llm: interpretable lane change trajectoryprediction via parametric finetuning

Zhuo Cao, Yunxiao Shi, Min Xu

机构 * University of Queensland, School of Civil Engineering(昆士兰大学土木工程学院) University of Technology Sydney, Faculty of Engineering(悉尼科技大学工程学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00299 2025-08-04 cs.CV cs.AI cs.RO 67%

Controllable Pedestrian Video Editing for Multi-View Driving Scenarios via Motion Sequence

Danzhen Fu, Jiagao Hu, Daiguo Zhou, Fei Wang, Zepeng Wang, Wenhua Liao

机构 * MiLM Plus, Xiaomi Inc.(小米公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

Comments ICCV 2025 Workshop (HiGen)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.05119 2025-07-23 cs.LG cs.AI cs.AR cs.CV eess.IV 67%

Balancing Robustness and Efficiency in Embedded DNNs Through Activation Function Selection

Jon Gutiérrez-Zaballa, Koldo Basterretxea, Javier Echanobe

机构 * Department of Electronics Technology, University of the Basque Country (UPV/EHU)(电子技术系,巴斯克国家大学(UPV/EHU)) Department of Electricity and Electronics, University of the Basque Country (UPV/EHU)(电力与电子系,巴斯克国家大学(UPV/EHU))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、eess.IV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19283 2025-07-04 cs.CV cs.AI cs.RO 67%

AirV2X: Unified Air-Ground Vehicle-to-Everything Collaboration

Xiangbo Gao, Yuheng Wu, Fengze Yang, Xuewen Luo, Keshu Wu, Xinghao Chen, Yuping Wang, Chenxi Liu, Yang Zhou, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯理工大学) KAIST(韩国科学技术院) The University of Utah(犹他大学) University of Washington(华盛顿大学) University of Michigan(密歇根大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.13504 2025-07-02 cs.LG cs.AI cs.CV cs.RO 67%

CoCMT: Communication-Efficient Cross-Modal Transformer for Collaborative Perception

Rujia Wang, Xiangbo Gao, Hao Xiang, Runsheng Xu, Zhengzhong Tu

机构 * Computer Science and Engineering, Texas A&M University(计算机科学与工程,德克萨斯A&M大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 感知 :BEV(abstract);分类 cs.RO、cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22593 2025-07-01 cs.RO cs.AI cs.CV 67%

Pixels-to-Graph: Real-time Integration of Building Information Models and Scene Graphs for Semantic-Geometric Human-Robot Understanding

Antonello Longo, Chanyoung Chung, Matteo Palieri, Sung-Kyun Kim, Ali Agha, Cataldo Guaragnella, Shehryar Khattak

机构 * NASA Jet Propulsion Laboratory, California Institute of Technology(美国国家航空航天局喷气推进实验室、加州理工学院) Department of Electrical And Information Engineering, Polytechnic University of Bari(巴里理工学院电子与信息工程系) Field AI

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV、cs.AI

Comments Paper accepted to 2025 IEEE International Conference on Automation Science and Engineering (CASE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20597 2025-06-26 eess.SP 67%

Differential Transformer-driven 6G Physical Layer for Collaborative Perception Enhancement

Soheyb Ribouh, Osama Saleem, Mohamed Ababsa

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06967 2025-06-23 cs.CV cs.AI eess.IV 67%

Dual Thinking and Logical Processing -- Are Multi-modal Large Language Models Closing the Gap with Human Vision ?

Kailas Dayanandan, Nikhil Kumar, Anand Sinha, Brejesh Lall

机构 * Indian Institute of Technology Delhi(印度理工学院德里)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、eess.IV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏