arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2512.04734 2025-12-10 cs.CV 57%

MT-Depth: Multi-task Instance feature analysis for the Depth Completion

MT-Depth:多任务实例特征分析用于深度补全

Abdul Haseeb Nizamani, Dandi Zhou, Xinhai Sun

机构 * Saisuode (Shanghai) Intelligent Technology Co., Ltd. (Synthoid.ai)(上海思速德智能科技有限公司(Synthoid.ai))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 MT-Depth通过实例感知的多任务实例特征分析,提升深度补全的精度,尤其在物体边界、遮挡和细长结构区域表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.01064 2025-12-09 cs.CV 57%

Roadside Monocular 3D Detection Prompted by 2D Detection

道路旁单目3D检测受2D检测启发

Yechi Ma, Yanan Li, Wei Hua, Shu Kong

机构 * Zhejiang University(浙江大学) Zhejiang Lab(浙江实验室) University of Macau(澳门大学) Institute of Collaborative Innovation(协同创新研究院)

专题命中 感知 :BEV(abstract);分类 cs.CV

AI总结 本文提出Pro3D,通过利用2D检测作为提示,提升道路旁单目3D检测的性能,实现更精确的3D定位。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06406 2025-12-09 cs.AI cs.LG 57%

UncertaintyZoo: A Unified Toolkit for Quantifying Predictive Uncertainty in Deep Learning Systems

UncertaintyZoo: 一个统一的工具包,用于量化深度学习系统中的预测不确定性

Xianzong Wu, Xiaohong Li, Lili Quan, Qiang Hu

机构 * Tianjin University(天津大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 UncertaintyZoo是一个统一的工具包,整合了29种不确定性量化方法,用于量化深度学习系统中的预测不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05482 2025-12-08 cs.CV 57%

Concept-based Explainable Data Mining with VLM for 3D Detection

基于概念的可解释数据挖掘与VLM用于3D检测

Mai Tsujimoto

机构 * The University of Tokyo(东京大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出基于概念的可解释数据挖掘方法,利用VLMs识别稀有物体以提升3D检测性能,减少标注负担并提高模型效果。

Comments 28 pages including appendix. Code: https://github.com/mm1129/concept_based_rare_detector_2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05412 2025-12-08 cs.CV 57%

YOLO and SGBM Integration for Autonomous Tree Branch Detection and Depth Estimation in Radiata Pine Pruning Applications

YOLO与SGBM融合用于辐射松修剪应用中的自主树枝检测与深度估计

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green

机构 * Centre for Data Science and Artificial Intelligence(数据科学与人工智能中心) Victoria University of Wellington(惠灵顿维多利亚大学) Department of Computer Science and Software Engineering(计算机科学与软件工程系) University of Canterbury(坎特伯雷大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出一种融合YOLO与SGBM的自主修剪系统,通过立体摄像机实现树枝检测与深度估计,提升林业作业的安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19552 2025-12-08 cs.CV 57%

iFinder: Structured Zero-Shot Vision-Based LLM Grounding for Dash-Cam Video Reasoning

iFinder: 结构化零样本视觉基于LLM的地面定位用于行车记录仪视频推理

Manyi Yao, Bingbing Zhuang, Sparsh Garg, Amit Roy-Chowdhury, Christian Shelton, Manmohan Chandraker, Abhishek Aich

机构 * NEC Laboratories, America(NEC美国实验室) University of California, Riverside(加州大学河滨分校) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 iFinder通过结构化语义接地框架,利用行车记录仪视频中的关键线索提升LLM在驾驶视频推理中的性能。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02031 2025-12-08 cs.CV 57%

Neural Eulerian Scene Flow Fields

神经欧拉场景流场

Kyle Vedder, Neehar Peri, Ishan Khatri, Siyi Li, Eric Eaton, Mehmet Kocamaz, Yue Wang, Zhiding Yu, Deva Ramanan, Joachim Pehserl

机构 * University of Pennsylvania(宾夕法尼亚大学) NVIDIA(英伟达) Carnegie Mellon University(卡内基梅隆大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 EulerFlow通过神经先验估计空间时间微分方程,实现高质量场景流估计,在多个领域表现优异,超越现有方法。

Comments Accepted to ICLR 2025. Winner of CVPR 2024 WoD Argoverse Scene Flow Challenge, Unsupervised Track. Project page at https://vedder.io/eulerflow

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03684 2025-12-04 cs.RO 57%

A Novel Approach to Tomato Harvesting Using a Hybrid Gripper with Semantic Segmentation and Keypoint Detection

一种基于语义分割和关键点检测的新型番茄采摘方法

Shahid Ansari, Mahendra Kumar Gohil, Yusuke Maeda, Bishakh Bhattacharya

机构 * TSTS

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 本文提出了一种结合语义分割和关键点检测的新型番茄采摘系统,通过混合机械手和智能控制实现高效、安全的采摘

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11323 2025-12-04 cs.CV 57%

Delving into Dynamic Scene Cue-Consistency for Robust 3D Multi-Object Tracking

深入研究动态场景提示一致性以实现稳健的3D多目标跟踪

Haonan Zhang, Xinyao Wang, Boxi Wu, Tu Zheng, Wang Yunhua, Zheng Yang

机构 * Fabu

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出DSC-Track方法,通过动态场景提示一致性提升3D多目标跟踪的鲁棒性,实验表明其在nuScenes基准上达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07768 2025-12-04 cs.CV 57%

Test-time Correction: An Online 3D Detection System via Visual Prompting

测试时校正:通过视觉提示的在线3D检测系统

Hanxue Zhang, Zetong Yang, Yanan Sun, Li Chen, Fei Xia, Fatma Güney, Hongyang Li

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai AI Lab(上海人工智能实验室) GAC R&D Center(GAC研发中心) The University of Hong Kong(香港大学) Google(谷歌) Koç University(科克大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出一种通过视觉提示实现在线3D检测的测试时校正系统,旨在提升自动驾驶系统在部署后的实时纠错能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07958 2025-12-03 cs.CV 57%

Detect Anything 3D in the Wild

在野外检测任意3D对象

Hanxue Zhang, Haoran Jiang, Qingsong Yao, Yanan Sun, Renrui Zhang, Hao Zhao, Hongyang Li, Hongzi Zhu, Zetong Yang

机构 * OpenDriveLab at Shanghai AI Laboratory(上海人工智能实验室开放驾驶实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Stanford University(斯坦福大学) CUHK MMLab(香港大学多模态实验室) Tsinghua University(清华大学) GAC R&D Center(广汽研发中心)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 DetAny3D通过结合2D基础模型知识和3D解释器,实现了在任意相机配置下检测任意新物体的3D检测基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01934 2025-12-02 cs.CV 57%

Physical ID-Transfer Attacks against Multi-Object Tracking via Adversarial Trajectory

针对多目标跟踪的物理ID转移攻击

Chenyi Wang, Yanmao Man, Raymond Muller, Ming Li, Z. Berkay Celik, Ryan Gerdes, Jonathan Petit

机构 * University of Arizona(亚利桑那大学) HERE Technologies(HERE技术公司) Purdue University(普渡大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出AdvTraj,一种针对多目标跟踪的在线物理ID转移攻击,通过对抗性轨迹干扰跟踪系统,提升系统鲁棒性。

Comments Accepted to Annual Computer Security Applications Conference (ACSAC) 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01427 2025-12-02 cs.CV 57%

Language-Guided Open-World Anomaly Segmentation

语言引导的开放世界异常分割

Klara Reichard, Nikolas Brasch, Nassir Navab, Federico Tombari

机构 * Technical University of Munich(慕尼黑技术大学) BMW Group(宝马集团)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 基于CLIP的开放世界异常分割方法,通过零样本学习实现未知物体的分割与命名,提升自动驾驶中的异常检测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01352 2025-12-02 cs.CV 57%

OpenBox: Annotate Any Bounding Boxes in 3D

OpenBox: 任意3D边界框的标注

In-Jae Lee, Mungyeom Kim, Kwonyoung Ryu, Pierre Musacchio, Jaesik Park

机构 * Seoul National University(首尔国立大学) POSTECH

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 OpenBox通过2D视觉基础模型实现无需自我训练的高质量3D边界框标注,提升自动驾驶中物体检测的准确性和效率。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01178 2025-12-02 cs.CV 57%

VSRD++: Autolabeling for 3D Object Detection via Instance-Aware Volumetric Silhouette Rendering

VSRD++: 通过实例感知的体素轮廓渲染实现3D目标检测的自标注

Zihua Liu, Hiroki Sakuma, Masatoshi Okutomi

机构 * Department of System and Control Engineering, Institute of Science Tokyo, Tokyo(系统与控制工程系,科学东京研究所)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 VSRD++通过实例感知的体素轮廓渲染技术实现单目3D目标检测的弱监督自标注,有效提升静态和动态场景下的检测性能。

Comments arXiv admin note: text overlap with arXiv:2404.00149

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17354 2025-12-02 cs.AI cs.LG 57%

Multi-Scenario Highway Lane-Change Intention Prediction: A Physics-Informed AI Framework for Three-Class Classification

多场景高速公路变道意图预测:一种融合物理的AI框架用于三类分类

Jiazhao Shi, Yichen Lin, Yiheng Hua, Ziyu Wang, Zijian Zhang, Wenjia Zheng, Yun Song, Kuan Lu, Shoufeng Lu

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出融合物理的AI框架,通过整合车辆动力学和交通安全指标,实现高速公路变道意图的三类分类预测,提升自动驾驶系统的安全性和决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22896 2025-12-01 cs.CV 57%

DM$^3$T: Harmonizing Modalities via Diffusion for Multi-Object Tracking

DM$^3$T: 通过扩散和谐多模态以实现多目标跟踪

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Qiannan Guo, Zhenbo Li

机构 * China Agricultural University(中国农业大学) Beijing Normal University(北京师范大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 DM$^3$T通过扩散模型实现多模态特征对齐,提升多目标跟踪的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22404 2025-12-01 cs.CV 57%

UAV-MM3D: A Large-Scale Synthetic Benchmark for 3D Perception of Unmanned Aerial Vehicles with Multi-Modal Data

UAV-MM3D: 一种大规模合成基准,用于多模态数据下的无人机三维感知

Longkun Zou, Jiale Wang, Rongqin Liang, Hai Wu, Ke Chen, Yaowei Wang

机构 * Pengcheng Laboratory(鹏城实验室) University of Southern California(南加州大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 UAV-MM3D通过多模态合成数据提升无人机三维感知能力,提供高保真数据集和多任务基线模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22142 2025-12-01 cs.CV cs.SY eess.SY 57%

SemOD: Semantic Enabled Object Detection Network under Various Weather Conditions

SemOD:在各种天气条件下启用语义的对象检测网络

Aiyinsi Zuo, Zhaoliang Zheng

机构 * Department of Electrical and Computer Engineering, University of Rochester(罗切斯特大学电气与计算机工程系) Department of Electrical and Computer Engineering, University of California, Los Angeles(加州大学洛杉矶分校电气与计算机工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 SemOD通过引入语义信息提升多天气条件下物体检测性能,mAP提升1.47%-8.80%

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16833 2025-11-27 cs.CV 57%

Open Vocabulary Monocular 3D Object Detection

开放词汇单目3D物体检测

Jin Yao, Hao Gu, Xuweiyi Chen, Jiayun Wang, Zezhou Cheng

机构 * University of Virginia(弗吉尼亚大学) California Institute of Technology(加州理工学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出了一种开放词汇单目3D检测方法,通过整合预训练的2D和3D视觉模型,解决3D标注稀缺和语义歧义问题,实现对新类别的零样本检测和已有类别的域内检测。

Comments 3DV 2026, Project page: https://cvlab.cs.virginia.edu/ovmono3d

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20467 2025-11-26 cs.RO cs.SY eess.SY 57%

Power-Efficient Autonomous Mobile Robots

低功耗自主移动机器人

Liangkai Liu, Weisong Shi, Kang G. Shin

机构 * Department of Computer Science and Engineering, University of Michigan, USA(计算机科学与工程系,密歇根大学) Department of Computer and Information Sciences, University of Delaware, USA(计算机与信息科学系,特拉华大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出pNav系统,通过联合优化自主移动机器人物理和网络子系统,显著提升其功率效率,实测显示功率消耗降低38.1%。

Comments 13 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18816 2025-11-25 cs.CV 57%

SupLID: Geometrical Guidance for Out-of-Distribution Detection in Semantic Segmentation

SupLID:用于语义分割中异常检测的几何指导

Nimeshika Udayangani, Sarah Erfani, Christopher Leckie

机构 * The University of Melbourne(墨尔本大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 SupLID通过利用语义空间的几何结构,提升语义分割中分布外检测的准确性与效率。

Comments 10 pages, CIKM 2025

Journal ref In Proceedings of the 34th ACM International Conference on Information and Knowledge Management (CIKM 2025), pages 2905-2914, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18695 2025-11-25 cs.CV 57%

Exploring Surround-View Fisheye Camera 3D Object Detection

探索环绕视图鱼眼相机的3D目标检测

Changcai Li, Wenwei Lin, Zuoxun Hou, Gang Chen, Wei Zhang, Huihui Zhou, Weishi Zheng

机构 * Changcai Li 1,2(李昌才 1,2) Wenwei Lin 1(林文伟 1) Zuoxun Hou 3(侯宙勋 3) Gang Chen 1(陈刚 1) Wei Zhang 2(张伟 2) Huihui Zhou 2(周会会 2) Weishi Zheng 1(郑伟世 1)

专题命中 感知 :BEV(abstract);分类 cs.CV

AI总结 本文提出FisheyeBEVDet和FisheyePETR两种方法,利用鱼眼图像的几何特性提升3D目标检测精度,通过Fisheye3DOD数据集验证效果,提升6.2%

Comments 9 pages,6 figures, accepted at AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence (AAAI), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10471 2025-11-25 cs.CV cs.LG 57%

DAGLFNet: Deep Feature Attention Guided Global and Local Feature Fusion for Pseudo-Image Point Cloud Segmentation

DAGLFNet:基于伪图像的深度特征注意力引导的全局和局部特征融合用于伪图像点云分割

Chuang Chen, Yi Lin, Bo Wang, Jing Hu, Xi Wu, Wenyi Ge

机构 * College of Computer Science, Chengdu University of Information Technology(成都信息科技大学计算机学院) College of Computer Science, Sichuan University(四川大学计算机学院) Publications Department, Optica Publishing Group(Optica出版社出版部) Department of Electronic Journals, Optica Publishing Group(Optica出版社电子期刊部)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 DAGLFNet通过深度特征注意力引导的全局和局部特征融合,提升伪图像点云分割的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17455 2025-11-24 cs.CV 57%

Improving Multimodal Distillation for 3D Semantic Segmentation under Domain Shift

改进多模态蒸馏以应对激光雷达语义分割中的域移位

Björn Michele, Alexandre Boulch, Gilles Puy, Tuan-Hung Vu, Renaud Marlet, Nicolas Courty

机构 * CNRS, IRISA, Univ. Bretagne Sud(CNRS、IRISA、布列塔尼大学) LIGM, Ecole des Ponts, Univ Gustave Eiffel, CNRS(LIGM、巴黎理工学院、古斯塔夫·埃菲尔大学、CNRS)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本研究提出改进多模态蒸馏方法,通过冻结预训练主干网络并训练MLP头,提升激光雷达语义分割在域移位下的性能。

Comments Accepted at BMVC 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17094 2025-11-24 cs.CV 57%

Sparse Reasoning is Enough: Biological-Inspired Framework for Video Anomaly Detection with Large Pre-trained Models

稀疏推理已足够:基于生物启发的视频异常检测大预训练模型框架

He Huang, Zixuan Hu, Dongxiao Li, Yao Xiao, Ling-Yu Duan

机构 * School of Computer Science Peking University(北京大学计算机科学学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 ReCoVAD通过生物启发的双通路框架实现视频异常检测,利用稀疏推理降低计算成本,取得最佳无训练性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16998 2025-11-24 cs.CV 57%

VLM-Augmented Degradation Modeling for Image Restoration Under Adverse Weather Conditions

增强型退化建模用于恶劣天气下的图像修复

Qianyi Shao, Yuanfan Zhang, Renxiang Xiao, Liang Hu

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种结合视觉-语言模型和隐式记忆库的统一模型,用于在恶劣天气下高效恢复图像,提升了修复精度和计算效率。

Journal ref Proc. 2025 30th International Conference on Automation and Computing (ICAC), pp. 1-6, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15459 2025-11-20 cs.CV 57%

Driving in Spikes: An Entropy-Guided Object Detector for Spike Cameras

在尖峰中驾驶:一种基于熵引导的对象检测器用于尖峰相机

Ziyan Liu, Qi Su, Lulu Tang, Zhaofei Yu, Tiejun Huang

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出EASD,一种基于熵引导的端到端尖峰相机检测器,通过双分支设计提升尖峰流检测性能,并引入DSEC尖峰基准用于自动驾驶场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15271 2025-11-20 cs.CV cs.LG 57%

Graph Query Networks for Object Detection with Automotive Radar

Loveneet Saini, Hasan Tercan, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学)

专题命中 感知 :BEV(abstract);分类 cs.CV

Comments Accepted in WACV 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14625 2025-11-19 cs.RO 57%

Gallant: Voxel Grid-based Humanoid Locomotion and Local-navigation across 3D Constrained Terrains

Qingwei Ben, Botian Xu, Kailin Li, Feiyu Jia, Wentao Zhang, Jingping Wang, Jingbo Wang, Dahua Lin, Jiangmiao Pang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学) University of Tokyo(东京大学) Shanghai Jiaotong University(上海交通大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

详情

展开后加载摘要…

URL PDF HTML 收藏