arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2606.24786 2026-06-26 cs.CV 新提交 70%

Counting Trees from Satellite Imagery with Noisy Supervision

基于噪声监督的卫星图像树木计数

Dimitri Gominski, Maurice Mugabowindekwe, Qiue Xu, Xiaowei Tong, Martin Brandt, Hieu Le, Rasmus Fensholt, Dimitris Samaras, Loic Landrieu

机构 * University of Copenhagen(哥本哈根大学) University of Rwanda(卢旺达大学) University of Chinese Academy of Sciences(中国科学院大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Stony Brook University(石溪大学) LIGM, CNRS, Univ Gustave Eiffel, ENPC, IPP(LIGM,CNRS,古斯塔夫·埃菲尔大学,ENPC,IPP)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 针对卫星图像中树木计数任务,提出基于非平衡最优传输的空间密度匹配方法,并引入自校正机制利用传输残差逐步优化噪声监督,在跨三大洲的TinyTrees基准上优于检测、回归和传输匹配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17936 2026-06-26 cs.RO 新提交 70%

SPARK: Low Latency Single-Camera 3D Pose Estimation for Autonomous Racing using Keypoints

SPARK: 基于关键点的自动驾驶赛车低延迟单摄像头3D姿态估计

Dominic Ebner, Markus Lienkamp

机构 * Technical University of Munich(慕尼黑工业大学) School of Engineering & Design, Department of Mobility Systems Engineering, Institute of Automotive Technology(工程与设计学院,移动系统工程系,汽车技术研究所) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出SPARK算法,利用单摄像头和关键点检测实现自动驾驶赛车中低延迟、高精度的3D姿态估计,性能优于现有方法。

Comments 9 pages, 6 figures, ITSC 2026, Invited Session

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07412 2026-06-25 cs.LG cs.AI 版本更新 70%

Tracking Large-scale Shared Bikes with Inertial Motion Learning in GNSS Blocked Environments

通过惯性运动学习在GNSS阻塞环境中跟踪大规模共享自行车

Feng Liu, Kejia Li, Zhiwei Yang, Chunwei Yang, Qun Li, Guobin Wu, Qiang Ni, Ruipeng Gao

机构 * School of Software Engineering, Beijing Jiaotong University(北京交通大学软件学院) DiDi, Beijing(滴滴(北京))

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.AI

AI总结 本文提出一种结合自行车机械约束与混合专家模型的惯性跟踪框架,通过多专家模块捕捉共享表示并改进多任务学习性能,实现不确定性感知的轨迹估计,并通过动态校准提升跟踪精度。

Comments This paper has been accepted by IEEE Transactions on Intelligent Transportation Systems (T-ITS) on June 23, 2026. Journal article. 15 pages, 18 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21309 2026-06-23 cs.CV 新提交 70%

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

WildBox: 非洲稀树草原野生动物航拍单目3D检测数据集与基准

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, Devis Tuia, Fabio Remondino, Benjamin Risse

机构 * D Optical Metrology Unit, Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会3D光学计量部) Computer Vision and Machine Learning Systems group, Institute for Geoinformatics, University of Muenster(明斯特大学地理信息学研究所计算机视觉与机器学习系统组) School of Civil, Aerospace and Design Engineering, University of Bristol(布里斯托大学土木、航空航天与设计工程学院) Department of Biology, University of Southern Denmark(南丹麦大学生物学系) The Ohio State University(俄亥俄州立大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所集体行为系) University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物学系) Environmental Computational Science and Earth Observation Laboratory, EPFL(瑞士联邦理工学院环境计算科学与地球观测实验室)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 提出WildBox数据集,含23.7万3D框标注,评估两种开放词汇单目3D架构,发现零样本3D检测失败,微调后恢复性能,深度估计是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08206 2026-06-18 cs.CV cs.LG 新提交 70%

SegmentAnyTreeV2: Scaling Transformer-Based Tree Instance Segmentation Across Sensors, Platforms, and Forests

SegmentAnyTreeV2:跨传感器、平台和森林的基于Transformer的树木实例分割扩展

Maciej Wielgosz, Stefano Puliti, Rasmus Astrup

机构 * Norwegian Institute of Bioeconomy Research (NIBIO)(挪威生物经济研究所(NIBIO))

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出SegmentAnyTreeV2,一种传感器和平台无关的森林点云语义与实例分割框架,结合Point Transformer v3骨干网络、轻量语义头和树木交叉注意力掩码解码器,在FOR-instance v3基准上达到90.5%精度和80.2%召回率,并展现出强跨域泛化能力。

Comments 25 pages, 6 figures, 10 tables, Corrected bibliography metadata and minor typographical issues; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15896 2026-06-16 cs.RO cs.LG 新提交 70%

LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors

LoComposition:无需步态先验的地形自适应高效四足运动

Loukas Kordos, Leonard T. Franz, Simon Rappenecker, Oliver Hausdoerfer, Angela P. Schoellig, Pavel Kolev, Georg Martius

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) Technical University of Munich(慕尼黑工业大学) University of Stuttgart(斯图加特大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种将任务奖励、操作约束、能量最小化和地形感知分离的框架,无需显式步态先验,在四足机器人上实现高效地形自适应运动,运输成本降低56%,违规减少96%。

Comments 17 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07742 2026-06-16 cs.CV 70%

Efficient 3D Perception on Multi-Sweep Point Cloud with Gumbel Spatial Pruning

多扫点云上的高效3D感知与Gumbel空间修剪

Tianyu Sun, Jianhao Li, Xueqian Zhang, Zhongdao Wang, Bailan Feng, Hengshuang Zhao

机构 * Department of Electronic Engineering, Tsinghua University(清华大学电子工程系) Department of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院) Noah’s Ark Lab(诺亚实验室) Department of Computer Science, University of Hong Kong(香港大学计算机科学系)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究了户外环境中点云感知问题,通过累积多个连续点云扫描以提高感知精度,引入Gumbel空间修剪层有效减少冗余点,提升3D感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09268 2026-06-09 cs.RO 新提交 70%

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

VGP-Nav:用于机器人导航的度量感知视觉几何感知

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shenzhen University(深圳大学) SpatialTemporal AI(时空人工智能)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08029 2026-06-09 cs.RO 新提交 70%

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

IntentNav: 从人类演示中学习空间-视觉物体导航

Yuxin Cai, Zongtai Li, Maonan Wang, Muyi Bao, Haokun Zhu, Ruofei Bai, Ding Zhao, Zirui Li, Wenshan Wang, Wei-Yun Yau, Ji Zhang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.RO

AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07016 2026-06-08 stat.AP cs.CV 新提交 70%

An Integrated Roadside Sensing and Communication Framework for Vulnerable Road User Safety at Signalized Intersections

信号交叉口弱势道路使用者安全的集成路边感知与通信框架

Parvez Anowar

机构 * Department of Civil, Environmental and Construction Engineering, University of Central Florida(中央佛罗里达大学土木、环境与建设工程系)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出集成多模态感知、边缘计算、V2X/P2X通信和自适应信号控制的框架,基于公开数据集R-LiViT分析53,319个标注,发现VRU占49%、昼夜密度差异大、近距离事件变化10倍、83%行人边界框小,支持多模态感知和自适应部署。

Comments 17 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18954 2026-06-03 cs.CV 70%

VOIC: Visible-Occluded Integrated Guidance for 3D Semantic Scene Completion

VOIC:可见-遮挡联合引导的3D语义场景补全

Zaidao Han, Risa Higashita, Jiang Liu

机构 * Research Institute of Trustworthy Autonomous Systems, Southern University of Science and Technology(可信自主系统研究院,南方科技大学) Department of Computer Science and Engineering, Southern University of Science and Technology(计算机科学与工程系,南方科技大学) School of Computer Science, University of Nottingham Ningbo China(宁波大学计算机学院) Department of Electronic and Information Engineering, Changchun University(电子与信息工程学院,长春大学)

专题命中 感知 :autonomous driving(abstract);occupancy(abstract);分类 cs.CV

AI总结 提出VOIC网络,通过解耦可见区域感知与遮挡区域推理,利用离线可见区域标签提取策略和双解码器框架,在SemanticKITTI和SSCBench-KITTI360上实现最先进的3D语义场景补全性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00576 2026-06-02 cs.RO 70%

Dynamic Resilient Spatio-Semantic Memory with Hybrid Localization for Mobile Manipulation

面向移动操作的动态弹性时空语义记忆与混合定位

Zhijie Yan, Shufei Li, Ze Zhang, Xin Liu, Yuhang Zheng, Zuoxu Wang

机构 * School of Mechanical Engineering and Automation, Beihang University(北京航空航天大学机械工程及自动化学院) Department of Systems Engineering, City University of Hong Kong(香港城市大学系统工程系) School of Computing, National University of Singapore(新加坡国立大学计算机学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出DREAM框架,通过在线构建时空语义体素记忆、冗余感知记忆剪枝和混合定位,实现无预建地图的动态室内移动操作,将长时任务成功率提升至55%-70%。

Comments Code, CAD model, and real-robot demonstrations are available at https://bjhyzj.github.io/dream-web

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12724 2026-06-02 cs.RO 70%

TRANS: Terrain-aware Reinforcement Learning for Agile Navigation of Quadruped Robots under Social Interactions

TRANS:面向社交互动下四足机器人敏捷导航的地形感知强化学习

Wei Zhu, Irfan Tito Kurniawan, Ye Zhao, Mitsuhiro Hayashibe

机构 * Department of Robotics, Graduate School of Engineering, Tohoku University(东邦大学机器人学系) Laboratory for Intelligent Decision and Autonomous Robots, Woodruff School of Mechanical Engineering, Georgia Institute of Technology(佐治亚理工学院智能决策与自主机器人实验室)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出一个名为TRANS的两阶段深度强化学习框架,通过三个DRL流水线(TRANS-Loco、TRANS-Nav和统一TRANS)实现四足机器人在非结构化地形上的社交导航,克服了传统方法中运动规划与运动控制分离、缺乏地形感知以及假设静态环境等局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26370 2026-05-27 cs.CV 70%

Joint Instance Segmentation and Geometric Attribute Regression for Roof Structures in Aerial Imagery

航空影像中屋顶结构的联合实例分割与几何属性回归

Luuk Versteeg, Rob G. J. Wijnhoven, Martin R. Oswald

机构 * University of Amsterdam (UvA)(阿姆斯特丹大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出一种从单张航空正射影像中联合预测屋顶实例分割掩码和三个连续几何属性(建筑高度、屋顶坡度、屋顶方位角)的方法,通过条件方位角损失和对数归一化高度表示解决数据噪声和分布偏斜问题,在荷兰大规模数据集上实现了高精度,并可从单张图像重建简化3D建筑模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25279 2026-05-26 cs.RO 70%

GreenSeg: Ground Segmentation Algorithm for Agricultural Robots in Mediterranean Greenhouses using RGB-D Point Clouds

GreenSeg: 基于RGB-D点云的地中海温室农业机器人地面分割算法

Fernando Cañadas-Aránega, José C. Moreno, José L. Blanco-Claraco

机构 * Department of Informatics, CIESOL, ceiA3, Universidad de Almería(信息学院,CIESOL,ceiA3,阿尔梅里亚大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 针对地中海温室狭窄通道、异构地形和光学干扰等挑战,提出一种基于RGB-D感知的双层验证地面分割框架GreenSeg,通过全局平面拟合、曲率滤波和种子点区域生长实现稳定导航,在AGRICOBIOT I平台上验证了其在动态光照下优于基准方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24992 2026-05-26 cs.NI cs.AI cs.LG cs.MA 70%

Scaling up Energy-Aware Multi-Agent Reinforcement Learning for Mission-Oriented Drone Networks with Individual Reward

面向任务驱动无人机网络的能量感知多智能体强化学习扩展与个体奖励

Changling Li, Ying Li

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Department of Computer Science, Colby College(科尔比学院计算机科学系)

专题命中 感知 :autonomous driving(abstract);trajectory planning(abstract);分类 cs.AI

AI总结 提出基于个体奖励函数的能量感知多智能体强化学习模型,利用深度Q网络解决无人机网络动态环境和电池容量限制下的轨迹规划问题,实验表明在任务密度高时成功率接近100%,且扩展性优于共享奖励模型。

Comments IEEE Internet of Things Journal

Journal ref volume=12, number=8, year=2025, pages=10640-10654

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23832 2026-05-25 cs.RO 70%

SFG-ROS: A Resource-Aware Framework for Dense Multi-Agent Perception

SFG-ROS:面向密集多智能体感知的资源感知框架

Constantin Blessing, Elias Geiger, Jakob Häringer, Dennis Grewe, Markus Enzweiler

机构 * Institute for Intelligent Systems, Faculty of Computer Sciences and Engineering(智能系统研究所,计算机科学与工程学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 针对ROS 2在多机器人协作感知中的网络饱和与计算开销问题,提出SFG-ROS框架,通过模式驱动的流量路由、按需集中解码和硬件无关容器管道,将网络流量限制为O(1)并减少72.3%的CPU扩展开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18507 2026-05-22 cs.CV 70%

Weakly Supervised Cross-Modal Learning for 4D Radar Scene Flow Estimation

弱监督跨模态学习用于4D雷达场景流估计

Jingyun Fu, Zhiyu Xiang, Na Zhao

机构 * Zhejiang University, Hangzhou, Zhejiang, China(浙江大学) Zhejiang Provincial Key Laboratory of Multi-Modal Communication Networks and Intelligent Information Processing(浙江省多模态通信网络与智能信息处理重点实验室) Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出了一种弱监督的雷达场景流学习框架,利用图像和里程计进行辅助监督,通过实例感知的自监督损失和静态区域的刚性损失,实现了更高效的场景流估计。

Comments Accepted by ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09631 2026-05-18 cs.DC cs.AI 70%

Hardware Utilization and Inference Performance of Edge Object Detection Under Fault Injection

边缘目标检测在故障注入下的硬件利用与推断性能

Faezeh Pasandideh, Mehdi Azarafza, Achim Rettberg

机构 * Hamm-Lippstadt University of Applied Sciences (HSHL)(哈姆-利普施塔特应用科学大学(HSHL))

专题命中 感知 :autonomous driving(abstract);occupancy(abstract);分类 cs.AI

AI总结 研究通过故障注入测试评估了TensorRT优化的YOLO模型在边缘平台上的硬件行为,发现其在资源降级下保持稳定性能,为边缘推断可靠性提供硬件层面的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15546 2026-05-18 cs.CV 70%

3DTMDet: A Dual-Path Synergy Network of Transformer and SSM for 3D Object Detection in Point Clouds

3DTMDet:一种结合Transformer和SSM的双路径协同网络用于点云中的3D目标检测

Bingwen Qiu, Yuan Liu, Junqi Bai, Tong Jiang, Ben Liang, Fangzhou Chen, Xiubao Sui, Qian Chen

机构 * School of Electronic and Optical Engineering(电子与光学工程学院) The 28th Research Institute of China Electronics Technology Group Corporation(中国电子科技集团第二十八研究所) College of Astronautics(航天学院) School of Information and Communication Engineering(信息与通信工程学院) State key Laboratory of Extreme Environment Optoelectronic Dynamic Measurement Technology and Instrument(极端环境光电动态测量技术与仪器国家重点实验室)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出3DTMDet网络,结合SSM和Transformer,解决点云检测中稀疏点与远距离上下文理解的矛盾,通过3D混合Mamba Transformer模块和体素生成模块提升检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08952 2026-05-12 cs.CV 70%

FugSeg: Fast Uncertainty-aware Ground Segmentation for 3D Point Cloud

FugSeg:面向3D点云的快速不确定性感知地面分割

Yu Li, Volker Schwieger

机构 * Institute of Engineering Geodesy, University of Stuttgart(斯图加特大学工程大地测量研究所) Daimler Truck AG(戴姆勒卡车公司)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出FugSeg,一种快速且考虑不确定性的地面分割方法,通过极坐标网格地图表示和自适应坡度策略,有效处理反射噪声和孤立地面问题,在多个数据集上实现最高精度和最快速度。

Comments Accepted for publication in IEEE Transactions on Intelligent Transportation Systems

Journal ref IEEE Transactions on Intelligent Transportation Systems (Early Access), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08213 2026-05-12 cs.CV 70%

Low-Cost Stereo Vision for Robust 3D Positioning of Thin Radiata Pine Branches in Autonomous Drone Pruning

低成本立体视觉用于自主无人机修剪中薄辐射松枝的稳健三维定位

Yida Lin, Bing Xue, Mengjie Zhang, Sam Schofield, Richard Green

机构 * Centre of Data Science and Artificial Intelligence & School of Engineering and Computer Science(数据科学与人工智能中心及工程与计算机科学学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究利用低成本立体相机实现自主无人机修剪薄枝的三维定位,通过分支分割与深度估计方法,解决森林场景中纹理稀疏、结构细长和噪声干扰等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06478 2026-05-08 cs.RO 70%

GA3T: A Ground-Aerial Terrain Traversability Dataset for Heterogeneous Robot Teams in Unstructured Environments

GA3T:一种用于异构机器人团队在非结构化环境中的地面-空中地形可 traversability 数据集

Siwei Cai, Knut Peterson, Quan Tran, Christian Ricks, Dhanush Parthasarathy, Amir Kaidarov, Neil Deshpande, Sukaina Najm, David Han, Lifeng Zhou

机构 * Drexel University(德雷塞尔大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 GA3T 数据集通过地面和空中平台的多模态数据融合,提升非结构化环境中的地形可 traversability 估计与协同场景理解能力。

Comments For DARS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13571 2026-04-22 cs.CV 70%

Radar-Informed 3D Multi-Object Tracking under Adverse Conditions

基于雷达的三维多目标跟踪在恶劣条件下的应用

Bingxue Xu, Emil Hedemalm, Ajinkya Khoche, Patric Jensfelt

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出RadarMOT框架,利用雷达点云提升远距离目标跟踪精度,在MAN-TruckScenes数据集上提升了AMOTA指标12.7%和10.3%。

Comments 7 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18476 2026-04-21 cs.CV 70%

SemLT3D: Semantic-Guided Expert Distillation for Camera-only Long-Tailed 3D Object Detection

SemLT3D: 基于语义的专家蒸馏用于仅相机的长尾3D目标检测

Hao Vo, Khoa Vo, Thinh Phan, Ngo Xuan Cuong, Gianfranco Doretto, Hien Nguyen, Anh Nguyen, Ngan Le

机构 * AICV Lab, University of Arkansas, USA(AICV实验室,阿肯色大学,美国) University of Utah, USA(犹他大学,美国) University of Houston, USA(休斯顿大学,美国) University of Liverpool, UK(利物浦大学,英国)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 针对仅相机3D目标检测中长尾不平衡问题,提出SemLT3D框架,通过语义先验增强稀有类别表示,结合语言引导的专家混合模块和语义投影蒸馏流程,提升模型对长尾分布和复杂场景的识别能力。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03191 2026-04-21 cs.CV 70%

CORP: A Multi-Modal Dataset for Campus-Oriented Roadside Perception Tasks

CORP:面向校园道路感知任务的多模态数据集

Beibei Wang, Zijian Yu, Lu Zhang, Jingjing Huang, Yao Li, Haojie Ren, Yuxuan Xiao, Yuru Peng, Jianmin Ji, Yu Zhang, Yanyong Zhang

机构 * Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(合肥综合国家科学中心人工智能研究院) University of Science and Technology of China(中国科学技术大学)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出CORP数据集,首个针对校园场景的多模态道路感知任务基准数据集,包含205k张图像和102k点云,用于提升校园区域的3D跟踪和实例分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13789 2026-04-16 cs.CV 70%

Temporally Consistent Long-Term Memory for 3D Single Object Tracking

用于3D单目标跟踪的时序一致长期记忆

Jaejoon Yoo, SuBeen Lee, Yerim Jeon, Miso Lee, Jae-Pil Heo

机构 * Sungkyunkwan University(成均馆大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出ChronoTrack框架,通过长期记忆和双重损失函数提升3D单目标跟踪的时序一致性与效率,实现新的SOTA性能。

Comments Accepted to CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09206 2026-04-13 cs.CV 70%

Long-SCOPE: Fully Sparse Long-Range Cooperative 3D Perception

Long-SCOPE:完全稀疏的长距离协作3D感知

Jiahao Wang, Zikun Xu, Yuner Zhang, Zhongwei Jiang, Chenyang Lu, Shuocheng Yang, Yuxuan Wang, Jiaru Zhong, Chuang Zhang, Shaobing Xu, Jianqiang Wang

机构 * Tsinghua University(清华大学) University of Pennsylvania(宾夕法尼亚大学) Nanyang Technological University(南洋理工大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 感知 :autonomous driving(abstract);BEV(abstract);分类 cs.CV

AI总结 本文提出Long-SCOPE框架,通过几何引导查询生成模块和上下文感知关联模块,解决远距离协作3D感知中的计算复杂性和特征关联问题,实现高精度低开销的长距离感知。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06838 2026-04-13 cs.CV 70%

SparseCoop: Cooperative Perception with Kinematic-Grounded Queries

SparseCoop:基于运动学的协作感知

Jiahao Wang, Zhongwei Jiang, Wenchao Sun, Jiaru Zhong, Haibao Yu, Yuner Zhang, Chenyang Lu, Chuang Zhang, Lei He, Shaobing Xu, Jianqiang Wang

专题命中 感知 :autonomous driving(abstract);BEV(abstract);分类 cs.CV

AI总结 本文提出SparseCoop,一种完全稀疏的协作感知框架,用于3D检测与跟踪,通过运动学实例查询、粗到细聚合模块和协作实例去噪任务,实现高效且鲁棒的协作感知。

Comments Accepted by AAAI 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, vol. 40, no. 12, pp. 9876-9884 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06332 2026-04-09 cs.CV cs.LG 70%

Telescope: Learnable Hyperbolic Foveation for Ultra-Long-Range Object Detection

望远镜:可学习的双曲视点用于超长距离目标检测

Parker Ewen, Dmitriy Rivkin, Mario Bijelic, Felix Heide

机构 * Torc Robotics Princeton University(普林斯顿大学)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 本文提出Telescope模型,通过可学习的双曲视点解决超长距离目标检测中远距离小目标检测难题,实现mAP相对提升76%。

Comments Project website: https://light.princeton.edu/telescope

详情

展开后加载摘要…

URL PDF HTML 收藏