arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 253 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 253 篇

2606.26151 2026-06-26 cs.RO cs.AI 新提交 73%

Unsupervised Memory-Enhanced Video Transformers: Obstacle Detection for Autonomous Agricultural Rover

无监督记忆增强视频变换器:自主农业机器人的障碍物检测

Théo Biardeau, Anne-Sophie Capelle-Laizé, Salwan Alwan, David Helbert

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出VMTAD,一种无监督方法,利用记忆增强的变换器处理动态场景,实现农业机器人实时障碍物检测,在油菜数据集上达到SOTA性能。

Journal ref Precision Agriculture, 2026, 27 (3), pp.74

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25953 2026-06-25 cs.RO cs.CV 新提交 73%

DSP-SLAM++: A Unified Framework for Multi-Class, High-Fidelity Object SLAM in the Wild

DSP-SLAM++:面向野外多类高保真物体SLAM的统一框架

Ahmad Kourani, Ghina Daoud, Daniel Asmar, Imad Elhajj

机构 * American University of Beirut(贝鲁特美国大学)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 提出DSP-SLAM++,通过异步建图流水线和单目鱼眼-激光雷达传感器融合,在支持多类物体的同时实现实时高保真物体建模,将最大物体处理延迟降低70%。

Comments 9 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07233 2026-06-08 cs.CV cs.LG cs.RO 新提交 73%

Does Appearance Help? A Systematic Study of Image-Based Re-Identification in Online 3D Multi-Pedestrian Tracking

外观有帮助吗?在线3D多行人追踪中基于图像的重识别系统研究

Eduardo Borges, Luís Garrote, Urbano J. Nunes

机构 * Institute of Systems and Robotics, Department of Electrical and Computer Engineering, University of Coimbra(系统与机器人研究所,电气与计算机工程系,科英布拉大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 系统研究轻量级投影框架下图像重识别在在线3D多目标追踪中的作用,提出级联匹配策略以在低延迟下恢复遮挡轨迹并防止身份切换。

Comments Accepted for publication at the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10997 2026-08-12 cs.RO 新提交 70%

Seeing above the waves: A modular sensing framework for data acquisition at sea

洞察海面之上:一种用于海上数据采集的模块化感知框架

Jonathan E. Schmidt, Julius Wirbel, P. Nicholas Hansen, Morgan Louédec, Christian L. H. Westerdahl, Dimitrios Dagdilelis, Roberto Galeazzi

机构 * Technical University of Denmark(丹麦技术大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 针对海洋环境下水面船只自主性研发中的传感器数据采集难题,提出融合多模态传感器的模块化平台,依托ROS2框架实现长时数据采集与可复现性,为自主海洋导航提供标准化数据集基础。

Comments Submitted and accepted to the IFAC WC 2026 as an invited session paper for track 7.2 Transportation and Vehicle Systems - Marine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05221 2026-08-07 cs.RO 新提交 70%

A System for Train Condition Monitoring and Structural Health Assessment of Rail Vehicles

轨道车辆的列车状态监测与结构健康评估系统

Maximilian Posner, Martin Dazer, Daniela Lauer, Robert Winkler-Höhn, Mathilde Laporte, Tobias Herrmann, Martin Köppel

机构 * DB InfraGO AG(DB InfraGO股份公司) DB Systemtechnik(DB系统技术公司) MSG Ammendorf(MSG阿门多夫公司)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 本文提出一种融合结构传感器技术与AI数据分析的系统,用于轨道车辆状态监测与撞击检测,可自动检测相关事件、支持状态维护及设计优化,助力干线铁路向全自动运行过渡。

Journal ref IEEE Intelligent Vehicles Symposium, Detroit, USA, Jun, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28442 2026-07-31 cs.CV 新提交 70%

ViewMind3D: Modular View-Aware Inference for Training-Free 3D-QA

ViewMind3D:用于无需训练的3D问答的模块化视图感知推理

Ping-Kun Chiang, Kun-Ru Wu, Po-han Li, Sandeep Chinchali, Ufuk Topcu, Yu-Chee Tseng

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出无需训练的模块化框架ViewMind3D,将3D-QA分解为四个组件,在ScanQA和SQA3D上实现竞争力性能,证明通用LLMs与VLMs的模块化编排可实现有效3D推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23979 2026-07-28 cs.CV 新提交 70%

Mutual Modality Trust with Lightweight Reconstruction Regularization for Fine-grained Tire Pattern Recognition

基于轻量级重建正则化的互模态信任用于细粒度轮胎花纹识别

Jianning Yang, Jie Fang, Xinda Ma, Zirui Song, Dianwei Wang, Nan Wang

机构 * School of Communications and Information Engineering, Xi’an University of Posts and Telecommunications(西安邮电大学通信与信息工程学院) School of Artificial Intelligence, Hainan Normal University(海南师范大学人工智能学院) School of Artificial Intelligence, Optics and Electronics (iOPEN), Northwestern Polytechnical University(西北工业大学人工智能与光电学院)

专题命中 感知 :autonomous driving(abstract);driving perception(abstract);分类 cs.CV

AI总结 针对现有细粒度轮胎识别技术的局限,提出含双分支独立推理和增强特征融合的轻量级方法,利用互模态信任、频域分层引导模块及轻量级重建正则化提升性能,建立数据集并经实验验证了算法优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22698 2026-07-28 cs.CV 新提交 70%

FogDrive: A Multi-Modal Synthetic Driving Dataset for Perception under Graded Fog

FogDrive:用于分级雾天感知的多模态合成驾驶数据集

Vansh Panwar

机构 * Indian Institute of Technology, Guwahati(印度理工学院古瓦哈提分校)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 FogDrive是用于分级雾天感知的多模态合成驾驶数据集,基于CARLA模拟器构建,含多种传感器数据,模拟不同密度雾。通过跨两种范式建立基线基准,得出训练中混合多密度雾可收紧3D边界框几何形状等见解,将开源加速多模态研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19781 2026-07-23 cs.CV 新提交 70%

WASABI: Whole-graph Assignment-based Stabilizer for lAne topology By Inter-frame tracking

WASABI:基于帧间跟踪的车道拓扑全图分配稳定器

Tetsuhiro Uchida, Myu Sasaki, Kensho Nakajima, Yasuhiro Shimada, Toru Saito

专题命中 感知 :autonomous driving(abstract);BEV(abstract);分类 cs.CV

AI总结 研究针对自动驾驶中车道拓扑感知模型输出不稳定问题,提出WASABI实时后处理管道,通过联合跟踪车道段及其连通性,集成多种技术,在内部验证数据上提升了检测F1等指标,实现帧内和帧间车道拓扑稳定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17813 2026-07-21 cs.RO cs.SY eess.SY 新提交 70%

A2RL V\textsubscript{max}: The A2RL autonomous racing dataset for long-range, high-speed perception and multi-vehicle interaction

A2RL V下标max:用于远程、高速感知和多车辆交互的A2RL自动驾驶数据集

Marvin Klemp, Dominic Ebner, Cornelius Schröder, Davide Malvezzi, László Turányi, Riccardo Donati, Ilia Schminik, Xia Ning, Yanxin Zhou, Matthew Flagg, Christoph Stiller, Markus Lienkamp, Marko Bertogna, Gergely Bári, Andreas Birk, Ren Jin, Chen Lv, Johannes Betz

机构 * Institute of Measurement and Control Systems, Karlsruhe Institute of Technology(测量与控制系统研究所,卡尔斯鲁厄理工学院) Institute of Automotive Technology, Technical University of Munich(汽车技术研究所,慕尼黑工业大学) Professorship of Autonomous Vehicle Systems, Technical University of Munich(自动驾驶车辆系统教授职位,慕尼黑工业大学) University of Modena and Reggio Emilia(摩德纳大学和雷焦艾米利亚大学) Humda Lab, Széchenyi István University(胡姆达实验室,塞切尼·伊什特万大学) Politecnico di Milano(米兰理工大学) Constructor University(康斯坦丁大学) Beijing Institute of Technology(北京理工大学) Nanyang Technological University(南洋理工大学) Code 19 Racing(代码19赛车) Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich(慕尼黑机器人与机器智能研究所(MIRMI),慕尼黑工业大学)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.RO

AI总结 介绍A2RL V下标max开源数据集,专为高速自动驾驶和多车辆交互感知任务设计,含多样场景数据及专业标注激光雷达点云,以开发者友好格式提供,还对相关检测和跟踪方法做了实现与评估。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13927 2026-07-16 cs.CV 新提交 70%

Cyclone: Diffusion Model for Cycle-Consistent Weather Editing from Unpaired Driving Data

Cyclone:基于未配对驱动数据的循环一致天气编辑扩散模型

Thang-Anh-Quan Nguyen, Moussab Bennehar, Luis Guillermo Roldao Jimenez, Nathan Piasco, Dzmitry Tsishkou, Laurent Caraffa, Jean-Philippe Tarel, Roland Brémond

机构 * Huawei Paris Research Center(华为巴黎研究中心) Gustave Eiffel University(古斯塔夫·埃菲尔大学) IGN-ENSG(法国国家地理信息与森林和环境信息研究所)

专题命中 感知 :autonomous driving(abstract);driving perception(abstract);分类 cs.CV

AI总结 针对自动驾驶系统在不同天气条件下可靠感知的挑战,提出Cyclone框架,基于潜在扩散,利用循环一致约束和图像-文本模型知识,无需配对数据生成多种天气条件,实验表明其输出更优,还可提炼为视频扩散模型。

Comments Project page: https://ntaquan0125.github.io/weather-cyclone/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06383 2026-07-08 cs.RO 新提交 70%

Towards Real-World Applications with an Autonomous Powered Wheelchair

迈向具有自主动力轮椅的现实世界应用

Simone Arreghini, Alessandro Giusti, Alex Bordini, Enrico Ferrara, Giovanni Fulgoni, Antonio Paolillo

机构 * Dalle Molle Institute for Artificial Intelligence (IDSIA), USI-SUPSI(达勒莫勒人工智能研究所(IDSIA),瑞士意大利语区大学 - 瑞士南部应用科学与艺术大学) Genny Factory(Genny工厂)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 针对动力轮椅自主性有限等问题,研究通过在商用自平衡轮椅上集成自主感知、手势交互和导航等技术构建概念验证原型,并在叫车和跟人等应用中展示,凸显自主与辅助结合潜力及可行性,也指出技术挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31814 2026-07-01 cs.CV 新提交 70%

Generative Lane Topology Reasoning via Autoregressive Model with Geometry Prior

基于几何先验的自回归模型生成车道拓扑推理

Jiahui Fu, Zehao Huang, Han Li, Naiyan Wang, Si Liu

机构 * Institute of Artificial Intelligence, Beihang University(北京航空航天大学人工智能研究院)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 提出TopoGPT生成式框架,通过自回归序列建模学习车道图结构的几何先验,解决现有方法端点不一致和遮挡导致图不完整的问题,在OpenLane-V2上提升6.4/11.6个点。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31467 2026-07-01 cs.CV 新提交 70%

AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience

AeroVerse-SatAgent: 受认知神经科学双视觉通路理论启发的无人机-卫星协同空间推理

Wenyi Zhang, Fanglong Yao, Youzhi Liu, Peng Hu, Zhengqiu Zhu, Chen Gao, Xian Sun, Kun Fu

机构 * Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院) University of Chinese Academy of Sciences(中国科学院大学) School of Electronic, Electrical and Communication Engineering, University of Chinese Academy of Sciences(中国科学院大学电子电气与通信工程学院) Key Laboratory of Target Cognition and Application Technology (TCAT), Aerospace Information Research Institute, Chinese Academy of Sciences(中国科学院空天信息创新研究院目标认知与应用技术重点实验室) School of Computer Science and Engineering, Beihang University(北京航空航天大学计算机学院)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 针对单视角感知易受遮挡和视角变化影响的问题,提出受人类视觉双通路机制启发的无人机-卫星协同空间推理模型SatAgent,通过几何感知3D重建编码器、多视角拓扑语义对齐模块和一致性损失,在复杂城市环境中实现鲁棒推理,构建首个大规模协同数据集,性能超越现有模型。

Comments 21 pages, 10 figures and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30896 2026-07-01 cs.CV 新提交 70%

Knowledge-Driven Dimension Estimation from a Single Image -3D Asset Generation Technology for Digital Twin Construction

基于知识的单图像维度估计——面向数字孪生构建的3D资产生成技术

Hidenori Sakaniwa, Akihito Akai, Akihiko Hyodo

机构 * Data & Knowledge Management Research Department, Digital Infrastructure Innovation Center, Research & Development Group, Hitachi, Ltd.(株式会社日立制作所 研究开发集团 数字基础设施创新中心 数据与知识管理研究部)

专题命中 感知 :autonomous driving(abstract);LiDAR(abstract);分类 cs.CV

AI总结 提出一种从单目图像估计物体尺寸的方法,通过分解结构元素并整合设计规则、几何关系等外部知识,生成与真实环境尺度接近的3D资产,用于提升自动驾驶车载相机虚拟验证精度。

Comments 6 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24786 2026-06-26 cs.CV 新提交 70%

Counting Trees from Satellite Imagery with Noisy Supervision

基于噪声监督的卫星图像树木计数

Dimitri Gominski, Maurice Mugabowindekwe, Qiue Xu, Xiaowei Tong, Martin Brandt, Hieu Le, Rasmus Fensholt, Dimitris Samaras, Loic Landrieu

机构 * University of Copenhagen(哥本哈根大学) University of Rwanda(卢旺达大学) University of Chinese Academy of Sciences(中国科学院大学) University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校) Stony Brook University(石溪大学) LIGM, CNRS, Univ Gustave Eiffel, ENPC, IPP(LIGM,CNRS,古斯塔夫·埃菲尔大学,ENPC,IPP)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 针对卫星图像中树木计数任务,提出基于非平衡最优传输的空间密度匹配方法,并引入自校正机制利用传输残差逐步优化噪声监督,在跨三大洲的TinyTrees基准上优于检测、回归和传输匹配基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17936 2026-06-26 cs.RO 新提交 70%

SPARK: Low Latency Single-Camera 3D Pose Estimation for Autonomous Racing using Keypoints

SPARK: 基于关键点的自动驾驶赛车低延迟单摄像头3D姿态估计

Dominic Ebner, Markus Lienkamp

机构 * Technical University of Munich(慕尼黑工业大学) School of Engineering & Design, Department of Mobility Systems Engineering, Institute of Automotive Technology(工程与设计学院,移动系统工程系,汽车技术研究所) Munich Institute of Robotics and Machine Intelligence (MIRMI)(慕尼黑机器人与机器智能研究所)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出SPARK算法,利用单摄像头和关键点检测实现自动驾驶赛车中低延迟、高精度的3D姿态估计,性能优于现有方法。

Comments 9 pages, 6 figures, ITSC 2026, Invited Session

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21309 2026-06-23 cs.CV 新提交 70%

WildBox: A Dataset and Benchmark for Aerial Monocular 3D Detection of African Savanna Wildlife

WildBox: 非洲稀树草原野生动物航拍单目3D检测数据集与基准

Vandita Shukla, Kilian Meier, Lucie Laporte-Devylder, Camille Rondeau Saint-Jean, Jenna M. Kline, Blair R. Costelloe, Devis Tuia, Fabio Remondino, Benjamin Risse

机构 * D Optical Metrology Unit, Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会3D光学计量部) Computer Vision and Machine Learning Systems group, Institute for Geoinformatics, University of Muenster(明斯特大学地理信息学研究所计算机视觉与机器学习系统组) School of Civil, Aerospace and Design Engineering, University of Bristol(布里斯托大学土木、航空航天与设计工程学院) Department of Biology, University of Southern Denmark(南丹麦大学生物学系) The Ohio State University(俄亥俄州立大学) Department of Collective Behavior, Max Planck Institute of Animal Behavior(马克斯·普朗克动物行为研究所集体行为系) University of Konstanz(康斯坦茨大学) Centre for the Advanced Study of Collective Behaviour, University of Konstanz(康斯坦茨大学集体行为高级研究中心) Department of Biology, University of Konstanz(康斯坦茨大学生物学系) Environmental Computational Science and Earth Observation Laboratory, EPFL(瑞士联邦理工学院环境计算科学与地球观测实验室)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.CV

AI总结 提出WildBox数据集,含23.7万3D框标注,评估两种开放词汇单目3D架构,发现零样本3D检测失败,微调后恢复性能,深度估计是主要瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08206 2026-06-18 cs.CV cs.LG 新提交 70%

SegmentAnyTreeV2: Scaling Transformer-Based Tree Instance Segmentation Across Sensors, Platforms, and Forests

SegmentAnyTreeV2:跨传感器、平台和森林的基于Transformer的树木实例分割扩展

Maciej Wielgosz, Stefano Puliti, Rasmus Astrup

机构 * Norwegian Institute of Bioeconomy Research (NIBIO)(挪威生物经济研究所(NIBIO))

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出SegmentAnyTreeV2,一种传感器和平台无关的森林点云语义与实例分割框架,结合Point Transformer v3骨干网络、轻量语义头和树木交叉注意力掩码解码器,在FOR-instance v3基准上达到90.5%精度和80.2%召回率,并展现出强跨域泛化能力。

Comments 25 pages, 6 figures, 10 tables, Corrected bibliography metadata and minor typographical issues; results unchanged

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15896 2026-06-16 cs.RO cs.LG 新提交 70%

LoComposition: Terrain-Adaptive Energy-Efficient Quadruped Locomotion without Gait Priors

LoComposition:无需步态先验的地形自适应高效四足运动

Loukas Kordos, Leonard T. Franz, Simon Rappenecker, Oliver Hausdoerfer, Angela P. Schoellig, Pavel Kolev, Georg Martius

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所) University of Tübingen(图宾根大学) Technical University of Munich(慕尼黑工业大学) University of Stuttgart(斯图加特大学)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出一种将任务奖励、操作约束、能量最小化和地形感知分离的框架,无需显式步态先验,在四足机器人上实现高效地形自适应运动,运输成本降低56%,违规减少96%。

Comments 17 pages, 5 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09268 2026-06-09 cs.RO 新提交 70%

VGP-Nav: Metric-Aware Visual Geometric Perception for Robot Navigation

VGP-Nav:用于机器人导航的度量感知视觉几何感知

Hewei Pan, Weiye Zhu, Zekai Zhang, Zitong Huang, Rongtao Xu, Jinbao Wang, Feng Zheng

机构 * Southern University of Science and Technology(南方科技大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) Shenzhen University(深圳大学) SpatialTemporal AI(时空人工智能)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.RO

AI总结 提出VGP-Nav,一种仅依赖单目RGB输入的框架,通过地面平面几何约束解决尺度模糊,实现度量定位与障碍物感知的统一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08029 2026-06-09 cs.RO 新提交 70%

IntentNav: Learning Spatial-Visual Object Navigation from Human Demonstrations

IntentNav: 从人类演示中学习空间-视觉物体导航

Yuxin Cai, Zongtai Li, Maonan Wang, Muyi Bao, Haokun Zhu, Ruofei Bai, Ding Zhao, Zirui Li, Wenshan Wang, Wei-Yun Yau, Ji Zhang, Chen Lv

机构 * Nanyang Technological University(南洋理工大学) Carnegie Mellon University(卡内基梅隆大学) The Chinese University of Hong Kong(香港中文大学) A*STAR Institute for Infocomm Research (I2R)(新加坡科技研究局资讯通信研究院)

专题命中 感知 :BEV(abstract,abstract_cn);分类 cs.RO

AI总结 提出IntentNav框架,通过人类演示学习类人物体导航策略,利用前沿标注和意图对齐目标实现最优性能,并零样本迁移到多种机器人平台。

Comments 26 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07016 2026-06-08 stat.AP cs.CV 新提交 70%

An Integrated Roadside Sensing and Communication Framework for Vulnerable Road User Safety at Signalized Intersections

信号交叉口弱势道路使用者安全的集成路边感知与通信框架

Parvez Anowar

机构 * Department of Civil, Environmental and Construction Engineering, University of Central Florida(中央佛罗里达大学土木、环境与建设工程系)

专题命中 感知 :LiDAR(abstract,abstract_cn);分类 cs.CV

AI总结 提出集成多模态感知、边缘计算、V2X/P2X通信和自适应信号控制的框架,基于公开数据集R-LiViT分析53,319个标注,发现VRU占49%、昼夜密度差异大、近距离事件变化10倍、83%行人边界框小,支持多模态感知和自适应部署。

Comments 17 pages, 5 figures, 2 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07577 2026-08-11 cs.CV cs.AI cs.RO 新提交 67%

Open-World Hierarchical Perception: Taxonomic Abstraction over Class-Agnostic Proposals for the Safe Handling of Out-of-Vocabulary Road Objects

开放世界层次感知:针对类无关候选区域的分类抽象,用于安全处理词汇外道路对象

Felix Schaller

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 本文提出开放世界层次感知层,在类无关区域候选上实现分类抽象,通过结合三类开放世界信号,在自动驾驶留类基准测试中,可安全处理词汇外道路对象且无分类错误。

Comments 6 pages, 4 figures, 1 table. Third paper in a series; v1 archived at Zenodo, doi:10.5281/zenodo.21593472. Code: https://github.com/freshNfunky/IE2025-Research-Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18715 2026-08-20 cs.CV cs.AI cs.LG 新提交 62%

The Impact of CutMix on Reliability and Robustness in Semantic Segmentation

CutMix对语义分割中可靠性与鲁棒性的影响

Steven Landgraf, Markus Ulrich

机构 * Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院摄影测量与遥感研究所)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 该研究探究CutMix对语义分割的影响,发现其对分割准确率影响微小,但可提升模型可靠性,尤其在分布偏移场景下,增强的是校准度与不确定性可信度,对安全关键应用意义重大。

Comments Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16499 2026-08-18 cs.RO cs.CV 新提交 62%

OccamView: Object-Conditioned View Selection for Frame-Budgeted Active 3D Gaussian Reconstruction

OccamView:面向帧预算约束下主动式3D高斯重建的物体条件视角选择方法

Hongbo Gao, Wei Zhang, Zeyu Ni, Dihao Zhu, Ruifeng Li, Yunke Wang, Chang Xu

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 针对帧预算紧张时现有主动3D高斯重建方法易漏重建物体的问题,提出OccamView框架,通过物体条件视角选择与Geo-Floor机制优化规划,在多数据集上提升了重建表现。

Comments 7 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16285 2026-08-18 cs.CV cs.AI 新提交 62%

Audio-Visual Segmentation via Depth-Guided Collaborative Modeling

基于深度引导协同建模的视听分割

Zhaojin Fu, Yuyang Hong, Qi Yang, Zili Wang, Kun Ding, Shiming Xiang, Bin Fan

机构 * School of Intelligent Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有视听分割方法未建模几何线索的问题,提出三模态框架DGCM-AVS,通过深度感知动态调制器与深度引导渐进融合模块优化,在AVSS数据集上实现M_J、M_F指标的显著提升。

Journal ref IEEE Transactions on Multimedia, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14724 2026-08-18 cs.CV cs.AI cs.LG 新提交 62%

Privacy-Preserving Dataset Curation for Kuala Lumpur Urban Traffic: Grounded Vision-Language Detection with Spatial Vehicle-Context Filtering

面向吉隆坡城市交通的隐私保护数据集构建:结合空间车辆上下文过滤的接地视觉-语言检测

Mohammed Abdul Al Arafat Tanzin, Rudzidatul Akmam Dziyauddin

机构 * Faculty of Artificial Intelligence, Universiti Teknologi Malaysia(马来西亚理工大学人工智能学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 针对吉隆坡热带城市交通场景的隐私保护数据集构建难题,提出结合Grounding DINO与空间车辆ROI包含引擎的自动化匿名化框架,在1266帧图像上实现约95%的匿名化成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13719 2026-08-17 cs.AI cs.RO 新提交 62%

Coverage Aware Active Evaluation for Failure Discovery with Paired Systems

面向配对系统故障发现的覆盖率感知主动评估

Anjali Parashar, Rachel Luo, Apoorva Sharma, Sushant Veer, Edward Schmerling, Carson Sobolewski, Mingxin Yu, Chuchu Fan, Marco Pavone

机构 * Laboratory of Information & Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室(LIDS)) NVIDIA Research(英伟达研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 该研究针对自主系统故障发现难题,提出结合代理评估与残差建模、支持感知互信息目标的自适应方法,在三类任务中发现的故障数是基线的两倍。

Comments 9 main pages followed by Appendix, total 21 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08025 2026-08-11 cs.RO cs.AI 新提交 62%

DA-NBV: A Direction-Aware Next-Best-View Planner for Efficient 3D Reconstruction of Ships at Sea

DA-NBV:一种用于海上船舶高效3D重建的方向感知最优下一个视点规划器

Jiaming Chen, Juntao Yang, Zhentao Zou, Qi Ming, Yi Yu, Zhihang Zhong, Xue Yang, Xue Jiang, Yue Zhou

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 针对海上船舶3D重建中现有NBV策略忽略方向观测历史的问题,本文提出DA-NBV策略,结合PAF等方法,在SeaShip-3D数据集与仿真环境下实现了更高效的船舶3D重建性能。

Comments 16pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏