arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2606.31834 2026-07-01 cs.CV cs.AI 新提交 62%

Real-Time Source-Free Object Detection

实时无源目标检测

Sairam VCR, Varun Gopal, Poornima Jain, Vineeth N Balasubramanian, Muhammad Haris Khan

机构 * IIT Hyderabad(印度理工学院海得拉巴分校) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29020 2026-06-30 cs.CV cs.AI cs.ET cs.MM 62%

Semantic-Aware, Physics-Informed, Geometry-Grounded Weather Video Synthesis

语义感知、物理信息、几何基础的天气视频合成

Chenghao Qian, Nedko Savov, Lingdong Kong, Yeying Jin, Rui Song, Wenjing Li, Zhun Zhong, Jiaqi Ma, Gustav Markkula, Luc Van Gool

机构 * University of Leeds, UK(利兹大学,英国) National University of Singapore, Singapore(新加坡国立大学) University of California, Los Angeles, USA(美国加州大学洛杉矶分校) Hefei University of Technology, China(合肥工业大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出一种语义感知、物理信息、几何基础的框架,通过语义、动力学和几何三个条件信号引导视频编辑器合成多样且真实的天气效果,并提升自动驾驶语义分割的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28094 2026-06-29 cs.CV cs.AI 新提交 62%

OSOR: One-Step Diffusion Inpainting for Effect-Aware Object Removal

OSOR: 一步扩散修复用于效果感知的对象移除

Qinming Zhou, Chenxi Sun, Deyang Kong, Junhao He, Xiangheng Tang, Peike Yu, Haotian Wu, Leilei Cao, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) Xidian University(西安电子科技大学) Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学) Transsion(传音控股)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。

Comments Code and resources are available at https://github.com/Zhouqm-Git/osor

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17455 2026-06-29 cs.CV cs.RO 版本更新 62%

VLM-Guided Visual Place Recognition for Planet-Scale Geo-Localization

VLM引导的视觉地点识别用于行星级地理定位

Sania Waheed, Na Min An, Michael Milford, Sarvapali D. Ramchurn, Shoaib Ehsan

机构 * Univ. of Southampton, UK(英国南安普顿大学) KAIST, South Korea(韩国科学技术院) QUT, Australia(昆士兰科技大学) Univ. of Essex, UK(英国埃塞克斯大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出VLM与检索式VPR结合的混合框架,利用VLM生成先验约束搜索空间,再通过检索和重排序实现行星级地理定位,在街道和城市级别分别提升4.51%和13.52%。

Journal ref Proceedings of the Australasian Conference on Robotics and Automation (ACRA 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24096 2026-06-24 cs.CV cs.AI 新提交 62%

Beyond Bayer: Task-Optimal Sensor Co-Design for Robust Autonomous-Driving Segmentation

超越拜耳:面向鲁棒自动驾驶分割的任务最优传感器协同设计

Reeshad Khan, John Gauch

机构 * University Of Arkansas(阿肯色大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出可微RAW到任务流水线,学习光谱滤色器阵列权重提升分割mIoU,发现光学点扩散函数协同设计为负收益,噪声优化效果微弱,增大CFA块反而有害。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03694 2026-06-24 cs.RO cs.CV cs.HC 版本更新 62%

Face versus Body Tracking for Human-Robot Interaction: An Egocentric Dataset

面向人机交互的面部与身体跟踪:一个自我中心数据集

Jessica Wenninger, Gabriel Skantze

机构 * Furhat Robotics University of Naples Federico II(那不勒斯费德里科二世大学) Division of Speech, Music and Hearing, KTH Royal Institute of Technology(语音、音乐和听觉研究所,皇家理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 针对社交机器人自我中心视角下频繁身份切换问题,提出一个自定义标注的自我中心数据集,通过系统评估检测误差、对比面部与身体跟踪,并分析扩展空间记忆和外观重识别的影响,最终优化管道将身份切换减少49%。

Comments 8 pages, 5 figures, 3 tables. Camera-ready version. Accepted to the 35th IEEE International Conference on Robot and Human Interactive Communication (RO-MAN 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21623 2026-06-23 cs.CV cs.AI 新提交 62%

A DVDrive Approach for doScenes Instructed Driving Challenge

一种面向 doScenes 指令驾驶挑战的 DVDrive 方法

Zijian Fu, Xiangyang Chu, Mengshi Qi, Huadong Ma, Guanghao Zhang, Wei Li

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Xiaomi EV(小米汽车)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15493 2026-06-23 cs.RO cs.CV 版本更新 62%

Build Once, Monitor Continuously: Persistent Semantic Mapping via Autonomous Exploration and Open-Vocabulary Object Updates

一次构建,持续监控:通过自主探索和开放词汇对象更新的持久语义地图

Sai Haneesh Allu, Itay Kadosh, Tyler Summers, Yu Xiang

机构 * Department of Mechanical Engineering, University of Texas at Dallas(德克萨斯大学达拉斯分校机械工程系)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 提出两阶段系统,先通过前沿探索构建几何地图,再通过开放词汇检测和分割模型更新语义对象图,实现仅重复轻量语义阶段的高效持久监控。

Comments 10 pages, 8 figures, 5 tables. Project page is available at https://irvlutd.github.io/SemanticMapping/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18112 2026-06-19 cs.RO cs.CV 新提交 62%

Qwen-RobotNav Technical Report: A Scalable Navigation Model Designed for an Agentic Navigation System

Qwen-RobotNav 技术报告:为智能体导航系统设计的可扩展导航模型

Jiazhao Zhang, Gengze Zhou, Hale Yin, Yiyang Huang, Zixing Lei, Qihang Peng, Haoqi Yuan, Jie Zhang, Xudong Guo, Xiaoyue Chen, An Yang, Fei Huang, Zhibo Yang, Junyang Lin, Dayiheng Liu, Jingren Zhou, Zhuoyuan Yu, Jingyang Fan, Zhixuan Liang, Pei Lin, Ye Wang, Haoyang Li, Anzhe Chen, Kun Yan, Xiao Xu, Jiahao Li, Lulu Hu, Minying Zhang, Shurui Li, Wenhu Xiao, Shuai Bai, Xuancheng Ren, Chenxu Lv, Chenfei Wu, Xiong-Hui Chen

机构 * Qwen Team(通义实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV

AI总结 提出 Qwen-RobotNav 可扩展导航模型,通过参数化接口支持多种任务模式和可调观测参数,在15.6M样本上训练,联合视觉语言数据防止行为坍缩,在多个导航基准上取得新最优结果,并展示零样本泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20002 2026-06-18 cs.CV cs.AI cs.CR 版本更新 62%

Semantic Router: On the Feasibility of Hijacking MLLMs via a Single Adversarial Perturbation

语义路由器:通过单一对抗扰动劫持多模态大语言模型的可行性研究

Changyue Li, Jiaying Li, Youliang Yuan, Jiaming He, Zhicong Huang, Pinjia He

机构 * The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)) School of Data Science, School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(数据科学学院、人工智能学院、香港中文大学(深圳))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出语义感知通用扰动(SAUP),作为语义路由器同时劫持多个无状态决策,通过理论分析和SORT优化策略实现,在Qwen上对五个目标达到66%攻击成功率。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16996 2026-06-16 cs.CV cs.AI cs.LG 新提交 62%

ActiveSAM: Image-Conditional Class Pruning for Fast and Accurate Open-Vocabulary Segmentation

ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割

Tran Dinh Tien, Zhiqiang Shen

机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。

Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16558 2026-06-16 cs.AI cs.RO cs.SY eess.SY 新提交 62%

ROSA-RL: Uncertainty-Aware Roundabout Optimized Speed Advisory with Reinforcement Learning

ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议

Anna-Lena Schlamp, Jeremias Gerner, Klaus Bogenberger, Werner Huber, Stefanie Schmidtner

机构 * Universität der Bundeswehr München(慕尼黑联邦国防军大学) Hochschule für angewandte Wissenschaften Landshut(兰茨胡特应用科学大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 针对混合交通中环岛场景的不确定性,提出ROSA-RL框架,结合Transformer预测冲突区域占用概率与强化学习,实现安全高效的环岛入口速度协调。

Comments 8 pages, 2 figures, 2 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24058 2026-06-16 cs.CV cs.AI 版本更新 62%

Mitigating Object Hallucinations in LVLMs via Attention Imbalance Rectification

通过注意力不平衡修正减轻LVLM中的对象幻觉

Han Sun, Qin Li, Peixin Wang, Min Zhang

机构 * Shanghai Key Laboratory of Trustworthy Computing, East China Normal University(上海可信计算实验室,东华大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 发现多模态和token间注意力不平衡是对象幻觉的因果因素,提出轻量级解码干预方法AIR,通过重新分配注意力权重修正不平衡,在多个基准上减少幻觉达35.1%,并提升通用能力。

Comments CVPR 2026 Findings Track, code is available at https://github.com/Ice-wave/AIR

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13222 2026-06-12 cs.RO cs.AI 新提交 62%

Proprioceptive-visual correspondence enables self-other distinction in humanoid robots

本体感觉-视觉对应使能人形机器人的自我-他人区分

Yurun Chen, Tianyuan Gao, Yizhong Ge, Shikun Ban, Yizhou Wang, Hongkai Xiong, Wenjun Zeng, Wentao Zhu

机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学) Carnegie Mellon University(卡内基梅隆大学) East China Normal University(华东师范大学) Ningbo Institute of Digital Twin(宁波数字孪生研究院)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 提出通过本体感觉与视觉的对应学习自我-他人区分,无需身份标签或运动学模型,并建立预测性自我模型,支持目标到达、碰撞感知运动规划和运动重定向。

Comments 23 pages, 9 figures, 1 supplementary table

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12603 2026-06-12 cs.RO cs.AI 新提交 62%

From Imitation to Alignment: Human-Preference Flow Policies for Long-Horizon Sidewalk Navigation

从模仿到对齐:面向长距离人行道导航的人类偏好流策略

Honglin He, Zhizheng Liu, Yukai Ma, Bolei Zhou

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11563 2026-06-11 cs.CV cs.RO 新提交 62%

Cross-Modal Benchmarking for Robotic Perception in Natural Environments

自然环境中机器人感知的跨模态基准测试

David Hall, Joshua Knights, Mark Cox, Peyman Moghadam

机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。

Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11120 2026-06-10 cs.AI cs.CV 新提交 62%

Monte Carlo Pass Search: Using Trajectory Generation for 3D Counterfactual Pass Evaluation in Football

蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估

Andrew Kang, Priya Narasimhan

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。

Comments CVPR 2026, CVSports Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21457 2026-06-09 cs.CV cs.AI 版本更新 62%

ACTIVE-o3: Empowering MLLMs with Active Perception via Pure Reinforcement Learning

ACTIVE-o3:通过纯强化学习赋予多模态大语言模型主动感知能力

Muzhi Zhu, Hao Zhong, Canyu Zhao, Zongze Du, Mingyu Liu, Zheng Huang, Anzhou Li, Hao Chen, Cheng Zou, Jingdong Chen, Ming Yang, Chunhua Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出ACTIVE-o3框架,基于GRPO强化学习,通过模块化感知-动作设计和双形式奖励,使MLLM自主学会高效准确的区域选择策略,在开放世界和领域特定任务中显著提升主动感知能力。

Comments Accepted to ICML 2026. Project page: https://aim-uofa.github.io/ACTIVE-o3

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06721 2026-06-08 cs.RO cs.AI 新提交 62%

SCOUT: Semantic scene COverage via Uncertainty-guided Traversal

SCOUT: 基于不确定性引导遍历的语义场景覆盖

Junyu Mao, Sara Ayoubi, Vishnu D. Sharma, Ilija Hadžić, Matthew Andrews

机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国) Nokia Bell Labs, Murray Hill, NJ, USA(诺基亚贝尔实验室,美国,新泽西州 Murray Hill) Imperial College London(帝国理工学院伦敦分校) Locus Robotics(Locus机器人技术公司)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI

AI总结 提出SCOUT框架,通过不确定性引导的遍历规划与概率场景图构建的闭环,使机器人主动探索并逐步理解环境,实现语义场景完整性作为操作目标。

Comments 2026 ICRA Workshop on Uncertainty in Open World Robotics

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04656 2026-06-04 cs.CV cs.AI 62%

Instance-Level Post Hoc Uncertainty Quantification in Object Detection

目标检测中的实例级事后不确定性量化

Chongzhe Zhang, Zifan Zeng, Qunli Zhang, Feng Liu, Zheng Hu

机构 * Tsinghua University(清华大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出蒙特卡洛广义线性模型(MC-GLM),用于目标检测中实例级、近似事后不确定性量化,无需重新训练,在nuScenes数据集上验证了有效性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1605.02196 2026-06-04 eess.SY cs.CV cs.LG cs.RO cs.SY 62%

All Weather Perception: Joint Data Association, Tracking, and Classification for Autonomous Ground Vehicles

全天候感知:面向自主地面车辆的数据关联、跟踪与分类的联合解决方案

Peter Radecki, Mark Campbell, Kevin Matzen

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种新型概率感知算法,用于自主地面车辆在全天候条件下的数据关联、目标跟踪和分类。该算法扩展了原有的 Rao-Blackwellized 粒子滤波器,结合多模型跟踪进行分类,并通过升级 Cornell 的 AGV 实验证明了先进视觉算法在恶劣天气下的鲁棒性。

Comments 35 pages, 21 figures, 14 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01689 2026-06-02 cs.CV cs.AI 62%

RPCASSM: Robust PCA State Space Model For Infrared Small Target Detection

RPCASSM: 基于鲁棒主成分分析的状态空间模型用于红外小目标检测

Pingping Liu, Aohua Li, Yubing Lu, Jin Kuang, Tongshun Zhang, Qiuzhan Zhou

机构 * College of Computer Science and Technology, Jilin University(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education, Jilin University(教育部符号计算与知识工程重点实验室) College of Software, Jilin University(吉林大学软件学院) School of Geosciences, Yangtze University(长江大学地球科学学院) College of Communication Engineering, Jilin University(吉林大学通信工程学院)

专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI

AI总结 针对红外小目标检测中主流状态空间模型难以准确建模目标边缘的问题,提出基于鲁棒主成分分析(RPCA)的RPCASSM网络,通过设计背景状态空间模块(BSSM)和目标状态空间模块(TSSM)分别利用空间异质信号显著性和目标稀疏局部高亮特性进行状态空间建模,有效解决了边缘建模难题。

Comments 12 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28312 2026-05-28 cs.RO cs.CV 62%

EventShiftFlow: Towards Hardware-efficient FPGA-based Flow Estimation

EventShiftFlow:面向硬件高效的基于FPGA的流估计

Arianna Alonso Bizzi, Fernando Cladera, C. J. Taylor

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV

AI总结 提出一种基于事件相机的流估计方法,通过离散化事件、构建1位空间占用网格并并行评估速度假设,仅使用固定宽度整数逻辑实现,无需帧重建、浮点运算或迭代优化,适用于低延迟机器人感知。

Comments 10 pages, 5 figures. Accepted to the IEEE ICRA 2026 Workshop on Challenges and Opportunities of Neuromorphic Field Robotics and Automation

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.11852 2026-05-28 cs.RO cs.AI 62%

Delay-Aware Reinforcement Learning for Highway On-Ramp Merging under Stochastic Communication Latency

考虑随机通信延迟的高速公路匝道合流延迟感知强化学习

Amin Tabrizian, Zhitong Huang, Arsyi Aziz, Peng Wei

机构 * Department of Computer Science, George Washington University, Washington, D.C.(计算机科学系,乔治华盛顿大学,华盛顿特区) Connected and Automated Vehicle Program Manager, Traffic Operations Division, Virginia Department of Transportation(连接与自动化车辆计划主任,交通运营处,弗吉尼亚州交通部) Department of Mechanical & Aerospace Engineering, George Washington University, Washington, D.C.(机械与航空航天工程系,乔治华盛顿大学,华盛顿特区)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI

AI总结 针对V2I通信随机延迟导致状态观测延迟的问题,提出DAROM框架,通过随机延迟MDP建模和延迟感知编码器恢复马尔可夫性,结合物理安全控制器实现鲁棒控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26501 2026-05-27 cs.CV cs.AI 62%

Unveiling the Fragility of Vision-Language Models: Multi-Modal Adversarial Synergy via Texture-Constrained Perturbations and Cross-Modal Optimization

揭示视觉-语言模型的脆弱性:通过纹理约束扰动和跨模态优化的多模态对抗协同

Xiang Fang, Wanlong Fang, Changshuo Wang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Nanyang Technological University, Singapore(新加坡南洋理工大学) University College London(伦敦大学学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 提出多模态对抗协同框架,通过纹理约束的通用对抗扰动和可学习的文本提示扰动,在黑盒设置下联合优化,揭示视觉-语言模型在多模态攻击下的脆弱性。

Comments Publish in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22455 2026-05-22 cs.CV cs.AI cs.LG physics.optics 62%

Making the Discrete Continuous: Synthetic RAW Augmentations for Fine-Grained Evaluation of Person Detection Performance in Low Light

使离散的成为连续的:合成RAW增强用于细粒度评估人检测性能在低光环境

Valeria Pais, Malena Mendilaharzu, Daniele Faccio, Luis Oala, Christoph Clausen, Bruno Sanguinetti

机构 * University of Glasgow(格拉斯哥大学) Dotphoton

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出了一种合成RAW增强方法,用于在低光条件下更准确地评估人检测模型的性能,通过生成与相机传感器噪声模型匹配的低光样本,以改善基准测试的数据覆盖。

Comments Accepted non-archival paper at the CVPR 2026 AUTOPILOT Workshop (Autonomous Understanding Through Open-world Perception and Integrated Language Models for On-road Tasks)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16859 2026-05-19 cs.CV cs.AI 62%

VGGT-CD: Training-Free Robust Registration for 3D Change Detection

VGGT-CD:无训练的鲁棒三维变化检测注册

Wei Zhang, Songhua Li, Yihang Wu, Qiang Li, Qi Wang

机构 * Northwestern Polytechnical University(西北工业大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VGGT-CD方法,通过解耦跨时间注册与动态变化干扰,实现无训练的鲁棒三维变化检测注册,有效减少轨迹误差并提升注册速度。

Comments 13 pages, 5 figures. Code is available at: https://github.com/WZ-CS/VGGT-CD

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10032 2026-05-14 cs.CV cs.RO 62%

Perception with Guarantees: Certified Pose Estimation via Reachability Analysis

具有保证的感知:通过可达性分析进行认证姿态估计

Tobias Ladner, Yasser Shoukry, Matthias Althoff

机构 * Technical University of Munich, Germany(慕尼黑技术大学) University of California, Irvine, USA(加州大学 Irvine 分校)

专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV

AI总结 本文提出通过可达性分析实现认证姿态估计,利用相机图像和已知目标几何体,确保在最坏情况下姿态估计的准确性与安全性。

Comments Accepted at Computed Aided Verification (CAV'2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11520 2026-05-13 cs.CV cs.AI 62%

PointGS: Semantic-Consistent Unsupervised 3D Point Cloud Segmentation with 3D Gaussian Splatting

PointGS: 基于3D高斯散射的语义一致无监督3D点云分割

Yixiao Song, Qingyong Li, Wen Wang, Zhicheng Yan

机构 * Key Laboratory of Big Data & Artificial Intelligence in Transportation (Beijing Jiaotong University), Ministry of Education(大数据与人工智能在交通运输中的关键实验室(北京交通大学),教育部) Frontiers Science Center for Smart High-speed Railway System, Beijing Jiaotong University(智能高速铁路系统前沿科学中心,北京交通大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI

AI总结 PointGS通过3D高斯散射统一中间表示,解决3D点云与2D图像的语义一致性问题,实现无监督分割,优于现有方法,在ScanNet-V2和S3DIS上分别提升0.9%和2.8%的mIoU。

Comments Accepted by Computer Vision and Pattern Recognition (CVPR) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10201 2026-05-13 cs.RO cs.AI 62%

HeteroGenManip: Generalizable Manipulation For Heterogeneous Object Interactions

HeteroGenManip:异构物体交互的通用操作

Zhenhao Shen, Zeming Yang, Yue Chen, Yuran Wang, Shengqiang Xu, Mingleyang Li, Hao Dong, Ruihai Wu

机构 * Peking University(北京大学) Tianjin University(天津大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI

AI总结 本文提出HeteroGenManip框架,通过两阶段方法解决机器人异构物体交互中的接触点定位和轨迹规划问题,实现跨类型物体的鲁棒泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏