arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2603.28141 2026-03-31 cs.CV cs.LG 57%

Intelligent Road Condition Monitoring using 3D In-Air SONAR Sensing

利用3D空中SONAR传感进行智能道路状况监测

Amber Cassimon, Robin Kerstens, Walter Daems, Jan Steckel

机构 * Department of Electronics and ICT Engineering Technology, Cosys-Lab Research Group, University of Antwerp(安特卫普大学电子与ICT工程技术系Cosys-Lab研究组) Flanders Make Strategic Research Centre(弗兰德斯制造战略研究中心)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文研究了空中3DSONAR传感器在道路表面状况监测中的应用,通过单个数据集实现道路材料分类和道路损坏检测,采用SONAR传感在恶劣天气下表现更优,但损坏检测准确率仍需提升。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27534 2026-03-31 cs.RO 57%

S3KF: Spherical State-Space Kalman Filtering for Panoramic 3D Multi-Object Tracking

S3KF:基于旋转激光雷达和四鱼眼相机的全景三维多目标跟踪框架

Zhongyuan Liu, Shaonan Yu, Jianping Li, Pengfei Wan, Xinhang Xu, Pengfei Wang, Maggie Y. Gao, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电气与电子工程学院) ST Engineering(新科工程) School of Civil and Environmental Engineering, Nanyang Technological University(南洋理工大学土木与环境工程学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出S3KF框架,利用旋转激光雷达和四鱼眼相机实现全景三维多目标跟踪,通过球面状态表示和扩展球面卡尔曼滤波提升跟踪精度与实时性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04594 2026-03-31 cs.CV 57%

Unleashing the Power of Chain-of-Prediction for Monocular 3D Object Detection

释放链式预测在单目3D物体检测中的潜力

Zhihao Zhang, Abhinav Kumar, Girish Chandar Ganesan, Xiaoming Liu

机构 * Michigan State University(密歇根州立大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出MonoCoP框架,通过链式预测和不确定性引导选择器结合,提升单目3D检测的深度精度,尤其在远距离物体上表现优异。

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16816 2026-03-30 cs.CV cs.DL 57%

WildDepth: A Multimodal Dataset for 3D Wildlife Perception and Depth Estimation

WildDepth:用于野生动物感知和深度估计的多模态数据集

Muhammad Aamir, Naoya Muramatsu, Sangyun Shin, Matthew Wijers, Jia-Xing Zhong, Xinyu Hou, Amir Patel, Andrew Loveridge, Andrew Markham

机构 * University of Oxford(牛津大学) University of Cape Town(开普敦大学) University College London(伦敦大学学院)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出WildDepth数据集,通过同步RGB和LiDAR数据提升动物深度估计和3D重建性能,实验表明多模态数据使深度可靠性提升10%RMSE,3D重建精度提高12%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25502 2026-03-27 cs.CV 57%

RealRestorer: Towards Generalizable Real-World Image Restoration with Large-Scale Image Editing Models

RealRestorer:迈向通用的现实世界图像修复的大型图像编辑模型

Yufeng Yang, Xianfang Zeng, Zhangqi Jiang, Fukun Yin, Jianzhuang Liu, Wei Cheng, jinghong lan, Shiyu Liu, Yuqi Peng, Gang YU, Shifeng Chen

机构 * Southern University of Science and Technology(南方科技大学) StepFun Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出RealRestorer,通过构建大规模数据集和训练先进开源模型,提升现实世界图像修复的泛化能力,并引入RealIR-Bench评估基准,实验表明其在开源方法中表现最佳。

Comments 27 pages, 15 figures, Project homepage: https://yfyang007.github.io/RealRestorer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25275 2026-03-27 cs.CV 57%

V2U4Real: A Real-world Large-scale Dataset for Vehicle-to-UAV Cooperative Perception

V2U4Real: 一种用于车辆与无人机协同感知的真实世界大规模数据集

Weijia Li, Haoen Xiang, Tianxu Wang, Shuaibing Wu, Qiming Xia, Cheng Wang, Chenglu Wen

机构 * Fujian Key Laboratory of Urban Intelligent Sensing and Computing, Xiamen University, China(福建省城市智能感知与计算重点实验室,厦门大学,中国) Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University, China(多媒体可信感知与高效计算教育部重点实验室,厦门大学,中国)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出V2U4Real数据集,用于研究跨视角协同感知,包含56K激光雷达帧、56K多视角图像和700K标注的3D边界框,评估了多种先进模型,展示了V2U协作在提升感知鲁棒性和远距离感知方面的有效性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25218 2026-03-27 cs.CV 57%

SDD-YOLO: A Small-Target Detection Framework for Ground-to-Air Anti-UAV Surveillance with Edge-Efficient Deployment

SDD-YOLO:一种面向地面到空中反无人机监视的高效边缘部署小目标检测框架

Pengyu Chen, Haotian Sa, Yiwei Hu, Yuhan Cheng, Junbo Wang

机构 * Chien-Shiung Wu College, Southeast University(东南大学吴健雄学院) School of Information Science and Engineering, Southeast University(东南大学信息科学与工程学院)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出SDD-YOLO框架,针对地面到空中反无人机监视中的小目标检测问题,通过高分辨率检测头和改进的训练策略提升检测性能与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25131 2026-03-27 cs.CV 57%

Denoise and Align: Towards Source-Free UDA for Robust Panoramic Semantic Segmentation

去噪与对齐:迈向无源无监督领域适应的鲁棒全景语义分割

Yaowen Chang, Zhen Cao, Xu Zheng, Xiaoxin Mi, Zhen Dong

机构 * Wuhan University(武汉大学) HKUST (Guangzhou)(香港科技大学(广州)) Wuhan University of Technology(武汉理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出DAPASS框架,通过全景置信度引导去噪和上下文分辨率对抗模块,解决无源领域适应中因几何失真和数据缺失导致的伪标签不准确问题,提升户外和室内场景的语义分割性能。

Comments Accepted to CVPR26

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22120 2026-03-27 cs.CV 57%

StreamingClaw Technical Report

流式Claw技术报告

Jiawei Chen, Zhe Chen, Chaoqun Du, Maokui He, Wei He, Hengtao Li, Qizhen Li, Zide Liu, Hao Ma, Xuhao Pan, Chang Ren, Xudong Rao, Xintian Shen, Chenfeng Wang, Tao Wei, Chengjun Yu, Pengfei Yu, Shengyu Yao, Chunpeng Zhou, Kun Zhan, Lihao Zheng, Pan Zhou, Xuhan Zhu, Yufei Zheng

机构 * Li Auto Inc.(理想汽车)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出StreamingClaw框架,解决流式视频理解与具身智能中的实时推理、多模态记忆和闭环控制问题,提升复杂环境下的自主决策能力。

Comments Under Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24699 2026-03-27 cs.RO 57%

Saranga: MilliWatt Ultrasound for Navigation in Visually Degraded Environments on Palm-Sized Aerial Robots

Saranga:用于手掌大小空中机器人在视觉退化环境中的导航的毫瓦超声波

Manoj Velmurugan, Phillip Brush, Colin Balfour, Richard J. Przybyla, Nitin J. Sanket

机构 * Perception and Autonomous Robotics (PeAR) Group(感知与自主机器人组) Worcester Polytechnic Institute(沃思彻斯特理工学院) TDK InvenSense

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 Saranga通过低功耗超声波感知栈在视觉退化环境中实现导航,利用双超声波阵列定位障碍物,并通过物理降噪和深度学习去噪方法解决信号噪声问题,实现在密集雾、黑暗和雪中导航。

Journal ref Science Robotics Vol 11, Issue 112, eadz9609 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07237 2026-03-27 cs.CV 57%

Unified Camera Positional Encoding for Controlled Video Generation

统一的相机位置编码用于受控视频生成

Cheng Zhang, Boying Li, Meng Wei, Yan-Pei Cao, Camilo Cruz Gambardella, Dinh Phung, Jianfei Cai

机构 * Monash University(莫纳什大学) Building 4.0 CRC(4.0建筑CRC) VAST(VAST研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出UCPE,通过统一相机信息实现视频生成中的高可控性与视觉真实性,结合轻量级注意力适配器提升模型性能。

Comments Camera Ready of CVPR2026. Project Page: https://chengzhag.github.io/publication/ucpe/ Code: https://github.com/chengzhag/UCPE

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24294 2026-03-26 cs.CV 57%

VERIA: Verification-Centric Multimodal Instance Augmentation for Long-Tailed 3D Object Detection

VERIA:面向长尾3D目标检测的验证导向多模态实例增强

Jumin Lee, Siyeong Lee, Namil Kim, Sung-Eui Yoon

机构 * KAIST(韩国科学技术院) Naver Labs(Naver实验室)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 VERIA通过多模态实例增强方法提升长尾分布下3D目标检测性能,利用基础模型生成同步RGB-LiDAR实例并进行语义与几何验证,改进稀有类别的检测效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23276 2026-03-25 cs.CV 57%

CCF: Complementary Collaborative Fusion for Domain Generalized Multi-Modal 3D Object Detection

CCF:互补协作融合用于领域泛化的多模态3D目标检测

Yuchen Wu, Kun Wang, Yining Pan, Na Zhao

机构 * Singapore University of Technology and Design(新加坡科技设计大学)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出CCF方法,通过查询解耦损失、LiDAR引导深度先验和互补跨模态掩码,提升多模态3D目标检测在跨领域场景下的鲁棒性,实验表明优于现有方法且保持源域性能。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23112 2026-03-25 cs.RO 57%

Active Robotic Perception for Disease Detection and Mapping in Apple Trees

主动机器人感知用于苹果树疾病检测与制图

Hayden Feddock, Francisco Yandun, Srđan Aćimović, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所) Department of Plant Pathology, Virginia Polytechnic Institute and State University(弗吉尼亚理工大学植物病理学系)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出一种自主移动主动感知系统,用于在苹果树休眠期精准检测和制图疾病,通过融合多种传感技术实现疾病症状的精确定位,并评估了三种视角规划策略以提升观测精度。

Comments 8 pages, 6 figures, IROS 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22502 2026-03-25 cs.RO 57%

MapForest: A Modular Field Robotics System for Forest Mapping and Invasive Species Localization

MapForest:一种用于森林制图和入侵物种定位的模块化野外机器人系统

Sandeep Zachariah, Francisco Yandun, Sachet Korada, Abhisesh Silwal

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出MapForest,一种模块化机器人系统,利用多模态传感器数据生成GIS-ready的入侵物种地图,通过LiDAR-惯性制图、图像识别和地理参考制图实现精准定位,实验显示其在GNSS间断环境下具有高精度和鲁棒性。

Comments 8 pages, 9 figures. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20188 2026-03-23 cs.CV 57%

Wildfire Spread Scenarios: Increasing Sample Diversity of Segmentation Diffusion Models with Training-Free Methods

野火蔓延场景:通过无训练方法增加分割扩散模型的样本多样性

Sebastian Gerard, Josephine Sullivan

机构 * KTH Royal Institute of Technology(皇家理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出通过无训练方法提升分割扩散模型样本多样性,验证了粒子引导和SPELL等技术在野火蔓延场景中的有效性,提升了HM IoU指标。

Comments Accepted at NLDL 2026. This version contains small corrections compared to the initial publication, see appendix for details

Journal ref Proceedings of the 7th Northern Lights Deep Learning Conference (NLDL), PMLR, Jan. 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19776 2026-03-23 cs.CV 57%

ReManNet: A Riemannian Manifold Network for Monocular 3D Lane Detection

ReManNet:一种用于单目3D车道检测的黎曼流形网络

Chengzhi Hong, Bijun Li

机构 * State Key Laboratory of Information Engineering in Surveying, Mapping and Remote Sensing(信息工程测绘遥感国家重点实验室)

专题命中 感知 :BEV(abstract);分类 cs.CV

AI总结 本文提出ReManNet,通过将道路视为三维空间中的光滑2D流形,利用黎曼流形上的高斯描述符和轻量级门机制,提升单目3D车道检测的几何一致性与形状对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19308 2026-03-23 cs.LG cs.AI cs.MA 57%

GT-Space: Enhancing Heterogeneous Collaborative Perception with Ground Truth Feature Space

GT-Space:通过地面真实特征空间增强异构协作感知

Wentao Wang, Haoran Xu, Guang Tan

机构 * Sun Yat-sen University, Shenzhen Campus(中山大学深圳校区) Peng Cheng Laboratory (PCL)(鹏城实验室)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出GT-Space框架,通过构建地面真实标签的共同特征空间,实现异构agent的统一特征对齐,避免了传统方法中需要重新训练编码器或设计解释器模块的局限,提升了多agent协作感知的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18210 2026-03-20 cs.RO 57%

GoalVLM: VLM-driven Object Goal Navigation for Multi-Agent System

GoalVLM: 多智能体系统中基于视觉语言模型的目标导航

MoniJesu James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

机构 * Intelligent Space Robotics Laboratory(智能空间机器人实验室) Center for Digital Engineering(数字工程中心) Skolkovo Institute of Science and Technology(斯克尔科夫科学与技术研究所)

专题命中 感知 :BEV(abstract);分类 cs.RO

AI总结 本文提出GoalVLM,一种基于视觉语言模型的多智能体零样本开放词汇目标导航框架,通过整合SAM3和SpaceOM实现语义优先级探索,无需重新训练即可完成复杂目标导航任务。

Comments 8 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20292 2026-03-19 cs.RO 57%

Dynamic-ICP: Doppler-Aware Iterative Closest Point Registration for Dynamic Scenes

动态ICP:针对动态场景的多普勒感知迭代最近点配准

Dong Wang, Daniel Casado Herraez, Stefan May, Andreas Nüchter

机构 * Julius-Maximilians-Universität Würzburg(乌尔姆-约亨大学) Zentrum für Telematik e.V.(电信研究中心) Nuremberg Institute of Technology Georg Simon Ohm(纽伦堡技术学院 Georg Simon Ohm) University of Bonn(波恩大学)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出动态ICP方法,通过多普勒速度估计自身运动、动态物体聚类、常速模型预测动态点及结合点到平面残差与多普勒残差的紧凑目标,实现动态场景下的鲁棒配准。

Comments 8 pages, 5 figures

Journal ref IEEE Robotics and Automation Letters, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17351 2026-03-19 cs.RO 57%

OmniVLN: Omnidirectional 3D Perception and Token-Efficient LLM Reasoning for Visual-Language Navigation across Air and Ground Platforms

OmniVLN:面向空和地面平台的全方位3D感知与高效token LLM推理的视觉语言导航

Zhongyuang Liu, Min He, Shaonan Yu, Xinhang Xu, Muqing Cao, Jianping Li, Jianfei Yang, Lihua Xie

机构 * CertaintyX School of Electrical and Electronic Engineering, Nanyang Technological University(南洋理工大学电子与电气工程学院) Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 OmniVLN结合全方位3D感知与高效token分层推理,提升空和地面机器人在复杂环境中的视觉语言导航能力,提升空间指认准确率并减少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16742 2026-03-18 cs.CV 57%

When the City Teaches the Car: Label-Free 3D Perception from Infrastructure

当城市教导汽车:从基础设施实现无标签的3D感知

Zhen Xu, Jinsu Yoo, Cristian Bautista, Zanming Huang, Tai-Yu Pan, Zhenzhen Liu, Katie Z Luo, Mark Campbell, Bharath Hariharan, Wei-Lun Chao

机构 * The Ohio State University(俄亥俄州立大学) Google(谷歌) Cornell University(康奈尔大学) Stanford University(斯坦福大学) Boston University(波士顿大学)

专题命中 感知 :self-driving(abstract);分类 cs.CV

AI总结 本文提出一种无标签的3D感知方法,利用道路设施作为无监督教师,通过固定视角和重复观测学习局部3D检测器,并广播预测作为伪标签监督,无需基础设施即可训练独立的车辆检测器。

Comments Project Page: https://jinsuyoo.info/civet/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16303 2026-03-18 cs.RO 57%

Toward Deep Representation Learning for Event-Enhanced Visual Autonomous Perception: the eAP Dataset

迈向事件增强的视觉自主感知的深度表示学习:eAP数据集

Jinghang Li, Shichao Li, Qing Lian, Peiliang Li, Xiaozhi Chen, Yi Zhou

机构 * Neuromorphic Automation and Intelligence Lab (NAIL) at School of AI & Robotics, Hunan University(神经形态自动化与智能实验室(NAIL)位于人工智能与机器人学院,湖南大学) ByteDance(字节跳动) Zhuoyu Technology(卓宇科技)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出eAP数据集,用于研究事件增强的深度视觉感知,通过深度学习方法提升3D车辆检测和物体时间到接触估计性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19490 2026-03-18 cs.HC cs.CV 57%

RISEE: A Highly Interactive Naturalistic Driving Trajectories Dataset with Human Subjective Risk Perception and Eye-tracking Information

RISEE:一个具有人类主观风险感知和眼动信息的高交互自然驾驶轨迹数据集

Xinzheng Wu, Junyi Chen, Peiyi Wang, Shunxiang Chen, Haolan Meng, Yong Shen

机构 * School of Automotive Studies, Tongji University(同济大学汽车学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出RISEE数据集,整合人类主观风险评估和眼动数据,通过无人机与模拟相结合的方法,提升自动驾驶决策系统的人机交互研究质量。

Comments Preprint accepted by ITSC 2025

Journal ref 2025 IEEE 28th International Conference on Intelligent Transportation Systems (ITSC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16253 2026-03-18 cs.CV 57%

Open-Vocabulary Octree-Graph for 3D Scene Understanding

开放词汇八叉树图用于3D场景理解

Zhigang Wang, Yifei Su, Chenhui Li, Dong Wang, Yan Huang, Bin Zhao, Xuelong Li

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) University of Chinese Academy of Sciences(中国科学院大学) CASIA TeleAI

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出Octree-Graph,通过CGSM和IFA算法获取3D实例及语义特征,构建适应性八叉树结构以高效表示场景,实验表明其在多种任务中具有广泛适用性和有效性。

Comments Accepted by ICCV25. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15470 2026-03-17 cs.CV 57%

Automated Counting of Stacked Objects in Industrial Inspection

工业检测中堆叠物体的自动化计数

Corentin Dumery, Noa Etté, Aoxiang Fan, Ren Li, Jingyi Xu, Hieu Le, Pascal Fua

机构 * EPFL(苏黎世联邦理工学院) MBZUAI(马克斯·普朗克人工智能研究所) Southern University of Science and Technology(南方科技大学) Stony Brook University(石溪大学) University of North Carolina(北卡罗来纳大学)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出一种新的3D计数方法,通过多视角图像估计堆叠物体的3D几何和占用率,解决容器中堆叠物体遮挡问题,验证了在大规模合成和真实数据上的鲁棒性。

Comments This preprint is a journal extension of our ICCV25 Oral paper: https://corentindumery.github.io/projects/stacks.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14909 2026-03-17 cs.CV 57%

TopoVST: Toward Topology-fidelitous Vessel Skeleton Tracking

TopoVST:迈向拓扑忠实的血管骨架跟踪

Yaoyu Liu, Minghui Zhang, Junjun He, Yun Gu

机构 * Institute of Medical Robotics, Shanghai Jiao Tong University(上海交通大学医学机器人研究所) School of Automation and Intelligent Sensing, Shanghai Jiao Tong University(上海交通大学自动化与智能感知学院) Shanghai AI Lab(上海人工智能实验室)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 本文提出TopoVST,通过多尺度球图和图神经网络实现血管骨架跟踪,结合门控特征融合和几何感知加权方案,有效解决拓扑忠实性和类别不平衡问题,实验表明其在重叠和拓扑指标上表现优异。

Comments 10 pages, 9 figures. Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12908 2026-03-17 cs.RO 57%

GoalSwarm: Multi-UAV Semantic Coordination for Open-Vocabulary Object Navigation

GoalSwarm:多无人机语义协调用于开放词汇物体导航

MoniJesu Wonders James, Amir Atef Habel, Aleksey Fedoseev, Dzmitry Tsetserokou

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出GoalSwarm框架,通过轻量语义地图构建、零样本目标检测和去中心化协调策略,实现多无人机在未知环境中的开放词汇物体导航。

Comments 6 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01535 2026-03-17 cs.CV 57%

Benchmarking Semantic Segmentation Models via Appearance and Geometry Attribute Editing

通过外观和几何属性编辑评估语义分割模型

Zijin Yin, Bing Li, Kongming Liang, Hao Sun, Zhongjiang He, Zhanyu Ma, Jun Guo

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出Gen4Seg数据生成管道,通过生成具有不同属性变化的挑战样本来评估语义分割模型,构建了Pascal-EA和COCO-EA两个新基准,发现开放词汇模型在几何变化下不比封闭集方法更鲁棒,数据增强技术在提升外观变化鲁棒性上有限。

Comments Accepted to IEEE TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 57%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏