MUTR3D: A Multi-camera Tracking Framework via 3D-to-2D Queries
专题命中 感知 :autonomous driving(abstract,comments);分类 cs.CV、cs.AI
Comments Appear on CVPR 2022 Workshop on Autonomous Driving
视觉与机器人
自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。
专题命中 感知 :autonomous driving(abstract,comments);分类 cs.CV、cs.AI
Comments Appear on CVPR 2022 Workshop on Autonomous Driving
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV;autonomous driving(journal_ref)
Comments Code & models are available at http://rl.uni-freiburg.de/research/panoptictracking
Journal ref The IEEE Conference on Computer Vision and Pattern Recognition (CVPR) Workshop on Scalability in Autonomous Driving, 2020
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV;autonomous driving(comments)
Comments Accepted for publication at CVPR Workshop on Autonomous Driving 2019
专题命中 感知 :autonomous driving(abstract,journal_ref);分类 cs.CV;driving perception(journal_ref)
Comments Code available at https://github.com/JoseLGomez/Co-training_SemSeg_UDA. Paper accepted on Sensors at https://www.mdpi.com/1424-8220/23/2/621
Journal ref Sensors, Special Issue Machine Learning for Autonomous Driving Perception and Prediction (2023)
MIVIFI:弥合透视域与鱼眼域以训练多视图鱼眼图像生成模型
机构 * ETH Zurich(苏黎世联邦理工学院) ; Bosch Research(博世研究中心) ; Technical University of Munich(慕尼黑工业大学)
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV
AI总结 本研究针对多视图鱼眼图像生成问题,提出SyntheOcc-FE与MIVIFI两种方法,其中MIVIFI利用跨域学习缓解鱼眼数据稀缺问题,实现高保真的多视图鱼眼图像生成。
Comments Accepted at the IEEE International Conference on Intelligent Transportation Systems (ITSC) 2026
A2DINOv3:通过社会化协作重新思考多模态目标检测
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 本文提出A2DINOv3框架,通过社会化协作协议让RGB与红外分支以异构专家模式选择性交互,结合零初始化策略,在四个多模态基准上实现了多模态目标检测的SOTA性能。
CutMix对语义分割中可靠性与鲁棒性的影响
机构 * Institute of Photogrammetry and Remote Sensing (IPF), Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院摄影测量与遥感研究所)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 该研究探究CutMix对语义分割的影响,发现其对分割准确率影响微小,但可提升模型可靠性,尤其在分布偏移场景下,增强的是校准度与不确定性可信度,对安全关键应用意义重大。
Comments Accepted for publication in the ISPRS Annals (ISPRS Congress 2026, Toronto, Oral Presentation)
通过语义感知协同感知扩展智能交通系统的安全 horizon
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 本文提出 HMS-SCP 框架,通过多尺度语义冗余与 JSCC 编码实现带宽效率与鲁棒性的平衡,在 V2X 环境中保障安全关键型协同感知的性能。
Comments 15 pages, 7 figures, 6 tables, Submitted to IEEE Transactions on Vehicular Technology (TVT)
面向机器人操作的视觉提示:采用带标注引导的拾取与放置方法,基于ACT算法
机构 * Embodied AI Research Team(具身人工智能研究团队) ; National Institute of AIST(国家信息与系统技术研究所)
专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI
AI总结 针对便利店机器人拾取放置任务的挑战,提出带标注引导视觉提示的感知-行动流水线,采用ACT算法实现自适应操作,提升了零售环境下的抓取精度与适应性。
OccamView:面向帧预算约束下主动式3D高斯重建的物体条件视角选择方法
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.CV
AI总结 针对帧预算紧张时现有主动3D高斯重建方法易漏重建物体的问题,提出OccamView框架,通过物体条件视角选择与Geo-Floor机制优化规划,在多数据集上提升了重建表现。
Comments 7 pages, 5 figures. Preprint
基于深度引导协同建模的视听分割
机构 * School of Intelligent Science and Technology, University of Science and Technology Beijing(北京科技大学智能科学与技术学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 该研究针对现有视听分割方法未建模几何线索的问题,提出三模态框架DGCM-AVS,通过深度感知动态调制器与深度引导渐进融合模块优化,在AVSS数据集上实现M_J、M_F指标的显著提升。
Journal ref IEEE Transactions on Multimedia, 2026
面向吉隆坡城市交通的隐私保护数据集构建:结合空间车辆上下文过滤的接地视觉-语言检测
机构 * Faculty of Artificial Intelligence, Universiti Teknologi Malaysia(马来西亚理工大学人工智能学院)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 针对吉隆坡热带城市交通场景的隐私保护数据集构建难题,提出结合Grounding DINO与空间车辆ROI包含引擎的自动化匿名化框架,在1266帧图像上实现约95%的匿名化成功率。
面向配对系统故障发现的覆盖率感知主动评估
机构 * Laboratory of Information & Decision Systems (LIDS), MIT(麻省理工学院信息与决策系统实验室(LIDS)) ; NVIDIA Research(英伟达研究院)
专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 该研究针对自主系统故障发现难题,提出结合代理评估与残差建模、支持感知互信息目标的自适应方法,在三类任务中发现的故障数是基线的两倍。
Comments 9 main pages followed by Appendix, total 21 pages, 12 figures
DIMOS: 解耦实例级运动目标分割
机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出双解耦特征提取框架分离图像与事件模态的外观和运动信息,并通过多粒度跨模态对齐实现有效融合,在运动实例分割任务中尤其对快速运动和低光下的小目标取得最优性能。
DA-NBV:一种用于海上船舶高效3D重建的方向感知最优下一个视点规划器
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI
AI总结 针对海上船舶3D重建中现有NBV策略忽略方向观测历史的问题,本文提出DA-NBV策略,结合PAF等方法,在SeaShip-3D数据集与仿真环境下实现了更高效的船舶3D重建性能。
Comments 16pages, 11 figures
基于多任务一致性的对抗攻击检测
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 针对自动驾驶中DNNs易受对抗攻击且现有防御成本高的问题,提出基于多任务视觉任务输出一致性的高效检测方案,在BDD100k数据集上对PGD攻击的ROC-AUC达99.9%。
几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪
机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) ; PinPark, Inc.(PinPark公司)
专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI
AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。
HyperDet: 基于超4D雷达点云的3D目标检测
机构 * University of Edinburgh(爱丁堡大学) ; HKUST (GZ)(香港科技大学(广州)) ; University of Oxford(牛津大学) ; MIT(麻省理工学院)
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV
AI总结 提出一种与检测器无关的框架HyperDet,通过构建任务感知的超4D雷达点云,利用时空累积、跨传感器验证和多普勒引导的运动补偿以及前景生成增强,显著提升仅用雷达的3D目标检测性能。
Comments 11 pages, 3 figures, 3 tables
基于OpenArm的实验室移动操作的表示交接
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI
AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。
Comments Robotics: Science and Systems (RSS) Workshop 2026
面向光流估计网络的物理实时红外攻击
机构 * City University of Hong Kong(香港城市大学) ; University of Electronic Science and Technology(电子科技大学) ; Shenzhen University(深圳大学) ; Jilin University(吉林大学)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出一种利用红外光的物理实时攻击方法,通过动态显示对抗样本破坏光流估计网络,在多种场景下均能有效削弱网络的光流估计能力。
面向可信赖的具身智能:一个系统框架与分级可信赖性水平
机构 * THU(清华大学) ; PKU(北京大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。
Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai
具有缓冲区受限交接站的终身多子系统取货与送货
机构 * Robert Bosch GmbH(罗伯特·博世有限公司) ; Technical University of Berlin(柏林工业大学) ; Robotics Institute Germany (RIG)(德国机器人研究所)
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI
AI总结 研究终身多子系统取货与送货中协调子系统载荷转移的问题,提出交接感知预留与路由(HARR)方法,通过共享日历和缓冲区预测协调行动,模拟显示该方法能显著提高吞吐量、减少积压并降低规划时间,提升运输稳定性。
Comments IROS 2026
深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合
机构 * Technion–Israel Institute of Technology(以色列理工学院) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI
AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。
Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测
机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) ; Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.AI
AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。
用于高速赛车的带里程计的3D车道检测
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、eess.IV
AI总结 研究高速赛车场景下的3D车道检测问题,通过新数据集比较多种方法,提出改进措施,利用多摄像头集成及里程计等提升性能,相比其他方法提高了F1分数并降低误差,在车辆部署中取得良好指标。
Comments 14 pages, IROS paper, includes extended abstract
M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV
AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。
Comments 24 pages, 13 figures
四足机器人的行为基础:ABot-C0技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI
AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。
Comments Abot-C0 project page will be released soon
HumAIN:人类感知的隐式社交机器人导航
机构 * Ewha Womans University(梨花女子大学) ; George Mason University(乔治梅森大学) ; University of Virginia(弗吉尼亚大学) ; Tufts University(塔夫茨大学) ; Semio(Semio公司) ; Hokkaido University(北海道大学)
专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI
AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。
Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
NegROI:基于场景条件负提示的以点击为中心的不确定性引导细化用于稳健交互式3D分割
机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI
AI总结 研究针对交互式3D分割中粗体素分辨率及背景误报问题,提出NegROI框架,结合点击中心多分辨率细化与场景条件负提示,通过不确定性驱动选择性细化、负提示建模及边界感知硬负挖掘,提升点击效率、减少误报并增强跨数据集鲁棒性。
迈向精确状态估计:用于3D多目标跟踪的运动动力学卡尔曼滤波器
机构 * Khalifa University(哈利法大学) ; New York University of Abu Dhabi(纽约大学阿布扎比分校)
专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.CV
AI总结 提出运动动力学卡尔曼滤波器(MD-KF),通过将连续测量间运动变化建模为高斯分布并自适应调整加权运动模型,克服恒定运动假设,在保持模型单一性的同时提升遮挡和静止目标的状态估计精度与计算效率。