Multi-Task Consistency-based Detection of Adversarial Attacks
基于多任务一致性的对抗攻击检测
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 针对自动驾驶中DNNs易受对抗攻击且现有防御成本高的问题,提出基于多任务视觉任务输出一致性的高效检测方案,在BDD100k数据集上对PGD攻击的ROC-AUC达99.9%。
视觉与机器人
自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。
基于多任务一致性的对抗攻击检测
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 针对自动驾驶中DNNs易受对抗攻击且现有防御成本高的问题,提出基于多任务视觉任务输出一致性的高效检测方案,在BDD100k数据集上对PGD攻击的ROC-AUC达99.9%。
几何胜过估计深度:Sim2Real 场景下仅用 RGB 的多相机 3D 跟踪
机构 * LSU New Orleans(路易斯安那州立大学新奥尔良分校) ; PinPark, Inc.(PinPark公司)
专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI
AI总结 在 Sim2Real 场景下,研究人员通过实验验证跨视图几何一致性而非单目深度精度决定仅用 RGB 的多相机 3D 跟踪性能,提出几何优先流水线并取得显著优于伪激光雷达方法的结果。
基于OpenArm的实验室移动操作的表示交接
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI
AI总结 本研究提出基于OpenArm的实验室移动操作原型,通过表示交接整合多模块,可暴露部署阻碍并为具身系统整合提供调试接口。
Comments Robotics: Science and Systems (RSS) Workshop 2026
面向光流估计网络的物理实时红外攻击
机构 * City University of Hong Kong(香港城市大学) ; University of Electronic Science and Technology(电子科技大学) ; Shenzhen University(深圳大学) ; Jilin University(吉林大学)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 该研究提出一种利用红外光的物理实时攻击方法,通过动态显示对抗样本破坏光流估计网络,在多种场景下均能有效削弱网络的光流估计能力。
面向可信赖的具身智能:一个系统框架与分级可信赖性水平
机构 * THU(清华大学) ; PKU(北京大学) ; HKUST (GZ)(香港科技大学(广州))
专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 该研究提出具身智能可信赖性的四层系统框架,构建涵盖多维度的可信赖性水平层级,为具身智能的可信赖部署、评估等提供依据。
Comments Website: https://xsparkai.com/sparklab/towards-trustworthy-eai
具有缓冲区受限交接站的终身多子系统取货与送货
机构 * Robert Bosch GmbH(罗伯特·博世有限公司) ; Technical University of Berlin(柏林工业大学) ; Robotics Institute Germany (RIG)(德国机器人研究所)
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI
AI总结 研究终身多子系统取货与送货中协调子系统载荷转移的问题,提出交接感知预留与路由(HARR)方法,通过共享日历和缓冲区预测协调行动,模拟显示该方法能显著提高吞吐量、减少积压并降低规划时间,提升运输稳定性。
Comments IROS 2026
深度雷达:用于自动驾驶车辆感知的端到端MIMO雷达设计与多模态融合
机构 * Technion–Israel Institute of Technology(以色列理工学院) ; Ben-Gurion University of the Negev(内盖夫本-古里安大学)
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI
AI总结 深度雷达以雷达为中心,通过端到端学习稀疏采集模式,共同设计雷达传感与多模态3D检测。其可学习的MIMO设计模块在融合网络中训练,由其他传感器监督。在RADIal数据集上评估,能发现稀疏配置,降低成本与复杂性,表明最优设计取决于融合堆栈和感知任务。
Comments Accepted for publication at the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
AEGIS:用于开源液体处理机器人的检测感知协议验证和运行时监测
机构 * Data Science and Learning Division, Argonne National Laboratory(阿贡国家实验室数据科学与学习部) ; Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
专题命中 感知 :self-driving(abstract);分类 cs.RO、cs.AI
AI总结 研究开源液体处理机器人运行问题,提出AEGIS两层防护系统。一层结合检测规则库与大语言模型验证协议,二层用主成分分析模型监测运行轨迹,经实验验证有效,统一了检测感知验证与视觉监测,且开源。
用于高速赛车的带里程计的3D车道检测
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、eess.IV
AI总结 研究高速赛车场景下的3D车道检测问题,通过新数据集比较多种方法,提出改进措施,利用多摄像头集成及里程计等提升性能,相比其他方法提高了F1分数并降低误差,在车辆部署中取得良好指标。
Comments 14 pages, IROS paper, includes extended abstract
M$^\text{4}$World:用于交互式对象操纵和分钟级流的多视图多模态驾驶世界模型
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV
AI总结 针对现有驾驶世界生成方法局限,提出M$^\text{4}$World模型,通过灵活接口与多阶段训练实现对象操纵及长时流稳定,引入后训练与生成模型,并用新管道评估,实验证明其在驾驶模拟中有高质量、可控性与稳定性。
Comments 24 pages, 13 figures
四足机器人的行为基础:ABot-C0技术报告
机构 * Alibaba Group(阿里巴巴集团)
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.AI
AI总结 该研究聚焦四足机器人运动控制,提出ABot-C0通用系统,构建数据金字塔生成运动片段,训练流匹配通用策略展示跟踪缩放定律,采用特定框架推动全地形遍历运动,经实验验证其能让四足机器人迈向产品级行为智能。
Comments Abot-C0 project page will be released soon
HumAIN:人类感知的隐式社交机器人导航
机构 * Ewha Womans University(梨花女子大学) ; George Mason University(乔治梅森大学) ; University of Virginia(弗吉尼亚大学) ; Tufts University(塔夫茨大学) ; Semio(Semio公司) ; Hokkaido University(北海道大学)
专题命中 感知 :trajectory planning(abstract);分类 cs.RO、cs.AI
AI总结 研究提出HumAIN框架,通过知识蒸馏将隐式社交线索融入机器人导航规划。利用基于Transformer的教师模型学习强大表示,蒸馏到轻量级学生模型。实验表明该方法能有效提升轨迹预测指标,在资源受限平台实现类人导航意识。
Comments 8 pages, 4 figures. Accepted to the IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
NegROI:基于场景条件负提示的以点击为中心的不确定性引导细化用于稳健交互式3D分割
机构 * School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)
专题命中 感知 :LiDAR(abstract);分类 cs.CV、cs.AI
AI总结 研究针对交互式3D分割中粗体素分辨率及背景误报问题,提出NegROI框架,结合点击中心多分辨率细化与场景条件负提示,通过不确定性驱动选择性细化、负提示建模及边界感知硬负挖掘,提升点击效率、减少误报并增强跨数据集鲁棒性。
实时无源目标检测
机构 * IIT Hyderabad(印度理工学院海得拉巴分校) ; Microsoft Research(微软研究院) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出一种基于YOLOv10的实时无源目标检测方法,通过双头伪标签融合(DHF)和多尺度自适应表示多样化(MARD)损失,在保持实时性和轻量化的同时,显著提升域适应精度。
Comments Accepted to ECCV 2026
OSOR: 一步扩散修复用于效果感知的对象移除
机构 * Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; Xidian University(西安电子科技大学) ; Tongji University(同济大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Transsion(传音控股)
专题命中 感知 :occupancy(abstract);分类 cs.CV、cs.AI
AI总结 提出一步扩散模型OSOR,通过占用引导判别器、alpha头和语义锚定验证管道,实现高效、效果感知且对不完美掩码鲁棒的对象移除,速度提升4-30倍。
Comments Code and resources are available at https://github.com/Zhouqm-Git/osor
超越拜耳:面向鲁棒自动驾驶分割的任务最优传感器协同设计
机构 * University Of Arkansas(阿肯色大学)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出可微RAW到任务流水线,学习光谱滤色器阵列权重提升分割mIoU,发现光学点扩散函数协同设计为负收益,噪声优化效果微弱,增大CFA块反而有害。
一种面向 doScenes 指令驾驶挑战的 DVDrive 方法
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Xiaomi EV(小米汽车)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出基于 OmniDrive 的指令条件轨迹预测方法,引入 DVPE 分视角感知模块减少跨视角干扰,提升多视角视觉定位与语言指令对齐能力。
Qwen-RobotNav 技术报告:为智能体导航系统设计的可扩展导航模型
机构 * Qwen Team(通义实验室)
专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.CV
AI总结 提出 Qwen-RobotNav 可扩展导航模型,通过参数化接口支持多种任务模式和可调观测参数,在15.6M样本上训练,联合视觉语言数据防止行为坍缩,在多个导航基准上取得新最优结果,并展示零样本泛化能力。
ActiveSAM: 图像条件类别剪枝实现快速准确的开放词汇分割
机构 * VILA Lab, Mohamed bin Zayed University of Artificial Intelligence(VILA实验室,穆罕默德·本·扎耶德人工智能大学)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出ActiveSAM,一种无需训练、零样本的推理框架,通过图像条件类别剪枝和低分辨率预览,将SAM 3转化为主动词汇分割器,在8个基准上平均提升1.4 mIoU,速度提升最高5.5倍。
Comments Preprint. Code is available at https://github.com/VILA-Lab/ActiveSAM
ROSA-RL:基于强化学习的不确定性感知环岛优化速度建议
机构 * Universität der Bundeswehr München(慕尼黑联邦国防军大学) ; Hochschule für angewandte Wissenschaften Landshut(兰茨胡特应用科学大学)
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI
AI总结 针对混合交通中环岛场景的不确定性,提出ROSA-RL框架,结合Transformer预测冲突区域占用概率与强化学习,实现安全高效的环岛入口速度协调。
Comments 8 pages, 2 figures, 2 tables. Copyright 2026 IEEE. This is the accepted manuscript for 2026 IEEE International Conference on Intelligent Transportation Systems (ITSC), not the final published version
本体感觉-视觉对应使能人形机器人的自我-他人区分
机构 * Eastern Institute of Technology, Ningbo(宁波东方理工大学) ; Shanghai Jiao Tong University(上海交通大学) ; Peking University(北京大学) ; Carnegie Mellon University(卡内基梅隆大学) ; East China Normal University(华东师范大学) ; Ningbo Institute of Digital Twin(宁波数字孪生研究院)
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI
AI总结 提出通过本体感觉与视觉的对应学习自我-他人区分,无需身份标签或运动学模型,并建立预测性自我模型,支持目标到达、碰撞感知运动规划和运动重定向。
Comments 23 pages, 9 figures, 1 supplementary table
从模仿到对齐:面向长距离人行道导航的人类偏好流策略
机构 * University of California, Los Angeles(加州大学洛杉矶分校)
专题命中 感知 :autonomous driving(abstract);分类 cs.RO、cs.AI
AI总结 提出FlowPilot,一种仅使用单目RGB相机的无地图导航策略,通过锚定流匹配进行预训练,并引入人类偏好学习实现对齐,在长距离人行道导航中提升鲁棒性和社会合规性。
自然环境中机器人感知的跨模态基准测试
机构 * CSIRO Robotics, CSIRO, Australia(CSIRO机器人研究所,CSIRO,澳大利亚) ; University of Sydney (USyd), Australia(悉尼大学(USyd),澳大利亚) ; Queensland University of Technology (QUT), Australia(昆士兰理工大学(QUT),澳大利亚)
专题命中 感知 :LiDAR(abstract);分类 cs.RO、cs.CV
AI总结 针对自然环境中机器人感知的挑战,提出WildCross跨模态基准,用于大规模自然场景下的地点识别和度量深度估计,并扩展了度量深度估计实验。
Comments Accepted to the IEEE ICRA Workshop on Open Challenges for Rigorous Robot Perception 2026
蒙特卡洛传球搜索:利用轨迹生成进行足球3D反事实传球评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV、cs.AI
AI总结 提出蒙特卡洛传球搜索(MCPS),结合价值模型、世界模型和反事实策略,基于3D轨迹数据评估足球传球,通过两种执行盈余分数实现分布感知的传球分析。
Comments CVPR 2026, CVSports Workshop
SCOUT: 基于不确定性引导遍历的语义场景覆盖
机构 * Nokia Bell Labs, France(诺基亚贝尔实验室,法国) ; Nokia Bell Labs, Murray Hill, NJ, USA(诺基亚贝尔实验室,美国,新泽西州 Murray Hill) ; Imperial College London(帝国理工学院伦敦分校) ; Locus Robotics(Locus机器人技术公司)
专题命中 感知 :occupancy(abstract);分类 cs.RO、cs.AI
AI总结 提出SCOUT框架,通过不确定性引导的遍历规划与概率场景图构建的闭环,使机器人主动探索并逐步理解环境,实现语义场景完整性作为操作目标。
Comments 2026 ICRA Workshop on Uncertainty in Open World Robotics
ADAPT:面向自适应可迁移HVAC控制的物理感知扩散式世界模型
专题命中 感知 :occupancy(abstract);分类 cs.AI
AI总结 本文针对现有HVAC控制方法泛化性差的问题,提出物理感知扩散世界模型ADAPT,在IID控制下可降HVAC能耗7.3%、不适度30.2%,OOD场景下迁移鲁棒性显著优于现有方法。
CAViAR:用于真实场景细粒度事故推理的因果视频数据集
机构 * NEC Laboratories, America(美国NEC实验室)
专题命中 感知 :autonomous driving(abstract);分类 cs.CV
AI总结 该研究推出人工标注的真实事故视频基准CAViAR,测试发现现有VLMs存在感知-推理差距,无法可靠将驾驶场景主体行为映射到责任类别。
Comments Accepted to ECCV 2026 Workshop DriveX
SceneGTMM:一种基于保角映射的场景感知可迁移GNN-Transformer双图交互地图匹配框架
专题命中 感知 :autonomous driving(abstract);分类 cs.CV
AI总结 本文提出SceneGTMM框架,通过保角映射场景策略、双图交互架构与CRF增强预测,提升地图匹配的噪声鲁棒性、跨区域迁移性与可解释性,在多源及跨城轨迹匹配中表现优于基线方法。
PartialBiGrasp:从部分视角推断隐藏局部几何以实现双臂抓取
机构 * Robotics Research Center IIIT Hyderabad(印度信息技术研究所海得拉巴分校机器人研究中心)
专题命中 感知 :occupancy(abstract);分类 cs.RO
AI总结 PartialBiGrasp是基于部分点云的双臂抓取生成框架,通过卷积占用网络学习几何特征生成抓取对并优化,经实验验证可实现鲁棒稳定的抓取。
USR-Drive:通过3D高斯与边界框联合去噪实现统一驾驶场景表示
专题命中 感知 :autonomous driving(abstract);分类 cs.CV
AI总结 本文提出USR-Drive框架,将3D高斯与边界框作为对齐的潜在令牌流,通过统一多模态扩散Transformer联合去噪,在nuScenes和VKitti数据集上实现动态重建与3D检测的SOTA性能。