arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

自动驾驶

自动驾驶感知、规划、BEV、占用预测、激光雷达和仿真评测。

共收录 6072 信号源:cs.RO, cs.CV, eess.IV, cs.AI

1. 感知 6072 篇

2605.20044 2026-05-20 cs.CV 57%

OP2GS: Object-Aware 3D Gaussian Splatting with Dual-Opacity Primitives

OP2GS: 带双不透明度的物体感知3D高斯散射

Guiyu Liu, Niklas Vaara, Janne Mustaniemi, Juho Kannala, Janne Heikkilä

机构 * Center for Machine Vision and Signal Analysis, University of Oulu, Finland(奥卢大学机器视觉与信号分析中心,芬兰) Aalto University, Finland(阿尔托大学,芬兰)

专题命中 感知 :occupancy(abstract);分类 cs.CV

AI总结 OP2GS通过引入双不透明度机制,为每个原始体素添加显式实例身份和专用实例不透明度σ*,以解决3D高斯散射在物体层面身份缺失的问题,从而提升开放词汇场景理解的性能。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19744 2026-05-20 cs.CV 57%

Real-World On-Vehicle Evaluation of Embedding-Based Anomaly Detection

车载场景中基于嵌入的异常检测实测

Albert Schotschneider, Daniel Bogdoll, Svetlana Pavlitska, Ahmed Abouelazm, Johann Marius Zoellner

机构 * FZI Research Center for Information Technology(FZI信息科技研究中心) KIT Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种适应性强的实时异常检测方法,利用预训练视觉变换器嵌入来检测潜在异常,通过在潜在语义特征空间中使用最近邻相似性检测偏差,并在真实世界场景中评估了该方法的性能。

Comments Accepted at CVPR 2026 Workshop AUTOPILOT-NA

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19120 2026-05-20 cs.RO 57%

CosFly: Plan in the Matrix, Fly in the World

CosFly:矩阵中的计划,世界中的飞行

Hanxuan Chen, Xiangyue Wang, Songsheng Cheng, Ruilong Ren, Jie Zheng, Shuai Yuan, Tianle Zeng, Hanzhong Guo, Binbo Li, Kangli Wang, Ji Pei

机构 * Autel Robotics(Autel机器人公司) Nanjing University(南京大学) Peking University(北京大学) Southern University of Science and Technology(南方科技大学) University of Hong Kong(香港大学)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 本文提出CosFly,一个用于空中跟踪的盒状结构规划和多模态模拟流程,以及CosFly-Track大规模无人机数据集,用于在多样环境中动态目标跟踪。CosFly通过将复杂的3D世界转换为结构化障碍表示进行规划,然后将轨迹投影到多模态传感器数据中,并支持可配置的固定视角缩放级别。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17822 2026-05-19 cs.CV 57%

Unleashing the Representational Power of Fourier Shapes for Attacking Infrared Object Detection

释放傅里叶形状的表示能力以攻击红外目标检测

Yixing Yong, Jian Wang, Ming Lei, Lijun He, Fan Li

机构 * School of Information and Communications Engineering, Faculty of Electronic and Information Engineering, Xi'an Jiaotong University, Xi'an, China(信息与通信工程学院,电子与信息工程学院,西安交通大学,西安,中国) School of Physics, Xi'an Jiaotong University, Xi'an, China(物理学院,西安交通大学,西安,中国)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出了一种基于傅里叶形状的红外目标检测攻击方法,通过引入可学习的傅里叶形状,克服了传统形状方法在表示能力和优化能力之间的根本权衡问题,实现了高效的梯度优化生成具有欺骗性的形状,使人类目标逃避检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17421 2026-05-19 cs.RO 57%

MUSE: Multimodal Uncertainty Quantification of State Estimation

MUSE:多模态状态估计不确定性量化

Minkyung Kim, Henry Che, Bhargav Chandaka, Bhumsitt Pramuanpornsatid, Chengyu Yang, Sheng Cheng, Xiaofeng Wang, Naira Hovakimyan, Shenlong Wang

机构 * Department of Mechanical Science and Engineering, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校机械科学与工程系) Siebel School of Computing and Data Science, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校塞贝尔计算与数据科学学院) Department of Electrical Engineering, University of South Carolina(南卡罗来纳大学电气工程系)

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 本文提出MUSE,一种基于学习的实时框架,利用Mamba的强效序列建模能力,从多个异步传感器流中估计定位不确定性,提高了状态估计的可靠性和鲁棒性。

Comments Code and dataset: https://github.com/hungdche/MUSE

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16979 2026-05-19 cs.RO 57%

NORM-Nav: Zero-Shot Mobile Robot Navigation with Natural Language Behavioral Constraints

NORM-Nav: 通过自然语言行为约束实现零样本移动机器人导航

Dongjie Huo, Junhui Wang, Chao Gao, Yan Qiao, Dong Zhang, Guyue Zhou

机构 * College of Information Science and Technology, Beijing University of Chemical Technology(北京化工大学信息科学与技术学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院) Institute of Systems Engineering and Collaborative Laboratory for Intelligent Science and Systems, Macau University of Science and Technology(澳门大学系统工程与智能科学与系统联合实验室) School of Vehicle and Mobility, Tsinghua University(清华大学车辆与移动系统学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出NORM-Nav框架,通过将自然语言行为约束整合到基于成本图的规划中,提升移动机器人在人类环境中导航的社交适应性,实验表明其在任务成功率和轨迹贴近人类参考方面优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16925 2026-05-19 cs.CV 57%

P2GS: Physical Prior-guided Gaussian Splatting for Photometrically Consistent Urban Reconstruction

P2GS: 基于物理先验的高斯点云法用于光度一致的城市重建

Kota Shimomura, Hidehisa Arai, Tsubasa Takahashi, Takayoshi Yamashita, Hironobu Fujiyoshi

机构 * Chubu University(名古屋大学) Turing Inc.(图灵公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出P2GS,一种基于物理先验的高斯点云法,用于解决自动驾驶中由于异质相机管道和动态户外照明导致的光度不一致问题,通过联合分解视图不变的线性HDR光场、每视图曝光尺度和色调映射函数,提升光度一致性与光照一致性。

Comments Accepted CVPR2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06037 2026-05-19 cs.CV 57%

Thinking with Geometry: Active Geometry Integration for Spatial Reasoning

基于几何的思考:用于空间推理的主动几何整合

Haoyuan Li, Qihang Cao, Tao Tang, Kun Xiang, Zihan Guo, Jianhua Han, JiaWang Bian, Hang Xu, Xiaodan Liang

机构 * Shenzhen campus of Sun Yet-sen University(中山大学深圳校区) Yinwang Intelligent Technology Co. Ltd.(云网智能科技有限公司) Shanghai Jiao Tong University(上海交通大学) Shanghai innovation institute(上海创新研究院) Nanyang Technological University(南洋理工大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出GeoThinker框架,通过主动感知机制改进空间推理,通过空间接地融合和重要性门控实现几何与语义的精准整合,提升空间智能性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15326 2026-05-18 cs.CV 57%

Multimodal Object Detection Under Sparse Forest-Canopy Occlusion

多模态目标检测在稀疏森林冠层遮挡下的应用

Nitik Jain, Mangal Kothari

机构 * Robotics & AI, Johns Hopkins University, USA(约翰霍普金斯大学机器人与人工智能系,美国) Department of Aerospace Engineering, IIT Kanpur(印度理工学院坎浦尔航空航天工程系) Senior Principal Flight Control Engineer, ADASI, EDGE Group, Abu Dhabi, UAE(阿布扎赫尔ADASI高级飞行控制系统工程师,EDGE集团)

专题命中 感知 :LiDAR(abstract);分类 cs.CV

AI总结 本文提出一种多模态管道,结合激光雷达、可见-热成像融合和合成孔径成像技术,以提高森林冠层下人类检测的可靠性,展示了改进的YOLOv5检测器在热成像和融合图像上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15116 2026-05-15 cs.CV 57%

DriveCtrl: Conditioned Sim-to-Real Driving Video Generation

DriveCtrl: 基于条件的仿真到现实驾驶视频生成

Haonan Zhao, Yiting Wang, Jingkun Chen, Valentina Donzella, Thomas Bashford-Rogers, Kurt Debattista

机构 * University of Warwick(沃里克大学) Northwestern Polytechnical University(西北工业大学) Queen Mary University of London(伦敦大学玛丽女王学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出DriveCtrl框架,通过深度条件生成逼真的驾驶视频,保留场景结构和运动模式,提升生成视频的现实感和时序一致性,同时引入可扩展的数据生成管道和Driving Video Realism Score评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12957 2026-05-14 cs.CV 57%

GTA: Advancing Image-to-3D World Generation via Geometry Then Appearance Video Diffusion

GTA: 通过几何然后外观视频扩散推进图像到3D世界生成

Hanxin Zhu, Cong Wang, Peiyan Tu, Jiayi Luo, Tianyu He, Xin Jin, Zhibo Chen

机构 * College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出GTA方法,通过几何先于外观的两阶段框架提升3D场景生成的结构精度和视觉质量,同时引入随机潜在shuffle策略和测试时缩放方案,实验表明其在保真度、视觉质量和几何准确性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12735 2026-05-14 cs.RO 57%

The Unified Autonomy Stack: Toward a Blueprint for Generalizable Robot Autonomy

统一自主栈:迈向通用机器人自主性的蓝图

Mihir Dharmadhikari, Nikhil Khedekar, Mihir Kulkarni, Morten Nissov, Martin Jacquet, Angelos Zacharia, Marvin Harms, Albert Gassol Puigjaner, Philipp Weiss, Kostas Alexis

机构 * Autonomous Robots Lab(自主机器人实验室)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出统一自主栈,通过多模态感知、多行为规划和多层安全导航模块实现通用机器人自主性,经实地测试验证其在复杂环境中的鲁棒性。

Comments 35 pages, 22 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05077 2026-05-13 cs.CV 57%

FlowDIS: Language-Guided Dichotomous Image Segmentation with Flow Matching

FlowDIS:基于流匹配的语言引导二元图像分割

Andranik Sargsyan, Shant Navasardyan

机构 * Picsart AI Research (PAIR)(Picsart AI研究院)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出FlowDIS,一种基于流匹配框架的二元图像分割方法,通过文本提示实现精确像素级对象分割,实验表明其在DIS-TE测试集上优于现有方法。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11678 2026-05-13 cs.AI 57%

OOM-Free Alpamayo via CPU-GPU Memory Swapping for Vision-Language-Action Models

无需显存的Alpamayo通过CPU-GPU内存交换用于视觉-语言-动作模型

Seungwoo Roh, Huiyeong Kim, Jong-Chan Kim

机构 * Graduate School of Automobile and Mobility, Kookmin University, Korea(汽车与移动研究生院,韩国高垣大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文提出一种无需修改模型的内存高效方法,通过系统级优化实现视觉-语言-动作模型在显存受限的GPU上的推理,提升性能并保持精度。

Comments Submitted to IEEE RTCSA on March 26, 2026 (KST); Accepted on May 4, 2026 (KST)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11521 2026-05-13 cs.CV 57%

XWOD: A Real-World Benchmark for Object Detection under Extreme Weather Conditions

XWOD:面向极端天气条件的现实世界目标检测基准

Chih-Hsin Chen, Yu-Tung Liu, Amar Fadillah, Kuan-Ting Lai, Dong Liu

机构 * Department of Electronic Engineering(电子工程系) National Taipei University of Technology(台北科技大学) Adobe Inc.(Adobe公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出XWOD基准,包含10010张图像和42924个边界框,涵盖七种极端天气条件,通过训练标准YOLO模型在其他基准上取得显著提升,验证了数据质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.04647 2026-05-13 cs.RO 57%

ReflectDrive-2: Reinforcement-Learning-Aligned Self-Editing for Discrete Diffusion Driving

ReflectDrive-2: 用于离散扩散驾驶的强化学习对齐的自我编辑

Huimin Wang, Yue Wang, Bihao Cui, Pengxiang Li, Ben Lu, Mingqian Wang, Tong Wang, Chuan Tang, Teng Zhang, Kun Zhan

机构 * LiAuto

专题命中 感知 :autonomous driving(abstract);分类 cs.RO

AI总结 ReflectDrive-2通过平行掩码解码生成离散轨迹令牌,结合强化学习训练提升驾驶性能,实现轨迹实时修正,达到91.0 PDMS成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11566 2026-05-12 cs.CV 57%

R4Det: 4D Radar-Camera Fusion for High-Performance 3D Object Detection

R4Det:用于高性能3D目标检测的4D雷达-摄像头融合

Zhongyu Xia, Yousen Tang, Yongtao Wang, Zhifeng Wang, Weijun Qin

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) EBTech Co. Ltd(EBTech公司)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 R4Det通过全景深度融合模块提升深度估计,设计变形门控时间融合模块以不依赖车辆姿态,结合实例引导动态细化模块,实现更准确的3D目标检测。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09902 2026-05-12 cs.CV 57%

Adversarial Attacks Against MLLMs via Progressive Resolution Processing and Adaptive Feature Alignment

通过渐进分辨率处理和自适应特征对齐对多模态大语言模型进行对抗攻击

Haobo Wang, Xiaorong Ma, Weiqi Luo, Xiaojun Jia, Jiwu Huang

机构 * Sun Yat-sen University(中山大学) Nanyang Technological University(南洋理工大学) Shenzhen MSU-BIT University(深圳MSU-BIT大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出PRAF-Attack框架,通过多尺度语义指导和中间层局部对齐提升多模态大语言模型的对抗攻击转移性,实验表明其在多种黑盒MLLM上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09672 2026-05-12 cs.RO 57%

MVB-Grasp: Minimum-Volume-Box Filtering of Diffusion-based Grasps for Frontal Manipulation

MVB-Grasp:基于扩散模型的抓取生成中最小体积盒过滤用于正前方操作

Bibek Poudel, Abdul Basit, Muhammad Shafique

机构 * Unitree(单位树) Intel(英特尔)

专题命中 感知 :trajectory planning(abstract);分类 cs.RO

AI总结 本文提出MVB-Grasp方法,通过引入最小体积包围盒几何先验,提升低成本机械臂在受限工作空间中的正前方抓取成功率,结合几何过滤与重评分函数,验证了其在Z1机械臂上的有效性。

Comments 8 pages, 12 figures, accepted to IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07549 2026-05-11 cs.CV cs.LG 57%

Probabilistic Object Detection with Conformal Prediction

基于置信预测的概率目标检测

Christopher Ries, Moussa Kassem Sbeyti, Nicolas Bianco, Nadja Klein

机构 * Karlsruhe Institute of Technology (KIT)(卡尔斯鲁厄理工学院(KIT))

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出基于置信预测的目标检测方法,通过坐标轴应用和置信区间缩放提升预测精度,同时结合RAPS构建预测集,提升不确定性量化效果。

Comments Code is available at https://github.com/mos-ks/OD-CP

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11758 2026-05-11 cs.RO 57%

HAIC: Humanoid Agile Object Interaction Control via Dynamics-Aware World Model

HAIC:通过动态感知世界模型实现人形敏捷物体交互控制

Dongting Li, Xingyu Chen, Qianyang Wu, Bo Chen, Sikai Wu, Hanyu Wu, Guoyao Zhang, Liang Li, Mingliang Zhou, Diyun Xiang, Jianzhu Ma, Qiang Zhang, Renjing Xu

机构 * Tsinghua University(清华大学) HKUST(Guangzhou)(香港科技大学(广州)) ETH Zurich(苏黎世联邦理工学院) Xiaomi Robotics Lab(小米机器人实验室)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出HAIC框架,通过动态预测和空间优先级构建动态占用地图,实现人形机器人在复杂动态环境下与不同物体的稳健交互,提升敏捷任务和多物体长周期任务的完成能力。

Comments RSS 2026. Webpage: https://haic-humanoid.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01340 2026-05-05 cs.RO eess.SP 57%

Terrain Perception for Agricultural UAVs in Complex Farmland via Rotating mmWave Radar

通过旋转毫米波雷达实现复杂农田中农业无人机的地形感知

Zhihao Zhan, Le Tao, Shaobin Li, Chenxin Fang, Xingrui Yang, Liang Li, Rui Fan, Yuhang Ming

机构 * School of Computer Science, Hangzhou Dianzi University(杭州电子科技大学计算机科学学院) TopXGun Robotics(TopXGun机器人) CARDC College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) College of Electronics and Information Engineering, Tongji University(同济大学电子信息工程学院)

专题命中 感知 :LiDAR(abstract);分类 cs.RO

AI总结 本文提出一种低成本旋转毫米波雷达框架,用于提升农业无人机在复杂农田中的地形感知能力,通过扩大空间覆盖范围和改进地形可观察性,实现更准确的地面提取和连续地形估计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01227 2026-05-05 cs.RO 57%

Dynamics Aware Quadrupedal Locomotion via Intrinsic Dynamics Head

通过内在动力学头部实现动态感知的四足运动

Aman Arora, Nalini Ratha

机构 * Department of Computer Science, University at Buffalo, The State University of New York(纽约州立大学布法罗分校计算机科学系)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出一种新的训练框架,通过内在动力学头部学习状态到力矩的动力学,使控制策略能理解和推理物理动力学,从而提升四足机器人的运动效率和稳定性。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00362 2026-05-04 cs.CV 57%

Time-series Meets Complex Motion Modeling: Robust and Computational-effective Motion Predictor for Multi-object Tracking

时间序列与复杂运动建模的交汇:多目标跟踪的鲁棒且计算高效的运动预测器

Nhat-Tan Do, Le-Huy Tu, Nhi Ngoc-Yen Nguyen, Dieu-Phuong Nguyen, Trong-Hop Do

机构 * Faculty of Information Science and Engineering, University of Information Technology, Ho Chi Minh City, Vietnam(1* 信息科学与工程学院,信息技术大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(2 越南国家大学,胡志明市,越南)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出TCMP框架,通过改进的TCN网络实现高效多目标跟踪,实验显示其在HOTA、IDF1和AssA等指标上均优于现有方法,且计算效率高。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00050 2026-05-04 cs.LG cs.CV 57%

Learning physically grounded traffic accident reconstruction from public accident reports

从公共事故报告中学习物理基础的交通事故重建

Yanchen Guan, Haicheng Liao, Chengyue Wang, Zhenning Li

机构 * State Key Laboratory of Internet of Things for Smart City(物联网智能城市国家重点实验室) Department of Civil Engineering(土木工程系) Department of Computer and Information Science(计算机与信息科学系)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出基于公共报告和现场测量的参数化多模态学习框架,构建了6217个真实事故案例数据集CISS-REC,实现了交通事故重建的高保真度,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00005 2026-05-04 cs.LG cs.AI cs.DC cs.NI 57%

Cloud Is Closer Than It Appears: Revisiting the Tradeoffs of Distributed Real-Time Inference

云比它看起来更近:重新审视分布式实时推理的权衡

Pragya Sharma, Hang Qiu, Mani Srivastava

机构 * University of California Los Angeles(加州大学洛杉矶分校) University of California Riverside(加州大学河滨分校)

专题命中 感知 :autonomous driving(abstract);分类 cs.AI

AI总结 本文重新审视云推理在实时控制任务中的适用性,通过建立分析模型和仿真实验,证明云平台在高吞吐量资源下可有效缓解网络和排队延迟,从而在安全约束下优于本地推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27499 2026-05-01 cs.CV 57%

Towards All-Day Perception for Off-Road Driving: A Large-Scale Multispectral Dataset and Comprehensive Benchmark

迈向全天候越野驾驶的感知:一个大规模多光谱数据集和全面基准

Shuo Wang, Jilin Mei, Wenfei Guan, Shuai Wang, Yan Xing, Chen Min, Yu Hu

机构 * Research Center for Intelligent Computing Systems, Institute of Computing Technology, Chinese Academy of Sciences, Beijing(智能计算系统研究中心,计算技术研究所,中国科学院,北京) Beijing Institute of Control Engineering(北京控制工程研究所)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出IRON数据集和IRONet框架,解决越野夜间驾驶中可见光感知不可靠的问题,通过多光谱数据和内存注意力机制提升全天候自由空间检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22046 2026-05-01 cs.CV cs.CR 57%

Backdoor Attacks on Prompt-Driven Video Segmentation Foundation Models

针对提示驱动视频分割基础模型的后门攻击

Zongmin Zhang, Zhen Sun, Yifan Liao, Wenhan Dong, Xinlei He, Xingshuo Han, Shengmin Xu, Xinyi Huang

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Nanjing University of Aeronautics and Astronautics(南京航空航天大学) Fujian Normal University(福建师范大学) Jinan University(暨南大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文研究了针对提示驱动视频分割基础模型的后门攻击,提出BadVSFM框架,通过两阶段策略实现可控的后门效果,实验表明其在多种模型和数据集上具有有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17435 2026-05-01 cs.RO 57%

ImagineNav++: Prompting Vision-Language Models as Embodied Navigator through Scene Imagination

ImagineNav++: 通过场景想象促使视觉语言模型作为具身导航器

Teng Wang, Xinxin Zhao, Wenzhe Cai, Changyin Sun

机构 * School of Automation, Southeast University(东南大学自动化学院)

专题命中 感知 :occupancy(abstract);分类 cs.RO

AI总结 本文提出ImagineNav++,通过场景想象将视觉语言模型用于无地图导航,利用想象模块生成高探索潜力的视点,并通过选择性聚焦记忆机制实现空间一致性,实验表明其在无地图导航中表现优异。

Comments 17 pages, 10 figures. arXiv admin note: text overlap with arXiv:2410.09874

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01875 2026-04-30 cs.CV 57%

StreamAgent: Towards Anticipatory Agents for Streaming Video Understanding

StreamAgent:面向流视频理解的前瞻性代理

Haolin Yang, Feilong Tang, Lingxiao Zhao, Xinlin Zhuang, Yifan Lu, Xiang An, Ming Hu, Xiaofeng Zhang, Abdalla Swikir, Junjun He, Zongyuan Ge, Muhammad Haris Khan, Imran Razzak

机构 * MBZUAI Shanghai AI Laboratory(上海人工智能实验室) DeepGlint Shanghai Jiao Tong University(上海交通大学) Monash University(墨尔本大学)

专题命中 感知 :autonomous driving(abstract);分类 cs.CV

AI总结 本文提出StreamAgent,通过整合问题语义和历史观测,预测关键事件的时间进展,调整感知动作,提升流视频处理的响应准确性和实时效率。

详情

展开后加载摘要…

URL PDF HTML 收藏