arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 7464 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 7464 篇

2608.23965 2026-08-26 cs.CR cs.AI cs.IR cs.LG 新提交 73%

RAGSentinel: Certifiable Geometric Consensus for Robust Retrieval-Augmented Generation

RAGSentinel:用于鲁棒检索增强生成的可验证几何共识

Yueyang Quan, Anjun Gao, Yufei Xia, Minghong Fang, Zhuqing Liu

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究针对RAG系统的中毒攻击漏洞,提出无训练无标签的RAGSentinel防御方法,通过几何共识过滤中毒文档,实验显示其能低攻高保准且抗自适应攻击。

Comments To appear in EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18076 2026-08-26 cs.CV cs.AI 版本更新 73%

From Corpora to Co-Evolving Capabilities: Capability-Centric Data Design for Generalist Image Generation

从语料到协同进化的能力:面向通用图像生成的以能力为中心的数据设计

Xingjian Wang, Zhao Wang, Taihang Hu, Jun Zheng, Zhengrui Chen, Qinye Zhou, Zhengtao Wu, Yongchao Du, Zuan Gao, Chao Lin, Yefeng Shen, Yuan Wang, Xiaoli Xu, Zhengze Xu, Hao Yan, Denghui Yang, Yuhang Yu, Huayu Zhang, Mingzhou Zhang, Mengting Chen

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 该研究提出能力驱动的数据基础设施,构建三类监督引擎,整理大规模图像语料,训练多模态扩散模型,在CPI-Bench等评估中展现良好生成与迁移能力。

Comments 19 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20958 2026-08-24 cs.AI cs.CV 新提交 73%

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

TLive-Omni:面向电商直播的全模态理解模型

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun Liu, Meiguang Jin, Junfeng Ma

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究提出专为电商直播设计的全模态理解模型TLive-Omni,通过引入Per-vGrid等技术,结合多阶段训练流程,在电商直播基准任务上表现强劲且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11260 2026-08-13 cs.AI cs.CV 新提交 73%

Glance, Scrutinize, and Think: Advancing Video Anomaly Detection from Training-Free to Agentic Reasoning

扫视、审视与思考:将视频异常检测从无训练推进到智能体推理

Shibo Gao, Peipei Yang, Xu-Yao Zhang, Linlin Huang

机构 * Beijing Jiaotong University(北京交通大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对视频异常检测的“何时-何事”脱节问题,提出无训练框架GtS及工具增强型智能体方法,扩展基准并引入联合评估指标,实现了更高的异常检测准确性与推理速度。

Comments 34 pages, 8 figures, 8 tables. Journal extension of our AAAI 2026 paper (arXiv:2507.21507)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19180 2026-08-11 cs.CV cs.AI 版本更新 73%

SNR-Edit: Structure-Aware Noise Rectification for Inversion-Free Flow-Based Editing

SNR-Edit: 基于结构的噪声校正用于无反向的流式编辑

Lifan Jiang, Boxi Wu, Yuhang Pei, Tianrun Wu, Yongyuan Chen, Yan Zhao, Shiyu Yu, Deng Cai

机构 * State Key lab of CAD\&CG, Zhejiang University(CAD与CG国家重点实验室,浙江大学) UniTTEC Co. Ltd.(UniTTEC有限公司) Research center, Ningbo Meidong Container Terminal Co.,Ltd.(宁波梅东集装箱码头有限公司研究中心)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 SNR-Edit通过自适应噪声控制实现无反向的流式编辑,提升潜在轨迹的结构保真度,同时保持高效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06076 2026-08-10 cs.AI cs.CV 版本更新 73%

Learning Visual Spatial Planning from Symbolic State via Modality-Gap-Aware Self-Distillation

通过模态差距感知自蒸馏从符号状态学习视觉空间规划

Haocheng Luo, Jiahui Liu, Ruicheng Zhang, Zhizhou Zhong, Jiaqi Huang, Zunnan Xu, Quan Shi, Jun Zhou, Shuiyang Mao, Wei Liu, Xiu Li

机构 * Tsinghua University(清华大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出MGSD两阶段框架,通过冷启动接地和特权教师蒸馏弥合视觉与符号规划之间的模态差距,在视觉规划基准上显著提升性能。

Comments 18 pages, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06075 2026-08-07 cs.CV cs.AI 新提交 73%

Domain-Grounded Candidate Selection for Agentic Image Editing: A Shadow Removal Case

面向智能体图像编辑的领域 grounded 候选选择:以阴影去除为例

Shilin Hu, Jingyi Xu, Dimitris Samaras, Hieu Le

机构 * Stony Brook University(石溪大学) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究以阴影去除为例,提出领域 grounded 的智能体候选选择流程,结合物理原理约束商用视觉-语言模型的生成,在 ShadowRemovalRefine 基准上使 CDD 降低至少 47%,证明经典低级视觉先验仍具实用价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06277 2026-08-07 cs.CV cs.LG 版本更新 73%

Dynamic Object Masks as Goal Representations for Visual Goal-Conditioned Reinforcement Learning

动态目标掩码作为视觉目标条件强化学习的目标表示

Fahim Shahriar, Cheryl Wang, Alireza Azimi, Gautham Vasan, Hany Hamed, Abhishek Naik, A. Rupam Mahmood, Colin Bellinger

机构 * University of Alberta(阿尔伯塔大学) McGill University(麦吉尔大学) University of Ottawa(渥太华大学) AMII CIFAR Canada AI Chair(CIFAR加拿大人工智能主席) Vector Institute(向量研究所)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 该研究针对视觉目标条件强化学习,提出动态目标掩码作为目标表示,结合Detic等预训练检测器生成掩码,在机械臂和仿真导航任务中实现高成功率与高效学习,支持仿真到现实迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01055 2026-08-04 cs.CV cs.AI 新提交 73%

Credit the Right Box: Marginal Contribution Assignment for Structured Visual Perception

为正确的边界框分配信用:结构化视觉感知的边际贡献分配

Xinheng Han, Jianfei Wang, Yu Chen, Xiang Wang, Shuai Li, Weixing Li, Feng Pan

机构 * Amap, Alibaba Group(高德,阿里巴巴集团)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型结构化视觉感知中响应级监督的粒度不匹配问题,提出MCR-GRPO框架,通过边界框级边际贡献分配优化,在多个基准上取得了优于现有GRPO基线的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08340 2026-08-04 cs.CV cs.AI 版本更新 73%

Mastering PokeGym: Graph-Guided Multimodal Evolution at Test Time

PokeGym: 一种以视觉驱动的长周期基准用于视觉-语言模型

Ruizhi Zhang, Ye Huang, Yuangang Pan, Chuanfu Shen, Zhilin Liu, Ting Xie, Haijun Lei, Lixin Duan

机构 * SIAS, UESTC(电子科技大学深圳高等研究院) CFAR/IHPC A*STAR(新加坡科技研究局高性能计算研究所)

专题命中 视觉定位与Grounding :VLM(abstract_cn);grounding(abstract_cn);分类 cs.CV、cs.AI

AI总结 PokeGym通过复杂的3D开放世界游戏评估视觉-语言模型在长周期任务中的表现,揭示了物理死锁恢复是当前模型的主要瓶颈,并发现高级模型存在元认知分歧。

Comments Tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29124 2026-08-03 cs.CV cs.LG 新提交 73%

SciFigPlag-Bench: A Benchmark for Provenance-Aware Scientific Figure Plagiarism Detection

SciFigPlag-Bench:面向来源感知的科学图片抄袭检测基准

Zhiying Cui, Minghao Yang, Linlin Gao, Jie Liu, Pengyuan Li

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出SciFigPlag-Bench基准,用于科学图片的来源感知抄袭检测,含四类任务,实验发现视觉语言模型在细粒度来源推理等方面仍有挑战。

Comments 30 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16311 2026-07-21 cs.CV cs.AI 新提交 73%

Seeing What Is Actually There: PriVE-Bench and PriVE-Tools for Counterfactual Evaluation of Agentic Visual Evidence in VLMs

看清实际存在的东西:用于在视觉语言模型中对代理视觉证据进行反事实评估的PriVE-Bench和PriVE-Tools

Jingyu Sun, Jiachen Tu, Yuyang Xue, Yaoxin Jiang, Guoyi Xu, Zhengtao Yao, Rui Qian, Yizheng Sun, Hongpeng Zhou, Jingyuan Sun, Yan Lin

机构 * The University of Manchester(曼彻斯特大学) The University of Melbourne(墨尔本大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Edinburgh(爱丁堡大学) University of Southern California(南加州大学) Fudan University(复旦大学) University of Newcastle(纽卡斯尔大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文针对视觉语言模型常依先验而非图像回答问题的现象,引入PriVE-Bench和PriVE-Tools。通过配对图像及工具衍生证据评估模型,对比不同输入,发现视觉证据工具在特定情况有帮助,但不能解决所有模型依先验回答的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13712 2026-07-16 cs.CV cs.AI cs.CL cs.MM 新提交 73%

Groc-PO: Grounded Context Preference Optimization for Truthful Multimodal LLMs

Groc-PO:用于真实多模态大语言模型的基于上下文的偏好优化

Zhixiao Zheng, Zheren Fu, Zhiyuan Yao, Chunxiao Liu, Dongming Zhang, Zhendong Mao

机构 * University of Science and Technology of China(中国科学技术大学) Xiaomi Corporation(小米公司) State Key Laboratory of Communication Content Cognition, People’s Daily Online(人民日报社传播内容认知国家重点实验室)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 研究针对多模态大语言模型的不真实问题,提出基于上下文的偏好优化框架Groc-PO,构建相关数据集,通过多阶段偏好样本捕捉基础上下文,加强上下文相关推理,减轻跨阶段错误传播,提升模型性能。

Comments Accepted by ACM-MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24602 2026-07-16 cs.CV cs.AI 版本更新 73%

Correcting Visual Blur Induced by Attention Distraction to Reduce Hallucinations: Algorithm and Theory

纠正注意力分散引起的视觉模糊以减少幻觉:算法与理论

Quanjiang Li, Zhiming Liu, Wei Luo, Tingjin Luo, Chenping Hou

机构 * National University of Singapore(新加坡国立大学) University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文揭示多模态大语言模型中的物体幻觉与类人注意力分散现象相关,并提出一种无需额外训练的注意力聚焦方法(AFIP)通过跨头注意力增强和动态历史注意力强化来纠正视觉模糊,从而减少幻觉。

Journal ref ICML2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01759 2026-07-03 cs.CV cs.AI 新提交 73%

ProCal: Inference-Time Proposal Calibration for Open-Vocabulary Object Detection

ProCal:开放词汇目标检测的推理时提议校准

Jae-Ryung Hong, Ho-Joong Kim, Seong-Whan Lee

机构 * Korea University(高丽大学)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ProCal方法,通过结合定位感知前景分数和背景感知抑制分数计算提议先验,在推理时校准分类分数,提升开放词汇目标检测中未见类别的定位质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01303 2026-07-03 cs.CV cs.AI 新提交 73%

CPG-PAD: Concept-Informed Prompts Guided Presentation Attack Detection

CPG-PAD: 概念引导提示的呈现攻击检测

Haoyuan Zhang, Xiangyu Zhu, Li Gao, Ajian Liu, Siran Peng, Zhen Lei

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统国家重点实验室) China Mobile Financial Technology Co., Ltd.(中移动金融科技有限公司) Centre for Artificial Intelligence and Robotics, Hong Kong Institute of Science and Innovation, Chinese Academy of Sciences(中国科学院香港创新研究院人工智能与机器人创新中心) School of Computer Science and Engineering, the Faculty of Innovation Engineering, Macau University of Science and Technology(澳门科技大学创新工程学院计算机科学与工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出概念引导提示的呈现攻击检测框架,通过可解释AI发现攻击相关视觉概念并注入提示空间,提升跨域泛化能力,在多个基准数据集上达到最优。

Comments Accepted by IEEE Transactions on Information Forensics & Security (TIFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27876 2026-07-01 cs.CV cs.AI 新提交 73%

SpatialUAV: Benchmarking Spatial Intelligence for Low-Altitude UAV Perception, Collaboration, and Motion

SpatialUAV:低空无人机感知、协作与运动的空间智能基准

Haoyu Zhang, Meng Liu, Qianlong Xiang, Kun Wang, Yaowei Wang, Liqiang Nie

机构 * IEEE

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SpatialUAV基准,包含4331个实例和14种任务类型,评估低空无人机在语义判别、空间关系、多视角协作及运动理解等方面的空间智能,发现现有模型在跨视角关联、结构化定位、几何推理和时间理解上远逊于人类。

Comments 10 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00263 2026-07-01 cs.CV cs.LG cs.NE 版本更新 73%

Room Scene Discovery and Grouping in Unstructured Vacation Rental Image Collections

非结构化度假租赁图像集合中的房间场景发现与分组

Vignesh Ram Nithin Kappagantula, Shayan Hassantabar

机构 * Expedia Group(Expedia集团)

专题命中 视觉定位与Grounding :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 针对度假租赁平台图片缺乏结构化分类的问题,提出一种低延迟、样本高效的机器学习流水线,通过监督式房间类型检测、重叠检测和聚类算法实现房间分组,并利用多模态大语言模型识别床型,显著优于对比学习和预训练嵌入聚类方法。

Comments Presented at the Two-sided Marketplace Optimization Workshop, KDD 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27596 2026-06-29 cs.CV cs.AI 新提交 73%

Dismantling Pathological Shortcuts: A Causal Framework for Faithful LVLM Decoding

拆除病理性捷径:忠实LVLM解码的因果框架

Liu Yu, Can Chen, Ping Kuang, Zhikun Feng, Fan Zhou, Gillian Dobbie

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出Fox框架,通过视觉注意力熵探针定位风险中介头,利用数值logit饱和进行因果干预,并结合冲突门控协同解码,消除视觉语言模型中的对象幻觉,实现忠实解码。

Comments 29 pages, 25 figures. Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26443 2026-06-26 cs.RO cs.AI cs.CV 新提交 73%

WatchAct: A Benchmark for Behavior-Grounded Robot Manipulation

WatchAct: 行为引导的机器人操作基准

Baiqi Li, Ce Zhang, Yu Fang, Yue Yang, Shangzhe Li, Mingyu Ding, Gedas Bertasius

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出WatchAct基准,通过人类行为视频与指令配对,评估机器人对观察行为的推理能力,涵盖事件解析、程序推理、意图推断和情景记忆四个认知维度,实验显示现有系统性能远低于人类。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26387 2026-06-26 cs.CV cs.CL cs.LG 新提交 73%

Staying VIGILant: Mitigating Visual Laziness via Counterfactual Visual Alignment in MLLMs

保持VIGILant:通过多模态大语言模型中的反事实视觉对齐缓解视觉懒惰

Xi Xiao, Chen Liu, Chih-Ting Liao, Yunbei Zhang, Qizhen Lan, Yuxiang Wei, Lin Zhao, Janet Wang, Jianyang Gu, Muchao Ye, Tianyang Wang, Hao Xu

机构 * UAB(阿拉巴马大学伯明翰分校) Yale(耶鲁大学) UNSW(新南威尔士大学) Tulane(杜兰大学) Georgia Tech(佐治亚理工学院) NEU(东北大学) OSU(俄亥俄州立大学) UIowa(爱荷华大学) Harvard(哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 提出VIGIL框架,通过强化学习后训练最大化视觉输入与生成响应间的互信息,惩罚“盲目自信”实例,有效缓解MLLMs的视觉懒惰问题,在幻觉和推理基准上优于现有方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25894 2026-06-25 cs.CV cs.AI 新提交 73%

Enhancing Brain MRI Anomaly Detection and Reasoning with ROI Rethink and Synthetic Data

通过ROI重思考与合成数据增强脑部MRI异常检测与推理

Shangkun Li, Jie Xu, Yi Guo, Zeju Li, Yuanyuan Wang

机构 * College of Biomedical Engineering, Fudan University(复旦大学 生物医学工程学院)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出BrReMark框架,通过显式区域标记和假设验证机制增强脑部MRI诊断的可信度,结合结构化推理轨迹的监督微调和强化学习,以及基于域随机化的病理合成增强,显著提升定位精度并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23888 2026-06-24 eess.IV cs.AI cs.CV 新提交 73%

E-MRL: Cross-view Aligned Evidence-driven Multimodal Reinforcement Learning for Reliable 3D Tumor Analysis

E-MRL: 跨视图对齐的证据驱动多模态强化学习用于可靠的3D肿瘤分析

Sijing Li, Zhongwei Qiu, Zhuoya Wang, Boxiang Yun, Zhenyu Yi, Jianwei Xu, Wenqiao Zhang, Yingda Xia, Ling Zhang

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里巴巴集团达摩院) Hupan Lab(华平实验室) Huazhong University of Science and Technology(华中科技大学) East China Normal University(华东师范大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出跨视图对齐的证据驱动多模态强化学习框架E-MRL,通过将生成过程建模为“诊断-定位-验证”的马尔可夫决策过程,并引入跨视图一致性奖励,减少视觉幻觉并提升3D CT肿瘤诊断准确性。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21419 2026-06-23 cs.CV cs.AI 新提交 73%

MIRCaps: A Large-Scale Mixed-Domain Dataset with Image-Level and Region-Level Captions for Fine-Grained Vision-Language Learning

MIRCaps: 一个大规模混合域数据集,包含图像级和区域级描述,用于细粒度视觉-语言学习

Arlindo Luciano Tulumba Roberto, Hyungjoon Kim

机构 * Changwon National University(昌原国立大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 为解决通用与监控视频领域的混合域图像-描述数据集匮乏问题,构建了包含14万图像、98万图像级描述、174万区域级描述和139万边界框的大规模数据集,通过互补描述类型帮助视觉语言模型学习细粒度视觉属性,并在图像描述和目标检测任务上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02469 2026-06-23 cs.RO cs.AI cs.CL cs.CV 版本更新 73%

SIMSplat: Language-Aligned 4D Gaussian Splatting for Driving Scenario Generation

SIMSplat: 面向驾驶场景生成的语言对齐4D高斯泼溅

Sung-Yeon Park, Adam Lee, Juanwu Lu, Can Cui, Luyang Jiang, Rohit Gupta, Kyungtae Han, Ahmadreza Moradipari, Ziran Wang

机构 * Purdue University(普渡大学) University of California, Berkeley(加州大学伯克利分校) Toyota InfoTech Labs(丰田信息科技实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出SIMSplat,一种基于场景图的4D高斯泼溅框架,通过嵌入语言对齐特征实现自由文本查询、对象级编辑和多智能体仿真,在驾驶场景生成中显著提升定位精度和任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00344 2026-06-16 cs.CV cs.AI cs.CL 版本更新 73%

When RAG Hurts: Diagnosing and Mitigating Attention Distraction in Retrieval-Augmented LVLMs

当RAG有害:诊断和缓解检索增强LVLMs中的注意力分散

Beidi Zhao, Wenlong Deng, Xinting Liao, Yushu Li, Nazim Shaikh, Yao Nie, Xiaoxiao Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文发现检索增强生成(RAG)在LVLMs中导致注意力分散(AD)问题,即检索文本抑制视觉注意力并偏离问题相关区域,提出MAD-RAG方法通过双问题公式和注意力混合来解耦视觉定位与上下文整合,在三个基准上提升性能并纠正大部分失败案例。

Comments 19 pages, 13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11459 2026-06-11 cs.CL cs.AI cs.LG 新提交 73%

APEX: Automated Prompt Engineering eXpert with Dynamic Data Selection

APEX: 具有动态数据选择的自动提示工程专家

Fei Wang, Si Si, Cho-Jui Hsieh, Inderjit S. Dhillon

机构 * Google(谷歌) UCLA(加州大学洛杉矶分校)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出APEX框架,通过动态数据分层(易、难、混合)优先选择高杠杆子集,在固定预算下提升提示优化效率,在三个基准上平均提升11.2%和6.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08868 2026-06-02 cs.LG cs.AI 73%

AnomSeer: Reinforcing Multimodal LLMs to Reason for Time-Series Anomaly Detection

AnomSeer: 增强多模态大语言模型进行时间序列异常检测的推理能力

Junru Zhang, Lang Feng, Haoran Shi, Xu Guo, Han Yu, Yabo Dong, Duanqing Xu

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出AnomSeer,通过专家思维链和基于最优传输的时间序列接地策略优化,增强多模态大语言模型在时间序列异常检测中的细粒度推理能力,统一异常分类、定位和解释。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11723 2026-05-29 cs.CV cs.AI 73%

CaC: Advancing Video Reward Models via Hierarchical Spatiotemporal Concentrating

CaC:通过分层时空聚焦推进视频奖励模型

Jiyuan Wang, Huan Ouyang, Jiuzhou Lin, Chunyu Lin, Dewen Fan, Boheng Zhang, Haonan Fan, Fei Zuo, Jia Sun, Huaiqing Wang, Honglie Wang, Yiyang Fan, Zhenlong Yuan, Zijun Li, Yongrui Heng, Guosheng Lin, Fan Yang, Tingting Gao

机构 * BJTU(北京工业大学) NTU(国立台湾大学) BUPT(北京邮电大学) Kuaishou Technology(快手科技)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 提出基于视觉语言模型的粗到细异常奖励模型CaC,通过全局时间扫描、局部空间定位和结构化时空思维链推理,结合大规模生成视频异常数据集和三阶段渐进训练,显著提升细粒度异常检测精度并减少生成视频异常。

Comments 27 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24008 2026-05-26 cs.LG cs.CV cs.SE 73%

CAFD: Concept-Aware DNN Fault Detection using VLMs

CAFD: 使用视觉语言模型的概念感知深度神经网络故障检测

Amin Abbasishahkoo, Mahboubeh Dadkhah, Lionel Briand

机构 * School of EECS, University of Ottawa(渥太华大学电子工程与计算机科学学院) Research Ireland Lero centre for software, University of Limerick(利默尼克大学爱尔兰研究中心)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 提出概念感知故障检测(CAFD)方法,通过整合模型信号、距离特征和基于视觉语言模型的概念故障比(CFR)特征,在保持效率的同时显著提升DNN故障检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏