arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-24 至 2026-08-24 共收录 29 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 29 篇

2608.20720 2026-08-24 cs.CV 新提交 93%

AffordAny: Open-World 3D Affordance Grounding from Monocular RGB Images via Vision-Language-Guided Geometric Reasoning

AffordAny:基于单目RGB图像的开放世界3D affordance grounding,通过视觉-语言引导的几何推理实现

Junqi Wu, Kaihua Tang, Xuanwen Chen, Hongzhi Li, Jianqiang Huang, Xian-Sheng Hua

专题命中 视觉定位与Grounding :grounding(title,title_cn);VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 AffordAny是端到端框架,通过单目RGB图像结合VLM引导解码器与伪标签自训练,实现开放世界3D affordance grounding,在未见对象、类别等评估中表现出有效性与鲁棒性。

Comments The code and dataset are publicly available. Code: this https URL (https://github.com/lzlfwow/AffordAny). Dataset: this https URL (https://modelscope.cn/datasets/lzlfwow/AffordAny)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21244 2026-08-24 cs.CV 新提交 91%

A VLM Answer Is Not an Anomaly Score: Rank Compression in Training-Free Video Anomaly Detection

VLM 的回答并非异常分数:无训练视频异常检测中的排名压缩

Inpyo Song, Jangwon Lee

机构 * SungKyunKwan University(成均馆大学)

专题命中 视觉定位与Grounding :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对基于VLM的无训练视频异常检测,发现生成式回答读出存在排名压缩问题,提出概率读出方法可提升性能,证明回答接口是该类检测器的关键组成部分。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21180 2026-08-24 eess.IV cs.CV 新提交 89%

Toward Vision Language Model-based Assessment of Clinical Quality and Usability of LGE-MR Images for Cardiac Ablation Planning

面向基于视觉语言模型的LGE-MR图像临床质量与可用性评估以用于心脏消融规划

Bipasha Kundu, Abhishek Chaturvedi, Axel W. E. Wismueller, Richard Simon, Cristian A. Linte

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision language model(title,abstract);分类 cs.CV

AI总结 本研究提出两阶段VLM框架用于左心房LGE-MRI的临床导向图像质量评估,在60个图像切片-文本对数据集上,InternVL2的标准级准确率最高,DeepSeek实现完美临床可用性一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20534 2026-08-24 cs.CV 新提交 87%

Grounded-Exo2Ego: Structured Semantic Grounding for Robust Exocentric-to-Egocentric Video Generation

Grounded-Exo2Ego:用于鲁棒外部视角到自我视角视频生成的结构化语义 grounding

Shengze Wang, Michael Stengel, Tianye Li, Seonwook Park, Amrita Mazumdar, Koki Nagano, Alex Trevithick, Shalini De Mello

机构 * NVIDIA(英伟达)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文提出Grounded-Exo2Ego框架,通过双分支视频扩散模型、相机重定位算法和自动合成数据引擎,在EgoExo4D数据集上大幅提升了外部视角到自我视角视频生成的性能。

Comments website url: this https URL (https://research.nvidia.com/labs/amri/projects/grounded-exo2ego/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17633 2026-08-24 cs.RO 版本更新 83%

OVIP-SG: Open-Vocabulary Instance-Preserving Scene Graphs for Mapping and Retrieval of Small, Fine-Grained Objects

OVIP-SG:用于小型细粒度物体映射与检索的开放词汇实例保留场景图

Tianjing Hao, Haiyu Lan, Angsong Li, Cheng Chen, Enyu Li, Jiarui Yang, Yuning Su, Peiwen Lin, Wang Chuang

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);vision-language model(abstract)

AI总结 本文提出OVIP-SG框架,通过VLM等技术实现小型细粒度物体的实例保留映射与语言引导检索,在Replica数据集上的多项指标优于现有方法,且经实际机器人实验验证有效。

Comments 15 pages, 6 figures, including appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20392 2026-08-24 cs.CL cs.AI 新提交 79%

Evaluation-as-Search: Adaptive Discovery of Grounding Failures in Meeting Assistants

评估即搜索:会议助手接地故障的自适应发现

Sami Khairy, Yasaman Hosseinkashi, Vishak Gopal, Ross Cutler

机构 * Microsoft(微软公司)

专题命中 视觉定位与Grounding :grounding(title,abstract);分类 cs.AI

AI总结 本文提出EaS方法构建MeetingProbe基准,发现会议助手故障多源于话语语用挑战,其自适应搜索比随机探测的故障发现率高2.5倍,且公开了该基准以支持可复现评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20405 2026-08-24 cs.CL 新提交 78%

ARGUS: Theory-of-Mind Guided Argument Generation with Strategy-Aware Planning and Knowledge Grounding

ARGUS:基于心理理论(Theory-of-Mind)的论证生成,结合策略感知规划与知识接地

Zhe Hu

机构 * InspireOmni AI The Hong Kong Polytechnic University(香港理工大学)

专题命中 视觉定位与Grounding :grounding(title,abstract)

AI总结 该研究提出基于智能体的Argus框架,结合心理理论推理、策略感知规划等,在三个基准上优于基线,可有效改变抗拒受众立场。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20492 2026-08-24 cs.CV 新提交 77%

Annotations as Rollouts: Efficient and Scalable Reinforcement Learning for Video MLLMs

以标注为回滚:面向视频多模态大语言模型的高效可扩展强化学习

Yunheng Li, Guohong Mu, Hao Li, Shengsheng Qian, Dingwen Zhang, Qibin Hou, Ming-Ming Cheng

机构 * Nankai University(南开大学) Northwestern Polytechnical University(西北工业大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) NKIARI

专题命中 视觉定位与Grounding :MLLM(summary_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出OraRL算法,将标注作为神谕回滚解耦优势估计,实现高效可扩展的视频MLLM强化学习,在多项视频感知基准上超越现有模型,解码速度大幅提升。

Comments Project page: this https URL (https://orarl.github.io/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20844 2026-08-24 cs.AI 新提交 74%

TRACE: Agentic Catalog Enrichment with Multi-source Evidence Grounding

TRACE:基于多源证据锚定的智能体式商品目录丰富

Rohan Kumar, Steven Xu, Kyle MacDonald, Matthew Long, Bernice Chow, Mac VanRenterghem, Sudeep Das

机构 * DoorDash(多闸道科技(DoorDash))

专题命中 视觉定位与Grounding :grounding(title);分类 cs.AI

AI总结 针对电商商品目录属性稀疏问题,提出基于LLM的TRACE框架,经离线评估、生产部署及在线实验验证,可高效提升目录属性丰富的准确率、覆盖率及结账转化率。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20958 2026-08-24 cs.AI cs.CV 新提交 73%

TLive-Omni: An Omni-Modal Understanding Model for E-Commerce Live Streaming

TLive-Omni:面向电商直播的全模态理解模型

Yibo Hu, Yu Qian, Mao Gu, Yingfan Tao, Yuhao Chen, Yongdong Luo, Zhuoqun Liu, Meiguang Jin, Junfeng Ma

机构 * Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究提出专为电商直播设计的全模态理解模型TLive-Omni,通过引入Per-vGrid等技术,结合多阶段训练流程,在电商直播基准任务上表现强劲且泛化能力出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21031 2026-08-24 cs.RO 新提交 71%

PhysCaP: Grounding Code-as-Policy Agent with Physics-Informed Exploration

PhysCaP:基于物理引导探索的代码即策略智能体

Chen-Yu Lin, Jing-Wen Chen, Hsueh-En Chang, Hung-An Chen, Sheng-Hsun Chang, Chi-Pin Huang, Fu-En Yang, Min-Hung Chen, Yi-Ting Chen, Yu-Chiang Frank Wang, Shao-Hua Sun

机构 * National Taiwan University(台湾大学) NVIDIA Research(英伟达研究院) National Yang Ming Chiao Tung University(国立阳明交通大学)

专题命中 视觉定位与Grounding :grounding(title)

AI总结 PhysCaP是一种带物理引导探索层的代码即策略智能体,采用双智能体设计,可高效估算物体物理属性,在桌面操纵及LIBERO模拟任务中性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20831 2026-08-24 cs.CL cs.AI 新提交 70%

STAR-OPD: Structured Aspect-Cascade-Aware On-Policy Reward Distillation for ABSA Quadruple Extraction

STAR-OPD:面向ABSA四元组抽取的结构化级联感知在线策略奖励蒸馏

Tong Sun, Mingyang Ma, Jiayang Yu

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究针对ABSA四元组抽取中蒸馏模型的结构错误问题,提出STAR-OPD方法,通过在线策略蒸馏结合级联感知集结构奖励,在多个数据集上优于基线,缩小了学生-教师差距并提升了推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 67%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 视觉定位与Grounding :grounding(abstract,abstract_cn)

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13798 2026-08-24 cs.CV cs.AI cs.LG 版本更新 67%

CFM: Language-aligned Concept Foundation Model for Vision

CFM:面向视觉的语言对齐概念基础模型

Kai Wittenmayer, Sukrut Rao, Amin Parchami-Araghi, Bernt Schiele, Jonas Fischer

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 CFM提出一种语言对齐的概念基础模型,提供细粒度可解释的概念,提升视觉任务的解释能力,实现分类、分割和描述生成的高性能表现。

Comments Accepted as a Spotlight at ECCV 2026. Corrected inaccuracies in equation 3,4 and B.8. 58 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21067 2026-08-24 cs.CV cs.AI 新提交 62%

AT-ViT: Area-Targeted Multi-View Vision Transformer with Cross-Attention and Multi-Scale Patching for Plant Trait Recognition in Herbarium Images

AT-ViT:面向标本馆图像植物性状识别的区域定向多视图视觉Transformer,融合交叉注意力与多尺度分块技术

Amani Sedrat, Takieddine Chehhat, Youcef Sklab, Hanane Ariouat, Abderrazak Sebaa, Eric Chenin, Jean-Daniel Zucker, Edi Profiti

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对标本馆图像植物性状识别的背景干扰问题,提出双分支视觉Transformer模型AT-ViT,通过交叉注意力与掩码引导分块加权机制提升植物区域注意力,在多任务中实现准确率与鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20690 2026-08-24 cs.CV cs.AI 新提交 62%

Identity-Aware Human-Object Interaction Motion Captioning

身份感知的人-物交互动作描述

Yiming Wang, Yonghao Dang, Huilai Li, Jiawei Tu, Jianqin Yin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 针对现有HOI动作描述未关联主体身份的局限,提出身份感知HOI动作描述任务,构建ID-HOINet模型,含MVIML与TSCR组件,在BEHAVE和InterCap数据集上实现SOTA性能。

Comments 9 pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20607 2026-08-24 cs.CL cs.AI cs.LG 新提交 62%

JuryProbe: An Empirical Consensus-Risk Diagnostic for Routing Reference-Free Factuality Judge Panels to Grounded Verification

JuryProbe:用于将无参考事实性评判小组路由至基于事实的验证的经验共识风险诊断方法

Tianxin Zhou, Ruixi Lin

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 针对无参考事实性LLM评判小组的共识风险诊断方法JuryProbe,通过校准路由策略减少假阴性盲区导致的错误,在FEVER数据上验证了其有效性,可降低假接受并减少参考获取。

Comments 22 pages, 1 figure, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21230 2026-08-24 cs.CR cs.AI 新提交 57%

Utility Under Attack: Agent Memory Poisoning and the Limits of Content Screening and Provenance Ranking

受攻击下的效用:智能体记忆投毒及内容筛选与来源排序的局限性

Arulnidhi Karunanidhi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究针对智能体记忆投毒问题,测试了内容筛选和来源排序的防御效果,发现仅内容筛选无法抵御投毒,来源加权检索也存在局限,主张采用有限占用约束并发布了相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20754 2026-08-24 cs.CV 新提交 57%

SPARK-SAM: Self-Prompt Adaptation with Response Knowledge for SAM in Infrared Small Target Segmentation

SPARK-SAM:面向红外小目标分割SAM的、基于响应知识的自提示适配

Aji Mao, Zhenming Peng, Bailin Mu, Tian Pu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 针对SAM直接迁移至红外小目标分割存在的提示-响应不匹配问题,提出SPARK-SAM方法,仅增0.726M参数即实现高IoU,在两个基准上排名第一。

Comments 9 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20713 2026-08-24 cs.CV 新提交 57%

AGIDefect-4K: A Richly Annotated Dataset for AI-Generated Image Defect Detection, Localization and Explanation

AGIDefect-4K:用于AI生成图像缺陷检测、定位与解释的富标注数据集

Xiangfei Sheng, Weidong Zou, Tianjiao Gu, Zhichao Yang, Pengfei Chen, Leida Li

机构 * Xidian University(西安电子科技大学)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);分类 cs.CV

AI总结 本文推出含4000张图像的AGIDefect-4K数据集,并提出基于多模态大语言模型的AGIDA基准框架,用于AGI缺陷检测、定位、解释及质量预测,凸显了AGI缺陷理解研究的价值。

Comments 8 pages, 6 figures. Accepted by ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20393 2026-08-24 cs.CL cs.AI 新提交 57%

Knowledge-Graph-Gated Defactualization for Style-Controllable and Fact-Preserving Generation in Agentic Conversational AI

面向智能体对话AI的风格可控且事实保留生成的知识图谱门控去事实化方法

Tanmay Kumar Shrivastava, Darsh Rohit Nandu, Rajesh Kumar Mundotiya

机构 * Indian Institute of Technology (IIT) Bhilai(印度比莱印度理工学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 针对智能体对话AI的事实保留与风格可控生成需求,提出DSR知识工程框架,结合KG与激活引导,在LLaMA系列模型上验证其可提升实体恢复率并保持风格控制,无需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11238 2026-08-24 cs.AI 版本更新 57%

Towards Query-Agnostic RAG Evaluation via Query Coverage and Claim Verifiability

面向查询不可知的RAG评估:基于查询覆盖率与声明可验证性

Jeonghwan Choi, Taewon Yun, Minjeong Ban, Gyeonghun Sun, Jae-Gil Lee, Hwanjun Song

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出Q-CARE框架,通过分解查询与答案实现RAG的细粒度评估,在8个数据集的基准测试中,其评估结果与人工判断的相关性优于现有4种RAG评估指标。

Comments Accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13988 2026-08-24 cs.AI 版本更新 57%

Recognizing Artificial Minds: A Philosophical Defense of AI Cognition

识别人工心智:对AI认知的哲学辩护

Herman Cappelen, Josh Dever

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 该研究为“全猪论题”辩护,主张LLMs是具备认知状态的成熟智能体,反驳相关质疑并推测其可能拥有人类概念体系外的内容。

Comments Pre-publication draft. Forthcoming as Open Access from Oxford University Press. Please cite the OUP version when available. Note title change: previously, "Going Whole Hog: A Philosophical Defence of AI Cognition"

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20412 2026-08-24 q-bio.GN 新提交 50%

PEN-STACK: A non-fabricating tool layer for language-model agents in genome writing

PEN-STACK:用于基因组写作的语言模型智能体的非制造工具层

Anees Ahmed Mahaboob Ali, Radhakrishnan Delhibabu, Everette Jacob Remington Nelson

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本研究提出PEN-STACK工具层,为基因组写作的语言模型智能体提供可靠来源的工具,可消除数量伪造,经测试能提升生物安全,为智能体基因组工程系统提供了开源基底。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21035 2026-08-24 cs.RO 新提交 50%

TaPeR: Probabilistic Recovery of Sparse Task Precedence Graphs from a Handful of Demonstrations

TaPeR:从少量演示中概率恢复稀疏任务优先关系图

Adrian Röfer, Karla Stepanova, Abhinav Valada

机构 * University of Freiburg(弗莱堡大学) Czech Technical University(捷克技术大学) Czech Institute of Informatics, Robotics, and Cybernetics(捷克信息学、机器人学与控制论研究所)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 TaPeR方法仅用运动学图和物体位姿分布,从少量演示中恢复更准确的稀疏任务优先关系图,可生成机器人的多种有效执行顺序。

Comments 8 pages, 5 figures, 3 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20356 2026-08-24 cs.DB 新提交 50%

Disentangling Structure and Semantics: How Schema Representation Affects LLM-Based SQL Generation

解耦结构与语义:模式表示如何影响基于大语言模型(LLM)的SQL生成

Daniel Yitian Su, Sophie Yiran Su, Qiang Sun, Yihao Ding, Wei Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文通过6×3析因实验发现,基于LLM的文本转SQL中,语义线索对性能的影响大于结构线索,有意义的标识符可弥补结构缺失,而丰富结构元数据无法改善名称不明确的情况。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19056 2026-08-24 math.AT 版本更新 50%

Relative Obstructions and Spectral Diagnostics for Sheaves on Cell Complexes

相对障碍与谱诊断:关于细胞复形上sheaves的分析

Shinobu Yokoyama

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出了一种基于sheaf理论和谱分析的框架,用于评估结构不一致的相对障碍,通过谱特征识别不一致的性质和位置。

Comments 8 pages. Presented at the Finland-Japan Workshop in Industrial and Applied Mathematics 2026. v3: Substantially revised and corrected. Previous claims on spectral interleavings and cone reduction are removed. The cone-kernel statement is recast via the standard mapping-cone long exact sequence, and the paper is reframed as a methodological and computational application

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22194 2026-08-24 math.OC 版本更新 50%

Stability Analysis of an Integrated Multistage Stochastic Programming and Markov Decision Process Problem

一个集成多阶段随机规划与马尔可夫决策过程问题的稳定性分析

Zhiyao Yang, Zhiping Chen, Huifu Xu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 研究集成MSP-MDP框架下的动态决策过程,通过推导动态嵌套重构、函数性质及误差界来研究内、外生不确定性概率分布扰动下的稳定性,结果与现有不同,为相关模型提供新理论基础。

Comments 68 pages, revised manuscript with corrections and clarifications to the model formulation, theoretical analysis, proofs, and examples

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12536 2026-08-24 cs.DB cs.DS cs.IR 版本更新 50%

jXBW: A Compressed Index Enabling Structure-Aware JSONL Retrieval for Structured RAG

jXBW: 面向结构化RAG中结构感知JSONL检索的压缩索引

Yasuo Tabei

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 提出jXBW压缩索引,通过合并树表示、基于扩展Burrows-Wheeler变换的简洁树索引和三阶段子结构搜索算法,实现查询依赖的复杂度,在百万级JSONL数据集上比最强基线快16倍至2800倍。

详情

展开后加载摘要…

URL PDF HTML 收藏