arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-26 至 2026-08-26 共收录 90 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 6 篇

2608.24302 2026-08-26 cs.AI 新提交 89%

VideoHarness-RSI: Recursive Harness Self-Improvement for Long-Video Understanding with Frozen Vision-Language Models

VideoHarness-RSI:基于冻结视觉语言模型的长视频理解的递归 harness 自改进方法

Guoyang Xu, Hao Chen

机构 * Tencent(腾讯)

专题命中 视觉问答 :VLM(summary_cn,abstract);vision-language model(title,abstract);分类 cs.AI

AI总结 该研究提出 VIDEOHARNESS-RSI,通过递归搜索可执行上下文构建程序,在冻结 VLM 上实现长视频理解的改进,且所选 harness 可迁移至其他长视频基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24325 2026-08-26 cs.AI 新提交 85%

SonarLLM: A Native Sonar--Optical Multimodal Large Language Model for Underwater Perception

SonarLLM:一种用于水下感知的原生声呐-光学多模态大语言模型

Cong Su, longxuan ma, Ling Dong, Guofeng Tang, Weijie Yin, Haohui Chen, Zhengtao Yu

机构 * Faculty of Information Engineering and Automation, Kunming University of Science and Technology(昆明理工大学信息工程与自动化学院) Yunnan Key Laboratory of Artificial Intelligence(云南省人工智能重点实验室)

专题命中 视觉问答 :multimodal large language model(title);MLLM(abstract,abstract_cn);visual question answering(abstract);分类 cs.AI

AI总结 针对现有多模态大语言模型不适用于水下声呐-光学感知的问题,提出SonarLLM模型,结合专用编码器与分层融合机制,在SonarBench基准上实现了优异的水下感知性能,凸显了声呐的互补价值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24011 2026-08-26 cs.CL cs.AI 新提交 70%

SAGE: From Direct Answering to Evidence-Grounded Inference for Chinese Ancient Document Understanding

SAGE:面向中国古代文献理解的从直接回答到证据导向推理

Yuchuan Wu, Xuan Luo, Yinglian Zhu, Meng Fang, Xiangyang Xue, Bin Li

机构 * Fudan University(复旦大学) University of Liverpool(利物浦大学)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 针对现有大型视觉语言模型(LVLMs)在古代文献理解中证据支撑不足的问题,本文提出SAGE多智能体框架,通过多阶段证据导向推理实现任务规划、证据获取与验证,在AncientDoc基准上优于基线,搭载Qwen3.5-9B的SAGE性能超更大单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12202 2026-08-26 cs.PL cs.AI cs.CR cs.LG 版本更新 62%

Quasar: A Programming Language Specialized for LLM Code Actions

Quasar:一种专门用于LLM代码操作的编程语言

Stephen Mell, Botong Zhang, David Mell, Shuo Li, Ramya Ramalingam, Nathan Yu, Stephan Zdancewic, Osbert Bastani

专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出专门用于LLM代码操作的编程语言Quasar,通过分离内部代码与外部调用实现新特性,还实现了访问控制、自动并行化、共形预测等增强代码操作的特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24134 2026-08-26 cs.CV 新提交 57%

EgoErrorVQA: Assess Egocentric Comprehension Capabilities through Procedural Errors for Ego-Agentic AI

EgoErrorVQA:通过程序错误评估自我主体人工智能的以自我为中心的理解能力

Junlong Li, Junxi Li, Jianjun Gao, Chen Cai, Lap-Pui Chau, Yi Wang

机构 * The Hong Kong Polytechnic University(香港理工大学) Nanyang Technological University(南洋理工大学)

专题命中 视觉问答 :visual language model(abstract);分类 cs.CV

AI总结 针对现有视觉智能体和VLMs忽略以自我为中心视角评估程序理解能力的问题,本文提出EgoErrorVQA任务,开发基于A2A协议的评估智能体,引入Ego-ADR框架提升模型对程序错误的理解,取得良好效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24221 2026-08-26 cs.SE cs.CL cs.PL 新提交 50%

DeepRepoQA: Code Repository Question Answering with Deep Agent Exploration

DeepRepoQA:基于深度智能体探索的代码仓库问答系统

Weihan Peng, Yuling Shi, Yingwei Ma, Longfei Yun, Beijun Shen, Xiaodong Gu

专题命中 视觉问答 :grounding(abstract)

AI总结 针对现有代码仓库问答方法缺乏深度推理能力的问题,提出基于LLM智能体与蒙特卡洛树搜索的DeepRepoQA框架,在SWE-QA基准上实现了性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 16 篇

2608.21170 2026-08-26 cs.CV cs.AI 版本更新 91%

Is Visual Prompting All You Need? Studying VLM Spatial Reasoning under Progressive Visual Scaffolds

视觉提示就足够了?研究渐进式视觉支架下视觉语言模型的空间推理能力

Lars Benedikt Kaesberg, Tianyu Yang, Florian Valentin Wunderlich, Terry Ruas, Daniel Kurzawe, Jan Philip Wahle, Bela Gipp

专题命中 视觉推理 :VLM(title,summary_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对 VLMs 的空间推理问题,在 SPaRC 基准中引入轻量视觉支架,可提升 VLMs 任务准确率并补充 GRPO 训练,揭示视觉呈现对 VLM 基准测量属性的关键作用。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24040 2026-08-26 cs.LG 新提交 90%

PinSieve: Production Selective VLM Serving and a Governed Memory Flywheel for Enterprise Content-Quality Triage

PinSieve:面向企业内容质量分类的生产级选择性VLM服务及受控内存飞轮

Chuqing Gao, Yuanfang Song, Jonathan Zhang, Yifan Wu, Vishwakarma Singh, Qinglong Zeng, Andrey Gusev

专题命中 视觉推理 :VLM(title,title_cn);分类 cs.LG

AI总结 本文提出PinSieve,即面向企业内容质量分类的选择性VLM服务智能体,结合受控内存飞轮维护机制,提升审核效率、降低成本并改善信号交付,具有任务可迁移性。

Comments Accepted at the KDD 2026 workshop "Enterprise AI Agents: From Prototypes to Production."

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24430 2026-08-26 cs.CV 新提交 89%

Vision Language Model Fusion for Explainable Face Recognition

用于可解释人脸识别的视觉语言模型融合

Ana Estrada-Real, Lydia Alapatt, Christoph Busch, Christian Rathgeb

机构 * Hochschule Darmstadt(达姆施塔特应用科学大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision language model(title);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出多视觉语言模型(VLM)融合框架,结合相似度分数、文本解释与人脸图像,提升了人脸识别准确率,同时生成更丰富稳健的可解释决策,助力开发负责任的可解释人脸识别系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14026 2026-08-26 cs.CE 版本更新 85%

MMDynOpt-Agent: Dynamic Optimization for Multimodal Large Language Model Reasoning via Reinforcement Learning

MMDynOpt-Agent:基于强化学习的多模态大语言模型推理动态优化方法

Wenjin Liu, Haoran Luo, Fayuan Ke, Zhenghong Lin, Yue Lu, Zhe Cui, Anh Tuan Luu, Carl Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn)

AI总结 该研究针对多模态大语言模型推理效率不足的问题,提出MMDynOpt-Agent,通过强化学习将多模态推理动态优化建模为马尔可夫决策过程,结合多轮优化提示与多维度奖励机制,在15个公开数据集上性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24535 2026-08-26 cs.CV cs.HC 新提交 84%

VizAnchor: Decoding Manipulation Intent from Tampering Visualizations via Dual-Anchor Reasoning

VizAnchor:通过双锚推理从篡改可视化中解码操纵意图

Xiaotian Zhang, Huayuan Ye, Haiyang Zhang, Chenhui Li, Changbo Wang, Sicheng Song

机构 * School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院) Division of Emerging Interdisciplinary Areas, The Hong Kong University of Science and Technology(香港科技大学新兴跨学科领域分部) School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出VizAnchor框架,通过双锚构建与VLM推理实现可视化操纵理解,含三个专用智能体,构建相关数据集,可准确定位篡改并生成忠实解释。

Comments 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23974 2026-08-26 cs.CV cs.MM 新提交 84%

Boot-and-Feedback Framework for Generalist-Expert Model Collaboration in Breast Ultrasound Diagnosis

用于乳腺超声诊断的通才-专家模型协作的引导与反馈框架

Ming Cheng, Hongyu Sun, Zhaolin Chen, Jun Liu, Hossein Rahmani, Qiuhong Ke

机构 * Monash University(莫纳什大学) Renmin University of China(中国人民大学) Lancaster University(兰卡斯特大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对乳腺超声诊断中深度学习的可靠性与可解释性难题,提出BooF框架实现MLLM与专家模型协作,经多数据集验证其性能优于现有最优方法。

Comments 5 pages, 2 figures. Published in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19261 2026-08-26 cs.CV cs.AI 版本更新 81%

EviPathBench: Benchmarking Evidence Acquisition and Reasoning in Vision-Language Models for Whole-Slide Pathology

PathAgentBench:在全切片病理图像上对寻求证据的视觉语言模型进行基准测试

Dankai Liao, Tianyi Zhang, Yufeng Wu, Xinyue Zhang, Qiaochu Xue, Zeyu Liu, Dachun Zhao, Linghan Cai, Yueming Jin

机构 * National University of Singapore(新加坡国立大学) PuzzleLogic Pte Ltd(拼图逻辑私人有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学深圳校区) Peking Union Medical College Hospital(北京协和医院)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对全切片病理图像诊断中证据获取与整合问题,引入PathAgentBench基准,评估视觉语言模型的四项互补能力,包含多模型评估结果,揭示了证据推理与获取间的差距,为改进病理模型提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-08-26 cs.CV cs.AI cs.CL 版本更新 81%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24439 2026-08-26 cs.CV 新提交 79%

DoublesEval: Diagnosing Multi-Agent Tactical Reasoning in Vision-Language Models via Professional Doubles Badminton

DoublesEval:通过专业双打羽毛球诊断视觉语言模型的多智能体战术推理能力

Jintao Cheng, Weibin Li

机构 * The Hong Kong University of Science and Technology(香港科技大学) University of Macau(澳门大学)

专题命中 视觉推理 :vision-language model(title);visual language model(abstract);分类 cs.CV

AI总结 本研究提出DoublesEval框架,以专业双打羽毛球为测试平台评估VLMs的多智能体战术推理能力,发现现有模型存在明显瓶颈,所提TacticCheck可提升模型表现但仍有差距,强调需改进VLMs的评估范式。

Comments Accepted by BMVC2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13394 2026-08-26 cs.CV 版本更新 79%

Spatial-DISE: A Unified Benchmark for Evaluating Spatial Reasoning in Vision-Language Models

空间-DisE:评估视觉语言模型空间推理能力的统一基准

Xinmiao Huang, Qisong He, Zhenglin Huang, Boxuan Wang, Zhuoyun Li, Guangliang Cheng, Yi Dong, Xiaowei Huang

机构 * School of Computer Science & informatics, University of Liverpool(计算机科学与信息学系,利物浦大学)

专题命中 视觉推理 :vision-language model(title);vision language model(abstract);分类 cs.CV

AI总结 本文提出Spatial-DISE基准,用于评估视觉语言模型的空间推理能力,通过四个象限分类和大规模数据集,揭示当前模型在多步骤多视角推理上的不足。

Comments ICLR 2026 Accepted Project Page: this https URL (https://shinmohuang.github.io/spatialdise_page/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15994 2026-08-26 cs.AI 版本更新 70%

ReactBench: A Benchmark for Topological Reasoning in MLLMs on Chemical Reaction Diagrams

ReactBench: 一种用于在化学反应图上进行拓扑推理的MLLMs基准测试

Qiang Xu, Shengyuan Bai, Yu Wang, He Cao, Leqing Chen, Yuanyuan Liu, Bin Feng, Zijing Liu, Yu Li

机构 * International Digital Economy Academy(国际数字经济学院) University of Wisconsin–Madison(威斯康星大学麦迪逊分校)

专题命中 视觉推理 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 ReactBench通过化学反应图揭示MLLMs在拓扑推理中的局限性,包含1618个专家标注的问答对,评估17种MLLMs显示锚定任务与整体结构推理任务存在超过30%的性能差距。

Comments Accepted to EMNLP 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23329 2026-08-26 cs.CV cs.AI 版本更新 62%

Thinking Beyond Videos: Unifying Video Reasoning and Deep Research for Open-World Video Agents

超越视频:统一视频推理与深度研究的开放世界视频智能体

Wenqi Liu, Shijie Ma, Yunxiao Wang, Meng Liu, Qile Su, Han Liu, Bohan Hou, Zeyu Wang, Xuanyu Zheng, Changyi Liu, Tianke Zhang, Haonan Fan, Kaiyu Jiang, Yingxin Li, Jiankang Chen, Xu Wang, Hongyi Fu, Jianxiong Wang, Bin Wen, Tingting Gao, Han Li, Jianhua Yin, Yinwei Wei, Xuemeng Song

机构 * Shandong University(山东大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Beihang University(北京航空航天大学) City University of Hong Kong(香港城市大学) Nanyang Technological University(南洋理工大学) Kuaishou Technology(快手科技) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出统一视频推理与深度研究的VideoRover框架,构建相关数据集与基准,其8B-RL模型在无工具直接回答场景性能接近专有模型,优于同工具套件的更大开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20073 2026-08-26 cs.CL cs.AI cs.LG 版本更新 62%

A Modular Multitask Reasoning Framework Integrating Spatio-temporal Models and LLMs

整合时空模型与大语言模型(LLMs)的模块化多任务推理框架

Kethmi Hirushini Hettige, Jiahao Ji, Cheng Long, Shili Xiang, Gao Cong, Jingyuan Wang

机构 * College of Computing and Data Science, Nanyang Technological University, Singapore(南洋理工大学计算机与数据科学学院) Institute for Infocomm Research, A*STAR, Singapore(资讯通信研究院) School of Computer Science and Engineering, Beihang University, China(北京航空航天大学计算机科学与工程学院)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出整合时空模型与LLMs的STReason框架,通过上下文学习分解查询生成解释,在时空推理任务中显著优于LLM基线,可抑制幻觉并减少专家工作量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22018 2026-08-26 cs.AI 版本更新 57%

SPAR-Hate: Auditor-Guided Multi-Perspective Role Reasoning for Bilingual Hate Speech Parsing

SPAR-Hate:一种由审核员引导的用于双语仇恨言论解析的多智能体框架

Yifan Lyu, Dianqing Lin, Xinran Li, Jiaqi Qiao, Xiujuan Xu

机构 * Dalian University of Technology(大连理工大学) Inner Mongolia University(内蒙古大学)

专题命中 视觉推理 :grounding(abstract);分类 cs.AI

AI总结 针对结构化仇恨言论解析的文化等挑战,提出SPAR-Hate多智能体框架,分解文档为决策单元后从三视角生成判断并仲裁,在基准上实现双语仇恨解析最优结果。

Comments 16 pages, 2 figures. Submitted to EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18974 2026-08-26 cs.CV 版本更新 57%

Visual-OPSD: Cross-Modal On-Policy Self-Distillation for Efficient Unified Multimodal Reasoning

Visual-OPSD:用于高效统一多模态推理的跨模态在策略自蒸馏

Pengyu Li, Zhitao Gao, Lingling Zhang, Muye Huang, Yuanming Li, Fangzhi Xu, Jun Liu

机构 * Xi’an Jiaotong University(西安交通大学) MOE KLINNS Lab(MOE KLINNS实验室) Shaanxi Province Key Laboratory of Big Data Knowledge Engineering(陕西省大数据知识工程重点实验室) Sun Yat-sen University(中山大学)

专题命中 视觉推理 :VLM(abstract_cn);分类 cs.CV

AI总结 提出Visual-OPSD方法,通过跨模态在策略自蒸馏,将多步扩散生成的可视化思维推理能力转移到纯文本学生模型,实现14.3倍加速且性能提升3.40个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19001 2026-08-26 cs.CV 版本更新 57%

Life-Bench: A Benchmark and Knowledge Graph Framework for Multimodal Personalization Beyond Concept Recognition

一个用于高级多模态个性化研究的基准和知识引导框架

Xia Hu, Honglei Zhuang, Brian Potetz, Alireza Fathi, Bo Hu, Babak Samari, Howard Zhou

机构 * Google(谷歌) DeepMind(深Mind)

专题命中 视觉推理 :vision language model(abstract);分类 cs.CV

AI总结 本文提出Life-Bench基准和LifeGraph框架,用于解决高级多模态个性化研究中的复杂任务挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 35 篇

2608.23880 2026-08-26 cs.CV 新提交 93%

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

LG-GER:基于多模态证据蒸馏的语言引导群体情绪识别

Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

机构 * University of South Carolina(南卡罗来纳大学)

专题命中 视觉定位与Grounding :VLM(summary_cn,abstract);MLLM(summary_cn,abstract);vision-language model(abstract,abstract_cn);multimodal large language model(abstract,abstract_cn)

AI总结 该研究提出LG-GER框架,通过MLLM生成结构化证据并蒸馏至VLM骨干,无需检测器等即可实现高效群体情绪识别,在GroupEmoW和GAF 3.0数据集上取得了有竞争力或更优的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24133 2026-08-26 cs.CV cs.AI cs.IR 新提交 91%

PlaceSeek: Human-Centered Geospatial Retrieval of Urban Outdoor Places via Semantic Grounding and Affective Alignment

PlaceSeek:通过语义 grounding 与情感对齐实现以人类为中心的城市户外地点地理空间检索

Ziqi Cui, Shangyu Lou

机构 * University of British Columbia(不列颠哥伦比亚大学) University of California, Santa Barbara(加利福尼亚大学圣巴巴拉分校) San Diego State University(圣地亚哥州立大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对现有地理空间检索难以满足情感/活动类需求的问题,提出 PlaceSeek 框架,通过语义 grounding 与情感对齐实现城市户外地点检索,在米兰数据集上的表现优于多种基线方法。

Comments Accepted as a Research Paper (short) at ACM SIGSPATIAL 2026. This arXiv version is the full version of the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24671 2026-08-26 cs.CV 新提交 90%

ReGround-Surg: Reliability-Guided Anchor Grounding for Referring Surgical Video Segmentation

ReGround-Surg:用于指代手术视频分割的可靠性引导锚点 grounding

Jiaxin Wen, Ming Yin, Lu Liu, Zeyu Fu

机构 * University of Exeter(埃克塞特大学)

专题命中 视觉定位与Grounding :grounding(title,title_cn);分类 cs.CV

AI总结 本文针对手术视频分割中初始锚点错误导致跟踪误差传播的问题,提出 ReGround-Surg 框架,通过可靠性引导锚点 grounding 改进 SAM2,在 Ref-EndoVis 数据集上实现优于 SOTA 的性能且速度损失极小。

Comments 15 pages, 5 figures, accepted at PRCV 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23869 2026-08-26 cs.CV 新提交 87%

Gen2Physics: Grounding Generated 3D Meshes in Physics via Multi-View Material Decomposition

Gen2Physics:通过多视图材料分解将生成的三维网格与物理特性关联

Mauro Comi, Jordi Serrano Berbel, Kevis-Kokitsi Maninis, Philipp Henzler, Manuel Sanchez

机构 * University of Bristol(布里斯托大学) Google DeepMind(谷歌DeepMind) Google Research(谷歌研究院)

专题命中 视觉定位与Grounding :grounding(title,abstract);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 Gen2Physics是一个将生成的三维网格与物理特性关联的自动化框架,通过多视图材料分解实现,其材料分割精度较现有方法提升超一倍,还能输出水密性各材料子网格。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23553 2026-08-26 cs.CV 版本更新 84%

RT-NeuS: Towards Real-Time Neuro-Symbolic Video Understanding via Adaptive Temporal Verification

LE-NeuS: 通过自适应时间验证实现低延迟的神经符号视频理解

Shawn Liang, Sahil Shah, Chengwei Zhou, S P Sharan, Harsh Goel, Arnab Sanyal, Sandeep Chinchali, Gourav Datta

机构 * Case Western Reserve University(凯斯西储大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉定位与Grounding :VLM(abstract,abstract_cn);grounding(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 LE-NeuS通过自适应时间验证优化,实现低延迟的神经符号视频理解,在保持高准确率的同时大幅减少推理延迟。

Comments Camera-ready version, accepted at NeuS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23978 2026-08-26 cs.AI cs.CV 新提交 84%

When Seeing Is Not Enough: Benchmarking Interactive Visual Grounding in LVLMs

当视觉不再足够:评估大视觉语言模型(LVLMs)中的交互式视觉定位

Zhengxiang Wang, Owen Rambow

机构 * Stony Brook University(石溪大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文针对大视觉语言模型(LVLMs)提出交互式视觉定位的受控评估框架,发现当前LVLMs表现低于人类基线,主动提问式定位困难且校准不佳,该任务仍具挑战性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23928 2026-08-26 cs.CV cs.AI 新提交 84%

RefineRank: Joint Box Refinement and Ranking for Surgical Spatio-Temporal Grounding

RefineRank:用于外科时空定位的联合框优化与排序

Linzhe Jiang, Jiayuan Huang, Changhao Zhang, Chunyang Jiang, Zhehua Mao, Mobarak I. Hoque

机构 * UCL Hawkes Institute, University College London(伦敦大学学院霍克斯研究所) King’s College London(伦敦国王学院) School of Medicine, Nankai University(南开大学医学院) University of Manchester(曼彻斯特大学)

专题命中 视觉定位与Grounding :grounding(title,abstract);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 RefineRank通过RefineNet模块结合冻结医学视觉语言模型与开放集检测器,实现外科时空定位的联合框优化与排序,在MedVidBench上取得较高STG mIoU,提升了定位性能且无需重训主干。

Comments 17 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23474 2026-08-26 cs.CL cs.AI cs.CV 版本更新 84%

What's the Catch? Evaluating Temporal Consistency in Vision-Language Models

有何玄机?评估视觉-语言模型的时间一致性

Marek Hradil, Danae Sánchez Villegas

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究提出TimeCatch基准,发现视觉-语言模型可检测单帧异常但难整合跨帧信息,在时间异常检测上表现接近随机水平。

Comments 17 pages, ACL format

详情

展开后加载摘要…

URL PDF HTML 收藏