arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4513 篇

2607.26595 2026-07-30 cs.CV 新提交 91%

SpatialQ: Understanding 3D Gaussian Splatting Scene Quality via Visual-based MLLM

SpatialQ:基于视觉的多模态大语言模型(MLLM)理解3D Gaussian Splatting场景质量

Jingxuan Su, Shenglin Wang, Tiesong Zhao, Ge Li, Wei Gao

机构 * Peking University(北京大学) Peng Cheng Laboratory(鹏城实验室) Fuzhou University(福州大学)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 针对3DGS场景质量评估的局限,本文提出SpatialQ框架,通过VGGT编码器与Qwen-MLLM实现结构感知的多模态质量评估,解决传统IQA仅依赖2D线索的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21061 2026-07-24 cs.CV 新提交 91%

MVEI & EmObserver: Empowering MLLM-Oriented Visual Emotional Intelligence via Emotion Statement Judgement

MVEI与EmObserver:通过情感陈述判断增强面向MLLM的视觉情商

Daiqing Wu, Dongbao Yang, Jiashu Yao, Hongrui Zhang, Can Ma, Yu Zhou, Sicheng Zhao

机构 * Tsinghua University(清华大学) Nankai University(南开大学) Beijing Institute of Technology(北京理工大学) Chinese Academy of Sciences(中国科学院)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型视觉情商评估缺失问题,引入情感陈述判断公式ESJ,开发INSETS及MVEI基准,构建EmObserver模型。通过实验评估,确立了ESJ、MVEI和EmObserver在推进面向MLLM的视觉情商方面的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01848 2026-07-22 cs.CV 版本更新 91%

Semantic Richness or Geometric Reasoning? The Fragility of VLM's Visual Invariance

语义丰富性还是几何推理?VLM视觉不变性的脆弱性

Jason Qiu, Zachary Meurer, Xavier Thomas, Deepti Ghadiyaram

机构 * Boston University(波士顿大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 研究揭示VLM在基本几何变换下的脆弱性,指出其在空间不变性与等变性上的不足,影响物体识别的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31200 2026-07-01 cs.AI 新提交 91%

Agentic RAG-VLM: Affordance-Aware Retrieval-Augmented Generation with Self-Reflective Planning for Robotic Grasping

Agentic RAG-VLM:基于自反规划与可操作性感知的检索增强生成在机器人抓取中的应用

Tao Chen, Lizheng Liu, Jiaxu Wang, Ziyue Jiang, Ruiqi Tian, JiGuang Huo, Zhongxue Gan

机构 * Fudan University(复旦大学) Kean University(肯恩大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出Agentic RAG-VLM框架,通过可操作性感知检索、场景图推理和自反规划,在杂乱环境中实现鲁棒抓取,成功率78.3%,比纯VLM基线提升53.3个百分点。

Comments 8 pages,5 figures,5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09781 2026-06-30 cs.CV 91%

Text-Guided 6D Object Pose Rearrangement via Closed-Loop VLM Agents

基于闭环VLM代理的文本引导的6D物体姿态重排

Sangwon Baik, Gunhee Kim, Mingi Choi, Hanbyul Joo

机构 * Seoul National University RLWRLD(首尔大学 RLWRLD)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 本文提出通过闭环VLM代理实现文本引导的6D物体姿态重排,引入多视角推理、坐标系可视化和单轴旋转预测等技术,提升VLM在3D场景中推理目标物体姿态的能力,且在不同VLM上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23165 2026-05-25 cs.RO cs.AI cs.CL 91%

Autonomous Frontier-Based Exploration with VLM Guidance

基于自主前沿探索与VLM引导

Aarush Aitha, Avideh Zakhor

机构 * EECS Department, University of California(加州大学EECS系)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 提出利用视觉语言模型进行高层战略决策,替代几何启发式,通过多模态提示选择最优前沿,在模拟环境中将地图覆盖率提升高达24%。

Comments 8 pages, 10 figures, CVPR 2026: 2nd Workshop on 3D-LLM/VLA: Bridging Language, Vision and Action in 3D Environments

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20892 2026-05-21 cs.CV 91%

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

FruitEnsemble: MLLM-Guided Arbitration for Heterogeneous ensemble in Fine-Grained Fruit Recognition

Enhui Yu, Junhui Li, Ruitong Lu, Jialu Li, Youshan Zhang

机构 * University of Science and Technology Liaoning(辽宁科技大学) Chuzhou University(楚州大学) Yeshiva University(犹他大学)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FruitEnsemble框架,通过多阶段动态推理解决细粒度水果分类中的泛化限制问题,利用MLLM进行专家仲裁以提升分类准确率,最终达到70.49%的分类精度。

Comments 10 pages,6 figures,submitted to CVPR 2026

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops (CVPRW) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20818 2026-05-21 cs.CV 91%

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

OSGNet with MLLM Reranking @ Ego4D Episodic Memory Challenge 2026

Yisen Feng, Leigang Qu, Haoyu Zhang, Qiaohui Chu, Meng Liu, Xuemeng Song, Weili Guan, Liqiang Nie

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) National University of Singapore(新加坡国立大学) Pengcheng Laboratory(鹏城实验室) Shandong Jianzhu University(山东建筑大学) Southern University of Science and Technology(南方科技大学)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出一种基于多模态大语言模型(MLLM)的重排序框架,用于解决Ego4D事件记忆挑战2026中的自然语言查询和目标步 tracks,通过结合现有定位模型OSGNet的候选片段和MLLM的视频-语言推理能力,提升时间片段的定位精度。

Comments Champion solution for the Natural Language Queries and GoalStep tracks of the Ego4D Challenge at the CVPR EgoVis Workshop 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01390 2026-05-08 cs.HC cs.AI 91%

Toward Scalable Audio Description Quality Control: A Workflow for Evaluating Human and VLM Raters

迈向可扩展的音频描述质量控制:评估人类和VLM评分者的流程

Lana Do, Gio Jung, Juvenal Francisco Barajas, Andrew Taylor Scott, Shasta Ihorn, Alexander Mario Blum, Vassilis Athitsos, Ilmi Yoon

机构 * Northeastern University(东北大学) San Francisco State University(旧金山州立大学) University of Texas at Arlington(德克萨斯大学阿灵顿分校)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.AI

AI总结 本文提出了一种评估人类和VLM评分者音频描述质量的流程,利用项目反应理论评估其与专家标准的匹配程度,发现VLM在大规模评估中可与人类评分者相当,但其推理可靠性较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.24300 2026-04-28 cs.CV 91%

ReVSI: Rebuilding Visual Spatial Intelligence Evaluation for Accurate Assessment of VLM 3D Reasoning

ReVSI:重建视觉空间智能评估以准确评估VLM 3D推理

Yiming Zhang, Jiacheng Chen, Jiaqi Tan, Yongsen Mao, Wenhu Chen, Angel X. Chang

机构 * Simon Fraser University(西蒙弗雷泽大学) University of Waterloo(滑铁卢大学) Hong Kong University of Science(香港科学大学) Alberta Machine Intelligence Institute (Amii)(阿尔伯塔人工智能研究所(Amii))

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.CV

AI总结 ReVSI通过改进数据质量和评估可控性,解决现有空间智能评估在VLM 3D推理中的系统性失效问题,提供更可靠的诊断评估。

Comments Project Page: https://3dlg-hcvc.github.io/revsi/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16918 2026-04-21 cs.CL cs.LG 91%

Freshness-Aware Prioritized Experience Replay for LLM/VLM Reinforcement Learning

具有新鲜度意识的优先经验回放用于LLM/VLM强化学习

Weiyu Ma, Yongcheng Zeng, Yan Song, Xinyu Cui, Jian Zhao, Xuhui Liu, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology(卡布尔大学科学与技术大学) Chinese Academy of Sciences, Institute of Automation(中国科学院自动化研究所) AI Centre, Department of Computer Science, University College London(伦敦大学学院人工智能中心) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究所)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);分类 cs.LG

AI总结 本文提出Freshness-Aware PER,通过引入指数衰减机制解决LLM/VLM强化学习中优先级过时问题,显著提升样本效率,在多个任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12630 2026-04-15 cs.CV cs.CL 91%

GeoAlign: Geometric Feature Realignment for MLLM Spatial Reasoning

GeoAlign:用于MLLM空间推理的几何特征重定位

Zhaochen Liu, Limeng Qiao, Guanglu Wan, Tingting Jiang

机构 * National Engineering Research Center of Visual Technology, National Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(视觉技术国家工程研究中心、多媒体信息处理国家重点实验室、计算机学院、北京大学) Meituan Inc.(美团公司) National Biomedical Imaging Center, Peking University(生物医学成像国家中心、北京大学)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出GeoAlign框架,通过动态聚合多层几何特征以解决MLLM在空间推理中的任务对齐偏差问题,实验表明其紧凑模型在多个基准测试中达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21346 2026-04-24 cs.AI cs.CL cs.CV 91%

Symbolic Grounding Reveals Representational Bottlenecks in Abstract Visual Reasoning

符号 grounding 揭示了抽象视觉推理中的表征瓶颈

Mohit Vaishnav, Tanel Tammet

机构 * Applied Artificial Intelligence Group, Tallinn University of Technology, Estonia(塔林技术大学应用人工智能小组,爱沙尼亚) Kimova AI, Tallinn, Estonia(Kimova AI,塔林,爱沙尼亚)

专题命中 视觉推理 :grounding(title,title_cn);visual reasoning(title,abstract);分类 cs.CV、cs.AI

AI总结 本文通过Bongard-LOGO基准测试,发现符号输入能显著提升抽象视觉推理性能,揭示了表征能力是核心瓶颈。

Journal ref 30th Conference on Computational Natural Language Learning (CoNLL), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.16517 2025-09-23 cs.CV cs.AI cs.CL cs.MM 91%

Seeing Culture: A Benchmark for Visual Reasoning and Grounding

Burak Satar, Zhixin Ma, Patrick A. Irawan, Wilfried A. Mulyawan, Jing Jiang, Ee-Peng Lim, Chong-Wah Ngo

机构 * Singapore Management University(新加坡管理大学) Bandung Institute of Technology(班达理工大学)

专题命中 视觉推理 :visual reasoning(title,abstract);grounding(title,abstract);vision-language model(abstract);visual question answering(abstract)

Comments Accepted to EMNLP 2025 Main Conference, https://seeingculture-benchmark.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22857 2026-08-25 cs.CL 新提交 90%

SAVER: Selective Auditing of Verbal Evidence for Error Recovery in VLM Change Reasoning

SAVER:面向VLM变化推理中错误恢复的口头证据选择性审计

Youdi Li

机构 * Panasonic Connect Co., Ltd.(松下连接公司)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract)

AI总结 针对VLMs视觉变化推理的表述失败问题,提出轻量规则方法SAVER,通过选择性审计VLM输出的口头证据触发结构化重提示,在CLEVR-Change等基准上显著提升准确率。

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29374 2026-08-03 cs.RO 新提交 90%

SAGP: Semantic Affordance-Guided Grasp Planning via Coarse-Zone VLM Reasoning

SAGP:基于粗区域VLM推理的语义 affordance 引导抓取规划

Muhayy Ud Din, Irfan Hussain

机构 * Khalifa University(哈利法大学) KU Center for Autonomous Robotic Systems (KUCARS)(KU自主机器人系统中心(KUCARS))

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract)

AI总结 SAGP是一种无训练的抓取规划框架,通过粗区域抽象层结合VLM推理与几何规划,在保持纯几何抓取高成功率的同时,提升了抓取的功能适用性,尤其适用于非对称带把手物体。

Comments Accepted in ICAME2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.23934 2026-04-28 eess.SY cs.SY 90%

VLM-VPI: A Vision-Language Reasoning Framework for Improving Automated Vehicle-Pedestrian Interactions

VLM-VPI:一种用于改进自动驾驶车辆-行人交互的视觉语言推理框架

Qingwen Pu, Kun Xie, Yuxiang Liu

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract)

AI总结 本文提出VLM-VPI框架,结合多模态感知、视觉场景理解和意图推理,提升自动驾驶中行人意图识别和安全控制,实验证明其在安全性和效率上的提升。

Comments 40 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18846 2026-06-18 cs.CV 新提交 90%

From Bounding Boxes to Visual Reasoning: An On-Policy Data Annotation Tool for Vision-Language Models

从边界框到视觉推理:一种用于视觉语言模型的在线策略数据标注工具

Like Zhang, Runliang Niu, Shiqi Wang, Xiyu Hu, Qianli Xing, Pan Wang, Qingzu He, Qi Wang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) College of Computer Science, Jilin University(吉林大学计算机科学与技术学院) OPPO

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出ScreenAnnotator,通过统一标注原子模式、在线策略循环与贝叶斯验证器,解决现有工具表达力不足、标注-训练脱节和数据复用性差的问题,实现高效多任务数据生成。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11196 2025-08-18 cs.CV 90%

UAV-VL-R1: Generalizing Vision-Language Models via Supervised Fine-Tuning and Multi-Stage GRPO for UAV Visual Reasoning

Jiajin Guan, Haibo Mei, Bonan Zhang, Dan Liu, Yuanshuang Fu, Yue Zhang

机构 * Research Institute of Electronic Science and Technology, University of Electronic Science and Technology of China(电子科学与技术研究院,电子科技大学) School of Aeronautics and Astronautics, University of Electronic Science and Technology of China(航空航天学院,电子科技大学)

专题命中 视觉推理 :vision-language model(title,abstract);visual reasoning(title,abstract);VLM(abstract);visual question answering(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26432 2026-07-30 cs.CV cs.AI 新提交 90%

FAS-R1: A Unified Multi-Task MLLM for Reasoning Face Anti-Spoofing

FAS-R1:用于推理人脸防伪的统一多任务多模态大语言模型(MLLM)

Hongyang Wang, Yichen Shi, Hongrui Li, Yiru Huo, Jun Feng, Zitong Yu

专题命中 视觉推理 :MLLM(title,title_cn);分类 cs.CV、cs.AI

AI总结 本文提出面向推理的两阶段多任务MLLM框架FAS-R1,结合DSA与DA-GRPO优化,在人脸防伪的分类、识别、定位任务中表现优异,性能优于对比系统且具备良好缩放性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00148 2026-06-02 cs.CV cs.AI 90%

StemBind: When MLLMs Get Lost Between Rules and Instances in Abstract Visual Reasoning

StemBind: 当多模态大语言模型在抽象视觉推理中迷失于规则与实例之间

Xixiang He, Baiqi Wu, Xingming Li, Ao Cheng, Qiyao Sun, Xuanyu Ji, Qingyong Hu

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉推理 :MLLM(summary_cn,abstract);visual reasoning(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出 StemBind 诊断基准,通过共享主干的三对齐问题(感知、规则、完整)定位 MLLM 在抽象视觉推理中的失败环节,发现规则到实例的绑定是主要瓶颈。

Comments Project page: https://hexixiang.github.io/StemBind

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17629 2026-05-26 cs.CV cs.AI cs.CL 90%

CLiViS: Unleashing Cognitive Map through Linguistic-Visual Synergy for Embodied Visual Reasoning

CLiViS: 通过语言-视觉协同释放认知地图用于具身视觉推理

Kailing Li, Qi'ao Xu, Tianwen Qian, Yuqian Fu, Yang Jiao, Xiaoling Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) King Abdullah University of Science and Technology(科廷大学) Fudan University(复旦大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);visual reasoning(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 提出CLiViS框架,通过LLM进行高层任务规划并协调VLM驱动的开放世界视觉感知,构建动态认知地图以迭代更新场景上下文,实现无需训练的具身视觉推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12374 2026-05-26 cs.CV cs.AI cs.LG 90%

Fill the GAP: A Granular Alignment Paradigm for Visual Reasoning in Multimodal Large Language Models

填补GAP:多模态大语言模型中视觉推理的粒度对齐范式

Yanting Miao, Yutao Sun, Dexin Wang, Mengyu Zhou, Pascal Poupart, Lei Lv, Qi Zhao, Li Wang, Hao Li, Xiaoxi Jiang, Guanjun Jiang

机构 * Qwen Large Model Application Team, Alibaba(阿里云大模型应用团队) Alibaba University of Waterloo(阿里大学水力学院) Vector Institute(向量研究所) Zhejiang University(浙江大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(title);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 提出GAP(粒度对齐范式),通过特征级、上下文级和能力引导级对齐,解决多模态大语言模型中视觉潜在推理的特征空间不匹配问题,提升感知与推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18002 2026-03-19 cs.CV cs.AI cs.CL 90%

Loc3R-VLM: Language-based Localization and 3D Reasoning with Vision-Language Models

Loc3R-VLM:基于语言的定位与3D推理的视觉语言模型

Kevin Qu, Haozhe Qi, Mihai Dusmanu, Mahdi Rad, Rui Wang, Marc Pollefeys

机构 * Microsoft Spatial AI Lab(微软空间AI实验室) ETH Zurich(苏黎世联邦理工学院) EPFL(苏黎世联邦理工学院)

专题命中 视觉推理 :VLM(title,abstract);vision-language model(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 Loc3R-VLM通过结合全局布局重建和显式情境建模,提升视觉语言模型的3D空间理解能力,在语言定位和3D问答任务中取得最优性能。

Comments Project Page: https://kevinqu7.github.io/loc3r-vlm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24040 2026-08-26 cs.LG 新提交 90%

PinSieve: Production Selective VLM Serving and a Governed Memory Flywheel for Enterprise Content-Quality Triage

PinSieve:面向企业内容质量分类的生产级选择性VLM服务及受控内存飞轮

Chuqing Gao, Yuanfang Song, Jonathan Zhang, Yifan Wu, Vishwakarma Singh, Qinglong Zeng, Andrey Gusev

专题命中 视觉推理 :VLM(title,title_cn);分类 cs.LG

AI总结 本文提出PinSieve,即面向企业内容质量分类的选择性VLM服务智能体,结合受控内存飞轮维护机制,提升审核效率、降低成本并改善信号交付,具有任务可迁移性。

Comments Accepted at the KDD 2026 workshop "Enterprise AI Agents: From Prototypes to Production."

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23234 2026-08-25 cs.CV 新提交 90%

MLLM-Assisted Audio VOS: A 3rd Place Report for the MeViS-Audio Track, 8th LSVOS Challenge

多模态大语言模型(MLLM)辅助音频引导的视频目标分割:第8届LSVOS挑战赛MeViS音频赛道第3名报告

Liangtao Shi, Jinxia Xie, Xiantao Hu, Ting Liu

机构 * Hefei University of Technology(合肥工业大学) Nanjing University of Science and Technology(南京理工大学) Hunan Police College(湖南警察学院)

专题命中 视觉推理 :MLLM(title,title_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 该研究提出一种结合MLLM与SAM的无训练音频引导视频分割框架,分解任务至各阶段并选用适配基础模型,在第8届LSVOS挑战赛MeViS音频赛道获第3名,验证了基础模型用于该任务的有效性。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22429 2026-08-25 cs.AI 新提交 90%

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习

Changjiang Jiang, Qiannian Zhao, Lei Xin, Jinxiang Xie, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Nanjing University(南京大学)

专题命中 视觉推理 :grounding(title,abstract);MLLM(abstract,abstract_cn);visual reasoning(abstract);multimodal large language model(abstract)

AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31257 2026-07-01 cs.CV 新提交 90%

Decodable Is Not Grounded: A Vision-Ablation Arbiter for VLM Spatial Reasoning

可解码不等于已接地:用于VLM空间推理的视觉消融仲裁器

Chih-Ting Liao, Fei Shen, Xin Cao, Tat-Seng Chua

机构 * University of New South Wales(新南威尔士大学) National University of Singapore(新加坡国立大学)

专题命中 视觉推理 :VLM(title,title_cn);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出一种视觉消融仲裁方法,通过将图像替换为灰色空白,揭示视觉语言模型在空间推理中存在的三种接地机制:接地、先验和反转,并证明线性探针和转向恢复会系统性地高估模型的实际视觉接地能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23354 2026-06-23 cs.CV 新提交 90%

Faithful Grounded Visual Reasoning via Learned Proxy-Tokens

通过学习的代理令牌实现忠实的接地视觉推理

Tom Hodemon, Mohamed Chaouch, Aboubacar Tuo, Angelique Loesch

机构 * CEA-LIST(法国原子能委员会-信息与系统技术实验室)

专题命中 视觉推理 :visual reasoning(title,abstract);MLLM(abstract,abstract_cn);visual question answering(abstract);grounding(abstract)

AI总结 提出Composer模型,利用基于学习代理令牌的视觉接地机制,通过离散符号指针显式索引图像潜在空间,在保持答案准确性的同时将视觉接地准确率提升9.0个百分点。

Comments Accepted at ICIP 2026. Code, model and data available at: https://github.com/CEA-LIST/Composer

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08894 2026-06-09 cs.CV cs.CL 新提交 90%

Are Reasoning Vision-Language Models Robust to Semantic Visual Distractions?

推理视觉语言模型对语义视觉干扰具有鲁棒性吗?

Yizheng Sun, Mochuan Zhan, Yanan Ma, Jia Tong See, Yifan Wang, Ziyi Wang, Hao Li, Yang Cui, Wenhao Cai, Jingyu Sun, Chenghua Lin, Riza Batista-Navarro, Jingyuan Sun

机构 * University of Manchester(曼彻斯特大学) Marex Imperial College London(帝国理工学院)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(title,abstract);visual reasoning(abstract);分类 cs.CV

AI总结 针对推理VLM在真实场景中易受语义视觉干扰的问题,提出Distract-Bench基准,发现推理VLM对语义干扰的鲁棒性低于感知退化,且干扰常被纳入推理过程导致错误答案。

详情

展开后加载摘要…

URL PDF HTML 收藏