arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 4478 信号源:cs.CV, cs.AI, cs.LG

1. 视觉推理 4478 篇

2508.10523 2026-06-16 cs.CV 版本更新 86%

Reasoning in Computer Vision: Taxonomy, Models, Tasks, and Methodologies

计算机视觉中的推理:分类、模型、任务与方法论

Ayushman Sarkar, Zhenyu Yu, Mohd Yamani Idna Idris

机构 * Department of Computer Science and Engineering, Birbhum Institute of Engineering and Technology(计算机科学与工程系,比罗尔理工学院) College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学) Faculty of Computer Science and Information Technology, Universiti Malaya(计算机科学与信息技术学院,马来亚大学)

专题命中 视觉推理 :vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract);visual question answering(abstract)

AI总结 本文对计算机视觉中的推理进行系统分类,涵盖关系、符号、时间、因果和常识推理,并综述了从图模型到多模态大语言模型的实现方法及评估协议,指出开放挑战并设定未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06476 2026-06-05 cs.CV 86%

Thinking with Imagination: Agentic Visual Spatial Reasoning with World Simulators

思考与想象:基于世界模拟器的智能视觉空间推理

Chenming Zhu, Jingli Lin, Yilin Long, Peizhou Cao, Tai Wang, Jiangmiao Pang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学) Beihang University(北航大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 提出Astra框架,通过强化学习训练VLM策略与Bagel世界模拟器交互,在推理中生成想象视觉证据,解决空间推理中的未观察布局、跨视角一致性和替代视角推理问题。

Comments Project page: https://zcmax.github.io/projects/Thinking-With-Imagination

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24098 2026-05-26 cs.CV 86%

D2-V2X: Depth-Driven Cooperative V2X Reasoning for Autonomous Driving

D2-V2X: 面向自动驾驶的深度驱动协同V2X推理

Kevin Richard, Alphin Varghese, Colin Pham, David Oh, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳州立大学)

专题命中 视觉推理 :VLM(summary_cn,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV

AI总结 针对单车辆视觉语言模型受传感器遮挡限制的问题,提出D2-V2X基准和基线模型,通过融合3D LiDAR特征与VLM潜空间,利用链式思维推理实现遮挡目标识别和空间估计,在识别遮挡危险和降低空间估计误差上取得显著提升。

Comments Accepted to the DriveX Workshop at CVPR 2026 (Non-archival)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17980 2026-05-08 cs.CV 86%

Feeling the Space: Egomotion-Aware Video Representation for Efficient and Accurate 3D Scene Understanding

感知空间:面向高效准确3D场景理解的自我运动感知视频表示

Shuyao Shi, Kang G. Shin

机构 * Department of Computer Science(计算机科学系) University of Michigan(密歇根大学) University of Michigan Ann Arbor(密歇根大学安阿伯分校)

专题命中 视觉推理 :MLLM(summary_cn,abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出Motion-MLLM框架,结合IMU数据与视觉特征,通过运动-视觉关键帧过滤模块和异构跨模态融合模块,提升3D场景理解与空间推理的效率和准确性。

Comments 22 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18829 2026-04-22 cs.CV 86%

DUALVISION: RGB-Infrared Multimodal Large Language Models for Robust Visual Reasoning

DUALVISION:用于鲁棒视觉推理的RGB-红外多模态大语言模型

Abrar Majeedi, Zhiyuan Ruan, Ziyi Zhao, Hongcheng Wang, Jianglin Lu, Yin Li

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon(亚马逊) Northeastern University(东北大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);visual reasoning(title);分类 cs.CV

AI总结 本文提出DUALVISION,通过局部化交叉注意力融合IR-RGB信息,提升多模态大语言模型在视觉退化条件下的性能,并引入DV-204K和DV-500数据集进行评估。

Comments Accepted at CVPR Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05920 2026-04-21 cs.CV 86%

High-Resolution Visual Reasoning via Multi-Turn Grounding-Based Reinforcement Learning

通过多轮基于定位的强化学习实现高分辨率视觉推理

Xinyu Huang, Yuhao Dong, Weiwei Tian, Bo Li, Rui Feng, Ziwei Liu

机构 * Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室)

专题命中 视觉推理 :grounding(title,abstract);visual reasoning(title);分类 cs.CV

AI总结 本文提出MGPO框架,通过多轮对话机制使LMMs在无需额外标注的情况下提升视觉定位能力,实验表明其在MME-Realworld和V*Bench任务中表现优异。

Comments Accepted by ACL(Findings) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17312 2026-04-02 cs.CV 86%

CodeDance: A Dynamic Tool-integrated MLLM for Executable Visual Reasoning

CodeDance: 一种动态集成工具的多模态大语言模型用于可执行视觉推理

Qi Song, Honglin Li, Yingchen Yu, Haoyi Zhou, Lin Yang, Song Bai, Qi She, Zilong Huang, Yunqing Zhao

机构 * Beihang University(北京航空航天大学) Westlake University(西湖大学) ByteDance Singapore(字节跳动新加坡) ByteDance China(字节跳动中国)

专题命中 视觉推理 :visual reasoning(title,abstract);MLLM(title);分类 cs.CV

AI总结 CodeDance通过可执行代码实现视觉推理,结合多工具协作与自检机制,提升复杂任务的灵活性和可解释性,实验显示其在多个基准测试中优于现有方法。

Comments CVPR 2026. Project page: https://codedance-vl.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.21277 2025-05-22 cs.AI 86%

Reinforced MLLM: A Survey on RL-Based Reasoning in Multimodal Large Language Models

Guanghao Zhou, Panjia Qiu, Cen Chen, Jie Wang, Zheming Yang, Jian Xu, Minghui Qiu

机构 * East China Normal University(东华师范大学) ByteDance(字节跳动)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06461 2026-08-18 cs.CV cs.AI 版本更新 86%

Focusing by Contrastive Attention: Enhancing VLMs' Visual Reasoning

通过对比注意力实现聚焦:增强视觉语言模型的视觉推理能力

Yuyao Ge, Shenghua Liu, Yiwei Wang, Lingrui Mei, Baolong Bi, Xuanshan Zhou, Jiayu Yao, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of California, Merced(加州大学默塞德分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究针对VLMs在复杂环境下性能下降的问题,提出无训练方法CARVE,通过像素级注意力对比提取任务相关视觉信号,在开源模型上实现最高75%的性能提升,为提升视觉推理提供了高效路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06699 2026-08-10 cs.AI cs.CV 新提交 86%

AgentPatch: Coarse-to-Fine Weak-Task Repair for Merging Agentic Multimodal Large Language Models

AgentPatch:用于合并智能体多模态大语言模型的由粗到细弱任务修复

Zibo Shao, Baochen Xiong, Chengdong Xu, Linhui Xiao, Kaichen Li, Haoran Gong, Yan Li, Yaguang Song, Xiaoshan Yang

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 针对智能体多模态大语言模型合并时的弱任务退化与关键行为遗忘问题,提出无需训练的AgentPatch框架,通过由粗到细修复实现能力平衡,提升合并模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26738 2026-08-06 cs.CV cs.AI cs.CL 版本更新 86%

SleepVLM: A Rule-Grounded Vision-Language Model for Auditable Sleep Staging

SleepVLM:基于视觉语言模型的可解释且规则驱动的睡眠分期

Guifeng Deng, Pan Wang, Mengfan Niu, Jiquan Wang, Shuying Rao, Junyi Xie, Xi'ang Chen, Sha Zhao, Gang Pan, Wanjun Guo, Tao Li, Haiteng Jiang

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract_cn);visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 提出SleepVLM,一种基于规则驱动的视觉语言模型,通过多通道PSG波形图像进行睡眠分期,并生成符合AASM评分标准的临床可读解释,在保持高准确率的同时提升可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17298 2026-07-09 cs.CV cs.AI 版本更新 86%

Explain Before You Answer: A Survey on Compositional Visual Reasoning

回答之前先解释:组合视觉推理综述

Fucai Ke, Joy Hsu, Zhixi Cai, Zixian Ma, Xin Zheng, Xindi Wu, Sukai Huang, Weiqing Wang, Pari Delir Haghighi, Gholamreza Haffari, Ranjay Krishna, Jiajun Wu, Hamid Rezatofighi

机构 * Monash University(墨尔本大学) Stanford University(斯坦福大学) University of Washington(华盛顿大学) Griffith University(格里菲斯大学) Princeton University(普林斯顿大学) Allen Institute for Artificial Intelligence(人工智能研究院)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 综述2023年至2025年组合视觉推理文献,形式化核心定义,追溯范式转变,编目基准指标,提炼见解、识别挑战并概述方向,为该领域提供统一分类、历史路线图和批判性展望。

Comments Project Page: https://github.com/pokerme7777/Compositional-Visual-Reasoning-Survey

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28593 2026-06-30 cs.CV cs.AI cs.CL 86%

Animation2Code: Evaluating Temporal Visual Reasoning in Video-to-Code Generation

Animation2Code: 评估视频到代码生成中的时间视觉推理

Anya Ji, Abhijith Varma Mudunuri, David M. Chan, Alane Suhr

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Animation2Code基准,通过从视频重建可执行网页动画代码来评估视觉语言模型的时间视觉推理能力,发现现有模型在时间一致性上表现不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05833 2026-06-19 cs.CV cs.AI 版本更新 86%

Learning Geometric Representations from Videos for Spatial Intelligent Multimodal Large Language Models

从视频中学习几何表示以实现空间智能多模态大语言模型

Haibo Wang, Lifu Huang

机构 * University of California, Davis(加州大学戴维斯分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出GeoVR框架,通过从2D视频序列中蒸馏3D几何知识(包括相机姿态、深度图、尺度因子和多尺度3D特征),重塑多模态大语言模型的内部表示以赋予其空间智能,在空间推理基准上达到最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04917 2026-06-19 cs.CV cs.AI cs.CL 版本更新 86%

Vero: An Open RL Recipe for General Visual Reasoning

Vero: 通用视觉推理的开放RL配方

Gabriel Sarch, Linrong Cai, Qunzhong Wang, Haoyang Wu, Danqi Chen, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 视觉推理 :visual reasoning(title,abstract);vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.AI

AI总结 提出Vero系列开放视觉语言模型,通过构建600K样本数据集Vero-600K和任务路由奖励,在30个基准测试中平均提升2.9-5.4点,Vero-Qwen3I-8B超越Qwen3-VL-8B-Thinking 3.8点。

Comments Project page: https://vero-reasoning.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14697 2026-06-15 cs.CV cs.AI cs.CL 新提交 86%

ClinHallu: A Benchmark for Diagnosing Stage-Wise Hallucinations in Medical MLLM Reasoning

ClinHallu: 用于诊断医学多模态大语言模型推理中阶段式幻觉的基准

Sicheng Yang, Hangjie Yuan, Wenjun Zhang, Jinwang Wang, Yichen Qian, Weihua Chen, Fan Wang, Lei Zhu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DAMO Academy, Alibaba Group(阿里巴巴达摩院) Hupan Lab(湖畔实验室) Zhejiang University(浙江大学)

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 提出ClinHallu基准,包含7031个实例,每个实例带有结构化推理轨迹(视觉识别、知识回忆、推理整合),通过阶段替换干预和轨迹监督微调,实现细粒度幻觉诊断与缓解。

Comments Code and datasets: https://github.com/alibaba-damo-academy/ClinHallu

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07541 2026-06-09 cs.HC cs.AI cs.CV cs.CY cs.MM 新提交 86%

Multimodal Large Language Models as Synthetic Participants in Video-Based Studies: An Evaluation

多模态大语言模型作为视频研究中的合成参与者:一项评估

Prabal Shrestha, Bohan Jiang, Haoning Xue, Huan Liu, Xinyi Zhou

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本研究评估多模态大语言模型在视频感知任务中模拟人类主观评分的表现,发现模型存在偏差且与人类一致性有限。

Comments Accepted to SocialLLM @ ICWSM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14405 2026-06-02 cs.LG cs.AI 86%

ES-Merging: Biological MLLM Merging via Embedding Space Signals

ES-Merging: 通过嵌入空间信号进行生物多模态大模型合并

Wonbin Lee, Dongki Kim, Sung Ju Hwang

机构 * KAIST(韩国科学技术院) DeepAuto.ai

专题命中 视觉推理 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 提出ES-Merging框架,利用嵌入空间信号估计合并系数,实现生物多模态大模型的高效合并,提升跨模态推理和单模态知识保留能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00415 2026-06-02 cs.AI cs.LG 86%

PolarMem: A Training-Free Polarized Latent Graph Memory for Verifiable Vision-Language Models

PolarMem: 一种无需训练的可验证视觉语言模型极化隐式图记忆

Zhisheng Chen, Tingyu Wu, Zijie Zhou, Zhengwei Xie, Jinhan Li, Ziyan Weng, Liang Lin, Jingwei Song, Zikai Xiao, Yingwei Zhang

机构 * ICT, CAS(中国科学院信息科技研究院) UCAS(中国科学院大学) CUPB(中国政法大学) USTC(中国科学技术大学) CityU-DG(城市大学-数据科学) HKU(香港大学) ZJU(浙江大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 提出PolarMem,一种无需训练的极化隐式图记忆框架,通过语义一致性验证和自适应分布划分将视觉语言模型感知信号转化为HAS、NOT_HAS和Uncertain记忆状态,并采用词典逻辑感知检索协议优先保证逻辑一致性,从而提升检索密集型任务性能并减少矛盾。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26038 2026-05-26 cs.CV cs.AI 86%

DRScaffold: Boosting Dense-Scene Reasoning in Lightweight Vision Language Models

DRScaffold:提升轻量级视觉语言模型在密集场景推理中的能力

Xinrui Shi, Kai Liu, Ziqing Zhang, Jianze Li, Anqi Li, Yulun Zhang

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);grounding(abstract)

AI总结 针对轻量级视觉语言模型在密集场景推理中缺乏显式视觉锚定导致推理链不可靠的问题,提出DRScaffold监督微调框架,通过将监督目标分解为四个因果有序阶段,在不修改架构的情况下强制进行有根据的推理,显著提升密集场景推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23270 2026-05-25 cs.CV cs.AI cs.RO 86%

ChainFlow-VLA: Causal Flow Planning with Vision-Language Models

ChainFlow-VLA: 基于视觉语言模型的因果流规划

Xiyang Wang, Xinlin Wang, Tingguang Zhou, Gong Chen, Xingtai Gui, Zhi Xu, Xiaolei Wu, Feiyang Tan, Hangning Zhou, Mu Yang

机构 * Afari Intelligent Drive(阿法瑞智能驾驶) Tianjin University(天津大学) University of Macau(澳门大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 提出ChainFlow-VLA框架,通过自回归生成因果轨迹模式与扩散残差校正的统一概率模型,结合视觉语言模型语义先验,实现自动驾驶中鲁棒的轨迹规划,在NAVSIM v1排行榜上达到94.85分,匹配人类水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20211 2026-05-21 cs.CV cs.AI 86%

Leveraging Vision-Language Models to Detect Attention in Educational Videos

利用视觉-语言模型检测教育视频中的注意力

Gabriel Becquet, Sébastien Lallé, Vanda Luengo, Ali Abou-Hassan

机构 * Sorbonne University, CNRS, LIP6 & PHENIX(索邦大学、国家科学研究中心、LIP6与PHENIX)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文研究利用视觉-语言模型直接分析教育视频内容,结合眼动数据以提高注意力检测的准确性,但发现其在实时教育诊断中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18162 2026-05-19 cs.CV cs.AI 86%

Self-Evolving Spatial Reasoning in Vision Language Models via Geometric Logic Consistency

通过几何逻辑一致性实现视觉语言模型中的自演化空间推理

Junming Liu, Yuqi Li, Yifei Sun, Maonan Wang, Piotr Koniusz, Yirong Chen, Ding Wang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The City University of New York(纽约城市大学) The Chinese University of Hong Kong(香港中文大学) Data61 CSIRO(Data61澳大利亚国家科学研究院) University of New South Wales(新南威尔士大学) Australian National University(澳大利亚国立大学)

专题命中 视觉推理 :vision language model(title);VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出SAGE框架,通过几何和语言二元操作在视觉语言模型中实现自演化空间推理,提升模型在空间推理任务中的鲁棒性和泛化能力。

Comments 23 pages, 7 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10120 2026-05-12 cs.CV cs.AI 86%

MicroWorld: Empowering Multimodal Large Language Models to Bridge the Microscopic Domain Gap with Multimodal Attribute Graph

MicroWorld: 通过多模态属性图赋能多模态大语言模型,弥合微观领域差距

Manyu Li, Ruian He, Chenxi Ma, Weimin Tan, Bo Yan

机构 * Shanghai Key Laboratory of Intelligent Information Processing(上海智能信息处理关键实验室) School of Computer Science, Fudan University(复旦大学计算机科学学院)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 MicroWorld通过构建多模态属性图增强多模态大语言模型在微观领域的能力,无需领域微调即可提升推理性能,实验显示在MicroVQA和MicroBench基准上均取得显著提升。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09719 2026-05-12 cs.CV cs.AI 86%

Distilling 3D Spatial Reasoning into a Lightweight Vision-Language Model with CoT

将3D空间推理蒸馏到轻量级视觉-语言模型中:利用推理链

Alaa Asfour, Christopher Indris, Leihan Chen, Tejas Vyas, Guanghui Wang

机构 * Department of Computer Science, Toronto Metropolitan University(多伦多 Metropolitan 大学计算机科学系)

专题命中 视觉推理 :vision-language model(title,abstract);LLaVA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出一种知识蒸馏框架,将7B教师模型的3D空间推理能力转移到2.29B学生模型,实现8.7倍更低的推理延迟和3倍模型压缩,同时保留54-72%的性能。引入隐藏推理链提升推理能力,学生模型联合执行空间描述、深度估计和目标检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22228 2026-05-01 cs.CV cs.AI cs.CL 86%

Lost in Space? Vision-Language Models Struggle with Relative Camera Pose Estimation

迷失在空间中?视觉-语言模型在相对相机姿态估计中挣扎

Ken Deng, Yifu Qiu, Yoni Kasten, Shay B. Cohen, Yftah Ziser

机构 * University of Edinburgh(爱丁堡大学) University of Oxford(牛津大学) NVIDIA Research(NVIDIA研究) University of Groningen(格罗宁根大学)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究视觉-语言模型在相对相机姿态估计中的表现,发现其在多视角空间推理中存在显著不足,尽管人类和专用几何方法表现良好,但VLMs仍处于初级水平,揭示了跨视角对应和投影相机运动理解等关键能力缺失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22875 2026-04-29 cs.CV cs.AI 86%

SketchVLM: Vision language models can annotate images to explain thoughts and guide users

SketchVLM:视觉语言模型可以注释图像以解释思路并引导用户

Brandon Collins, Logan Bolton, Hung Huy Nguyen, Mohammad Reza Taesiri, Trung Bui, Anh Totti Nguyen

机构 * Auburn University(阿伯拉罕大学) Adobe Research(Adobe研究)

专题命中 视觉推理 :vision language model(title);vision-language model(abstract);VLM(abstract_cn);visual reasoning(abstract)

AI总结 SketchVLM通过生成可编辑的SVG叠加图提升视觉推理和绘图任务的准确性与注释质量,实现高达28.5%的精度提升和1.48倍的注释质量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14951 2026-04-17 cs.CV cs.AI cs.CL cs.MM 86%

RaTA-Tool: Retrieval-based Tool Selection with Multimodal Large Language Models

RaTA-Tool: 基于检索的多模态大语言模型工具选择

Gabriele Mattioli, Evelyn Turri, Sara Sarto, Lorenzo Baraldi, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(比萨大学)

专题命中 视觉推理 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 本文提出RaTA-Tool框架,利用多模态大语言模型将多模态查询转化为结构化任务描述,并通过语义丰富的工具描述检索合适工具,支持开放世界场景下的工具扩展。

Comments ICPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13993 2026-04-16 cs.AI cs.CL cs.CV 86%

Reward Design for Physical Reasoning in Vision-Language Models

用于视觉语言模型中物理推理的奖励设计

Derek Lilienthal, Manisha Mukherjee, Sameera Horawalavithana

机构 * Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 视觉推理 :vision-language model(title);VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI

AI总结 本文探讨了奖励设计对视觉语言模型物理推理的影响,通过对比不同奖励信号发现,基于准确性的奖励在多数领域表现最佳,而基于注意力权重的奖励提升了空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18892 2026-03-20 cs.CV cs.AI 86%

MultihopSpatial: Multi-hop Compositional Spatial Reasoning Benchmark for Vision-Language Model

MultihopSpatial: 用于视觉语言模型的多跳组合空间推理基准

Youngwan Lee, Soojin Jang, Yoorhim Cho, Seunghwan Lee, Yong-Ju Lee, Sung Ju Hwang

机构 * Electronics and Telecommunications Research Institute, South Korea(韩国电信研究院) Korea Advanced Institute of Science and Technology, South Korea(韩国科学技术院) Sungkyunkwan University, South Korea(成均馆大学) DeepAuto, South Korea(DeepAuto)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文提出MultihopSpatial基准,针对多跳组合空间推理问题,引入Acc@50IoU指标,并通过大规模训练集提升视觉语言模型的空间推理能力。

Comments Project page: https://youngwanlee.github.io/multihopspatial

详情

展开后加载摘要…

URL PDF HTML 收藏