arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26465 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3164 篇

2605.30256 2026-07-30 cs.CV cs.CL cs.HC 版本更新 70%

VideoFDB: Evaluating Full-Duplex Vision-Speech Capabilities in Conversational Agents

VideoFDB: 评估对话代理中的全双工视觉-语音能力

Amrita Mazumdar, Seonwook Park, Rajarshi Roy, Nikhil Srihari, Shengze Wang, Yuhao Zhou, Julia Wang, Koki Nagano, Shalini De Mello

机构 * NVIDIA David AI

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 提出首个全双工视听到视听(AV2AV)对话基准VideoFDB,通过237个真实视频片段、感知与生成行为分类以及基于评分规则的LM评判框架,系统评估代理在非语言对话动态中的表现,发现现有系统存在字幕崩溃和视觉流忽视等缺陷。

Comments Project page: https://research.nvidia.com/labs/amri/projects/video-fdb/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15353 2026-07-29 cs.CL cs.AI 版本更新 70%

NeuroSymActive: Differentiable Neural-Symbolic Reasoning with Active Exploration for Knowledge Graph Question Answering

NeuroSymActive:基于主动探索的可微神经符号推理用于知识图谱问答

Rong Fu, Yang Li, Zeyu Zhang, Jiekai Wu, Yaohua Liu, Shuaishuai Cao, Yangchen Zeng, Yuhang Zhang, Xiaojing Du, Simon Fong

机构 * University of Macau(澳门大学) University of Chinese Academy of Sciences(中国科学院大学) The Australian National University(澳大利亚国立大学) Juntendo University(静冈大学) Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院) Central South University(中南大学) Southeast University(东南大学) China Agricultural University(中国农业大学) Adelaide University(阿德莱德大学)

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 NeuroSymActive结合可微神经符号推理层和主动探索控制器,通过软统一流程模块和神经路径评估器提升知识图谱问答的准确性和效率。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01483 2026-07-21 cs.RO cs.AI 版本更新 70%

Spatiotemporal Knowledge Graphs as Persistent Scene Memory for Embodied Question Answering

VL-KnG:从单目视频构建持久时空知识图谱以实现具身场景理解

Mohamad Al Mdfaa, Svetlana Lukina, Timur Akhtyamov, Arthur Nigmatzyanov, Dmitrii Nalberskii, Sergey Zagoruyko, Gonzalo Ferrer

机构 * Applied AI Institute, Moscow, Russia(莫斯科应用人工智能研究所)

专题命中 视觉问答 :vision-language model(abstract);grounding(abstract);分类 cs.AI

AI总结 VL-KnG通过构建时空知识图谱实现高效具身场景理解,采用LLM驱动的时空对象关联和图增强检索,无需3D重建,支持常数时间推理,优于现有前沿VLMs。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10350 2026-07-20 cs.AI cs.RO 版本更新 70%

ABot-AgentOS: A General Robotic Agent OS with Lifelong Multi-modal Memory

ABot-AgentOS:一个具有终身多模态记忆的通用机器人智能体操作系统

Jiayi Tian, Shiao Liu, Yuting Xu, Jia Lu, Zihao Guan, Honglin Han, Di Yang, Minqi Gu, Yifei Qian, Tianlin Zhang, Yanqing Zhu, Zeqian Ye, Menglin Yang, Fei Wang, Xu Hu, Xiuxian Li, Wei Zhang, Shihui Su, Yiyan Ji, Jingbo Wang, Ziteng Feng, Jiaheng Liu, Zhaoxiang Zhang, Xiaolong Wu, Zixiao Tang, Zhining Gu, Yang Cai, Linbo Zheng, Jingjing Ma, Mingyang Yin, Zedong Chu, Wenbin Tang, Mu Xu

机构 * AMAP CV Lab(AMAP计算机视觉实验室)

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 研究针对长期具身智能体运行需求,提出ABot-AgentOS通用机器人智能体操作系统,引入EmbodiedWorldBench基准,采用通用多模态图记忆及失败驱动自我进化循环,在相关测试中表现良好,证明该系统层可提升具身执行并提供持久记忆。

Comments Code: https://github.com/amap-cvlab/ABot-AgentOS Project page: https://amap-cvlab.github.io/ABot-AgentOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 70%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交 70%

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07089 2026-07-08 cs.CV 版本更新 70%

RS-Agent: Automating Remote Sensing Tasks through Intelligent Agent

RS-Agent:通过智能代理实现遥感任务自动化

Wenjia Xu, Zijian Yu, Boyang Mu, Jiuniu Wang, Zhiwei Wei, Mugen Peng

机构 * State Key Laboratory of Networking and Switching Technology, Beijing University of Posts and Telecommunications, Beijing 100876, China(网络与交换技术国家重点实验室,北京邮电大学,中国) City University of HongKong, Hong Kong 999077, China(香港城市大学,中国) School of Geographic Sciences, Hunan Normal University, Changsha 410081, China(地理科学学院,湖南师范大学,中国)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对多模态大语言模型在遥感任务中的局限,提出RS-Agent智能代理,通过结构化任务规划等连接用户意图与遥感流程,含四个组件及两种方法,实验显示其在多任务中显著优于现有模型,证明结合两者用于智能地理空间分析的价值。

Journal ref SCIENCE CHINA Information Sciences, 69(8), 180302 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05256 2026-07-03 cs.CV 版本更新 70%

Wiki-R1: Incentivizing Multimodal Reasoning for Knowledge-based VQA via Data and Sampling Curriculum

Wiki-R1: 通过数据和采样课程激励基于知识的多模态推理用于VQA

Shan Ning, Longtian Qiu, Xuming He

机构 * ShanghaiTech University(上海科技大学) Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程研究中心) Lingang Laboratory(临港实验室)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出Wiki-R1框架,通过可控课程数据生成和课程采样策略,结合强化学习激励MLLMs在KB-VQA中的推理能力,在Encyclopedic VQA和InfoSeek上取得新SOTA。

Comments Accepted by ICLR 26, code and weights are publicly available

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28780 2026-06-30 cs.IR cs.CV 70%

Multimodal Graph RAG for Long-range Visually Rich Document Understanding

多模态图RAG用于长程视觉丰富文档理解

Yi-Cheng Wang, Chu-Song Chen

机构 * Department of Computer Science and Information Engineering, National Taiwan University(国家台湾大学计算机科学与信息工程系) FinTech Center, National Taiwan University(国家台湾大学金融科技中心)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出多模态图RAG方法,通过构建多模态知识图谱解决长文档视觉问答中全局理解不足的问题,并引入新基准DLVQA进行评测,实验表明该方法优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 70%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交 70%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 70%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27373 2026-06-26 cs.CV 新提交 70%

Paying More Attention to Visual Tokens in Self-Evolving Large Multimodal Models

在自进化大型多模态模型中更加关注视觉标记

Shravan Venkatraman, Ritesh Thawkar, Omkar Thawakar, Rao Muhammad Anwer, Hisham Cholakkal, Salman Khan, Fahad Khan

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Aalto University(阿尔托大学) Australian National University(澳大利亚国立大学) Linköping University(林雪平大学)

专题命中 视觉问答 :visual reasoning(abstract);visual question answering(abstract);分类 cs.CV

AI总结 提出VISE框架,通过几何不变性和语义不变性奖励直接正则化视觉条件策略,解决自进化LMMs中视觉欠条件问题,在无监督设置下提升视觉语言理解。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 70%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25084 2026-06-25 cs.CV 新提交 70%

Are We There Yet? Exploring the Capabilities of MLLMs in Assistive AI Applications

我们到了吗?探索多模态大语言模型在辅助人工智能应用中的能力

Shayon Dasgupta, Avijit Dasgupta, C. V. Jawahar

机构 * IIT BHU India(印度理工学院瓦拉纳西校区) CVIT, IIIT Hyderabad India(印度海得拉巴国际信息技术学院计算机视觉与信息技术中心)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文通过真实世界任务评估多模态大语言模型在辅助AI中的表现,开发NetraLink系统收集基准数据,揭示其优势与局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23557 2026-06-23 cs.CV 新提交 70%

Dense Reward for Multi-View 3D Reasoning with Global Maps and Local Views

基于全局地图与局部视图的多视角3D推理的密集奖励

Jiho Choi, Seonho Lee, Seojeong Park, Hyunjung Shim

机构 * Graduate School of Artificial Intelligence, KAIST, Republic of Korea(韩国科学技术院人工智能研究生院) KRAFTON, Republic of Korea(韩国KRAFTON公司)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 提出DR-MV3D框架,通过全局一致性奖励和局部轨迹奖励对多视角3D VQA的中间推理过程进行密集监督,提升跨视图推理一致性。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19584 2026-06-19 cs.CV 新提交 70%

Language-Instructed Vision Embeddings for Controllable and Generalizable Perception

语言引导的视觉嵌入用于可控且可泛化的感知

Chengzhi Mao, Xudong Lin, Wen-Sheng Chu

机构 * Google(谷歌)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 提出语言引导视觉嵌入(LIVE)方法,利用语言动态引导视觉编码器生成任务中心嵌入,无需任务特定重训练,减少视觉幻觉并提升泛化能力。

Journal ref Published as a conference paper at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19297 2026-06-18 cs.LG cs.RO 新提交 70%

Does VLA Even Know the Basics? Measuring Commonsense and World Knowledge Retention in Vision-Language-Action Models

VLA 甚至知道基础知识吗?衡量视觉-语言-动作模型中的常识和世界知识保留

Nikita Kachaev, Andrey Moskalenko, Matvey Skripkin, Nikita Kurlaev, Daria Pugacheva, Albina Burlova, Mikhail Kolosov, Denis Shepelev, Andrey Kuznetsov, Elena Tutubalina, Aleksandr I. Panov, Alexey K. Kovalev, Vlad Shakhuro

机构 * CogAI Lab(CogAI实验室) FusionBrain Lab(FusionBrain实验室) IAI MSU(MSU人工智能研究所) Lomonosov MSU(Lomonosov莫斯科大学) NUST MISIS Applied AI Institute(应用人工智能研究所) HSE University(俄罗斯高等经济大学) Generalizable AI Systems(可泛化人工智能系统) ISP RAS(俄罗斯科学院信息与自动化过程研究所) MIRAI Domain-specific NLP Group(领域特定自然语言处理小组)

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.LG

AI总结 提出 Act2Answer 协议,通过动作回答评估 VLA 模型的知识保留,发现模型在简单概念上表现良好,但在丰富语义类别上存在差距,且 VQA 联合训练有助于知识保留。

Comments Project page: https://tttonyalpha.github.io/act2answer/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15513 2026-06-18 cs.RO cs.AI 70%

HIMM: Human-Inspired Long-Term Memory Modeling for Embodied Exploration and Question Answering

HIMM:面向具身探索与问答的人类启发式长期记忆建模

Ji Li, Bo Wang, Jing Xia, Mingyi Li, Shiyan Hu

机构 * The University of Hong Kong(香港大学) Beijing Institute of Technology(北京理工大学)

专题命中 视觉问答 :visual reasoning(abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出HIMM模型,通过分离事件记忆与语义记忆,提升具身智能在长期观察和有限上下文下的探索与问答能力,实验显示在多个基准测试中表现优异。

Journal ref IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17053 2026-06-16 cs.CL cs.CV 新提交 70%

Context-Aware RL for Agentic and Multimodal LLMs

上下文感知强化学习用于智能体与多模态大语言模型

Peiyang Xu, Bangzheng Li, Sijia Liu, Karthik R. Narasimhan, Pramod Viswanath, Prateek Mittal, Xingyu Fu

机构 * Princeton University(普林斯顿大学) UC Davis(加州大学戴维斯分校)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 提出ContextRL方法,通过间接辅助目标(上下文选择奖励)增强大模型在长上下文和多模态任务中的细粒度推理能力,在5个长程基准和12个视觉问答基准上分别提升+2.2%和+1.8%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16295 2026-06-16 cs.CV cs.CL 新提交 70%

VisualClaw: A Real-Time, Personalized Agent for the Physical World

VisualClaw:面向物理世界的实时个性化智能体

Haoqin Tu, Jianwen Chen, Zijun Wang, Siwei Han, Juncheng Wu, Hardy Chen, Haonian Ji, Kaiwen Xiong, Jiaqi Liu, Peng Xia, Jieru Mei, Hongliang Fei, Jason Eshraghian, Zeyu Zheng, Yuyin Zhou, Huaxiu Yao, Cihang Xie

机构 * UC Santa Cruz(加州大学圣克鲁兹分校) UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Google(谷歌) UC Berkeley(加州大学伯克利分校)

专题命中 视觉问答 :vision language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出VisualClaw,一种自进化多模态智能体,通过混合编码和技能进化机制降低部署成本并提升准确性,在多个视频QA基准上实现平均-98%的API成本削减和最高+15.80%的准确率提升。

Comments H. T. and J. C. contribute to this project equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15906 2026-06-16 cs.IR cs.AI cs.CL cs.DB cs.MM 新提交 70%

MAGE-RAG: Multigranular Adaptive Graph Evidence for Agentic Multimodal RAG in Long-Document QA

MAGE-RAG:面向长文档问答的多粒度自适应图证据多模态RAG

Yilong Zuo, Xunkai Li, Jing Yuan, Qiangqiang Dai, Hongchao Qin, Ronghua Li

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出MAGE-RAG框架,通过离线构建包含页面和元素节点的证据图,在线自适应构建证据子图,平衡证据覆盖与噪声控制,在长文档多模态问答中取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07962 2026-06-09 cs.CV 新提交 70%

ChronoPhyBench: Do MLLMs Truly Understand the World or Merely Exploit Language Priors?

ChronoPhyBench:多模态大语言模型真正理解世界还是仅仅利用语言先验?

Bin Zhu, Yanhao Jia, Kexin Zhao, Jie Wang, Munan Ning, Hao Li, Yuwei Niu, Tanqing Sun, Huangchong Yan, Mingjun Pan, Xinyi Wu, Qishen Yin, Yunyang Ge, Shuai Zhao, Li Yuan

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) Peng Cheng Laboratory(鹏城实验室) Rabbitpre Intelligence Nanyang Technological University(南洋理工大学) Tsinghua University(清华大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出ChronoPhyBench基准,通过视频上下文和文本描述强制模型进行物理状态推理,揭示当前开源模型物理推理能力仍处初级阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24481 2026-06-05 cs.CV 70%

OmniEgo-R$^2$: A Routed Reasoning Framework for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

OmniEgo-R$^2$:面向CVPR 2026首届跨领域EgoCross挑战赛的路由推理框架

Zixu Li, Zhiwei Chen, Zhiheng Fu, Wenbo Wang, Yupeng Hu, Weili Guan, Liqiang Nie

机构 * Shandong University(山东大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对跨领域自我中心视频推理中的时间边界模糊、语义粒度不匹配和决策不稳定问题,提出OmniEgo-R$^2$路由推理框架,在Source-Limited和Open-Source赛道均获第二名。

Comments Technical Report for the 1st Cross-Domain EgoCross Challenge at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01132 2026-06-02 cs.CV 70%

HakushoBench: A Japanese Chart and Table VQA Benchmark from Governmental White Papers

HakushoBench:来自政府白皮书的日语图表VQA基准

Issa Sugiura, Shuhei Kurita, Yusuke Oda, Naoaki Okazaki

机构 * Institute of Science Tokyo(东京科学研究所) NII(日本学术振兴会) NII LLMC(日本学术振兴会LLMC)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 利用政府白皮书构建日语图表VQA基准HakushoBench,包含2053张图像和人工标注问答对,评估视觉语言模型对图表的深度理解。

Comments 16 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31075 2026-06-01 cs.CV 70%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23764 2026-05-26 cs.CV cs.CL 70%

MMSI-Bench: A Benchmark for Multi-Image Spatial Intelligence

MMSI-Bench:多图像空间智能基准

Sihan Yang, Runsen Xu, Yiman Xie, Sizhe Yang, Mo Li, Jingli Lin, Chenming Zhu, Xiaochen Chen, Haodong Duan, Xiangyu Yue, Dahua Lin, Tai Wang, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) The Chinese University of Hong Kong(香港中文大学) Zhejiang University(浙江大学) Tsinghua University(清华大学) Shanghai Jiaotong University(上海交通大学) University of Hong Kong(香港大学) Beijing Normal University(北京师范大学)

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出MMSI-Bench基准,通过1000道精心设计的VQA问题评估多图像空间推理能力,发现现有模型准确率远低于人类。

Comments ICLR 2026 Camera ready. 38 pages. Project page: https://runsenxu.com/projects/MMSI_Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18111 2026-05-19 cs.CL cs.CV 70%

How Good LLMs Are at Answering Bangla Medical Visual Questions? Dataset and Benchmarking

LLMs在回答孟加拉语医学视觉问题方面的表现如何?数据集与基准测试

Rafid Ahmed, Intesar Tahmid, Mir Sazzat Hossain, Tasnimul Hossain Tomal, Md Fahim, Md Farhad Alam Bhuiyan

机构 * Penta Global Limited Center for Computational & Data Sciences, Independent University(独立大学计算与数据科学中心)

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 本文提出BanglaMedVQA数据集,用于评估当前基础模型在孟加拉语医学视觉问答任务中的表现,发现其性能显著低于英语基准,揭示了低资源语言在医学推理中的挑战。

Comments 14 pages, 7 figures, 5 tables, Proceedings of The Second AAAI Bridge Program on AI for Medicine and Healthcare, PMLR 317:1-14, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12497 2026-05-13 cs.CV 70%

From Web to Pixels: Bringing Agentic Search into Visual Perception

从网络到像素:将代理搜索引入视觉感知

Bokang Yang, Xinyi Sun, Kaituo Feng, Xingping Dong, Dongming Wu, Xiangyu Yue

机构 * Deep Research

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出感知深度研究,引入WebEye基准,通过代理搜索到像素的工作流程,解决隐藏目标身份并绑定到框、掩码或 grounded 答案,实验显示其在三个任务视图中表现最佳。

Comments Project page: https://pixel-searcher.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12074 2026-05-13 cs.CV 70%

BARISTA: A Multi-Task Egocentric Benchmark for Compositional Visual Understanding

BARISTA:一种多任务第一人称视角基准,用于组合视觉理解

Patrick Knab, Orgest Xhelili, Inis Buzi, Drago Andres Guggiana Nilo, Mohd Saquib Khan, Lorenz Kolb, Manuel Scherzer, Kerem Yildirir, Christian Bartelt, Philipp Johannes Schubert

机构 * Ramblr.ai Research(Ramblr.ai 研究院) Technical University of Clausthal(Clausthal 技术大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV

AI总结 BARISTA通过185个真实世界咖啡制作视频,提供密集标注的数据集,涵盖全自动、手冲和胶囊式流程,用于评估场景理解中的多任务能力,揭示任务家族间强变化及无主导模型家族。

详情

展开后加载摘要…

URL PDF HTML 收藏