arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 242 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 242 篇

2607.04079 2026-07-07 cs.CV cs.AI cs.LG 新提交 75%

Seeing Once is Enough? Online Geometry-Aware Token Pruning for 3D Question Answering

看一次就够了?用于3D问答的在线几何感知令牌剪枝

Ruei-Chi Lai, Bolivar Solarte, Chin-Hsuan Wu, Yi-Hsuan Tsai, Min Sun

机构 * National Tsing Hua University(国立清华大学) Industrial Technology Research Institute ITRI(工业技术研究院) University of Toronto(多伦多大学) Atmanity Inc(Atmanity公司)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 针对3D问答中多模态大语言模型推理成本高的问题,提出在线令牌剪枝方法,利用深度和相机姿态投影到体素空间,识别重叠区域并剪枝冗余令牌,减少令牌使用,提升效率和性能。

Comments published at ICLR 2026 Workshop on Efficient Spatial Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25136 2026-06-25 cs.RO 新提交 75%

Memory Retrieval in Visuomotor Policies for Long-Horizon Robot Control

视觉运动策略中的记忆检索用于长期机器人控制

Rutav Shah, Yisu Li, Femi Bello, Yuke Zhu, Roberto Martín-Martín

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉问答 :VLM(abstract,abstract_cn);vision-language model(abstract)

AI总结 提出HALO策略,通过注意力记忆检索机制和视觉语言模型先验蒸馏,解决长期控制中的虚假相关和记忆误差累积问题,实现从长达8分钟历史中检索任务相关信息。

Comments 16 pages, 5 tables, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15539 2026-08-18 cs.CV 新提交 74%

CrossView: Can Vision-Language Models Reason Across Cameras?

CrossView:视觉-语言模型能否跨相机进行推理?

Sahil Shah, S P Sharan, Harsh Goel, Manvik Pasula, Adithya Hebbalae, Minkyu Choi, Sandeep P. Chinchali

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视觉问答 :vision-language model(title);分类 cs.CV

AI总结 本文提出CrossView多相机视频问答基准,评估发现GPT-5.2等模型跨相机推理准确率低,开源模型表现更差,该基准可用于测试模型联合处理多视角的能力。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16902 2026-06-16 cs.RO cs.AI 新提交 74%

Binary Tracking for Spatial QA and Navigation with Open Vision-Language Models

基于开放视觉语言模型的空间问答与导航的二值追踪

Dongbin Na, Chanwoo Kim, Soonbin Rho, Giyun Choi, Gangbok Lee, Dooyoung Hong

机构 * RGA Inc.(RGA公司)

专题命中 视觉问答 :vision-language model(title);分类 cs.AI

AI总结 提出BinTrack,一种全开源的空间定位代理,通过二值搜索轨迹段,在SpaceLocQA基准上准确率提升22.8%,推理速度提升1.5倍,并发布多行程室外数据集GangnamLoop。

Comments 21 pages, 4 figures, 15 tables. Project page: https://ndb796.github.io/BinaryTracking ; Code and dataset: https://github.com/ndb796/BinaryTracking

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14075 2026-08-17 cs.AI cs.CV cs.DL 新提交 73%

A Pathway to General-Purpose Scientific AI: Multimodal Comprehension of Scientific Images

通用科学人工智能的实现路径:科学图像的多模态理解

Jennifer D'Souza, Fahad Ahmed, Cecilia Andrea Bustamante Andrade, Lina Frolova, Poorani Gnanasambandan, Dilshad Hussain, Muhammad Uzair Khan, Nkembeng Kevin Nkengfoa, Paul Praveen J., Fabio Priante, Sjoerd Franciscus van der Werf, Thomas Frederik Jan van Roeden

机构 * TIB Leibniz Information Centre for Science and Technology(莱布尼茨科学与技术信息中心(TIB)) Eindhoven University of Technology(埃因霍温理工大学) Freie Universität Berlin(柏林自由大学) International Center for Chemical and Biological Sciences, University of Karachi(卡拉奇大学国际化学与生物科学中心) National University of Sciences and Technology(国家科技大学) University of Warwick(华威大学) PSG College of Technology(PSG理工学院) Aalto University(阿尔托大学)

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 该研究提出以科学图像多模态理解构建通用科学AI的路径,依托ALD/E-ImageMiner基准与2026年ICDAR竞赛,明确相关任务能力检验维度及长期研究方向,推动可机器执行的科学视觉知识与可验证多模态科学AI发展。

Comments 15 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10964 2026-08-12 cs.CV cs.AI 新提交 73%

CARE: Confidence-Aware Reasoning for Reliable Medical VQA

CARE:用于可靠医学视觉问答的置信感知推理

Yuetian Du, Yucheng Wang, Zhenyuan Chen, Luyuan Chen, Rongyu Zhang, Jinjian Zhang, Wei Zhou, Zhijie Xu, Ming Kong, Zhan Zhou, Jie Liu, Qiang Zhu

机构 * Ant Group(蚂蚁集团) University of Michigan(密歇根大学) City University of Hong Kong(香港城市大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 该研究针对医学多模态大语言模型的置信度校准问题,提出CARE框架,通过双阶段流程优化准确率与校准度,在三个医学VQA基准上取得最优性能,为临床决策支持提供可信基础。

Comments Accepted by MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03826 2026-08-05 cs.CV cs.LG 新提交 73%

Geo-Embed: Towards Unified Multimodal Embeddings for Urban Understanding

Geo-Embed:面向城市理解的统一多模态嵌入

Jiapeng Li, Yong Li, Junjie Zhou, Fan Zhang, Yu Liu

专题命中 视觉问答 :visual question answering(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文针对现有多模态嵌入模型难以支持异构地理空间任务的问题,提出GeoMEB基准与Geo-Embed模型,在GeoMEB上实现15.3%的相对性能提升,为地理空间嵌入器发展提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01664 2026-08-04 cs.CV cs.LG 新提交 73%

FAU at ImageCLEF 2026 Task on Multimodal Reasoning Robust Candidate Scoring and Concise Multilingual Visual Answering

FAU参加2026年ImageCLEF多模态推理任务:鲁棒候选评分与简洁多语种视觉问答

Mohamed Basem, Vincent Christlein

机构 * Friedrich-Alexander-Universität Erlangen-Nürnberg(弗里德里希-亚历山大-埃尔兰根-纽伦堡大学)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV、cs.LG

AI总结 FAU提交的多模态推理系统,未做任务特定模型训练,在2026年ImageCLEF竞赛中,获Visual MCQ第三名、Visual OpenQA第一名,凸显推理工程的实用价值。

Comments 16 pages, 3 figures, 7 tables. CLEF 2026 Working Notes, ImageCLEF 2026 Multimodal Reasoning Task

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01328 2026-08-04 cs.CL cs.AI cs.CV 新提交 73%

LongChart VQA: A Comprehensive Benchmark for MLLMs with Complex Multi-Chart Reasoning

LongChart VQA:面向具备复杂多图表推理能力的多模态大语言模型的综合基准

Ziyan Xiao, Yinghao Zhu, Wenting Zhang, Heaju Kim, Lequan Yu

机构 * The University of Hong Kong(香港大学)

专题命中 视觉问答 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 LongChart VQA是面向具备复杂多图表推理能力的MLLMs的综合基准,该基准含平均6.5张图像与31.2个问题,评估10个SOTA MLLMs发现其准确率随计算复杂性提升下降,为多图表推理研究指明方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00345 2026-08-04 cs.CV cs.AI 新提交 73%

ORCA: ORgan-Centroid Aggregation for Training-Free 3D CT Visual Token Compression

ORCA:面向无需训练的3D CT视觉令牌压缩的器官质心聚合方法

Renjie Liang, Zijian Xu, Jinqian Pan, Chengkun Sun, Zhengkang Fan, Shawn Li, You Qin, Mei Liu, Jie Xu

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 针对3D CT视觉令牌压缩的痛点,提出无需训练的即插即用ORCA方法,在多数据集、多任务上实现显著压缩比与速度提升,性能优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03006 2026-07-07 cs.CV cs.AI cs.SE 新提交 73%

PosterHarness: Turning Scientific Poster Generation into an Auditable Instruction-Following Benchmark

PosterHarness:将科学海报生成转变为可审计的指令跟随基准

Tianyi Yang, Dawei Fu, Youpeng Wu, Zixun Kou, Linrui Chen, Ruobing Jiang, Zijian Wang, Qiang Li

机构 * School of Physics, Peking University(北京大学物理学院)

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对文本丰富图像模型,缺乏衡量其是否遵循科学传播规范的方法这一问题,提出PosterHarness,将海报生成变为可审计任务,介绍核心方法,展示了相关实验发现及与其他方法的对比结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01436 2026-07-03 cs.AI cs.LG 新提交 73%

Discrete Diffusion Language Models for Interactive Radiology Report Drafting

离散扩散语言模型用于交互式放射报告草稿生成

Max Van Puyvelde, Halil Ibrahim Gulluk, Wim Van Criekinge, Olivier Gevaert

机构 * Stanford University School of Medicine(斯坦福大学医学院) Ghent University(根特大学) Stanford University(斯坦福大学)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.AI、cs.LG

AI总结 提出将离散扩散语言模型用于放射报告草稿生成,利用其任意顺序填充能力实现交互式编辑,在医学VQA任务上达到或超越自回归模型,解码速度快3.5-4.4倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 73%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27023 2026-06-26 cs.LG cs.CL cs.CV 新提交 73%

Just how sure are you? Improving Verbalized Uncertainty Calibration in Medical VQA

你到底有多确定?改进医学视觉问答中的口头不确定性校准

Eren Senoglu, Federico Toschi, Nicolo Brunello, Andrea Sassella, Mark James Carman

机构 * Politecnico di Milano(米兰理工大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 针对多模态大语言模型在医学VQA中过度自信的问题,提出基于复合损失函数的微调框架,通过校准项、锚定正则化、对比对齐和KL稳定项,将校准误差降低60%以上,判别力提升26%以上。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19950 2026-06-19 cs.CV cs.AI 新提交 73%

Confidence Calibration for Multimodal LLMs: An Empirical Study through Medical VQA

多模态大语言模型的置信度校准:基于医学视觉问答的实证研究

Yuetian Du, Yucheng Wang, Ming Kong, Tian Liang, Qiang Long, Bingdi Chen, Qiang Zhu

机构 * College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) School of Computer Science and Technology, Xidian University(西安电子科技大学计算机科学与技术学院) Zhihui Medical Technology (Shanghai) Co., Ltd.(智汇医疗科技(上海)有限公司)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型在医学任务中置信度与准确性不匹配的问题,提出结合多策略融合询问与专家大语言模型评估的方法,在三个医学VQA数据集上将期望校准误差平均降低40%,提升了模型可靠性。

Comments Accepted by MICCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16256 2026-06-16 cs.CV cs.LG 新提交 73%

KeepLoRA++: Continual Learning with Layer-Scaled Residual Gradient Adaptation

KeepLoRA++: 基于层级缩放残差梯度适应的持续学习

Mao-Lin Luo, Yi-Lin Zhang, Zi-Hao Zhou, Yankun Hong, Xialiang Tong, Mingxuan Yuan, Tong Wei, Min-Ling Zhang

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Key Laboratory of Computer Network and Information Integration, Southeast University, Ministry of Education(东南大学计算机网络和信息集成教育部重点实验室) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV、cs.LG

AI总结 针对预训练视觉语言模型持续学习中保留预训练知识、旧任务知识和学习新知识的冲突,提出KeepLoRA++,通过层级缩放残差梯度适应方法,限制LoRA参数更新到残差子空间并采用浅到深层缩放,平衡三者,在图像分类、视觉问答和视频理解任务上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14958 2026-06-16 cs.CV cs.IR cs.LG 新提交 73%

MVEB: Massive Video Embedding Benchmark

MVEB:大规模视频嵌入基准

Adnan El Assadi, Roman Solomatin, Isaac Chung, Chenghao Xiao, Deep Shah, Manan Dey, Shriya Sudhakar, Zacharie Bugaud, Wissam Siblini, Ayush Sunil Munot, Yashwanth Devavarapu, Rakshitha Ireddi, Michelle Yang, Márton Kardos, Niklas Muennighoff, Kenneth Enevoldsen

机构 * Harvard University(哈佛大学) SaluteDevices MIRAI Zendesk Shanghai University of Finance and Economics(上海财经大学) Google LLC Salesforce Cornell University(康奈尔大学) Astera Institute(Astera研究院) Independent Contributor(独立贡献者) Indian Institute of Technology, Kharagpur(印度理工学院,克拉格浦分校) Barclays(巴克莱银行) Aarhus University(奥胡斯大学) Stanford University(斯坦福大学)

专题命中 视觉问答 :MLLM(abstract,abstract_cn);分类 cs.CV、cs.LG

AI总结 提出MVEB基准,包含23个任务评估33种视频嵌入模型,发现无单一模型占优,音频贡献取决于标注来源,并集成到MTEB生态。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07130 2026-06-08 cs.CL 新提交 71%

Explicit Evidence Grounding via Structured Inline Citation Generation

通过结构化内联引文生成实现显式证据基础

Anar Yeginbergen, Amelie Wührl, Anna Rogers, Rodrigo Agerri

机构 * University of the Basque Country (UPV/EHU)(巴斯克大学) IT University of Copenhagen(哥本哈根IT大学)

专题命中 视觉问答 :grounding(title)

AI总结 提出FullCite框架,通过提示生成、约束解码和后处理跨度对齐三种策略生成结构化内联引文,在三个QA基准上评估引文质量和忠实性,发现LLMs虽能识别相关文档但难以精确定位支持性证据跨度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18166 2026-08-20 eess.IV cs.CV 新提交 70%

TractoGraphVLM: A Unified Vision-Language Framework for White Matter Tractography

TractoGraphVLM:用于白质纤维束成像的统一视觉-语言框架

Gurucharan Marthi Krishna Kumar, Janine Dale Mendola, Amir Shmuel

专题命中 视觉问答 :vision language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 TractoGraphVLM是统一视觉-语言框架,可完成白质纤维束的分类、检索、描述、问答四项任务,在HCP数据集上表现良好,具跨年龄迁移鲁棒性,仅从语言学习神经解剖学知识。

Comments Accepted as a Spotlight at the ECCV 2026 Workshop on Artificial Intelligence for Medical 3D Vision (AI4M3D). Our codebase, including all training and evaluation pipelines, is publicly available at https://github.com/AS-Lab/Marthi-et-al-2026-TractoGraphVLM-Unified-Vision-Language-White-Matter-Tractography

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11329 2026-08-13 cs.SD cs.CV cs.MM 新提交 70%

Qwen-MusicAVQA-7B: A Multimodal Model for Music Audio-Visual QA

Qwen-MusicAVQA-7B:一种用于音乐音频-视觉问答的多模态模型

Maryam Dehdashti

机构 * Inference Matter Labs(推理物质实验室)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 该研究提出轻量级多模态模型Qwen-MusicAVQA-7B,通过连接冻结的Whisper编码器与Qwen2-VL-7B-Instruct,在MUSIC-AVQA等基准上实现高准确率,训练成本低,且发现音频时间信息保留程度影响下游问答准确率。

Comments 24 pages, 1 figure, 8 tables. Code: https://github.com/MKDehdashti/Qwen2-vl-audio Checkpoints: https://huggingface.co/MayaKD/qwen2-vl-audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08491 2026-08-11 cs.AI 新提交 70%

TrustRoboReward: Preference-Ordered Isotonic Score Editing for Multi-Paradigm Robot Reward Models

TrustRoboReward:面向多范式机器人奖励模型的偏好有序保序分数编辑方法

Yidong Wang, Yan Zhan, Ziteng Feng, Zhenyu Cui, Ziyi Zhou, Renzhao Liang, Jiaxuan Zhu, Zilei Yang, Yiran Zhao, Zhongkuan Mao, Bo Jia, Hanchu Ni, Chenggang Xie, Biao Liu, Yi Zhang, Yong Dai, Xiaozhu Ju, Wei Ye, Shikun Zhang

机构 * Peking University(北京大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) University of Science and Technology of China(中国科学技术大学) Southeast University(东南大学) Southern University of Science and Technology(南方科技大学) Beijing University of Aeronautics and Astronautics(北京航空航天大学) Beijing Language and Culture University(北京语言大学) Sichuan University(四川大学) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.AI

AI总结 针对现有机器人奖励模型的跨范式偏好与分数不一致问题,本文提出 TrustRoboReward 框架,通过 POISE 方法解决反转冲突,训练的 Qwen3-VL-4B 性能接近 GPT-5-mini,优于 RoboReward 基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07763 2026-08-11 cs.CL cs.CV 新提交 70%

Jako Tako or Fluent? Presenting PoVisLE: A Polish Vision-Language Evaluation

Jako Tako 还是 Fluent?推出 PoVisLE:波兰语视觉-语言评估基准

Anna Kołos, Grzegorz Statkiewicz, Karolina Seweryn, Katarzyna Kowol, Karolina Piosek, Wojciech Kusa

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 针对现有英语中心视觉-语言模型在文化理解上的不足,推出波兰语单文化视觉-语言基准 PoVisLE,含1117张图像与2366对标注VQA样本,可评估深层文化多模态理解。

Comments 28 pages. Preprint under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06972 2026-08-10 cs.CV 新提交 70%

Generative Embedding Benchmark: How Much Information Survives in a Dense Embedding?

生成式嵌入基准:密集嵌入中保留了多少信息?

Yun Li, Biao Yang, Peixi Wu, Yunhao Zhou, Mingzhou Jiang, Wei Yuan, Fan Yang, Wenwu Ou

专题命中 视觉问答 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究提出Generative Embedding Benchmark(GEB),通过仅用嵌入和问题文本的解码器评估7种嵌入模型,发现生成式读出能揭示可分性评估未捕捉的信息瓶颈,视觉语言模型嵌入表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27830 2026-07-31 cs.CV 新提交 70%

Thinking Once Is Enough: Intermediate-Layer Evidence Routing for High-Resolution VQA

一次思考足矣:面向高分辨率视觉问答的中间层证据路由

Zhongkuan Mao, Xianjie Liu, Tianyu Meng, Yidong Wang, Wenzhuo Zhao, Ronghao Xian, Yao Jiang, Fei Shen, Junfeng Fang, Yong Dai, Yi Zhang, Keren Fu

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文针对高分辨率视觉问答提出无需训练的Thinking-Once证据路由方法,通过利用中间层留存的细粒度证据,在多个基准上提升性能并降低内存与推理时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27506 2026-07-31 cs.CL cs.AI 新提交 70%

Models for minimalist RAG: B1ade 335M Embedding and 1B Parameter Small Language Models

极简RAG的模型:B1ade 335M嵌入模型与1B参数小型语言模型

Shreyas Subramanian, Mecit Gungor, Vikram Elango

机构 * Amazon(亚马逊公司)

专题命中 视觉问答 :grounding(abstract,abstract_cn);分类 cs.AI

AI总结 该研究提出含B1ade-embed嵌入模型与B1ade-1B小型语言模型的高效极简RAG架构,其在多QA基准及RAG评估中表现优异,还涌现出无明确监督的来源引用能力,验证了资源高效RAG的可行路径。

Comments 28 pages, 3 figures. Submitted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14660 2026-07-17 cs.CV 新提交 70%

VIABench: A Comprehensive Video Benchmark Collected from Blind Individuals for Visual Impairment Assistance

VIABench:一个从视障人士收集的用于视障辅助的综合视频基准测试

Yunfeng Liu, Yuandong Yang, Jiarui Han, Zhenpeng Huang, Yuqing Tang, Xiangyu Zeng, Gangshan Wu, Limin Wang

机构 * Nanjing University(南京大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 针对视障人士视觉信息获取难及多模态大语言模型在视障辅助中实用价值待探索的问题,引入VIABench视频基准测试,定义三个核心任务,提出严格测试流程,实验表明当前模型对视障人士支持不足,有望推动定制模型开发以改善其体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12764 2026-07-15 cs.CV 新提交 70%

EvoGraph-R1: Self-Evolving Multimodal Knowledge Hypergraphs for Agentic Retrieval

EvoGraph-R1:用于智能检索的自进化多模态知识超图

Jiashi Lin, Changhong Jiang, Xiangru Lin, Ruifei Zhang, Xinyi Zhu, Jiyao Liu, Cheng Tang, Ye Du, Shujian Gao, Junzhi Ning, Lihao Liu, Ziyan Huang, Tianbin Li, Jin Ye, Junjun He

机构 * Northwestern Polytechnical University(西北工业大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Hong Kong(香港大学) Monash University(莫纳什大学) The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 视觉问答 :grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 研究针对现有GraphRAG方法将知识图视为静态数据结构的局限,提出EvoGraph-R1自进化框架,把检索建模为MDP,智能体通过多种操作使超图结构进化以支持多跳推理,实验证明该方法在多模态问答基准测试中大幅优于现有基线。

Comments 10 pages main paper, 6 figures. CVPR 2026 accepted paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28060 2026-06-29 cs.CV 新提交 70%

ReScene: Structured Indoor Scene Reconstruction from Multi-View Captures

ReScene: 基于多视角图像的结构化室内场景重建

Haoran Xu, Lechao Zhang, Daoguo Dong, Yan Gao, Xin Tan

机构 * School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院) Institute of Trustworthy Embodied AI, Fudan University(复旦大学可信具身智能研究院)

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 提出ReScene框架,通过层级视图选择和关系感知组装,解决多视角场景重建中跨视角关系融合与物理一致性难题,在ScanNet上实现几何、渲染和感知质量的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28049 2026-06-29 cs.CV 新提交 70%

AirGroundBench: Probing Spatial Intelligence in Multimodal Large Models under Heterogeneous Multi-View Embodied Collaboration

AirGroundBench: 异构多视角具身协作下多模态大模型的空间智能探测

Haotian Li, Yida Wang, Leyuan Wang, Jinshan Lai, Keyang Wang, Zonghao Guo, Qiang Ma, Liuyu Xiang, Jianwei Hu, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) QiYuanLab(启元实验室) Tsinghua University(清华大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视觉问答 :visual question answering(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 提出AirGroundBench基准,通过异构无人机-无人车协作的多视角任务(10类、约6.2万道视觉问答和115个导航任务),系统评估多模态大模型在空间感知、跨视角对齐、空间变换推理和具身决策中的几何一致性,发现模型在跨视角对齐和变换推理上存在瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22873 2026-06-29 cs.CV cs.CL 新提交 70%

SingGuard: A Policy-Adaptive Multimodal LLM Guardrail with Dynamic Reasoning

SingGuard: 一种策略自适应的多模态大语言模型护栏,具有动态推理能力

SingGuard Team

机构 * AI Security Lab, Ant Group(蚂蚁集团AI安全实验室)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract_cn);分类 cs.CV

AI总结 提出SingGuard,一种策略自适应的多模态护栏模型,通过将策略作为运行时输入,支持快速、混合和慢速推理模式,实现动态规则下的安全评估,在多个基准上取得最优F1。

详情

展开后加载摘要…

URL PDF HTML 收藏