arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-27 至 2026-08-27 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 5 篇

2608.26091 2026-08-27 cs.IR cs.CL cs.CV 新提交 86%

PlanSightRAG: A Visual-First Multimodal RAG for Automating Question Answering and Compliance Checking for Civil Standard Plans

PlanSightRAG:面向民用标准图纸的自动化问答与合规检查的视觉优先多模态检索增强生成模型

Nabaraj Subedi, Shuvo Dip Datta, Ahmed Abdelaty, Shivanand Venkanna Sheshappanavar

专题命中 视觉问答 :grounding(summary_cn,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对民用标准图纸的OCR自动化方法会丢失关键几何信息,本文提出视觉优先多模态RAG框架PlanSightRAG,整合多向量检索与智能体架构,构建基准数据集并验证其在检索、合规检查任务上的性能,还实现了自主视觉规则 grounding。

Comments 32 pages, 9 figures, 25 tables. Preprint submitted to Automation in Construction

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25618 2026-08-27 cs.CL 新提交 83%

AWM: Answerable Working Memory for Long-Document VQA Agents

AWM:面向长文档VLM智能体的可回答工作记忆

Dongzhuoran Zhou, Yuqicheng Zhu, Yule Liu, Zhen Yang, Rui Lu, Yuxiao Dong, Jie Tang, Evgeny Kharlamov

机构 * University of Oslo(奥斯陆大学) Bosch Center for AI(博世人工智能中心) University of Stuttgart(斯图加特大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Tsinghua University(清华大学)

专题命中 视觉问答 :VLM(title_cn,abstract);visual question answering(abstract)

AI总结 针对长文档VQA智能体的记忆质量盲区,提出AWM方法,通过融入仅记忆可回答性的GRPO奖励机制,提升了最终答案准确率并降低记忆缺失正确的比例。

Comments EMNLP 2026 Findings. 16 pages, 4 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25422 2026-08-27 cs.IT 新提交 67%

Towards Faithful and Efficient Semantic Communication: An Ontological Approach

面向忠实且高效的语义通信:一种本体论方法

Yixiao Feng, Yueting Wang, Yining Wang, Han Han, Bo Zhang

专题命中 视觉问答 :vision-language model(abstract);visual question answering(abstract)

AI总结 针对多视图VQA任务,提出ODSC本体驱动语义通信框架,通过共享本体知识库优化场景图,可减少SI数据量、提升问答准确率及多视图VQA准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.08897 2026-08-27 cs.CV cs.AI cs.CL cs.MM 版本更新 62%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05393 2026-08-27 cs.CV 版本更新 57%

PreResQ-R1: Response-Preference Disentangled Ranking-and-Scoring Reinforcement Optimization for Robust Visual Quality Assessment

PreResQ-R1:用于鲁棒视觉质量评估的响应偏好解耦排序与评分强化优化

Zehui Feng, Weichuan Wang, Xiaohan Chen, Ting Han

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学)

专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出PreResQ-R1框架,通过解耦响应偏好的强化学习统一评分与排序目标,结合GRPO优化,在IQA和VQA基准上取得最优结果,推理轨迹更贴合人类感知。

Comments 27 pages, 16 figures, Accepted as EMNLP 2026 conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏