arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 26349 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 3153 篇

2605.13330 2026-05-14 cs.CL 50%

FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

FIND:迈向印度语言多模态金融推理与问答

Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad, Manish Gupta, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Microsoft(微软)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出FinVQA基准和FIND框架,针对多语言印度语言金融推理挑战,通过多模态和数值推理提升金融决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10877 2026-05-12 cs.CL cs.IR 50%

Neural at ArchEHR-QA 2026: One Method Fits All: Unified Prompt Optimization for Clinical QA over EHRs

神经网络在ArchEHR-QA 2026中的应用:一种方法适用于所有:面向电子健康记录的临床问答的统一提示优化

Abrar Majeedi, Viswanatha Reddy Gajjala, Sai Prasanna Teja Reddy Bogireddy, Siddhant Rai

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Chicago(芝加哥大学) Independent Researcher(独立研究员)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出Neural1.5方法,通过分阶段的提示优化提升电子健康记录中的临床问答性能,实现多任务统一优化,展现系统性提示优化的有效性。

Comments Accepted to CL4Health @ LREC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10199 2026-05-12 cs.CL eess.AS 50%

How Should LLMs Listen While Speaking? A Study of User-Stream Routing in Full-Duplex Spoken Dialogue

LLMs在说话时应该如何倾听?对全双工语音对话中用户流路由的探讨

Hui Lu, Xueyuan Chen, Huimeng Wang, Shuhai Peng, Shiyin Kang, Xixin Wu, Zhiyong Wu

机构 * The Chinese University of Hong Kong(香港中文大学) SenseTime Research(商汤科技研究院) Tsinghua University(清华大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 研究探讨了全双工语音对话中用户流路由对LLM的影响,通过对比通道融合与交叉注意力路由策略,发现通道融合在语义接地和问答性能上更优,但易受上下文干扰;交叉注意力路由更稳健,但问答表现较差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20825 2026-05-08 cs.CL 50%

Reinforced Informativeness Optimization for Long-Form Retrieval-Augmented Generation

强化信息量优化用于长文本检索增强生成

Yuhao Wang, Ruiyang Ren, Yucheng Wang, Wayne Xin Zhao, Jing Liu, Hua Wu, Haifeng Wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学公安学院人工智能学院) Baidu Inc.(百度公司)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出RioRAG框架,通过 nugget-centric 验证实现可验证的信息量优化,提升长文本检索增强生成的准确性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01664 2026-05-05 cs.IR 50%

A Hybrid Retrieval and Reranking Framework for Evidence-Grounded Retrieval-Augmented Generation

一种混合检索与重排序框架用于证据导向的检索增强生成

Fariba Afrin Irany, Sampson Akwafuo

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出一种混合检索与重排序框架,用于生物医学和医疗相关文档问答中的引用感知RAG,通过亚马逊Bedrock知识库进行文档处理,并通过Cohere重排序提升相关性,最终实现高准确率的证据基础生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26048 2026-04-30 cs.CL 50%

BioGraphletQA: Knowledge-Anchored Generation of Complex QA Datasets

BioGraphletQA: 基于知识图谱的复杂问答数据集生成

Richard A. A. Jonker, Bárbara Maria Ribeiro de Abreu Martins, Sérgio Matos

机构 * IEETA, DETI, LASI, University of Aveiro(IEETA、DETI、LASI、阿维罗大学) USF Atlântico Norte(大西洋北USF)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出一个系统化生成复杂问答数据的框架,通过图let锚定生成过程,利用知识图谱的小子图控制生成复杂度并确保事实准确性。BioGraphletQA数据集包含119,856对问答,基于OREGANO知识图谱的图let生成,提升问答任务的准确性和科学性。

Comments 15 pages, 7 figures, conference (ECIR)

Journal ref Advances in Information Retrieval: 48th European Conference on Information Retrieval, ECIR 2026, Delft, The Netherlands, March 29 - April 2, 2026, Proceedings, Part IV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14635 2026-04-28 cs.CL cs.PL cs.SE 50%

SWE-QA: Can Language Models Answer Repository-level Code Questions?

SWE-QA: 语言模型能否回答仓库级代码问题?

Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出SWE-QA基准,旨在研究自动化QA系统在真实代码环境中的能力,包含576个高质量问题对,涵盖意图理解、跨文件推理和多跳依赖分析,评估六种先进LLM在不同上下文增强策略下的表现。

Comments Accepted to ACL 2026 Findings. Code and data available at https://github.com/peng-weihan/SWE-QA-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13312 2026-04-28 cs.CL cs.IR 50%

ChatR1: Reinforcement Learning for Conversational Reasoning and Retrieval Augmented Question Answering

ChatR1: 基于强化学习的对话推理与检索增强问答

Simon Lupart, Mohammad Aliannejadi, Evangelos Kanoulas

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 ChatR1通过强化学习实现对话问答中的推理与检索增强,通过意图感知奖励提升多轮对话性能,优于多个基准数据集。

Comments 18 pages, 9 figures, Main ACL 2026 Proceedings of the 64th Annual Meeting of the Association for Computational Linguistics, July 2--7, 2026, San Diego, California

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10003 2026-04-24 cs.CL 50%

SocraticKG: Knowledge Graph Construction via QA-Driven Fact Extraction

SocraticKG:通过问答驱动的事实提取构建知识图谱

Sanghyeok Choi, Woosang Jeon, Kyuseok Yang, Taehyeong Kim

机构 * Department of Biosystems Engineering, Seoul National University(首尔国立大学生物系统工程系) Artificial Intelligence Institute, Seoul National University(首尔国立大学人工智能研究所) Interdisciplinary Program in Artificial Intelligence, Seoul National University(首尔国立大学人工智能跨学科项目) Interdisciplinary Program in Cognitive Science, Seoul National University(首尔国立大学认知科学跨学科项目)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出SocraticKG方法,通过引入问答对作为中间表示,系统展开文档语义,提升知识图谱的事实保留与结构连贯性,支持复杂多跳推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.14751 2026-04-17 cs.CL 50%

Query pipeline optimization for cancer patient question answering systems

癌症患者问答系统中的查询管道优化

Maolin He, Rena Gao, Mike Conway, Brian E. Chapman

机构 * School of Computing and Information Systems, University of Melbourne(墨尔本大学计算与信息系统学院) Health Data Science and Biostatistics, University of Texas Southwestern Medical Center(德克萨斯西南医学中心健康数据科学与生物统计学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出了一种针对癌症患者问答系统的RAG查询管道三方面优化方法,通过改进文档检索、段落检索和语义表示,提升了回答准确性。

Comments This paper has been accepted as a Findings Paper in ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12185 2026-04-15 cs.CL 50%

Knowledge Is Not Static: Order-Aware Hypergraph RAG for Language Models

知识并非静态:面向语言模型的顺序感知超图RAG

Keshu Wu, Chenchen Kuai, Zihao Li, Jiwan Jiang, Shiyu Shen, Shian Wang, Chan-Wei Hu, Zhengzhong Tu, Yang Zhou

机构 * Texas A&M University(德克萨斯大学A&M分校) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Kansas(堪萨斯大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出顺序感知超图RAG(OKH-RAG),通过将顺序作为结构属性,改进传统RAG方法,提升对顺序敏感任务的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09270 2026-04-14 cs.CL 50%

MCGA: A Multi-task Classical Chinese Literary Genre Audio Corpus

MCGA:多任务古典中文文学体裁音频语料库

Yexing Du, Kaiyuan Liu, Bihe Zhang, Youcheng Pan, Bo Yang, Liangyu Huo, Xiyuan Zhang, Jian Xie, Daojing He, Yang Xiang, Ming Liu, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) South China University of Technology(华南理工大学) Du xiaoman(杜小满)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文提出MCGA语料库,包含22000个音频样本,涵盖六个任务:ASR、S2TT、SEC、SQA、SU和SR,评估十种MLLM发现其在MCGA测试集上仍面临显著挑战,并引入领域特定的SEC指标和语音与文本一致性度量。

Comments Accepted in ACL 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13856 2026-04-08 cs.IR 50%

QKVQA: Question-Focused Filtering for Knowledge-based VQA

基于知识的视觉问答中基于问题的过滤

Wei Ye, Yixin Su, Yueguo Chen, Longxiang Gao, Jianjun Li, Ruixuan Li, Rui Zhang

专题命中 视觉问答 :visual question answering(abstract)

AI总结 本文提出基于问题的跨文章过滤方法,通过设计可训练的问题聚焦过滤器和基于块的动态跨文章选择模块,提升知识过滤效率和问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03612 2026-04-07 cs.CR 50%

Perceptual Gaps: ASCII Art and Overlapping Audio as CAPTCHA

感知缺口:ASCII艺术与重叠音频作为CAPTCHA

Choon-Hou Rafael Chong

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文探讨了利用人类高度专业化神经处理的CAPTCHA任务,提出基于ASCII艺术和重叠音频的两种CAPTCHA类型,测试结果显示现有LLM无法有效解决,表明其在当前有效但可能面临AI发展挑战。

Comments 8 pages, 3 figures. Research paper proposing novel CAPTCHA methods using ASCII art and overlapping audio

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26670 2026-03-31 cs.IR cs.CL 50%

SRAG: RAG with Structured Data Improves Vector Retrieval

SRAG:基于结构化数据的RAG改进向量检索

Shalin Shah, Srikanth Ryali, Ramasubbu Venkatesh

机构 * Anvai AI

专题命中 视觉问答 :grounding(abstract)

AI总结 SRAG通过引入结构化信息提升向量检索性能,实验显示在问答系统中提升30%的评分,尤其在比较、分析和预测类问题上效果显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20017 2026-03-23 cs.CL cs.DB cs.IR 50%

RouterKGQA: Specialized--General Model Routing for Constraint-Aware Knowledge Graph Question Answering

RouterKGQA: 专用-通用模型路由用于约束感知的知识图谱问答

Bo Yuan, Hexuan Deng, Xuebo Liu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院) Zhongguancun Academy, Beijing, China(中关村学院)

专题命中 视觉问答 :grounding(abstract)

AI总结 RouterKGQA提出专用-通用模型协作框架,通过专用模型生成推理路径,通用模型在必要时进行知识图谱引导修复,提升性能并降低成本,实验显示在多个基准上F1和Hits@1均优于现有最佳方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19688 2026-03-23 cs.CL 50%

DataProphet: Demystifying Supervision Data Generalization in Multimodal LLMs

DataProphet:解开多模态大语言模型监督数据泛化之谜

Xuan Qi, Luxi He, Dan Roth, Xingyu Fu

机构 * University of Pennsylvania(宾夕法尼亚大学) Tsinghua University(清华大学) Princeton University(普林斯顿大学)

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 本文提出DataProphet,一种无需训练的指标,通过结合多模态困惑度、相似性和数据多样性,有效评估监督数据对目标基准的影响,实现更优的数据选择。

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17822 2026-03-19 eess.AS cs.CL 50%

Multi-Source Evidence Fusion for Audio Question Answering

多源证据融合用于音频问答

Aivo Olev, Tanel Alumäe

机构 * Tallinn University of Technology, Estonia(塔林技术大学,爱沙尼亚)

专题命中 视觉问答 :grounding(abstract)

AI总结 本文提出多源融合框架,利用两个大音频语言模型与25种可靠性分层的声学工具,生成可验证的推理链,提升音频问答的逻辑性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14662 2026-03-17 cs.HC 50%

ViDscribe: Multimodal AI for Customizing Audio Description and Question Answering in Online Videos

ViDscribe:多模态AI用于定制在线视频的音频描述和问答

Maryam Cheema, Sina Elahimanesh, Pooyan Fazli, Hasti Seifi

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 ViDscribe通过整合AI生成的音频描述和六种用户自定义选项,提升视障和低视力用户在YouTube视频中的交互体验,研究显示定制化描述提高了效果和沉浸感。

Comments CHI EA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02123 2026-03-09 cs.CL 50%

CMRAG: Co-modality-based visual document retrieval and question answering

CMRAG:基于共模的视觉文档检索与问答

Wang Chen, Wenhan Yu, Guanqiang Qi, Weikang Li, Yang Li, Lei Sha, Deguo Xia, Jizhou Huang

机构 * Baidu Inc(百度公司) The University of Hong Kong(香港大学) Beihang University(北京航空航天大学) Peking University(北京大学)

专题命中 视觉问答 :visual language model(abstract)

AI总结 CMRAG通过统一编码模型和共模信息检索方法,提升多模态视觉文档问答系统的性能。

Comments Published at ICLR 2026 Workshop on Multimodal Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11371 2026-03-05 cs.IR 50%

RAG vs. GraphRAG: A Systematic Evaluation and Key Insights

RAG与GraphRAG:系统评估与关键洞察

Haoyu Han, Li Ma, Yu Wang, Harry Shomer, Yongjia Lei, Zhisheng Qi, Kai Guo, Zhigang Hua, Bo Long, Hui Liu, Charu C. Aggarwal, Jiliang Tang

专题命中 视觉问答 :grounding(abstract)

AI总结 本文系统评估RAG与GraphRAG在文本任务中的表现,提出统一评估协议,揭示两者优势与权衡,并探索整合策略以提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15850 2026-02-19 cs.CL 50%

Large Language Models for Assisting American College Applications

大型语言模型用于协助美国大学申请

Zhengliang Liu, Weihang You, Peng Shu, Junhao Chen, Yi Pan, Hanqi Jiang, Yiwei Li, Zhaojun Ding, Chao Cao, Xinliang Li, Yifan Zhou, Ruidong Zhang, Shaochen Xu, Wei Ruan, Huaqin Zhao, Dajiang Zhu, Tianming Liu

专题命中 视觉问答 :grounding(abstract)

AI总结 EZCollegeApp 通过大型语言模型帮助高中生处理复杂大学申请流程,提供结构化表格、权威文件支持及人工控制,提升申请效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13890 2026-02-17 cs.CL 50%

Evaluating Prompt Engineering Techniques for RAG in Small Language Models: A Multi-Hop QA Approach

评估用于RAG的提示工程技术在小型语言模型中的表现:一种多跳问答方法

Amir Hossein Mohammadi, Ali Moeinian, Zahra Razavizade, Afsaneh Fatemi, Reza Ramezani

专题命中 视觉问答 :grounding(abstract)

AI总结 本文通过评估24种提示模板,发现优化RAG在小型语言模型上的表现提升显著,为资源受限环境下的RAG系统提供实用建议。

Comments 32 Pages, Submitted to Journal of Computing and Security

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12709 2026-02-16 cs.CL 50%

ReFilter: Improving Robustness of Retrieval-Augmented Generation via Gated Filter

ReFilter:通过门控过滤提升检索增强生成的鲁棒性

Yixin Chen, Ying Xiong, Shangyu Wu, Xiangrui Ke, Nan Guan, Chun Jason Xue

机构 * City University of Hong Kong(香港城市大学) University of Waterloo(滑铁卢大学)

专题命中 视觉问答 :grounding(abstract)

AI总结 ReFilter通过门控过滤提升检索增强生成的鲁棒性,实现跨领域问答任务的高性能表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07266 2026-02-10 cs.HC 50%

ADCanvas: Accessible and Conversational Audio Description Authoring for Blind and Low Vision Creators

ADCanvas: 为视障和低视力创作者提供可访问且对话式的音频描述创作工具

Franklin Mingzhe Li, Michael Xieyang Liu, Cynthia L. Bennett, Shaun K. Kane

专题命中 视觉问答 :visual question answering(abstract)

AI总结 ADCanvas为视障和低视力创作者提供可访问且对话式的音频描述创作工具,通过多模态交互支持端到端的AD创作和视觉问答。

Comments 21 pages, 4 figures, published in CHI '26

Journal ref Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI '26), April 13-17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01986 2026-02-03 cs.HC 50%

Belief Updating and Delegation in Multi-Task Human-AI Interaction: Evidence from Controlled Simulations

信念更新与委托在多任务人机交互中的作用:来自受控模拟的证据

Shreyan Biswas, Alexander Erlei, Ujwal Gadiraju

专题命中 视觉问答 :visual question answering(abstract)

AI总结 研究发现用户在多任务人机交互中形成路径依赖的期望,保守更新信念,并基于主观信念而非客观性能决定对AI的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19202 2026-01-28 cs.CL 50%

Do Images Speak Louder than Words? Investigating the Effect of Textual Misinformation in VLMs

图像胜过言语吗?探讨文本误导在VLMs中的影响

Chi Zhang, Wenxuan Ding, Jiale Liu, Mingrui Wu, Qingyun Wu, Ray Mooney

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Pennsylvania State University(宾夕法尼亚州立大学) New York University(纽约大学) University of Chinese Academy of Sciences(中国科学院大学) AG2ai, Inc.(AG2ai公司)

专题命中 视觉问答 :vision-language model(abstract)

AI总结 研究探讨了文本误导对视觉-语言模型(VLMs)的影响,发现模型易受误导性文本提示影响,导致性能显著下降。

Comments 24 pages, 10 figures. Accepted at EACL 2026 (main conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07295 2026-01-28 cs.CL 50%

CCFQA: A Benchmark for Cross-Lingual and Cross-Modal Speech and Text Factuality Evaluation

CCFQA:跨语言和跨模态语音与文本事实性评估基准

Yexing Du, Kaiyuan Liu, Youcheng Pan, Zheng Chu, Bo Yang, Xiaocheng Feng, Ming Liu, Yang Xiang

专题命中 视觉问答 :multimodal large language model(abstract)

AI总结 CCFQA是一个用于评估多模态大语言模型跨语言和跨模态事实性能力的基准,通过少样本迁移学习策略在多语言语音问答任务中取得与GPT-4o-mini-Audio相当的性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17212 2026-01-27 cs.CL 50%

DF-RAG: Query-Aware Diversity for Retrieval-Augmented Generation

DF-RAG:基于查询的多样性检索增强生成

Saadat Hasan Khan, Spencer Hong, Jingyu Wu, Kevin Lybarger, Youbing Yin, Erin Babinsky, Daben Liu

机构 * George Mason University(乔治·马歇尔大学) Capital One

专题命中 视觉问答 :grounding(abstract)

AI总结 DF-RAG通过在检索阶段引入多样性,提升复杂推理问答任务的F1性能,相比传统RAG提升了4-10个百分点,并接近Oracle上限的91.3%

Comments Accepted to Findings of EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 50%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏