Spatial Audio Question Answering and Reasoning on Dynamic Source Movements
空间音频问答与动态声源运动推理
机构 * Qualcomm Technologies Inc.(高通技术公司)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。
AI 大模型
视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。
空间音频问答与动态声源运动推理
机构 * Qualcomm Technologies Inc.(高通技术公司)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种空间音频问答方法,通过运动推理和多模态微调提升动态声源识别与理解能力。
Fusionista2.0:大规模数据集的高效检索系统
机构 * Mohamed Bin Zayed University of Artificial Intelligence (MBZUAI), UAE(Mohamed Bin Zayed人工智能大学(MBZUAI)) ; AISIA Research Lab(AISIA研究实验室) ; University of Information Technology(信息技术大学) ; Ho Chi Minh University of Science(胡志明科学大学) ; Vietnam National University, Ho chi Minh City(越南国家大学,胡志明市)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 Fusionista2.0通过优化预处理、识别技术和用户界面,实现了大规模视频检索的高效性和准确性提升。
Journal ref MultiMedia Modeling. MMM 2026. Lecture Notes in Computer Science, vol 16415
统一多种基础模型以推进高级计算病理学
机构 * Shanghai Jiao Tong University(上海交通大学) ; Washington University in St. Louis(华盛顿大学) ; University of Science and Technology Beijing(北京科技大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Department of Surgical Oncology and General Surgery, Key Laboratory of Precision Diagnosis and Treatment of Gastrointestinal Tumours, Ministry of Education, The First Hospital of China Medical University(外科肿瘤科和普通外科,国家教育委员会胃肠道肿瘤精准诊断与治疗重点实验室,中国医科大学第一医院) ; Shanghai Innovation Institute(上海创新研究院) ; Sensetime Research(商汤科技研究院)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 Shazam通过在线整合多个预训练病理基础模型,实现高效且可扩展的计算病理学应用,优于单个模型性能。
Comments 50 pages, 5 main figures
MapVerse:一个用于在多样化真实世界地图上进行地理问答的基准测试
机构 * University of Southern California(南加州大学) ; University of California Los Angeles(加州大学洛杉矶分校) ; University of Utah(犹他大学) ; Arizona State University(亚利桑那州立大学)
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 MapVerse是一个基于真实世界地图的大规模基准测试,用于评估地理问答任务中的多模态推理能力,揭示了当前VLMs在复杂空间推理任务上的不足。
M2A:具有双层混合记忆的多模态记忆代理用于长期个性化交互
专题命中 视觉问答 :LLaVA(abstract);分类 cs.AI
AI总结 M2A通过双层混合记忆系统实现长期多模态交互中的个性化响应,利用在线更新机制提升用户偏好适应性。
CompactRAG: 减少多跳问答中的LLM调用和令牌开销
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) ; Erik Jonsson School of Engineering and Computer Science, University of Texas at Dallas(埃里克·乔纳森工程与计算机科学学院,德克萨斯大学达拉斯分校) ; Isoftstone Information Technology (Group) Co.,Ltd.(伊软石信息技术(集团)有限公司) ; College of Electronic and Information Engineering, Tongji University(电子信息工程学院,同济大学) ; School of Electronic Information, Central South University(电子信息学院,中南大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 CompactRAG通过解耦离线语料重组与在线推理,减少多跳问答中的LLM调用和令牌消耗,提升效率。
表下之物:对基于分布的视觉问答数据集的呼吁
机构 * Information Science(信息科学) ; University of Illinois(伊利诺伊大学) ; Urbana-Champaign(厄巴纳-香槟) ; Illinois, USA(伊利诺伊斯州,美国)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文呼吁建立专门针对科学图表的VQA基准,通过生成合成图表并要求模型基于底层数据回答问题,以解决现有数据集未能捕捉的图表与数据间关系的推理挑战。
Comments Accepted to ACM/IEEE Joint Conference on Digital Libraries JCDL 2025, 4 pages, 2 figures
ECG-Agent: 用于ECG多轮对话的设备端工具调用代理
机构 * KAIST(韩国科学技术院) ; Ajou University School of Medicine(全州大学医学院)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.AI
AI总结 ECG-Agent是一种基于LLM的多轮ECG对话工具调用代理,通过ECG-MTD数据集实现了设备端高效且准确的ECG对话处理。
Comments Accepted to ICASSP 2026 (5 pages, 2 figures, 5 tables)
RPO-RAG: 通过关系感知的偏好优化对齐小型LLM以实现知识图谱问答
机构 * Yonsei University(延世大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 RPO-RAG通过关系感知的偏好优化和以答案为中心的提示设计,提升小型LLM在知识图谱问答中的推理能力,实现性能提升。
Comments Accepted at The Web Conference (WWW) 2026
DGRAG:边缘-云计算系统中的分布式图驱动检索增强生成
机构 * Zhejiang University(浙江大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 DGRAG是一种面向边缘-云计算系统的分布式图驱动检索增强生成框架,通过边缘设备本地知识图和云端轻量级索引实现隐私保护和高效检索。
通过混合RAG方法增强问答
机构 * Plastic Lab(塑料实验室) ; Google(谷歌) ; Florida International University(佛罗里达国际大学) ; Rensselaer Polytechnic Institute(伦塞拉尔理工学院)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出SSRAG方法,通过混合查询增强、代理路由和结构化检索技术,提升问答任务的响应质量。
Comments 10 pages, 5 tables, 2 figures; presented at IEEE CogMI 2025
过多的帧,但并非都有用:长视频问答的高效策略
机构 * Stony Brook University(石溪大学) ; KAIST AI(韩国科学技术院人工智能研究所) ; Korea University(韩国大学)
专题命中 视觉问答 :vision language model(abstract);分类 cs.CV
AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。
VaseVQA: 古代希腊陶器的多模态代理与基准
机构 * University of Adelaide(阿德莱德大学) ; University of Liverpool(利物浦大学) ; University of Technology Sydney(悉尼技术大学) ; The Australian National University(澳大利亚国立大学) ; La Trobe University(拉特罗布大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 VaseVQA通过引入VaseVL强化学习方法,提升对古代希腊陶器的多模态推理能力,尤其在复杂推理任务中表现更优。
DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Peking University(北京大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。
分块、检索与重排序:RAG架构在政策文件问答中的实证评估
机构 * Computer Science (EECS) University of Toledo Toledo, OH, USA
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文通过实证评估,比较了RAG架构在政策文件问答中的有效性,发现Advanced RAG在忠实度上表现更优,但文档分段限制影响多步骤推理。
ReinPath:一种用于病理学的多模态强化学习方法
机构 * East China Normal University(华东师范大学) ; Shanghai University(上海大学) ; Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 ReinPath提出了一种多模态强化学习方法,通过构建高质量病理学VQA数据集,结合语义奖励策略和群体相对策略优化,提升了病理图像和文本的多模态推理能力,并在零样本分类任务中表现出色。
Vidi2.5:大型多模态模型用于视频理解和创作
机构 * ByteDance Inc.(字节跳动公司)
专题命中 视觉问答 :grounding(abstract);分类 cs.CV
AI总结 Vidi2.5通过细粒度时空定位和复杂情节推理模型,提升了视频理解和创作的多模态能力,同时在多个基准测试中表现出色。
ViSTA: 基于多模态适配器的文本到图像扩散模型用于视觉叙事
机构 * Department of Computer Science, Georgetown University(计算机科学系,乔治城大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 ViSTA通过多模态历史适配器提升文本到图像扩散模型在视觉叙事中的生成一致性与文本对齐能力。
Comments Accepted to WACV 2026
ROMA: 实时多模态助手与交互式流式理解
机构 * CAS Key Laboratory of AI Safety, Institute of Computing Technology, CAS, Beijing, China(中国科学院人工智能安全重点实验室,计算技术研究所,中国科学院,北京,中国) ; University of Chinese Academy of Sciences, Beijing, China(中国科学院大学,北京,中国) ; Tsinghua University, Beijing, China(清华大学,北京,中国)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 ROMA通过实时多模态处理和交互式流式理解,实现统一的反应性和主动性交互,展现强大的多模态处理能力。
Comments Our project page is available at https://eureka-maggie.github.io/ROMA_show
优化多模态大语言模型以实现视角视频理解:HD-EPIC VQA挑战的解决方案
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.CV
AI总结 本文提出一种优化多模态大语言模型的方法,通过预处理、微调和时间链式思考提示,在HD-EPIC VQA挑战中实现了41.6%的准确率。
Comments 4 pages, 1 figure, CVPR 2025 EgoVis Workshop, 2nd Place in HD-EPIC Challenge
Relink:为GraphRAG构建查询驱动的证据图谱
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。
Comments Accepted by AAAI 2026
可信计划驱动的RAG方法用于多跳问答
机构 * Macau University of Science and Technology(澳门科学技术大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。
Comments 24 pages, 7 figures
印度是如何烹饪饭团的?
机构 * IIIT Hyderabad
专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV
AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。
自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成
机构 * Department of Computer Science(计算机科学系) ; VIT-AP University(VIT-AP大学)
专题命中 视觉问答 :grounding(abstract);分类 cs.AI
AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。
Comments 13 figures, 3 tables
连续学习用于从大语言模型中建模低资源语言
机构 * Machine Intelligence Group, Department of CS&IS, Birla Institute of Technology and Sciences, Pilani, India(机器智能组,计算机科学与信息系,比拉理工学院和科学学院,印度帕利尼)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.AI
AI总结 本文提出利用基于词性的代码切换和重放适配器策略,解决从大语言模型构建小语言模型时的灾难性遗忘问题,并在视觉语言任务中验证了方法的有效性。
VNU-Bench:多源多模态新闻视频理解的基准数据集
机构 * University of Florida(佛罗里达大学)
专题命中 视觉问答 :multimodal large language model(abstract);分类 cs.LG
AI总结 VNU-Bench是首个多源多模态新闻视频理解基准数据集,通过设计新颖问题类型和混合生成方法,评估模型跨源信息整合能力。
通过大型语言模型理解多智能体推理用于漫画视觉问答
机构 * University of Reading(阅读大学)
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 本文提出多智能体LLM框架,用于解决漫画图像中视觉抽象和叙事上下文的VQA问题,通过三个智能体协作提升推理能力。
EarthVL: 一种渐进式地球视觉-语言理解和生成框架
专题命中 视觉问答 :visual question answering(abstract);分类 cs.CV
AI总结 EarthVL提出一种渐进式视觉-语言框架,通过多任务数据集和语义引导网络提升城市规划中的遥感目标识别与问答性能。
从提示本身学习:层次归因提示优化
专题命中 视觉问答 :MLLM(abstract);分类 cs.AI
AI总结 HAPO框架通过动态归因机制、语义单元优化和多模态支持,提升提示优化效率,适用于多任务场景。
CTIS-QA:基于临床模板的滑动切片级问题回答用于病理学
机构 * School of Biological Science(生物科学学院) ; Medical Engineering Beihang University Beijing, China(医学工程北京航空航天大学北京中国) ; ByteDance Inc.(字节跳动公司)
专题命中 视觉问答 :visual reasoning(abstract);分类 cs.CV
AI总结 CTIS-QA通过双流架构实现滑动切片级问题回答,结合临床模板和视觉-语言对齐,提升病理诊断准确性。
Comments The paper has been accepted by BIBM 2025