arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-13 至 2026-01-13 共收录 9 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 9 篇

2601.07092 2026-01-13 cs.CV 85%

Efficient Visual Question Answering Pipeline for Autonomous Driving via Scene Region Compression

面向自动驾驶的高效视觉问答流水线:场景区域压缩

Yuliang Cai, Dongqiangzi Ye, Zitian Chen, Chongruo Wu

机构 * University of Southern California(南加州大学) XPeng(小鹏)

专题命中 视觉问答 :visual question answering(title,abstract);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出SRC-Pipeline框架,通过场景区域压缩技术,在保持性能的同时显著降低计算成本,提升自动驾驶中的实时视觉问答效率。

Comments 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06750 2026-01-13 cs.CV cs.AI cs.CL 81%

Benchmarking Egocentric Clinical Intent Understanding Capability for Medical Multimodal Large Language Models

医疗多模态大语言模型的视点临床意图理解能力基准测试

Shaonan Liu, Guo Yu, Xiaoling Luo, Shiyi Zheng, Wenting Chen, Jie Liu, Linlin Shen

机构 * Shenzhen University(深圳大学) Stanford University(斯坦福大学) City University of Hong Kong(香港城市大学)

专题命中 视觉问答 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出MedGaze-Bench,首个评估医疗多模态大语言模型视点临床意图理解能力的基准测试,通过三维意图框架和陷阱QA机制,揭示现有模型在手术、急救和诊断任务中对意图理解的不足。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07459 2026-01-13 cs.CV cs.LG 73%

Improving Video Question Answering through query-based frame selection

通过基于查询的帧选择改进视频问答

Himanshu Patil, Geo Jolly, Ramana Raja Buddala, Ganesh Ramakrishnan, Rohit Saluja

机构 * Indian Institute of Technology, Bombay(印度理工学院孟买分校) Indian Institute of Technology, Mandi(印度理工学院曼迪分校)

专题命中 视觉问答 :visual language model(abstract);LLaVA(abstract);分类 cs.CV、cs.LG

AI总结 通过基于查询的帧选择方法提升视频问答的准确性,利用子模ularity互信息函数选择重要帧,实验表明在多动作视频任务中准确率提升达4%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06189 2026-01-13 cs.AI cs.LG 62%

Rational Synthesizers or Heuristic Followers? Analyzing LLMs in RAG-based Question-Answering

理性合成器还是启发式追随者?分析基于检索增强生成的问答系统

Atharv Naphade

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文通过GroupQA数据集分析LLM在基于检索增强生成的问答系统中如何整合冲突证据,发现模型倾向于优先证据且解释不忠实,表明LLM作为脆弱的启发式追随者。

Comments 13 pages, 9 figures, ACL ARR submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06097 2026-01-13 cs.CV cs.AI 62%

Semantic Event Graphs for Long-Form Video Question Answering

语义事件图用于长视频问答

Aradhya Dixit, Tianxi Liang

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 语义事件图通过轻量级符号接口提升长视频问答效率,减少令牌使用并保持推理能力。

Comments 7 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 57%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16787 2026-01-13 cs.CL cs.AI 57%

Credible Plan-Driven RAG Method for Multi-Hop Question Answering

可信计划驱动的RAG方法用于多跳问答

Ningning Zhang, Chi Zhang, Zhizhong Tan, Xingxing Yang, Weiping Deng, Wenyong Wang

机构 * Macau University of Science and Technology(澳门科学技术大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 PAR-RAG通过引入复杂性感知的计划生成和双验证机制,提升了多跳问答任务中的推理稳定性和事实一致性,实现了更可靠的问答性能。

Comments 24 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06198 2026-01-13 cs.CV 57%

How Does India Cook Biryani?

印度是如何烹饪饭团的?

Shubham Goel, Farzana S, C V Rishi, Aditya Arun, C V Jawahar

机构 * IIIT Hyderabad

专题命中 视觉问答 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出首个大规模饭团制作视频数据集及多阶段框架,用于研究烹饪视频中细粒度步骤差异及文化关联性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06034 2026-01-13 cs.SE cs.AI 57%

Autonomous QA Agent: A Retrieval-Augmented Framework for Reliable Selenium Script Generation

自主问答代理:一种增强检索的框架,用于可靠的Selenium脚本生成

Dudekula Kasim Vali

机构 * Department of Computer Science(计算机科学系) VIT-AP University(VIT-AP大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 本文提出了一种基于增强检索的框架,通过项目文档和HTML结构生成可靠的Selenium测试脚本,显著提高了脚本生成的准确性和执行成功率。

Comments 13 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏