arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-26 至 2026-01-26 共收录 31 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 2 篇

2601.16478 2026-01-26 cs.CL cs.AI 57%

DeepEra: A Deep Evidence Reranking Agent for Scientific Retrieval-Augmented Generated Question Answering

DeepEra: 一种用于科学检索增强生成问答的深度证据重排代理

Haotian Chen, Qingqing Long, Siyu Pu, Xiao Luo, Wei Ju, Meng Xiao, Yuanchun Zhou, Jianghua Zhao, Xuezhi Wang

机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Peking University(北京大学)

专题命中 视觉问答 :grounding(abstract);分类 cs.AI

AI总结 DeepEra通过集成逐步推理提升科学检索增强生成问答的检索精度,首次系统研究并验证了双阶段RAG框架中语义相似但逻辑无关的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16400 2026-01-26 cs.CL 50%

Clarify or Answer: Reinforcement Learning for Agentic VQA with Context Under-specification

澄清或回答:基于上下文不充分的代理视觉问答强化学习

Zongwan Cao, Bingbing Wen, Lucy Lu Wang

机构 * University of Washington(华盛顿大学) Allen Institute for AI(人工智能研究院)

专题命中 视觉问答 :visual question answering(abstract)

AI总结 CoA通过强化学习解决上下文不充分的视觉问答问题,通过生成聚焦问题澄清歧义,提升问答准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 9 篇

2601.09954 2026-01-26 cs.CV 85%

The Spatial Blindspot of Vision-Language Models

视觉-语言模型的空间盲区

Nahid Alam, Leema Krishna Murali, Siddhant Bharadwaj, Patrick Liu, Timothy Chung, Drishti Sharma, Akshata A, Kranthi Kiran, Wesley Tam, Bala Krishna S Vegesna

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出通过改进图像编码器和2D位置编码来提升视觉-语言模型的空间推理能力,以解决其在空间关系捕捉上的不足。

Comments Work done as part of the EleutherAI SOAR Program

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16520 2026-01-26 cs.CV cs.AI cs.CL 81%

TangramPuzzle: Evaluating Multimodal Large Language Models with Compositional Spatial Reasoning

TangramPuzzle: 通过组合空间推理评估多模态大语言模型

Daixian Liu, Jiayi Kuang, Yinghui Li, Yangning Li, Di Yin, Haoyu Cao, Xing Sun, Ying Shen, Hai-Tao Zheng, Liang Lin, Philip S. Yu

机构 * Tsinghua University(清华大学) Sun-Yat Sen University(孙逸人大学) Tencent Youtu Lab(腾讯优图实验室) University of Illinois Chicago(伊利诺伊大学香槟分校)

专题命中 视觉推理 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 TangramPuzzle通过几何基准测试评估多模态大语言模型的组合空间推理能力,发现模型在匹配轮廓时忽视几何约束,导致碎片变形。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16690 2026-01-26 cs.CL cs.CV 79%

EMemBench: Interactive Benchmarking of Episodic Memory for VLM Agents

EMemBench: 交互式评估VLM代理情景记忆的基准测试

Xinze Li, Ziyue Zhu, Siyuan Liu, Yubo Ma, Yuhang Zang, Yixin Cao, Aixin Sun

专题命中 视觉推理 :VLM(title,abstract);分类 cs.CV

AI总结 EMemBench通过交互式游戏评估VLM代理的情景记忆,发现归纳和空间推理在视觉设置中仍是瓶颈,且持续记忆对文本游戏有明显提升,但对VLM代理的提升不一致。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16218 2026-01-26 cs.CL cs.AI 79%

M3Kang: Evaluating Multilingual Multimodal Mathematical Reasoning in Vision-Language Models

M3Kang: 评估视觉-语言模型在多语言多模态数学推理中的表现

Aleix Torres-Camps, Nathaniel Mitrani Hadida, Víctor Conchello Vendrell, Àlex Batlle Casellas, Arnau Padrés Masdemont, Jordi Ros-Giralt

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视觉推理 :vision-language model(title,abstract);分类 cs.AI

AI总结 M3Kang是一个大规模多语言多模态数学推理数据集,用于评估视觉-语言模型在多语言数学推理中的表现,通过基准测试揭示模型在基础数学和图表推理上的不足,并展示多语言技术在多模态设置中的有效性。

Comments 10 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13680 2026-01-26 cs.CL cs.LG 77%

VMMU: A Vietnamese Multitask Multimodal Understanding and Reasoning Benchmark

VMMU:一个多任务多模态理解和推理基准

Vy Tuong Dang, An Vo, Emilio Villa-Cueva, Quang Tau, Duc Dm, Thamar Solorio, Daeyoung Kim

机构 * KAIST(韩国科学技术院) MBZUAI(慕布扎伊大学)

专题命中 视觉推理 :vision-language model(abstract);visual reasoning(abstract);grounding(abstract);分类 cs.LG

AI总结 VMMU是一个评估视觉语言模型在非英语环境下多模态理解和推理能力的基准,通过2500个多模态问题测试模型对视觉和文本信息的整合与推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06263 2026-01-26 cs.AI cs.LG 62%

Symmetry breaking for inductive logic programming

归纳逻辑编程中的对称性打破

Andrew Cropper, David M. Cerna, Matti Järvisalo

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种在归纳逻辑编程中打破对称性的方法,通过答案集编程实现,显著提升了在视觉推理和游戏玩法等领域的求解效率。

Comments AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01078 2026-01-26 cs.AI 57%

SimWorld: An Open-ended Realistic Simulator for Autonomous Agents in Physical and Social Worlds

SimWorld:一种用于物理和社会世界中自主代理的开放式真实模拟器

Jiawei Ren, Yan Zhuang, Xiaokang Ye, Lingjun Mao, Xuhong He, Jianzhi Shen, Mrinaal Dogra, Yiming Liang, Ruixuan Zhang, Tianai Yue, Yiqing Yang, Eric Liu, Ryan Wu, Kevin Benavente, Rajiv Mandya Nagaraju, Muhammad Faayez, Xiyan Zhang, Dhruv Vivek Sharma, Xianrui Zhong, Ziqiao Ma, Tianmin Shu, Zhiting Hu, Lianhui Qin

机构 * UCSD(加州大学圣地亚哥分校) UVA(弗吉尼亚大学) UIUC(伊利诺伊大学香槟分校) JHU(约翰·霍普金斯大学) Purdue(Purdue 大学) PolyU USC(美国南加州大学) UMich(密歇根大学)

专题命中 视觉推理 :VLM(abstract);分类 cs.AI

AI总结 SimWorld是一个基于Unreal Engine 5构建的开放式真实模拟器,旨在开发和评估LLM/VLM代理在复杂物理和社会环境中的能力,通过多代理配送任务验证其推理模式与局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01232 2026-01-26 cs.AI 57%

Efficient rule induction by ignoring pointless rules

通过忽略无用规则实现高效的规则归纳

Andrew Cropper, David M. Cerna

专题命中 视觉推理 :visual reasoning(abstract);分类 cs.AI

AI总结 本文提出了一种通过忽略无用规则来提升归纳逻辑编程效率的方法,实验表明该方法在多个领域显著减少了学习时间并保持了预测准确性。

Comments AAAI26

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04744 2026-01-26 cs.SD cs.CL eess.AS 50%

WildScore: Benchmarking MLLMs in-the-Wild Symbolic Music Reasoning

WildScore: 多模态符号音乐推理在现实中的基准测试

Gagan Mundada, Yash Vishe, Amit Namburi, Xin Xu, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视觉推理 :multimodal large language model(abstract)

AI总结 WildScore是首个用于评估多模态大语言模型在现实世界中符号音乐推理能力的基准测试,通过真实音乐作品和用户生成问题,系统性评估模型在音乐学分析中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 9 篇

2601.16895 2026-01-26 cs.CV cs.AI 84%

Evaluating Large Vision-language Models for Surgical Tool Detection

评估大型视觉-语言模型用于手术工具检测

Nakul Poudel, Richard Simon, Cristian A. Linte

机构 * Rochester Institute of Technology(罗切斯特理工大学) Center for Imaging Science(成像科学中心) Center for Imaging Science and Biomedical Engineering(成像科学与生物医学工程中心)

专题命中 视觉定位与Grounding :vision-language model(title,abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 本研究评估了三种大型视觉-语言模型在手术工具检测任务中的性能,发现Qwen2.5在检测和泛化能力上表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16394 2026-01-26 cs.CV cs.AI 84%

ResAgent: Entropy-based Prior Point Discovery and Visual Reasoning for Referring Expression Segmentation

ResAgent:基于熵的先验点发现与视觉推理的指称表达分割

Yihao Wang, Jusheng Zhang, Ziyi Tang, Keze Wang, Meng Yang

机构 * Sun Yat-sen University(中山大学)

专题命中 视觉定位与Grounding :visual reasoning(title);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 ResAgent通过熵引导的点发现和视觉推理方法,提升指称表达分割的准确性与效率。

Comments 23 pages, 7gigures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21862 2026-01-26 cs.CV cs.AI cs.IR 84%

A Multi-Stage Hybrid Framework for Automated Interpretation of Multi-View Engineering Drawings Using Vision Language Model

一种多阶段混合框架用于利用视觉语言模型自动解释多视图工程图

Muhammad Tayyab Khan, Zane Yong, Lequn Chen, Wenhe Feng, Nicholas Yew Jin Tan, Seung Ki Moon

专题命中 视觉定位与Grounding :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出一种多阶段混合框架,利用视觉语言模型自动解析多视图工程图,通过布局分割、方向感知检测和语义解析提升工程图解读效率。

Comments This draft has been accepted in the 13th International Conference on Industrial Engineering and Applications (ICIEA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16519 2026-01-26 cs.LG 57%

DANCE: Dynamic, Available, Neighbor-gated Condensation for Federated Text-Attributed Graphs

DANCE: 动态、可用、邻居门控的联邦文本属性图压缩

Zekai Chen, Haodong Lu, Xunkai Li, Henan Sun, Jia Li, Hongchao Qin, Rong-Hua Li, Guoren Wang

机构 * Department of Computer Science, Beijing Institute of Technology, Beijing, China(北京理工大学计算机科学系) The Hong Kong University of Science and Technology (GZ), Guangzhou, China(香港科技大学(广州))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.LG

AI总结 DANCE通过动态、可用、邻居门控的图压缩方法,提升联邦文本属性图学习的准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16344 2026-01-26 cs.AI 57%

DSGym: A Holistic Framework for Evaluating and Training Data Science Agents

DSGym: 一个全面的框架用于评估和训练数据科学代理

Fan Nie, Junlin Wang, Harper Hua, Federico Bianchi, Yongchan Kwon, Zhenting Qi, Owen Queen, Shang Zhu, James Zou

机构 * Stanford University(斯坦福大学) Together AI Duke University(杜克大学) Harvard University(哈佛大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 DSGym通过标准化框架提升数据科学代理的评估与训练,解决现有基准测试的碎片化和数据不足问题,提供可扩展的任务套件和数据合成管道。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02979 2026-01-26 cs.HC cs.AI 57%

Systematizing LLM Persona Design: A Four-Quadrant Technical Taxonomy for AI Companion Applications

对LLM人设设计的系统化:面向AI陪伴应用的四象限技术分类

Esther Sun, Zichu Wu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本文提出四象限技术分类系统,系统化LLM人设设计,涵盖虚拟与具身、情感与功能增强,分析不同应用场景的技术挑战与核心问题。

Comments Accepted to Neurips 2025 workshop: LLM Persona Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10931 2026-01-26 cs.AI 57%

Proof-of-Use: Mitigating Tool-Call Hacking in Deep Research Agents

证明-使用:减轻深度研究代理中的工具调用黑客行为

SHengjie Ma, Chenlong Deng, Jiaxin Mao, Jiadeng Huang, Teng Wang, Junjie Wu, Changwang Zhang, Jun wang

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 证明-使用通过优化证据依赖关系,减轻深度研究代理中的工具调用黑客行为,并展现出适应性强的工具使用模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16507 2026-01-26 cs.SE 50%

REprompt: Prompt Generation for Intelligent Software Development Guided by Requirements Engineering

REprompt:基于需求工程的智能软件开发提示生成

Junjie Shi, Weisong Sun, Zhenpeng Chen, Zhujun Wu, Xiaohong Chen, Zhi Jin, Yang Liu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 REprompt是一种基于需求工程的多代理提示优化框架,旨在通过根植需求工程原则来优化系统和用户提示,提升智能软件开发中的提示生成效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19469 2026-01-26 cs.SD cs.MM 50%

MusiCRS: Benchmarking Audio-Centric Conversational Recommendation

MusiCRS:面向音频导向的对话推荐基准测试

Rohan Surana, Amit Namburi, Gagan Mundada, Abhay Lal, Zachary Novack, Julian McAuley, Junda Wu

机构 * University of California, San Diego, USA(加州大学圣地亚哥分校)

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 MusiCRS通过链接Reddit用户对话与音乐曲目,为音频导向的对话推荐提供首个基准测试,揭示了跨模态整合的局限性,并释放了相关数据集和代码以促进研究进展。

Comments 5 pages

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2410.02729 2026-01-26 cs.CL cs.AI cs.IR 57%

Unified Multimodal Interleaved Document Representation for Retrieval

统一多模态交错文档表示用于检索

Jaewoo Lee, Joonho Ko, Jinheon Baek, Soyeong Jeong, Sung Ju Hwang

机构 * University of North Carolina Chapel Hill(北卡罗来纳大学教堂山分校) KAIST(韩国科学技术院) DeepAuto

专题命中 文档图表理解 :vision-language model(abstract);分类 cs.AI

AI总结 本文提出统一多模态交错文档表示方法,通过整合文本、图像和表格信息提升信息检索性能。

Comments EACL Findings 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

5. GUI与屏幕智能体 1 篇

2601.16973 2026-01-26 cs.CV 57%

VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents

VisGym: 多模态代理的多样化、可定制化、可扩展环境

Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken Goldberg, XuDong Wang, Ion Stoica, David M. Chan, Sewon Min, Joseph E. Gonzalez

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.CV

AI总结 VisGym通过多样化环境评估多模态代理在多步视觉决策中的表现,揭示模型在长上下文处理和视觉化任务中的局限性。

Comments Project page: https://visgym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 幻觉与鲁棒性 3 篇

2501.13223 2026-01-26 cs.LG 79%

Data Matters Most: Auditing Social Bias in Contrastive Vision Language Models

数据最为关键:审计对比视觉语言模型中的社会偏见

Zahraa Al Sahili, Ioannis Patras, Matthew Purver

机构 * Queen Mary University of London(伦敦女王学院) Institut Jožef Stefan(Jožef Stefan研究所)

专题命中 幻觉与鲁棒性 :vision language model(title);vision-language model(abstract);分类 cs.LG

AI总结 研究通过对比CLIP和OpenCLIP模型,发现数据来源是偏见的主要驱动因素,不同去偏策略在不同模型和数据规模下效果各异。

Comments Published at TMLR; updated version

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16429 2026-01-26 cs.CV cs.AI 62%

AlphaFace: High Fidelity and Real-time Face Swapper Robust to Facial Pose

AlphaFace: 高保真和实时的面部交换器,对面部姿态具有鲁棒性

Jongmin Yu, Hyeontaek Oh, Zhongtian Sun, Angelica I Aviles-Rivero, Moongu Jeon, Jinhong Yang

机构 * University of Cambridge(剑桥大学) University of Kent(肯特大学) Tsinghua University(清华大学) Gwangju Institute of Science and Technology(全州科学技术院) Inje University(庆北大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 AlphaFace通过结合视觉-语言模型和CLIP嵌入,实现高保真和实时的面部交换,提升对极端面部姿态的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16378 2026-01-26 cs.CV cs.AI q-bio.NC 62%

Cognitively-Inspired Tokens Overcome Egocentric Bias in Multimodal Models

具有认知启发的标记克服了多模态模型中的自我中心偏差

Bridget Leonard, Scott O. Murray

机构 * Department of Psychology University of Washington(心理学系华盛顿大学)

专题命中 幻觉与鲁棒性 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过引入视角标记,提升多模态模型在空间推理任务中的表现,实现更人样的空间认知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. VLM训练与架构 3 篇

2601.16582 2026-01-26 cs.CV 70%

X-Aligner: Composed Visual Retrieval without the Bells and Whistles

X-Aligner:无需炫技的组合视觉检索

Yuqian Zheng, Mariana-Iuliana Georgescu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(亥姆霍兹慕尼黑)

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV

AI总结 X-Aligner通过结合视觉和文本查询,提升视频检索性能,采用多阶段训练和交叉注意力模块实现更优的多模态表示对齐。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16549 2026-01-26 cs.AI 70%

LLM is Not All You Need: A Systematic Evaluation of ML vs. Foundation Models for text and image based Medical Classification

LLM并非万能:对ML与基础模型在文本和图像医学分类中的系统评估

Meet Raval, Tejul Pandit, Dhvani Upadhyay

机构 * University of Southern California Los Angeles, USA(美国南加州大学) Dhirubhani Ambani University Gandhinagar, India(印度达尔布哈尼·阿班尼大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本文系统评估了ML与基础模型在医学分类中的表现,发现传统ML模型在多数任务中表现优异,而PEFT方法的效果依赖于适应策略。

Comments 9 pages, 5 figures, 3 tables, paper accepted in AAIML'26 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16615 2026-01-26 cs.CL 50%

AuroraEdge-V-2B: A Faster And Stronger Edge Visual Large Language Model

AuroraEdge-V-2B: 一种更快更强大的边缘视觉大语言模型

Xiang Chen

机构 * Independent Researcher(独立研究者)

专题命中 VLM训练与架构 :InternVL(abstract)

AI总结 AuroraEdge-V-2B是一种为边缘部署设计的高性能视觉大语言模型,具有紧凑参数、高速推理和强大性能的特点。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 其他VLM 3 篇

2512.09867 2026-01-26 cs.CV cs.AI cs.CL 62%

Hierarchy-Aware Multimodal Unlearning for Medical AI

层次感知的多模态反遗忘用于医疗AI

Fengli Wu, Vaidehi Patil, Jaehong Yoon, Yue Zhang, Mohit Bansal

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 MedForget提出一个层次感知的多模态反遗忘基准和CHIP方法,有效解决医疗数据中层次结构的遗忘问题,同时保持下游效用。

Comments Dataset and Code: https://github.com/fengli-wu/MedForget

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23927 2026-01-26 cs.CV 57%

FUSAR-KLIP: Towards Multimodal Foundation Models for Remote Sensing

FUSAR-KLIP:迈向遥感多模态基础模型

Yi Yang, Xiaokun Zhang, Qingchen Fang, Jing Liu, Ziqi Ye, Rui Li, Li Liu, Haipeng Wang

机构 * Key Laboratory for Information Science of Electromagnetic Waves (MoE), Fudan University(电磁波信息科学重点实验室(MoE),复旦大学) Institute of Zhejiang Laboratory(浙江实验室研究院) College of Electronic Science and Technology, NUDT(电子科学与技术学院,南大学)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 FUSAR-KLIP是首个针对SAR图像的多模态基础模型,通过构建大规模数据集、生成结构化文本、设计自洽优化机制和建立统一评估基准,解决遥感图像与通用视觉表示之间的认知不一致问题。

详情

展开后加载摘要…

URL PDF HTML 收藏