arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-18 至 2025-12-18 共收录 19 信号源:cs.CV, cs.AI, cs.LG

1. 视觉问答 1 篇

2512.14770 2025-12-18 cs.CV cs.AI 79%

Improving VQA Reliability: A Dual-Assessment Approach with Self-Reflection and Cross-Model Verification

提升VQA可靠性:基于自我反思与跨模型验证的双评估方法

Xixian Wu, Yang Ou, Pengchao Tian, Zian Yang, Jielei Zhang, Peiyi Li, Longwen Gao

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 视觉问答 :vision-language model(abstract);VLM(abstract);visual question answering(abstract);分类 cs.CV、cs.AI

AI总结 本文提出DAVR框架,通过自我反思和跨模型验证提升VQA中VLM响应的可靠性,取得优异实验结果。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视觉推理 1 篇

2512.15701 2025-12-18 cs.CV 85%

VLIC: Vision-Language Models As Perceptual Judges for Human-Aligned Image Compression

VLIC: 基于视觉-语言模型的人类对齐图像压缩感知判官

Kyle Sargent, Ruiqi Gao, Philipp Henzler, Charles Herrmann, Aleksander Holynski, Li Fei-Fei, Jiajun Wu, Jason Zhang

机构 * Stanford University(斯坦福大学) Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 视觉推理 :vision-language model(title,abstract);VLM(abstract);visual reasoning(abstract);分类 cs.CV

AI总结 VLIC利用视觉-语言模型进行图像压缩,通过零样本推理实现人类感知对齐,提升压缩性能。

Comments 14 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视觉定位与Grounding 7 篇

2512.15115 2025-12-18 cs.LG cs.AI 62%

How Many Heads Make an SSM? A Unified Framework for Attention and State Space Models

多少个头才能构成一个SSM?一种统一的注意力和状态空间模型框架

Ali Ghodsi

机构 * Ali Ghodsi

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种统一框架,通过输入依赖的有效交互操作符,分析了注意力和状态空间模型的表达性和可训练性权衡,并推导了三个理论结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14989 2025-12-18 cs.CL cs.AI cs.CV 62%

Evaluating Large Language Models on Multimodal Chemistry Olympiad Exams

评估大型语言模型在多模态化学奥林匹克考试中的表现

Yiming Cui, Xin Yao, Yuxuan Qin, Xin Li, Shijin Wang, Guoping Hu

机构 * State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室) iFLYTEK AI Research(iFLYTEK人工智能研究院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文评估了多种多模态LLM在化学奥林匹克考试中的表现,发现其在多模态融合和科学推理方面存在显著局限,提出通过链式思维提示提升模型性能的方法。

Comments Published at Communications Chemistry

Journal ref Commun. Chem. 8 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14938 2025-12-18 cs.CV cs.AI cs.MM cs.SD 62%

TalkVerse: Democratizing Minute-Long Audio-Driven Video Generation

TalkVerse:民主化分钟级音频驱动视频生成

Zhenzhi Wang, Jian Wang, Ke Ma, Dahua Lin, Bing Zhou

机构 * The Chinese University of Hong Kong(香港中文大学) Snap Inc.(Snap公司)

专题命中 视觉定位与Grounding :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 TalkVerse通过大规模开放数据和高效模型,实现了分钟级音频驱动视频生成,降低研究门槛,提升生成质量与效率。

Comments open-sourced single-person full-body talking video generation dataset, training code and checkpoints

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10402 2025-12-18 cs.LG cs.AI 62%

The Eminence in Shadow: Exploiting Feature Boundary Ambiguity for Robust Backdoor Attacks

阴影中的卓越:利用特征边界模糊性实现稳健的后门攻击

Zhou Feng, Jiahao Chen, Chunyi Zhou, Yuwen Pu, Tianyu Du, Jinbao Li, Jianhai Chen, Shouling Ji

机构 * Zhejiang University(浙江大学) Chongqing University(重庆大学) Qilu University of Technology (Shandong Academy of Science)(青岛科技大学(山东科学院))

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 Eminence通过利用特征边界模糊性,实现稳健且隐蔽的后门攻击,以极低的毒化率有效提升攻击效果。

Comments Accepted by KDD2026 Cycle 1 Research Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15310 2025-12-18 cs.CV 57%

SynthSeg-Agents: Multi-Agent Synthetic Data Generation for Zero-Shot Weakly Supervised Semantic Segmentation

SynthSeg-Agents: 多智能体合成数据生成用于零样本弱监督语义分割

Wangyu Wu, Zhenhong Chen, Xiaowei Huang, Fei Ma, Jimin Xiao

机构 * Xi'an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学) Microsoft(微软公司)

专题命中 视觉定位与Grounding :vision language model(abstract);分类 cs.CV

AI总结 SynthSeg-Agents利用大型语言模型生成合成数据,无需现实图像即可实现零样本弱监督语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06032 2025-12-18 cs.CV 57%

Learning 3D Texture-Aware Representations for Parsing Diverse Human Clothing and Body Parts

学习3D纹理感知表示以解析多样化的人类服装和身体部位

Kiran Chhatre, Christopher Peters, Srikrishna Karanam

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 Spectrum通过改进的3D纹理生成模型,实现了对多样化人类服装和身体部位的精细解析与分割。

Comments Association for the Advancement of Artificial Intelligence (AAAI) 2026, 14 pages, 11 figures. Webpage: https://s-pectrum.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03197 2025-12-18 cs.CL 50%

Explain with Visual Keypoints Like a Real Mentor! A Benchmark for Multimodal Solution Explanation

像真实导师一样用视觉关键点解释吧!一个多模态解决方案解释基准

Jaewoo Park, Jungyang Park, Dongju Jang, Jiwan Chung, Byungwoo Yoo, Jaewoo Shin, Seonjoon Park, Taehyeong Kim, Youngjae Yu

专题命中 视觉定位与Grounding :grounding(abstract)

AI总结 本文提出多模态解决方案解释任务和ME2数据集,旨在评估模型识别视觉关键点并生成相关解释的能力,揭示当前LLM在数学视觉推理和教育应用中的不足。

Comments 14 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 文档图表理解 1 篇

2512.02498 2025-12-18 cs.CV 79%

dots.ocr: Multilingual Document Layout Parsing in a Single Vision-Language Model

dots.ocr: 一种单一视觉-语言模型中的多语言文档布局解析

Yumeng Li, Guang Yang, Hao Liu, Bowen Wang, Colin Zhang

机构 * hi lab(hi实验室) Xiaohongshu Inc(小红书公司)

专题命中 文档图表理解 :vision-language model(title,abstract);分类 cs.CV

AI总结 dots_ocr是一种单一视觉-语言模型,通过联合学习多语言文档布局解析的三个核心任务,实现了统一框架下的高效性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与鲁棒性 3 篇

2512.14801 2025-12-18 cs.CL cs.AI cs.LG 62%

Incentives or Ontology? A Structural Rebuttal to OpenAI's Hallucination Thesis

激励还是本体?对OpenAI“幻觉假说”的结构反驳

Richard Ackermann, Simeon Emanuilov

专题命中 幻觉与鲁棒性 :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文反驳OpenAI关于幻觉源于激励不匹配的观点,指出幻觉是Transformer架构的必然结果,需通过外部验证模块消除,而非改变激励或微调。

Comments 17 pages, references to prior work arXiv:2509.16297 and arXiv:2511.06073

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14715 2025-12-18 cs.LG cs.AI 62%

How a Bit Becomes a Story: Semantic Steering via Differentiable Fault Injection

一位比特如何成为故事:通过可微分故障注入实现语义引导

Zafaryab Haider, Md Hafizur Rahman, Shane Moeykens, Vijay Devabhaktuni, Prabuddha Chakraborty

机构 * University of Maine(缅因大学) Illinois State University(伊利诺伊州立大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 通过可微分故障注入分析,研究比特级扰动对生成模型语义的影响,揭示低级变化如何引导高层语义。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13734 2025-12-18 cs.CL 50%

GAPS: A Clinically Grounded, Automated Benchmark for Evaluating AI Clinicians

GAPS: 一种基于临床的自动化评估基准,用于评估AI临床医生

Xiuyuan Chen, Tao Sun, Dexin Su, Ailing Yu, Junwei Liu, Zhe Chen, Gangzeng Jin, Xin Wang, Jingnan Liu, Hansong Xiao, Hualei Zhou, Dongjie Tao, Chunxiao Guo, Minghui Yang, Yuan Xia, Jing Zhao, Qianrui Fan, Yanyun Wang, Shuai Zhen, Kezhong Chen, Jun Wang, Zewen Sun, Heng Zhao, Tian Guan, Shaodong Wang, Geyun Chang, Jiaming Deng, Hongchengcheng Chen, Kexin Feng, Ruzhen Li, Jiayi Geng, Changtai Zhao, Jun Wang, Guihu Lin, Peihao Li, Liqi Liu, Peng Wei, Jian Wang, Jinjie Gu, Ping Wang, Fan Yang

机构 * Department of Thoracic Surgery(胸外科部门) Thoracic Oncology Institute(胸外科肿瘤研究所) Research Unit of Intelligence Diagnosis and Treatment in Early Non-small Cell Lung Cancer(早期非小细胞肺癌智能诊断与治疗研究单元) Institute of Advanced Clinical Medicine(先进临床医学研究所) Beijing Key Laboratory of Innovative Application of Big Data in Lung Cancer(肺癌大数据创新应用北京市重点实验室) Ant Group(蚂蚁集团) School of Software and Microelectronics(软件与微电子学院)

专题命中 幻觉与鲁棒性 :grounding(abstract)

AI总结 GAPS提出了一种基于临床的自动化评估基准,用于评估AI临床医生系统,通过多维评估框架解决现有基准的不足,揭示了AI在临床实践中的关键失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. VLM训练与架构 5 篇

2412.09603 2025-12-18 cs.CV 83%

Do MLLMs Exhibit Human-like Perceptual Behaviors? HVSBench: A Benchmark for MLLM Alignment with Human Perceptual Behavior

多模态大语言模型是否表现出类人感知行为?HVSBench:一个用于多模态大语言模型对齐人类视觉行为的基准测试

Jiaying Lin, Shuquan Ye, Dan Xu, Wanli Ouyang, Rynson W. H. Lau

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 HVSBench通过测试多模态大语言模型与人类视觉行为的对齐性,揭示了其在感知任务上的显著差距,并强调了开发更符合人类认知的AI的重要性。

Comments Project page: https://jiaying.link/HVSBench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14757 2025-12-18 cs.CV cs.RO 83%

SocialNav-MoE: A Mixture-of-Experts Vision Language Model for Socially Compliant Navigation with Reinforcement Fine-Tuning

SocialNav-MoE: 一种用于社交合规导航的混合专家视觉语言模型,结合强化微调

Tomohito Kawabata, Xinyu Zhang, Ling Xiao

机构 * Graduate School of Information Science and Technology, Hokkaido University(信息科学与技术研究生院,北海道大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 SocialNav-MoE通过混合专家模型和强化微调提升机器人社交合规导航的效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09172 2025-12-18 cs.CV cs.AI 73%

Prompt-Based Continual Compositional Zero-Shot Learning

基于提示的持续组成零样本学习

Sauda Maryam, Sara Nadeem, Faisal Qureshi, Mohsen Ali

机构 * Intelligent Machines Lab(智能机器实验室) Information Technology University(信息技术大学) Visual Computing Lab(视觉计算实验室) Ontario Tech University(安大略技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 PromptCCZSL通过多教师蒸馏和正交投影损失,实现持续组成零样本学习中的知识保留与泛化提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.15611 2025-12-18 cs.CV 70%

If you can describe it, they can see it: Cross-Modal Learning of Visual Concepts from Textual Descriptions

如果你能描述它,他们就能看到它:从文本描述中跨模态学习视觉概念

Carlo Alberto Barbano, Luca Molinaro, Massimiliano Ciranni, Emanuele Aiello, Vito Paolo Pastore, Marco Grangetto

机构 * University of Turin(都灵大学) University of Genoa(热那亚大学) Politecnico di Torino(都灵理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出通过文本描述跨模态学习视觉概念的方法,利用知识迁移技术提升视觉-语言模型的零样本性能。

Comments 27 pages. Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15531 2025-12-18 cs.CV 57%

An Efficient and Effective Encoder Model for Vision and Language Tasks in the Remote Sensing Domain

一种用于遥感领域的高效且有效的编码器模型

João Daniel Silva, Joao Magalhaes, Devis Tuia, Bruno Martins

机构 * INESC-ID, Instituto Superior Técnico, University of Lisbon(INESC-ID,理工学院,里斯本大学) Department of Computer Science, Faculty of Science and Technology, Universidade NOVA de Lisboa(计算机科学系,科学与技术学院,诺瓦大学) School of Architecture, Civil and Environmental Engineering, EPFL(建筑、土木和环境工程学院,EPFL)

专题命中 VLM训练与架构 :visual question answering(abstract);分类 cs.CV

AI总结 本文提出了一种高效且紧凑的编码器模型,用于处理遥感领域的多任务学习,包括图像文本生成和跨模态检索。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 其他VLM 1 篇

2512.15254 2025-12-18 cs.CV cs.LG 81%

Assessing the Visual Enumeration Abilities of Specialized Counting Architectures and Vision-Language Models

评估专用计数架构和视觉-语言模型的视觉计数能力

Kuinan Hou, Jing Mi, Marco Zorzi, Lamberto Ballan, Alberto Testolin

机构 * University of Padova(帕多瓦大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本文比较了专用计数架构与VLMs在物体计数任务中的性能,发现VLMs在生成中间表示时计数准确率显著提高,但复杂场景计数仍需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏