arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-02 至 2026-02-02 共收录 12 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 12 篇

2509.14957 2026-02-02 cs.CV 83%

DF-LLaVA: Unlocking MLLMs for Synthetic Image Detection via Knowledge Injection and Conflict-Driven Self-Reflection

DF-LLaVA: 通过知识注入和冲突驱动的自我反思解锁MLLMs用于合成图像检测

Zhuokang Shen, Kaisen Zhang, Bohan Jia, Heming Jia, Yuan Fang, Zhou Yu, Shaohui Lin

机构 * East China Normal University(东华师范大学) Sanming University(三明大学) The 27th Research Institute of CETC(中国电子科技集团第27研究所)

专题命中 VLM训练与架构 :LLaVA(title,abstract);MLLM(abstract);分类 cs.CV

AI总结 DF-LLaVA通过知识注入和冲突驱动的自我反思,提升MLLMs在合成图像检测中的准确性和可解释性。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09071 2026-02-02 cs.CV 83%

BlindSight: Harnessing Sparsity for Efficient Vision-Language Models

BlindSight: 利用稀疏性提升视觉-语言模型的效率

Tharun Adithya Srikrishnan, Deval Shah, Timothy Hein, Ahmed Hasssan, Stephen Youn, Steven K. Reinhardt

机构 * Advanced Micro Devices, Inc. (AMD)(先进微器件公司(AMD))

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 BlindSight通过引入输入模板感知的注意力稀疏性掩码,显著提升了视觉-语言模型的推理效率,同时保持较高的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22654 2026-02-02 cs.CV cs.CL 83%

VScan: Rethinking Visual Token Reduction for Efficient Large Vision-Language Models

VScan:重新思考视觉标记减少以提高高效的大视觉-语言模型

Ce Zhang, Kaixin Ma, Tianqing Fang, Wenhao Yu, Hongming Zhang, Zhisong Zhang, Haitao Mi, Dong Yu

机构 * Carnegie Mellon University(卡内基梅隆大学) Tencent AI Lab(腾讯AI实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 VScan通过两阶段视觉标记减少框架提升大视觉-语言模型的推理效率,实现2.91倍预填充加速和10倍FLOPs减少,性能损失仅0.6%

Comments Accepted at TMLR 2026. Project page: https://zhangce01.github.io/VScan/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06746 2026-02-02 cs.CV cs.AI 73%

AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment

AlignGemini: 通过任务-模型对齐实现通用的AI生成图像检测

Ruoxin Chen, Jiahui Gao, Kaiqing Lin, Keyue Zhang, Yandan Zhao, Isabel Guan, Taiping Yao, Shouhong Ding

机构 * Tencent Youtu Lab East China University of Science Shenzhen University Hong Kong University of Science Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country

专题命中 VLM训练与架构 :vision language model(abstract);VLM(abstract);分类 cs.CV、cs.AI

AI总结 AlignGemini通过任务-模型对齐原则,结合语义和像素伪影检测,提升AI生成图像检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22796 2026-02-02 cs.GR cs.CV 70%

HeatMat: Simulation of City Material Impact on Urban Heat Island Effect

HeatMat:城市材料对城市热岛效应的模拟

Marie Reinbigler, Romain Rouffet, Peter Naylor, Mikolaj Czerkawski, Nikolaos Dionelis, Elisabeth Brunet, Catalin Fetita, Rosalie Martin

机构 * SAMOVAR, Inria Saclay, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR、Inria Saclay、 Télécom SudParis、 Institut Polytechnique de Paris) Adobe Research Asterisk Labs SAMOVAR, Télécom SudParis, Institut Polytechnique de Paris(SAMOVAR、 Télécom SudParis、 Institut Polytechnique de Paris)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 HeatMat通过街景图像和预训练视觉-语言模型,高分辨率模拟城市材料对热岛效应的影响,利用2.5D模拟器提升热传递建模效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 70%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22828 2026-02-02 cs.LG cs.CV 62%

Decomposing and Composing: Towards Efficient Vision-Language Continual Learning via Rank-1 Expert Pool in a Single LoRA

分解与组合:通过单个LoRA中的秩-1专家池实现高效的视觉-语言连续学习

Zhan Fa, Yue Duan, Jian Zhang, Lei Qi, Wanqi Yang, Yinghuan Shi

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 通过单个LoRA中的秩-1专家池实现高效的视觉-语言连续学习,减少参数更新并提升领域感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06646 2026-02-02 cs.CV cs.LG 62%

The Narrow Gate: Localized Image-Text Communication in Native Multimodal Models

窄门:原生多模态模型中的局部图像-文本通信

Alessandro Pietro Serra, Francesco Ortu, Emanuele Panizon, Lucrezia Valeriani, Lorenzo Basile, Alessio Ansuini, Diego Doimo, Alberto Cazzaniga

机构 * Area Science Park, Trieste, Italy(特里斯特科学公园) SISSA, Trieste, Italy(SISSA) University of Trieste, Trieste, Italy(特里斯特大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 研究揭示了原生多模态模型中图像与文本信息交互的机制,发现通过单个标记作为窄门影响图像理解性能,提出基于标记级干预的精细控制方法。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22696 2026-02-02 cs.CV cs.LG 62%

Bi-MCQ: Reformulating Vision-Language Alignment for Negation Understanding

Bi-MCQ:重新表述视觉-语言对齐以理解否定

Tae Hun Kim, Hyun Gyu Lee

机构 * Department of Electrical and Computer Engineering, Inha University, Republic of Korea(电气与计算机工程系,印哈大学,大韩民国) College of Medicine, Inha University, Republic of Korea(医学学院,印哈大学,大韩民国)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 Bi-MCQ通过重新表述视觉-语言对齐为条件语义比较,提升医学VLM对否定理解的性能。

Comments 15 pages, 4 figures, Submitted to ICPR 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22189 2026-02-02 eess.IV cs.CV cs.LG cs.MM 62%

SCENE: Semantic-aware Codec Enhancement with Neural Embeddings

SCENE:基于神经嵌入的语义感知编码器增强

Han-Yu Lin, Li-Wei Chen, Hung-Shin Lee

机构 * United Link Co., Ltd.(联合链接有限公司) Dept. Computer Science and Information Engineering, National Tsing Hua University(国立清华大学计算机科学与信息工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 SCENE通过整合视觉语言模型的语义嵌入,实现对压缩视频中伪影的语义感知增强,提升感知质量和细节纹理保留。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22680 2026-02-02 cs.CV 57%

Visual Personalization Turing Test

视觉个性化图灵测试

Rameen Abdal, James Burgess, Sergey Tulyakov, Kuan-Chieh Jackson Wang

机构 * Snap Research(Snap研究)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出视觉个性化图灵测试,通过感知不可区分性评估个性化生成模型,引入VPTT框架和评分指标,验证其在人类和VLM判断中的可靠性。

Comments Webpage: https://snap-research.github.io/vptt

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22633 2026-02-02 cs.NI cs.AI 57%

MCP-Diag: A Deterministic, Protocol-Driven Architecture for AI-Native Network Diagnostics

MCP-Diag:一种确定性的、基于协议的架构用于AI原生网络诊断

Devansh Lodha, Mohit Panchal, Sameer G. Kulkarni

机构 * Indian Institute of Technology Gandhinagar(印度理工学院加尔各答分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 MCP-Diag通过确定性翻译层和强制性 elicitation循环,实现高精度的AI原生网络诊断,提升实体提取准确性和上下文token使用效率。

Comments Accepted at COMSNETS 2026 Graduate Forum. Best Paper Award (Runner Up). 5 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏