arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-05 至 2026-02-05 共收录 50 信号源:cs.CV, cs.AI, cs.LG

1. 幻觉与鲁棒性 4 篇

2503.20504 2026-02-05 cs.CV 83%

UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models

UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测

Zehui Liao, Shishuai Hu, Ke Zou, Mengyuan Jin, Yanning Zhang, Huazhu Fu, Liangli Zhen, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);visual question answering(abstract);分类 cs.CV

AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。

Comments Under Review. 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 67%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 幻觉与鲁棒性 :vision-language model(abstract);VLM(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04340 2026-02-05 cs.CV cs.AI 62%

Explicit Uncertainty Modeling for Active CLIP Adaptation with Dual Prompt Tuning

显式不确定性建模用于主动CLIP适应与双提示微调

Qian-Wei Wang, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于双提示微调的显式不确定性建模框架,用于提升主动CLIP适应的分类可靠性与主动样本选择效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03895 2026-02-05 cs.CV cs.LG 62%

Benchmarking Bias Mitigation Toward Fairness Without Harm from Vision to LVLMs

面向视觉到大视觉语言模型的公平性无害基准测试

Xuwei Tan, Ziyu Hu, Xueru Zhang

机构 * The Ohio State University(俄亥俄州立大学) Stevens Institute of Technology(史蒂文斯理工学院)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.CV、cs.LG

AI总结 NH-Fair提出一个统一基准,评估视觉到大视觉语言模型的公平性无害性,通过系统调优和数据增强方法减少偏见,提升公平性和准确性。

Comments Accepted at ICLR 26

详情

展开后加载摘要…

URL PDF HTML 收藏

2. VLM训练与架构 11 篇

2503.20322 2026-02-05 cs.CV 85%

Dynamic Pyramid Network for Efficient Multimodal Large Language Model

动态金字塔网络用于高效多模态大语言模型

Hao Ai, Kunyi Wang, Zezhou Wang, Hao Lu, Jin Tian, Yaxin Luo, Peng Xing, Jen-Yuan Huang, Huaxia Li, Gen luo

机构 * Beihang University(北航大学) Shanghai AI Laboratory(上海人工智能实验室) KAUST(卡塔尔大学) Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Technical University Of Denmark(丹麦技术大学) Nanjing University of Science and Technology(南京理工大学) Peking University(北京大学) Xiaohongshu Inc(小红书公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);LLaVA(abstract);MLLM(abstract);分类 cs.CV

AI总结 动态金字塔网络通过分层结构和动态池化专家提升多模态大语言模型的效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04565 2026-02-05 cs.CV 83%

Understanding Degradation with Vision Language Model

理解视觉退化

Guanzhou Lan, Chenyi Liao, Yuqi Yang, Qianli Ma, Zhigang Wang, Dong Wang, Bin Zhao, Xuelong Li

机构 * School of Artificial Intelligence, OPtics and ElectroNics (iOPEN), Northwestern Polytechnical University(人工智能学院、光学与电子学(iOPEN)、西北工业大学) Honors College, Northwestern Polytechnical University(荣誉学院、西北工业大学) Shanghai AI Laboratory(上海人工智能实验室) School of Artificial Intelligence, Shanghai Jiaotong University(人工智能学院、上海交通大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出DU-VLM模型,通过结构化奖励强化学习解决视觉退化理解问题,引入大规模数据集并实现高保真图像恢复。

Comments 17 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04256 2026-02-05 cs.RO cs.AI 83%

AppleVLM: End-to-end Autonomous Driving with Advanced Perception and Planning-Enhanced Vision-Language Models

AppleVLM: 端到端自主驾驶与高级感知和规划增强的视觉语言模型

Yuxuan Han, Kunyuan Wu, Qianyi Shao, Renxiang Xiao, Zilu Wang, Cansen Jiang, Yi Xiao, Liang Hu, Yunjiang Lou

机构 * Shenzhen Key Lab for Advanced Motion Control and Modern Automation Equipments(深圳先进运动控制系统与现代自动化装备重点实验室) Guangdong Provincial Key Laboratory of Intelligent Morphing Mechanisms and Adaptive Robotics(广东省智能变形机制与适应机器人省重点实验室) School of Intelligence Science and Engineering(智能科学与工程学院) Harbin Institute of Technology(哈尔滨工业大学) National Key Laboratory of Smart Farm Technologies and Systems(国家智能农业技术与系统重点实验室) Autonomous Driving Center(自动驾驶中心) Shanghai Utopilot Technology Co.Ltd.(上海驭目科技有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.AI

AI总结 AppleVLM通过引入先进的视觉和规划编码器,提升端到端自动驾驶的感知和决策能力,实现复杂环境下的稳健驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23592 2026-02-05 cs.CV 83%

Same or Not? Enhancing Visual Perception in Vision-Language Models

相同还是不同?提升视觉语言模型的视觉感知能力

Damiano Marsili, Aditya Mehta, Ryan Y. Lin, Georgia Gkioxari

机构 * California Institute of Technology(加州理工学院)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 TWIN通过引入大规模图像对数据集提升视觉语言模型的细粒度视觉感知能力,显著提高在艺术、动物等未见领域识别性能。

Comments Project webpage: https://glab-caltech.github.io/twin/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17440 2026-02-05 cs.CV 83%

VEAttack: Downstream-agnostic Vision Encoder Attack against Large Vision Language Models

VEAttack: 面向大视觉语言模型的下游任务无关视觉编码器攻击

Hefei Mei, Zirui Wang, Shen You, Minjing Dong, Chang Xu

机构 * City University of Hong Kong(香港城市大学) University of Sydney(悉尼大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);visual question answering(abstract);分类 cs.CV

AI总结 VEAttack是一种针对大视觉语言模型视觉编码器的简单有效攻击方法,通过优化图像令牌降低计算开销,实现对多种下游任务的泛化攻击。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04337 2026-02-05 cs.CV cs.AI 81%

Fine-tuning Pre-trained Vision-Language Models in a Human-Annotation-Free Manner

无需人工标注的预训练视觉-语言模型微调

Qian-Wei Wang, Guanghao Meng, Ren Cai, Yaguang Song, Shu-Tao Xia

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) Institute of Perceptual Intelligence, Peng Cheng Laboratory(感知智能研究院,鹏城实验室) Peking University Shenzhen Graduate School, Peking University(北京大学深圳研究生院,北京大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 CoFT通过双模型跨模态协作机制和双提示学习策略,在无需人工标注的情况下提升预训练视觉-语言模型的下游任务适应能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16419 2026-02-05 cs.CL cs.CV 79%

Learning Domain Knowledge in Multimodal Large Language Models through Reinforcement Fine-Tuning

通过强化微调学习多模态大语言模型中的领域知识

Qinglong Cao, Yuntian Chen, Chao Ma, Xiaokang Yang

机构 * MoE Key Lab of Artificial Intelligence, AI Institute, Shanghai Jiao Tong University, Shanghai, China(人工智能大规模并行计算实验室,人工智能研究院,上海交通大学,上海)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出通过强化微调框架在优化层面整合领域知识,提升多模态大语言模型在专门领域任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04739 2026-02-05 cs.CL cs.AI cs.HC 70%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09554 2026-02-05 cs.CV 70%

RF-DETR: Neural Architecture Search for Real-Time Detection Transformers

RF-DETR:实时检测Transformer的神经架构搜索

Isaac Robinson, Peter Robicheaux, Matvei Popov, Deva Ramanan, Neehar Peri

机构 * Roboflow Carnegie Mellon University(卡内基梅隆大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 RF-DETR通过轻量级检测Transformer和神经架构搜索,在实时检测中实现更高的精度和速度,超越现有方法。

Comments This work has been accepted to the International Conference on Learning Representations (ICLR) 2026. Project Page: https://rfdetr.roboflow.com/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13928 2026-02-05 cs.CV cs.IR 57%

LoVR: A Benchmark for Long Video Retrieval in Multimodal Contexts

LoVR:一种多模态背景下长视频检索的基准

Qifeng Cai, Hao Liang, Zhaoyang Han, Hejun Dong, Meiyi Qiang, Ruichuan An, Quanqing Xu, Bin Cui, Wentao Zhang

机构 * East China Normal University Shanghai China Peking University \& Zhongguancun Academy Beijing China Huazhong University of Science Beihang University Beijing China Peking University Beijing China East China Normal University Peking University \& Zhongguancun Academy Beihang University Peking University

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 LoVR是一个针对长视频检索的多模态基准,通过高质量标注和细粒度数据提升视频理解挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04617 2026-02-05 cs.CL 50%

LEAD: Layer-wise Expert-aligned Decoding for Faithful Radiology Report Generation

LEAD:逐层专家对齐解码以生成准确的放射学报告

Ruixiao Yang, Yuanhe Tian, Xu Yang, Huiqi Li, Yan Song

专题命中 VLM训练与架构 :vision language model(abstract)

AI总结 LEAD通过逐层专家对齐解码方法,提升放射学报告生成的准确性并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他VLM 5 篇

2601.21610 2026-02-05 cs.CV 79%

WMVLM: Evaluating Diffusion Model Image Watermarking via Vision-Language Models

WMVLM:通过视觉-语言模型评估扩散模型图像水印

Zijin Yang, Yu Sun, Kejiang Chen, Jiawei Zhao, Jun Jiang, Weiming Zhang, Nenghai Yu

机构 * University of Science and Technology of China(中国科学技术大学) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室) National University of Singapore(新加坡国立大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 WMVLM通过视觉-语言模型提出首个统一且可解释的扩散模型图像水印评估框架,重新定义了残差和语义水印的评估指标,并通过三阶段训练策略提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12340 2026-02-05 cs.CV cs.CR 79%

Image Corruption-Inspired Membership Inference Attacks against Large Vision-Language Models

基于图像退化启发的对抗大视觉-语言模型的成员推断攻击

Zongyu Wu, Minhua Lin, Zhiwei Zhang, Fali Wang, Xianren Zhang, Xiang Zhang, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出基于图像退化启发的成员推断攻击方法,用于检测目标图像是否被用于训练大视觉-语言模型,通过图像退化和文本嵌入相似性进行攻击。

Comments Accepted by EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04355 2026-02-05 cs.CL 78%

Can Vision Replace Text in Working Memory? Evidence from Spatial n-Back in Vision-Language Models

视觉能否取代文本在工作记忆中的作用?来自视觉-语言模型中空间n-Back任务的证据

Sichu Liang, Hongyu Zhu, Wenwen Wang, Deyu Zhou

机构 * Southeast University(东南大学) Shanghai Jiao Tong University(上海交通大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他VLM :vision-language model(title,abstract)

AI总结 研究通过空间n-Back任务评估视觉-语言模型中视觉与文本对工作记忆的影响,发现文本条件下的表现优于视觉条件,揭示了视觉信息处理中的计算差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26521 2026-02-05 cs.CL 50%

Hebrew Diacritics Restoration using Visual Representation

希伯来文附加符号恢复使用视觉表示

Yair Elboher, Yuval Pinter

机构 * Faculty of Computer and Information Science(计算机与信息科学学院) Ben-Gurion University of the Negev(贝叶尔谢瓦巴内吉尔大学)

专题命中 其他VLM :visual language model(abstract)

AI总结 DiVRit通过视觉表示方法实现希伯来文附加符号恢复,利用零样本分类和视觉语言模型提升准确性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04157 2026-02-05 cs.RO 50%

A Modern System Recipe for Situated Embodied Human-Robot Conversation with Real-Time Multimodal LLMs and Tool-Calling

一种面向情境具身人机对话的现代系统配方,结合实时多模态大语言模型与工具调用

Dong Won Lee, Sarah Gillet, Louis-Philippe Morency, Cynthia Breazeal, Hae Won Park

专题命中 其他VLM :multimodal large language model(abstract)

AI总结 本文提出了一种结合实时多模态大语言模型与工具调用的系统配方,用于提升情境具身人机对话的交互质量与效率。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏