arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-24 至 2025-11-24 共收录 5 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5 篇

2511.01588 2025-11-24 cs.LG cs.CV 86%

Explore More, Learn Better: Parallel MLLM Embeddings under Mutual Information Minimization

探索更多,学习更好:基于互信息最小化的并行 MLLM 嵌入

Zhicheng Wang, Chen Ju, Xu Chen, Shuai Xiao, Jinsong Lan, Xiaoyong Zhu, Ying Chen, Zhiguo Cao

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) Huazhong University of Science and Technology(华中科技大学)

专题命中 VLM训练与架构 :MLLM(title,abstract);LLaVA(abstract);multimodal large language model(abstract);分类 cs.CV、cs.LG

AI总结 本文提出基于互信息最小化的并行解耦框架,通过多条并行路径提升多模态嵌入质量,实现高效且鲁棒的嵌入空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17255 2025-11-24 cs.CV cs.IR 83%

A Little More Like This: Text-to-Image Retrieval with Vision-Language Models Using Relevance Feedback

略多一些像这个:利用视觉语言模型进行文本到图像检索的相关反馈

Bulat Khaertdinov, Mirela Popa, Nava Tintarev

机构 * Maastricht University(马斯特里赫特大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出基于相关反馈机制提升视觉语言模型文本到图像检索性能的方法,通过四种反馈策略在Flickr30k和COCO数据集上验证,提升了检索效果并增强了多轮检索的鲁棒性。

Comments Accepted to WACV'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16743 2025-11-24 cs.CV cs.AI cs.LG 82%

SafeR-CLIP: Mitigating NSFW Content in Vision-Language Models While Preserving Pre-Trained Knowledge

SafeR-CLIP: 通过保留预训练知识来缓解视觉-语言模型中的不适宜内容

Adeel Yousaf, Joseph Fioresi, James Beetham, Amrit Singh Bedi, Mubarak Shah

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 SafeR-CLIP通过最小化干预策略,在保留预训练知识的同时提升视觉-语言模型的安全性,实现性能与安全性的平衡。

Comments AAAI 2026 (Main Technical Track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13428 2025-11-24 cs.RO 82%

VLM-SFD: VLM-Assisted Siamese Flow Diffusion Framework for Dual-Arm Cooperative Manipulation

VLM-SFD:基于视觉语言模型的双臂协作操作Siamese流扩散框架

Jiaming Chen, Yiyu Jiang, Aoshen Huang, Yang Li, Wei Pan

机构 * Department of Computer Science, The University of Manchester(计算机科学系,曼彻斯特大学) School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract)

AI总结 VLM-SFD通过双编码器-解码器架构和视觉语言模型,提升双臂协作操作的模仿学习效率与泛化能力。

Comments Accepted by IEEE RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16998 2025-11-24 cs.CV 79%

VLM-Augmented Degradation Modeling for Image Restoration Under Adverse Weather Conditions

增强型退化建模用于恶劣天气下的图像修复

Qianyi Shao, Yuanfan Zhang, Renxiang Xiao, Liang Hu

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 本文提出了一种结合视觉-语言模型和隐式记忆库的统一模型,用于在恶劣天气下高效恢复图像,提升了修复精度和计算效率。

Journal ref Proc. 2025 30th International Conference on Automation and Computing (ICAC), pp. 1-6, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏