arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-08 至 2025-12-08 共收录 6 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 6 篇

2512.05546 2025-12-08 cs.CV cs.AI 88%

Conscious Gaze: Adaptive Attention Mechanisms for Hallucination Mitigation in Vision-Language Models

有意识的注视:用于视觉-语言模型中幻觉抑制的自适应注意力机制

Weijue Bu, Guan Yuan, Guixian Zhang

机构 * School of Computer Science and Technology/School of Artificial Intelligence(计算机科学与技术学院/人工智能学院) China University of Mining and Technology(中国矿业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);LLaVA(abstract);grounding(abstract)

AI总结 CG-VLM通过认知需求传感器和聚焦共识诱导模块,在推理时精准干预视觉-语言模型的注意力,有效抑制幻觉并提升性能。

Comments 6 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05172 2025-12-08 cs.CV cs.AI 84%

Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning

Semore:基于VLM的增强语义运动表示用于视觉强化学习

Wentao Wang, Chunyang Liu, Kehua Sheng, Bo Zhang, Yan Wang

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 Semore通过结合VLM和CLIP实现高效的视觉强化学习,提升语义和运动表示的融合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00713 2025-12-08 cs.CR cs.AI 83%

Concept-Guided Backdoor Attack on Vision Language Models

基于概念的视觉语言模型后门攻击

Haoyu Shen, Weimin Lyu, Haotian Xu, Tengfei Ma

机构 * Stony Brook University(石溪大学)

专题命中 VLM训练与架构 :vision language model(title);vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 本研究提出基于概念的视觉语言模型后门攻击方法,通过概念阈值污染和概念瓶颈模型引导未见后门两种技术,实现对模型生成文本的恶意替换。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04555 2025-12-08 cs.RO cs.CV 70%

Evo-1: Lightweight Vision-Language-Action Model with Preserved Semantic Alignment

Evo-1:轻量级视觉-语言-动作模型,保持语义对齐

Tao Lin, Yilei Zhong, Yuxin Du, Jingjing Zhang, Jiting Liu, Yinxinyu Chen, Encheng Gu, Ziyan Liu, Hongyi Cai, Yanwen Zou, Lixing Zou, Zhaoye Zhou, Gen Li, Bo Zhao

机构 * School of AI, Shanghai Jiao Tong University(上海交通大学人工智能学院) EvoMind Tech(EvoMind科技) IAAR-Shanghai(IAAR-上海) SII Carnegie Mellon University(卡内基梅隆大学) University of Cambridge(剑桥大学) Nanyang Technological University(南洋理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 Evo-1是一种轻量级的视觉-语言-动作模型,通过减少计算并保持语义对齐,实现了高效的部署和强大的性能。

Comments Github: https://github.com/MINT-SJTU/Evo-1

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10809 2025-12-08 cs.LG cs.AI 62%

Rethinking Sparse Autoencoders: Select-and-Project for Fairness and Control from Encoder Features Alone

重新思考稀疏自编码器:仅从编码器特征中进行选择和投影以实现公平性与控制

Antonio Bărbălau, Cristian Daniel Păduraru, Teodor Poncu, Alexandru Tifrea, Elena Burceanu

机构 * Bitdefender University Politehnica of Bucharest(巴特亚大学) ETH Zurich(苏黎世联邦理工学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于编码器特征的选择和投影框架,通过改进公平性和可控性,提升模型在视觉语言和大语言模型中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05740 2025-12-08 cs.CV 57%

Distilling Expert Surgical Knowledge: How to train local surgical VLMs for anatomy explanation in Complete Mesocolic Excision

萃取专家手术知识:如何训练局部手术VLMs用于完全网膜切除术的解剖解释

Lennart Maack, Julia-Kristin Graß, Lisa-Marie Toscha, Nathaniel Melling, Alexander Schlaefer

机构 * 1 Institute of Medical Technology Intelligent Systems, Hamburg University of Technology, Hamburg, Germany 2 Department of General, Visceral Thoracic Surgery, University Medical Center Hamburg-Eppendorf, Hamburg, Germany

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出一种隐私保护框架,通过从大型通用LLM中萃取知识,训练出高效的本地手术VLM,用于在完全网膜切除术中进行解剖解释。

详情

展开后加载摘要…

URL PDF HTML 收藏