arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-11-25 至 2025-11-25 共收录 79 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 19 篇

2511.17793 2025-11-25 cs.CV cs.LG 86%

Attention Guided Alignment in Efficient Vision-Language Models

注意力引导的高效视觉-语言模型

Shweta Mahajan, Hoang Le, Hyojin Park, Farzad Farhadzadeh, Munawar Hayat, Fatih Porikli

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出AGE-VLM,通过交错交叉注意力层和空间知识提取,减少高效视觉-语言模型中的幻觉问题。

Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Efficient Reasoning

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19536 2025-11-25 cs.CV cs.AI cs.CL 84%

FlowCut: Rethinking Redundancy via Information Flow for Efficient Vision-Language Models

FlowCut: 通过信息流重新思考冗余性以提高视觉-语言模型的效率

Jintao Tong, Wenwei Jin, Pengda Qin, Anqi Li, Yixiong Zou, Yuhong Li, Yuhua Li, Ruixuan Li

机构 * School of Computer Science and Technology, Huazhong University of Science and Technology(华中科技大学计算机科学与技术学院) Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 FlowCut通过信息流视角改进视觉-语言模型的冗余识别,实现更高效的剪枝效果。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18591 2025-11-25 cs.CV 83%

Zero-Reference Joint Low-Light Enhancement and Deblurring via Visual Autoregressive Modeling with VLM-Derived Modulation

无需参考的联合低光照增强与去模糊化:基于视觉自回归建模与VLM衍生调制

Wei Dong, Han Zhou, Junwei Lin, Jun Chen

专题命中 VLM训练与架构 :VLM(title,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本文提出了一种无需参考的联合低光照增强与去模糊化方法,基于视觉自回归建模和VLM衍生调制,通过自适应曲线估计和动态旋转位置编码提升模型对模糊和光照变化的处理能力。

Comments Accepted by AAAI 2026; First Var-based method for joint LLIE and deblurring

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18504 2025-11-25 cs.CV 83%

Extreme Model Compression for Edge Vision-Language Models: Sparse Temporal Token Fusion and Adaptive Neural Compression

边缘视觉-语言模型的极端模型压缩:稀疏时间标记融合与自适应神经压缩

Md Tasnin Tanvir, Soumitra Das, Sk Md Abidar Rahaman, Ali Shiri Sichani

机构 * University of Information Technology and Sciences(信息科技与科学大学) The University of Burdwan(布尔德万大学) Tarakeswar Degree College(塔拉克瓦尔学位学院) University of Missouri, Columbia(密苏里大学,哥伦比亚)

专题命中 VLM训练与架构 :vision-language model(title,abstract);LLaVA(abstract);分类 cs.CV

AI总结 本文提出稀疏时间标记融合和自适应神经压缩技术,实现边缘视觉-语言模型的高效压缩,提升准确率并降低延迟。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17265 2025-11-25 cs.CL cs.CV 83%

Systematic Reward Gap Optimization for Mitigating VLM Hallucinations

系统性奖励缺口优化以缓解视觉语言模型的幻觉

Lehan He, Zeren Chen, Zhelun Shi, Tianyu Yu, Jing Shao, Lu Sheng

机构 * School of Software, Beihang University(北京航空航天大学软件学院) Shanghai Innovation Institute(上海创新研究院) Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学)

专题命中 VLM训练与架构 :VLM(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 TPR通过主题级偏好重写系统优化奖励缺口配置,显著减少VLM幻觉并提升对齐效果。

Comments 34 pages, 12 figures, Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18306 2025-11-25 cs.CL 82%

Table Comprehension in Building Codes using Vision Language Models and Domain-Specific Fine-Tuning

利用视觉语言模型和领域特定微调进行建筑规范中的表格理解

Mohammad Aqib, Mohd Hamza, Ying Hei Chui, Qipei Mei

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract)

AI总结 本文研究了利用视觉语言模型和领域特定微调提取建筑规范中表格信息的方法,发现直接输入方法在准确性上优于间接输入方法,且微调后模型性能显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19261 2025-11-25 cs.CV 79%

LAST: LeArning to Think in Space and Time for Generalist Vision-Language Models

LAST: 为通用视觉-语言模型学习在空间和时间中的思考

Shuai Wang, Daoan Zhang, Tianyi Bai, Shitong Shao, Jiebo Luo, Jiaheng Wei

机构 * HKUST(GZ)(香港科技大学(广州)) University of Rochester(罗切斯特大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 LAST通过学习在空间和时间上思考,提升通用视觉-语言模型对3D空间和长视频的理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17945 2025-11-25 cs.CV 79%

Test-Time Temporal Sampling for Efficient MLLM Video Understanding

测试时时间采样用于高效多模态大语言模型视频理解

Kaibin Wang, Mingbao Lin

机构 * SenseTime, China(深睿时代,中国) Rakuten, Singapore(拉结恩,新加坡)

专题命中 VLM训练与架构 :MLLM(title);multimodal large language model(abstract);分类 cs.CV

AI总结 T3S通过测试时时间采样提高多模态大语言模型处理长视频的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17952 2025-11-25 cs.CV 77%

Multi-speaker Attention Alignment for Multimodal Social Interaction

多说话者注意力对齐用于多模态社交互动

Liangyang Ouyang, Yifei Huang, Mingfang Zhang, Caixin Kang, Ryosuke Furuta, Yoichi Sato

机构 * The University of Tokyo(东京大学)

专题命中 VLM训练与架构 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出了一种多模态多说话者注意力对齐方法,通过动态头选择和自适应注意力偏差提升多模态社交互动理解能力,实现SOTA效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18875 2025-11-25 cs.CV cs.MM 70%

Parallel Vision Token Scheduling for Fast and Accurate Multimodal LMMs Inference

并行视觉令牌调度用于快速准确的多模态大语言模型推理

Wengyi Zhan, Mingbao Lin, Zhihang Lin, Rongrong Ji

机构 * Xiamen University(厦门大学) Rakuten Asia Pte. Ltd.(拉面亚洲有限公司) Xiamen University, China(厦门大学) Shanghai Innovation Institute, China(上海创新研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 ParVTS通过并行调度视觉令牌,高效减少多模态大语言模型推理的计算复杂度,实现高剪枝率与性能损失小的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20840 2025-11-25 cs.RO cs.AI cs.MM 70%

Learning Primitive Embodied World Models: Towards Scalable Robotic Learning

学习原始具身世界模型:迈向可扩展的机器人学习

Qiao Sun, Liujia Yang, Wei Tang, Wei Huang, Kaixin Xu, Yongchao Chen, Mingyu Liu, Jiange Yang, Haoyi Zhu, Yating Wang, Tong He, Yilun Chen, Xili Dai, Nanyang Ye, Qinying Gu

机构 * Shanghai AI Lab(上海人工智能实验室) Fudan(复旦大学) SJTU(上海交通大学) NJUST(南京理工大学) THU(清华大学) Harvard(哈佛大学) ZJU(浙江大学) NJU(南京大学) USTC(中国科学技术大学) Tongji(同济大学) HKUST (GZ)(香港科技大学(广州))

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.AI

AI总结 提出原始具身世界模型(PEWM)以解决具身数据稀疏和高维问题,通过短视界视频生成实现细粒度对齐、降低学习复杂度并提高数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19023 2025-11-25 cs.LG cs.AI 62%

OrdMoE: Preference Alignment via Hierarchical Expert Group Ranking in Multimodal Mixture-of-Experts LLMs

OrdMoE:通过多模态混合专家模型中的层次专家小组排名实现偏好对齐

Yuting Gao, Weihao Chen, Lan Wang, Ruihan Xu, Qingpei Guo

机构 * AntGroup(蚂蚁集团) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

AI总结 OrdMoE通过利用混合专家架构中的内在信号,实现多模态混合专家语言模型的零成本偏好对齐,无需人工标注数据即可提升模型对齐和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14169 2025-11-25 cs.CV cs.AI 62%

AdaTok: Adaptive Token Compression with Object-Aware Representations for Efficient Multimodal LLMs

AdaTok: 一种基于对象感知表示的自适应令牌压缩方法,用于高效多模态大语言模型

Xinliang Zhang, Lei Zhu, Hangzhou He, Shuang Zeng, Ourui Fu, Jiakui Hu, Zhengjian Yao, Yanye Lu

机构 * Institute of Medical Technology, Peking University Health Science Center(北京大学医学部医学技术研究所) Department of Biomedical Engineering, Peking University(北京大学生物医学工程系) National Biomedical Imaging Center, Peking University(北京大学国家生物医学成像中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 AdaTok通过自适应令牌压缩方法,利用对象感知表示提升多模态大语言模型的效率,实现高压缩比与高性能的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12609 2025-11-25 cs.CL cs.AI cs.CV 62%

Uni-MoE-2.0-Omni: Scaling Language-Centric Omnimodal Large Model with Advanced MoE, Training and Data

Uni-MoE-2.0-Omni: 通过先进MoE、训练和数据扩展语言导向的多模态大模型

Yunxin Li, Xinyu Chen, Shenyuan Jiang, Haoyuan Shi, Zhenyu Liu, Xuanyu Zhang, Nanhao Deng, Zhenran Xu, Yicheng Ma, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLM训练与架构 :visual reasoning(abstract);分类 cs.CV、cs.AI

AI总结 Uni-MoE-2.0-Omni通过先进MoE、训练和数据技术,实现了语言导向的多模态大模型,展现出在多模态理解、推理和生成任务中的卓越性能。

Comments 47 pages,10 Figures, Project Website: https://idealistxy.github.io/Uni-MoE-v2.github.io/ Codes: https://github.com/HITsz-TMG/Uni-MoE

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18396 2025-11-25 cs.CV 57%

Exploring Weak-to-Strong Generalization for CLIP-based Classification

探索基于CLIP的分类中的弱到强泛化

Jinhao Li, Sarah M. Erfani, Lei Feng, James Bailey, Feng Liu

机构 * School of Computing and Information Systems University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) School of Computing and Information Systems University of Melbournem, Australia(墨尔本大学计算机与信息系统学院) School of Computer Science and Engineering Southeast University, China(东南大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出类别原型学习方法,通过弱监督提升CLIP模型分类性能,实验显示在预训练受限情况下取得显著改进。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18272 2025-11-25 cs.CV cs.CR 57%

Vision Token Masking Alone Cannot Prevent PHI Leakage in Medical Document OCR: A Systematic Evaluation

仅依靠视觉标记无法防止医疗文档OCR中的PHI泄露:系统评估

Richard J. Young

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) Department of Neuroscience(神经科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究发现,仅靠视觉标记无法有效防止医疗文档OCR中的PHI泄露,需结合NLP后处理以提高隐私保护效果。

Comments 24 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18709 2025-11-25 cs.RO 50%

Autonomous Surface Selection For Manipulator-Based UV Disinfection In Hospitals Using Foundation Models

基于基础模型的医院机器人紫外线消毒表面自主选择

Xueyan Oh, Jonathan Her, Zhixiang Ong, Brandon Koh, Yun Hann Tan, U-Xuan Tan

机构 * Engineering Product Development Pillar, Singapore University of Technology and Design, Singapore(新加坡科技设计大学工程产品开发部门) Centre for Healthcare Assistive & Robotics Technology, Singapore(新加坡医疗辅助与机器人技术中心) National Centre for Infectious Diseases, Singapore(新加坡传染病国家中心)

专题命中 VLM训练与架构 :VLM(abstract)

AI总结 本研究提出基于基础模型的机器人紫外线消毒表面自主选择方法,通过视觉语言模型辅助分割细化,提高消毒效率并减少误判,实验证明其在实际应用中的有效性。

Comments 7 pages, 7 figures; This paper has been accepted by IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2511.17727 2025-11-25 cs.CV 79%

The Potential and Limitations of Vision-Language Models for Human Motion Understanding: A Case Study in Data-Driven Stroke Rehabilitation

视觉-语言模型在人类运动理解中的潜力与局限性:数据驱动中风康复的案例研究

Victor Li, Naveenraj Kamalakannan, Avinash Parnandi, Heidi Schambra, Carlos Fernandez-Granda

机构 * Center for Data Science(数据科学中心) Tandon School of Engineering(工程学院) VitalConnect(VitalConnect公司) Department of Neurology(神经病学部) Department of Rehabilitation Medicine(康复医学部) Courant Institute of Mathematical Sciences(数学科学研究所)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文研究了视觉-语言模型在数据驱动中风康复中的应用,发现其在运动识别和剂量估计方面存在局限性,但通过优化提示和后处理可实现中等准确性的活动分类和运动检测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06908 2025-11-25 cs.CV cs.AI 62%

Find Them All: Unveiling MLLMs for Versatile Person Re-identification

找到它们全部:揭示MLLMs用于多功能人物重识别

Jinhao Li, Zijian Chen, Lirong Deng, Guangtao Zhai, Changbo Wang

机构 * School of Computer Science and Technology, East China Normal University(东华大学计算机科学与技术学院) Institute of Image Communication and Information Processing, Shanghai Jiao Tong University(上海交通大学图像通信与信息处理研究所) Macao Polytechnic University(澳门 polytechnic 大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 本文提出VP-ReID基准,利用MLLMs提升人物重识别的多功能性和有效性,同时揭示其在处理某些模态时的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏