arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 18 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 18 篇

2603.28387 2026-08-31 cs.AI cs.LG 版本更新 91%

Prompts Without Evidence: How Neuroimaging Mentions Shift Clinical Vision-Language Model Predictions

脚手架效应:提示框架如何驱动临床VLM评估中的表面多模态增益

Doan Nam Long Vu, Simone Balloccu

机构 * Technical University of Darmstadt(达姆施塔特技术大学)

专题命中 VLM训练与架构 :VLM(title_cn,summary_cn);vision-language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现,在临床VLM评估中,提示中提及MRI可用性即可解释70-80%的性能提升,与图像数据是否存在无关,这种“脚手架效应”揭示了表面评估无法反映真实多模态推理能力。

Comments Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28218 2026-08-31 cs.CV 新提交 91%

Focus Where It Counts: A Salience-Driven Vision-Language Model for Low Vision Assistance

聚焦关键之处:面向低视力辅助的显著性驱动视觉-语言模型

Jiazhao Liang, Hao Huang, Shuaihang Yuan, Congcong Wen, Geeta Chandra Raju Bethala, Giles Hamilton-Fletcher, Yu Hao, John-Ross Rizzo, Mengyu Wang, Anthony Tzes, Yi Fang

机构 * New York University Tandon School of Engineering(纽约大学坦登工程学院) New York University Abu Dhabi(纽约大学阿布扎比分校) NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) NYU Langone Health(纽约大学兰贡医疗中心) Harvard University(哈佛大学)

专题命中 VLM训练与架构 :LLaVA(summary_cn,abstract);vision-language model(title,abstract);VLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对现有视觉-语言模型未建模人类感知优先级的问题,提出显著性驱动的Salience-LLaVA模型,构建三个显著性数据集并引入SCMI评估,部署于辅助眼镜实现低视力辅助。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28138 2026-08-31 cs.CV 新提交 89%

Token-Budget Distillation: Transferring Full-Token Semantics to Compressed Video Vision-Language Models

令牌预算蒸馏:将全令牌语义迁移至压缩视频视觉语言模型

Xiaoyang Guo, Guoping Luo, Jusheng Zhang, Keze Wang, Wenhao Wang

机构 * Sun Yat-sen University(中山大学) The University of British Columbia(不列颠哥伦比亚大学) Vast Intelligence Lab(威斯特智能实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract,abstract_cn);LLaVA(abstract,abstract_cn);分类 cs.CV

AI总结 本文提出令牌预算蒸馏(TBD)框架,通过双路径师生设计结合LoRA适配器与FlashVID压缩,在固定令牌预算下适配视频VLMs,大幅压缩令牌时仍能保留高语义性能,在多基准测试中优于仅压缩基线。

Comments ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22070 2026-08-31 cs.CE 版本更新 88%

Catellect-VL-2B: A Vision-Language Model for Edge-Based Feline Behavior Understanding

SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型

YuHang Wu, HaoXian Liu, Jia Tao

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28312 2026-08-31 cs.CV cs.CL 新提交 85%

AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning

AIM:锚定身份特征,再匹配以实现多模态大语言模型的遗忘

Wonjun Lee, Jaehyuk Jang, Kangwook Ko, Hee-Seon Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对删除阶段无法获取保留图像的多模态大语言模型身份遗忘场景,提出两阶段方法AIM,通过通用视觉提示锚定遗忘目标并结合Fisher约束,实现身份遗忘的同时保留非删除身份、先验知识与视觉感知。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28567 2026-08-31 cs.CV 新提交 84%

GeBDA: Building Damage Assessment as Text-Based Sequence Prediction

GeBDA:基于文本序列预测的建筑物损伤评估

Olivier Dietrich, Krishna Sapkota, Konrad Schindler, Genady Beryozkin

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出将建筑物损伤评估(BDA)转化为文本序列预测任务,基于通用视觉语言模型(VLM),用开源Gemma模型初步实现取得了有前景的双时相卫星图像损伤制图结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28008 2026-08-31 cs.CV 新提交 83%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27867 2026-08-31 cs.AI 新提交 81%

CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning

CoRe-MoE:用于持续多模态指令调优的紧凑可混合混合专家模型

Runze Liu, Naibin Gu, Mingxu Ai, Yuqing Li, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 针对持续多模态指令调优中 LoRA-MoE 参数开销大的问题,提出 CoRe-MoE 框架,通过复用方向基减少参数,在 MLLM 上性能提升达 5.90 点且参数仅为顺序 LoRA 的 1%。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27893 2026-08-31 cs.CV 新提交 77%

CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning

CommerceVibe:通过双反馈强化学习学习将电商创意设计为可执行视觉代码

Yajiao Xu, Jin Zhang, Jiangbo Ai, Tao Jiang, Mo Xu, Lina Huang, Chengfu Huo

机构 * Tongji University(同济大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出CommerceVibe,将电商创意转化为可执行视觉代码,通过双反馈强化学习优化生成效果,在基准测试中优于仅监督微调的变体及外部模型,实现可控可编辑的规模化电商创意生产。

Comments 20 pages, 13 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27881 2026-08-31 cs.CV 新提交 74%

StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models

StreamEMS:面向视觉语言模型的自演进记忆方案的流视频理解

Yuxin Liu, Peiqin Zhuang, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本研究提出StreamEMS机制,通过语义与先验感知两个演进模块优化记忆表征,在OVO-Bench等数据集上优于现有方法,高token下降率下仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28339 2026-08-31 cs.CV 新提交 70%

Abstract4D: A Large-Scale Dataset and Framework for Understanding the Visual Language of Abstract Art

Abstract4D:用于理解抽象艺术视觉语言的大规模数据集与框架

Haowei Zhang, Yuanpei Zhao, Ji-Zhe Zhou, Mao Li

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出Abstract4D数据集,通过人机混合注释流程构建超12万张抽象绘画数据,开展语义结构分析并建立基准任务,助力评估AI对抽象艺术视觉语言的表征与解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17727 2026-08-31 cs.CV 版本更新 70%

GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations

GraSP-VL: 长度作为视觉-语言表示的语义粒度接口

Zesheng Li, Chengchang Pan, Honggang Qi

机构 * University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究如何将嵌入长度转化为可控的语义访问接口,提出GraSP-VL方法,通过学习共享的近正交前缀变换,实现视觉-语言嵌入的语义层次递进接口,并在多个数据集上验证了其有效性。

Comments 17 pages (9 pages of main text, plus references and appendix), 7 figures, and 13 tables. Accepted to EMNLP 2026 Main Conference. Project page: this https URL (https://lizesheng13.github.io/Grasp-VL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2026-08-31 cs.CV cs.CL 版本更新 70%

The Telephone Game: Evaluating Semantic Drift in Unified Models

电话游戏:评估统一模型中的语义漂移

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 该研究提出语义漂移协议(SDP)等方法,评估统一模型在交替执行图像-文本理解与生成时的语义漂移,发现现有孤立基准无法预测模型的多轮表现,为统一模型可靠性评估提供了更准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12119 2026-08-31 cs.CV cs.AI cs.CL 版本更新 62%

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to EMNLP 2026 and selected for the ACL 2026 Best Paper Consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-08-31 eess.AS cs.AI cs.SD 版本更新 57%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Contents updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-31 cs.CL 版本更新 50%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM)

详情

展开后加载摘要…

URL PDF HTML 收藏