arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-08-31 至 2026-08-31 共收录 78 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 18 篇

2608.22070 2026-08-31 cs.CE 版本更新 88%

Catellect-VL-2B: A Vision-Language Model for Edge-Based Feline Behavior Understanding

SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型

YuHang Wu, HaoXian Liu, Jia Tao

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(title,abstract)

AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28312 2026-08-31 cs.CV cs.CL 新提交 85%

AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning

AIM:锚定身份特征,再匹配以实现多模态大语言模型的遗忘

Wonjun Lee, Jaehyuk Jang, Kangwook Ko, Hee-Seon Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 针对删除阶段无法获取保留图像的多模态大语言模型身份遗忘场景,提出两阶段方法AIM,通过通用视觉提示锚定遗忘目标并结合Fisher约束,实现身份遗忘的同时保留非删除身份、先验知识与视觉感知。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28567 2026-08-31 cs.CV 新提交 84%

GeBDA: Building Damage Assessment as Text-Based Sequence Prediction

GeBDA:基于文本序列预测的建筑物损伤评估

Olivier Dietrich, Krishna Sapkota, Konrad Schindler, Genady Beryozkin

机构 * ETH Zurich(苏黎世联邦理工学院) Google(谷歌公司)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);vision-language model(abstract);分类 cs.CV

AI总结 本研究提出将建筑物损伤评估(BDA)转化为文本序列预测任务,基于通用视觉语言模型(VLM),用开源Gemma模型初步实现取得了有前景的双时相卫星图像损伤制图结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28008 2026-08-31 cs.CV 新提交 83%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27867 2026-08-31 cs.AI 新提交 81%

CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning

CoRe-MoE:用于持续多模态指令调优的紧凑可混合混合专家模型

Runze Liu, Naibin Gu, Mingxu Ai, Yuqing Li, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 VLM训练与架构 :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 针对持续多模态指令调优中 LoRA-MoE 参数开销大的问题,提出 CoRe-MoE 框架,通过复用方向基减少参数,在 MLLM 上性能提升达 5.90 点且参数仅为顺序 LoRA 的 1%。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27893 2026-08-31 cs.CV 新提交 77%

CommerceVibe: Learning to Design E-Commerce Creatives as Executable Visual Code via Dual-Feedback Reinforcement Learning

CommerceVibe:通过双反馈强化学习学习将电商创意设计为可执行视觉代码

Yajiao Xu, Jin Zhang, Jiangbo Ai, Tao Jiang, Mo Xu, Lina Huang, Chengfu Huo

机构 * Tongji University(同济大学) Alibaba Group(阿里巴巴集团)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究提出CommerceVibe,将电商创意转化为可执行视觉代码,通过双反馈强化学习优化生成效果,在基准测试中优于仅监督微调的变体及外部模型,实现可控可编辑的规模化电商创意生产。

Comments 20 pages, 13 figures, 12 tables; includes supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27881 2026-08-31 cs.CV 新提交 74%

StreamEMS: Streaming Video Understanding with Self-Evolving Memory Scheme for Vision-Language Models

StreamEMS:面向视觉语言模型的自演进记忆方案的流视频理解

Yuxin Liu, Peiqin Zhuang, Yali Wang

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV

AI总结 本研究提出StreamEMS机制,通过语义与先验感知两个演进模块优化记忆表征,在OVO-Bench等数据集上优于现有方法,高token下降率下仍具优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28339 2026-08-31 cs.CV 新提交 70%

Abstract4D: A Large-Scale Dataset and Framework for Understanding the Visual Language of Abstract Art

Abstract4D:用于理解抽象艺术视觉语言的大规模数据集与框架

Haowei Zhang, Yuanpei Zhao, Ji-Zhe Zhou, Mao Li

机构 * College of Computer Science, Sichuan University(四川大学计算机学院)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 该研究推出Abstract4D数据集,通过人机混合注释流程构建超12万张抽象绘画数据,开展语义结构分析并建立基准任务,助力评估AI对抽象艺术视觉语言的表征与解读能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17727 2026-08-31 cs.CV 版本更新 70%

GraSP-VL: Length as a Semantic Granularity Interface for Vision-Language Representations

GraSP-VL: 长度作为视觉-语言表示的语义粒度接口

Zesheng Li, Chengchang Pan, Honggang Qi

机构 * University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);分类 cs.CV

AI总结 本文研究如何将嵌入长度转化为可控的语义访问接口,提出GraSP-VL方法,通过学习共享的近正交前缀变换,实现视觉-语言嵌入的语义层次递进接口,并在多个数据集上验证了其有效性。

Comments 17 pages (9 pages of main text, plus references and appendix), 7 figures, and 13 tables. Accepted to EMNLP 2026 Main Conference. Project page: this https URL (https://lizesheng13.github.io/Grasp-VL/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04438 2026-08-31 cs.CV cs.CL 版本更新 70%

The Telephone Game: Evaluating Semantic Drift in Unified Models

电话游戏:评估统一模型中的语义漂移

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract);分类 cs.CV

AI总结 该研究提出语义漂移协议(SDP)等方法,评估统一模型在交替执行图像-文本理解与生成时的语义漂移,发现现有孤立基准无法预测模型的多轮表现,为统一模型可靠性评估提供了更准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13247 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.MM 版本更新 67%

Aligning Agentic World Models via Knowledgeable Experience Learning

通过知识性经验学习对齐代理世界模型

Baochang Ren, Yunzhi Yao, Rui Sun, Shuofei Qiao, Ningyu Zhang, Huajun Chen

机构 * Zhejiang University(浙江大学) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 WorldMind通过知识性经验学习对齐代理世界模型,解决物理模拟中的幻觉问题,实现跨环境的高效迁移。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06079 2026-08-31 cs.CV cs.AI 版本更新 62%

Scientific Graphics Program Synthesis via Dual Self-Consistency Reinforcement Learning

通过双自一致性强化学习实现科学图形程序合成

Juekai Lin, Yun Zhu, Honglin Lin, Sijing Li, Tianwei Lin, Zheng Liu, Xiaoyang Wang, Wenqiao Zhang, Lijun Wu

机构 * Zhejiang University(浙江大学) Shanghai Artificial Intelligence Laboratory, OpenDataLab(上海人工智能实验室,OpenDataLab) Shanghai Jiao Tong University(上海交通大学) Peking University(北京大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出双自一致性强化学习框架,结合高质量数据集和多维基准,提升科学图形到可编辑TikZ代码的转换能力,实现视觉与结构的高精度优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12119 2026-08-31 cs.CV cs.AI cs.CL 版本更新 62%

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to EMNLP 2026 and selected for the ACL 2026 Best Paper Consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06199 2026-08-31 eess.AS cs.AI cs.SD 版本更新 57%

FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation

FastSLM:用于高效长语音自适应的层次时间抽象

Junseok Lee, Chang-Jae Chun

机构 * OKESTRO Sejong University(世宗大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 针对长语音输入中标记爆炸问题,提出FastSLM架构,通过层次时间抽象器(HTA)实现每秒1.67个标记的极端压缩率(减少97%),在显著降低计算量和参数的同时,在长语音基准上达到与最先进模型竞争的性能。

Comments Contents updated

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-31 cs.CL 版本更新 50%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract)

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2608.20756 2026-08-31 cs.CV cs.AI 版本更新 85%

Vis-Poison: Poisoning Visual Knowledge in Multimodal Retrieval-Augmented Generation

Vis-Poison:多模态检索增强生成中的视觉知识投毒攻击

Rujin Liang, Zhongpu Chen, Yuhao Lei, Xin Miao

机构 * Southwestern University of Finance and Economics(西南财经大学) Nanjing University of Science and Technology(南京理工大学)

专题命中 其他VLM :MLLM(summary_cn,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Vis-Poison攻击,通过自动化多智能体方法构建视觉合理的被投毒图像,在黑盒设置下对多模态RAG系统实现40.16%-65.40%的攻击成功率,且对仅依赖参数知识的MLLM平均成功率超60%。

Comments Findings of EMNLP, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28266 2026-08-31 cs.RO 新提交 80%

CoCoBench: A Cooperative Coordination Benchmark for Embodied Multi-Agent Task Planning

CoCoBench:用于具身多智能体任务规划的协作协调基准

Yang Chen, Ye-Xin Xie, Lirong Che, Danyang Peng, Yuzhe Yang, Peiwen Lin, Xu Cao, Chuang Wang, Lei Yuan, Jian Su, Lan-Zhe Guo

机构 * Nanjing University(南京大学) AgiBot Tsinghua University(清华大学)

专题命中 其他VLM :MLLM(summary_cn,abstract_cn);multimodal large language model(abstract)

AI总结 研究人员提出CoCoBench这一家庭任务多智能体具身协调基准,评估11种MLLM后发现协调能力具构造特异性,为相关模型设计提供新方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26536 2026-08-31 cs.CL cs.AI cs.CV cs.LG cs.RO 版本更新 75%

OceanGym: A Benchmark Environment for Underwater Embodied Agents

OceanGym: 一个用于水下具身智能体的基准环境

Yida Xue, Mingjun Mao, Xiangyuan Ru, Yuqi Zhu, Baochang Ren, Shuofei Qiao, Mengru Wang, Shumin Deng, Xinyu An, Ningyu Zhang, Ying Chen, Huajun Chen

专题命中 其他VLM :MLLM(abstract,abstract_cn);分类 cs.CV、cs.AI、cs.LG

AI总结 OceanGym通过多模态大语言模型构建首个水下具身智能体基准,揭示水下环境感知与规划的挑战,推动水下自主系统发展。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏