arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 32 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 图文多模态 4 篇

2608.26013 2026-08-28 cs.CL 版本更新 79%

VISA: Agentic Self-Evolving Data Synthesis for Multimodal Instruction Following

VISA:用于多模态指令遵循的智能体式自进化数据合成

Min Zeng, Guanxin Tan, Libin Cen, Yafei Wen, Rui Hu, Liuyang Bian, Xiaolong Chen, Xiaoxin Chen

机构 * vivo AI Lab(vivo AI实验室)

专题命中 图文多模态 :multimodal(title,abstract);分类 cs.CL

AI总结 VISA是一种智能体式自进化数据合成框架,通过自进化循环优化多模态指令合成,在MM-IFEval等基准上提升了多模态指令遵循性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21165 2026-08-28 cs.CL cs.CV 版本更新 62%

Many Dialects, Many Languages, One Cultural Lens: Evaluating Multilingual VLMs for Bengali Culture Understanding Across Historically Linked Languages and Regional Dialects

多种方言,多种语言,一种文化视角:评估多语言视觉语言模型对孟加拉文化的理解,涵盖历史关联语言和地区方言

Nurul Labib Sayeedi, Md. Faiyaz Abdullah Sayeedi, Shubhashis Roy Dipta, Mahbub E Sobhani, Rubaya Tabassum, Ariful Ekraj Hridoy, Mehraj Mahmood, Md. Tarek Hasan, Swakkhar Shatabda

机构 * United International University(国际联合大学) BRAC University(布拉塔克大学) University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 提出 BanglaVerse 基准,通过手工标注图像和扩展至多种语言及方言,评估多语言视觉语言模型在孟加拉文化理解中的表现,发现标准孟加拉语评估高估模型能力,方言变化导致性能下降,文化知识缺失是主要瓶颈。

Comments Accepted at EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08139 2026-08-28 cs.CV cs.AI 版本更新 62%

Subspace Alignment for Vision-Language Model Test-time Adaptation

子空间对齐用于视觉-语言模型测试时适应

Zhichen Zeng, Wenxuan Bao, Xiao Lin, Ruizhong Qiu, Tianxin Wei, Xuying Ning, Yuchen Yan, Chen Luo, Monica Xiao Cheng, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊)

专题命中 图文多模态 :cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 SubTTA通过子空间对齐提升视觉-语言模型测试时适应性能,有效解决模态差距和视觉噪声问题。

Comments 23 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13029 2026-08-28 cs.CV 版本更新 57%

Think3D: Thinking with Space for Spatial Reasoning

Think3D: 基于空间的思考以实现空间推理

Zaibin Zhang, Yuhan Wu, Lianjie Jia, Yifan Wang, Zhongbo Zhang, Yijiang Li, Binghao Ran, Fuxi Zhang, Zhuohan Sun, Yizhuang Peng, Zhenfei Yin, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学) University of California San Diego(加州大学圣地亚哥分校) University of Oxford(牛津大学)

专题命中 图文多模态 :multimodal(abstract);分类 cs.CV

AI总结 Think3D通过引入交互式3D推理框架,提升多模态代理的空间推理能力,实现在BLINK Multi-view和MindCube上的7.8%性能提升,并通过Think3D-RL优化小模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 音频语音多模态 1 篇

2608.23758 2026-08-28 cs.SD cs.AI 版本更新 70%

EXAM$^2$: $\underline{Ex}tending$ $\underline{A}udio$ $Understanding$ $in$ $\underline{M}ultilingual$ $and$ $\underline{M}ultimodal$ $Analysis$

EXAM²:扩展多语言与多模态分析中的音频理解能力

Jiawen Wang, Xiaoxue Gao, Zi Haur Pang, Nancy F. Chen

专题命中 音频语音多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.AI

AI总结 本文提出多语言多模态音频理解基准EXAM²,评估现有模型发现其存在多语言跨模态理解差距,微调的Gemma3n-EXAM²性能显著提升,推动相关研究发展。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频多模态 3 篇

2601.04778 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 70%

CounterVid: Counterfactual Video Generation for Mitigating Action and Temporal Hallucinations in Video-Language Models

CounterVid: 通过生成反事实视频缓解视频-语言模型中动作和时间幻觉

Tobia Poppi, Burak Uzkent, Amanmeet Garg, Lucas Porto, Garin Kessler, Yezhou Yang, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara, Florian Schiffers

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) University of Pisa(帕尔马大学) Amazon Prime Video(亚马逊Prime视频)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 CounterVid通过生成反事实视频缓解视频-语言模型中动作和时间幻觉问题,提出反事实视频生成框架和MixDPO方法,提升时间推理和动作识别性能。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05745 2026-08-28 cs.CV cs.AI 版本更新 62%

UniVVT: A Unified End-to-End Framework for High-Fidelity Video Virtual Try-on

UniVVT:用于高保真视频虚拟试穿的统一端到端框架

Yushe Cao, Shikun Feng, Fei Shen, Haikuo Peng, Jianqiang Xia, Yiheng Zhu, Dianxi Shi, Chun Yu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 UniVVT是一种统一端到端视频虚拟试穿框架,以多模态大语言模型为核心,采用三阶段渐进训练策略,在多基准上实现了优于主流方法的高保真试穿效果。

Comments 17 pages,21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21686 2026-08-28 cs.HC 版本更新 50%

UrbanGazeVis: A Visualization System for Analyzing Eye-Tracking Data on Urban Safety Perception

UrbanGazeVis:用于分析城市安全感知眼动数据的可视化系统

Andres De La Puente, Luis Sante, Felipe Moreno-Vera, Mauro Diaz, Jorge Poco

专题命中 视频多模态 :multimodal(abstract)

AI总结 本研究开发UrbanGazeVis可视化系统,通过30名参与者使用HoloLens 2分析150张里约街景的眼动数据,揭示注视与城市安全感知的关联,为城市设计提供见解。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 跨模态检索 2 篇

2509.08897 2026-08-28 cs.CV cs.AI cs.CL cs.MM 版本更新 85%

Recurrence Meets Transformers for Universal Multimodal Retrieval

循环机制与Transformer结合的通用多模态检索模型

Davide Caffagni, Sara Sarto, Marcella Cornia, Lorenzo Baraldi, Rita Cucchiara

机构 * Department of Education and Humanities, University of Modena and Reggio Emilia(教育与人文学院, Modena and Reggio Emilia大学)

专题命中 跨模态检索 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出结合循环机制与Transformer的统一多模态检索模型ReT-2,其支持多模态查询,在M2KR等基准上达最优性能,推理更快、内存占用更低,还可提升下游任务表现。

Comments TPAMI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22642 2026-08-28 cs.LG cs.AI 版本更新 74%

Mol-JEPA: A multimodal Joint Embedding Predictive Architecture for Molecules

Mol-JEPA:用于分子的多模态联合嵌入预测架构

Florian Rottach, Sebastian Schieferdecker, William Rudman, Randall Balestriero, Carsten Eickhoff

机构 * University of Tübingen(蒂宾根大学) Boehringer Ingelheim(勃林格殷格翰) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 跨模态检索 :multimodal(title);分类 cs.AI

AI总结 针对分子基础模型的化学无效增强等局限,提出Mol-JEPA多模态框架,利用模态掩码融入生化上下文,在基准测试中展现出优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 多模态生成 2 篇

2608.01942 2026-08-28 cs.CV cs.CL cs.MM 版本更新 80%

CultureVidBench: Benchmarking Cultural Understanding in Text-to-Video Generation

CultureVidBench:文本到视频生成中的文化理解基准测试

Xianjing Han, Yuhan Su, Yang Deng, Dong Ma, Wee Peng Tay, Bin Zhu

机构 * Nanyang Technological University(南洋理工大学) Centrale Supélec(中央高等电力学院) Singapore Management University(新加坡管理大学) University of Cambridge(剑桥大学)

专题命中 多模态生成 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.MM

AI总结 本研究推出CultureVidBench基准,评估7款T2V模型的文化理解能力,发现现有模型难捕捉细粒度文化细节,尤其针对代表性不足的文化区域与线索。

Comments EMNLP 2026 Main Conference, Project page: this https URL (https://hanxjing.github.io/CultureVidBench/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12631 2026-08-28 cs.CV cs.AI 版本更新 73%

Multivariate Diffusion Transformer with Decoupled Attention for High-Fidelity Mask-Text Collaborative Facial Generation

多变量扩散变换器与解耦注意力用于高保真遮罩-文本协同面部生成

Yushe Cao, Dianxi Shi, Xing Fu, Xuechao Zou, Haikuo Peng, Xueqi Li, Chun Yu, Junliang Xing

专题命中 多模态生成 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 MDiTFace通过解耦注意力机制和多变量变换块提升遮罩-文本协同面部生成的保真度与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 多模态评测 9 篇

2608.13463 2026-08-28 cs.CV cs.AI cs.CL cs.LG 版本更新 91%

MLLM-Routed Heterogeneous Ensembles for Robust Cross-Dataset Image Classification

用于鲁棒跨数据集图像分类的MLLM路由异质集成模型

Daniel Perkins, John Squires, Janou Milligan, Chandra Raskoti, Linda Ungerboeck

机构 * The Bredesen Center for Interdisciplinary Research and Graduate Education(布雷德森跨学科研究与研究生教育中心) University of Tennessee Knoxville(田纳西大学诺克斯维尔分校)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 该研究针对跨数据集图像分类泛化难题,提出ARMDIL模型,通过MLLM智能体动态路由图像到适配的视觉骨干,兼具竞争力、高适应性与可解释性,为通用视觉系统奠定基础。

Comments 15 pages (single column), 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02897 2026-08-28 cs.CR cs.AI cs.CV 版本更新 91%

PPE-Bench: A Benchmark for Evaluating MLLM Unlearning under Private-Public Entanglement

PPE-Bench:用于评估公私纠缠下MLLM遗忘能力的基准测试

Xianren Zhang, Delvin Ce Zhang, Dongwon Lee, Suhang Wang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) University of Sheffield(谢菲尔德大学)

专题命中 多模态评测 :MLLM(title,title_cn);multimodal(abstract);分类 cs.CV、cs.AI

AI总结 研究针对现有MLLM遗忘基准测试的局限性,提出PPE-Bench基准测试,包含公私纠缠图像,引入两种方法在遗忘中保护公共信息,实验发现现有方法能减少隐私泄露,但常损害相邻公共信息。

Comments to appear in EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22963 2026-08-28 cs.AI cs.CL 版本更新 84%

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

被文本债务掩埋:面向多模态大语言模型智能体的保留视觉证据的上下文剪枝

Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 多模态评测 :MLLM(title,abstract_cn);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型智能体长轨迹中文本主导上下文、抑制视觉证据的问题,提出基于KL引导的SPARE框架,结合OPSD与SFT实现高效剪枝,在多步视觉工具使用基准中达到最优准确率与剪枝比例的权衡。

Comments 17 pages, 3 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22084 2026-08-28 cs.CV 版本更新 83%

MObyGaze: a film dataset of multimodal objectification densely annotated by experts

MObyGaze:由专家密集标注的多模态客体化电影数据集

Elisa Ancarani, Julie Tores, Lucile Sassatelli, Hui-Yin Wu, Remy Sun, Paul Mouret, Clement Bergman, Lea Andolfi, Victor Ecrement, Thierry Devars, Magali Guaresi, Virginie Julliard, Sarah Lecossais, Frederic Precioso

机构 * Université Côte d’Azur, CNRS, I3S, France(法国里沃利大学、法国国家科学研究中心、I3S研究所) Université Côte d’Azur, CNRS, Inria, I3S, France(法国里沃利大学、法国国家科学研究中心、法国国家科学研究院、I3S研究所) Institut Universitaire de France(法国大学研究院) Université Côte d’Azur, Inria, France(法国里沃利大学、法国国家科学研究院、法国) Université Côte d’Azur, CNRS, BCL, France(法国里沃利大学、法国国家科学研究中心、BCL研究所) Sorbonne Université, GRIPIC(索邦大学、GRIPIC研究所) Université Sorbonne Paris Nord, LabSIC(巴黎-索邦大学北校区、LabSIC研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究引入新AI任务以量化电影中多模态客体化模式,构建含20部电影的MObyGaze数据集并完成标注,通过基准测试证明任务可行性,公开代码与数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10954 2026-08-28 cs.CV cs.AI 版本更新 82%

Evidence-Grounded Trustworthy Multimodal Reasoning and Evaluation Benchmark in Complex Urban Scenes

复杂城市场景中基于证据的可信多模态推理与评估基准

Zhaoyang Wei, Bowen Jiang, Xumeng Han, Jiashu Li, Xuehui Yu, Yuling Liu, Guorong Li, Zhenjun Han, Jianbin Jiao

机构 * University of Chinese Academy of Sciences (UCAS)(中国科学院大学) Tencent CDG(腾讯云与智慧产业事业群) Institute of Information Engineering, CAS(中国科学院信息工程研究所)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV、cs.AI;MLLM(comments)

AI总结 针对复杂城市场景中多模态大语言模型的推理可靠性问题,提出AD2-Bench基准与EGVOR模型,提升了不利条件下的多模态推理稳定性。

Comments This submission is an iterative version of our previous work, **"AD^2-Bench: A Hierarchical CoT Benchmark for MLLM in Autonomous Driving under Adverse Conditions"** ( arXiv:2506.09557 (https://arxiv.org/abs/2506.09557) ). We plan to consolidate the current submission with the earlier version into a unified manuscript. Therefore, we would like to withdraw this submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21883 2026-08-28 cs.CV 版本更新 79%

VIG: Visual Information Gain as a Reward Signal for Multimodal Chain-of-Thought Compression

VIG:作为多模态思维链压缩奖励信号的视觉信息增益

Wen Luo, Xiaohan Yi, Xiaotao Huang, Liqun Huang

机构 * School of Software Engineering, Huazhong University of Science and Technology(华中科技大学软件学院) Tsinghua University(清华大学)

专题命中 多模态评测 :multimodal(title,abstract);分类 cs.CV

AI总结 该研究提出VIG奖励机制,通过提升视觉信息密度优化多模态CoT的准确率与效率权衡,无需额外资源,在多类基准及不同规模模型上均有效。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17188 2026-08-28 cs.CV cs.CL 版本更新 73%

Not Truly Multilingual: Script Consistency as a Missing Dimension in VLM Evaluation

并非真正的多语言:脚本一致性作为VLM评估中缺失的维度

Prabhjot Singh, Bhushan Pawar, Madhu Reddiboina, Rajvee Sheth

机构 * RediMinds Inc.(RediMinds公司) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Independent Researcher(独立研究员)

专题命中 多模态评测 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL

AI总结 提出PuMVR基准,评估10个VLM在旁遮普语三种文字上的表现,发现显著的脚本差距,并提出脚本一致性率(SCR)作为必要评估指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31597 2026-08-28 cs.CV 版本更新 70%

SOCO: Benchmarking Semantic Object Correspondence in Vision Foundation Models

SOCO: 视觉基础模型中语义对象对应关系的基准测试

Olaf Dünkel, Basavaraj Sunagad, Haoran Wang, David T. Hoffmann, Christian Theobalt, Adam Kortylewski

机构 * Max Planck Institute for Informatics(马克斯·普朗克研究所信息学研究所) Saarland Informatics Campus(萨尔州信息学校园) CISPA Helmholtz Center for Information Security(信息安全霍夫曼中心) University of Freiburg(弗赖堡大学)

专题命中 多模态评测 :multimodal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 提出SOCO基准,通过引入对应类型分类法和100个类别上超过100万对功能上有意义的关键点注释,系统评估视觉基础模型中的语义对应能力,并揭示模型在跨类别迁移、语言引导定位与视觉对应之间的差距。

Comments Project page: this https URL (https://genintel.github.io/SOCO/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12588 2026-08-28 cs.LG cs.CL 版本更新 57%

Plain Transformers Can be Powerful Graph Learners

原始变换器可以成为强大的图学习者

Liheng Ma, Soumyasundar Pal, Yingxue Zhang, Philip H.S. Torr, Mark Coates

机构 * McGill University(麦吉尔大学) Mila - Quebec AI Institute(魁北克人工智能研究所) Huawei Noah’s Ark Lab, Montreal(华为诺亚实验室,蒙特利尔) University of Oxford(牛津大学)

专题命中 多模态评测 :multimodal(abstract);分类 cs.CL

AI总结 本研究证明原始变换器可通过简单修改成为强大图学习者,提出PPGT架构在图学习任务中表现优异。

Comments TMLR - 2026/06 this https URL (https://openreview.net/pdf?id=bEmDvP0fdv)

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 多模态Agent 2 篇

2605.30931 2026-08-28 cs.CL 版本更新 89%

MineExplorer: Evaluating Open-World Exploration of MLLM Agents in Minecraft

MineExplorer: 评估MLLM智能体在Minecraft中的开放世界探索能力

Tianjie Ju, Yueqing Sun, Zheng Wu, Wei Zhang, Yaqi Huo, Xi Su, Qi Gu, Xunliang Cai, Gongshen Liu, Zhuosheng Zhang

机构 * School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) Meituan(美团)

专题命中 多模态Agent :MLLM(title,title_cn);multimodal(abstract);分类 cs.CL

AI总结 提出MineExplorer基准,通过多智能体合成工作流构建隐式多跳任务,评估多模态大语言模型在Minecraft中的开放世界探索能力,发现长轨迹协调仍是挑战。

Comments Accepted at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02357 2026-08-28 cs.CV cs.AI 版本更新 81%

Do Multimodal Agents Really Benefit from Tool Use? A Systematic Study of Capability Gains

多模态智能体真的从工具使用中受益吗?能力增益的系统性研究

Jiawei Guo, Donglei Yu, Yu Chen, Xiang Wang, Shuai Li, Xinpei Zhao, Huaxing Liu, Qinghao Wang, Minpeng Liao

专题命中 多模态Agent :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 通过对比工具增强与无工具的多模态智能体在多项任务上的表现,发现工具使用并未带来一致的性能提升,智能体更多是学会了工具调用模式而非真正利用工具扩展能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

8. 多模态训练与对齐 8 篇

2608.03611 2026-08-28 cs.AI cs.MM 版本更新 86%

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

面向含不完整观测的多模态情感分析,重新思考模态可靠性

Chunlei Meng, Jacqueline J. Pang, Pengbin Feng, Zhenyu Yu, Chun Ouyang, Zhongxue Gan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对含不完整观测的多模态情感分析,本文提出显式建模模态可靠性的MRCF框架,缓解可靠性不匹配与传播偏差,在多个公开情感数据集上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22863 2026-08-28 cs.MM 版本更新 85%

Adaptive Hierarchical Representation Alliance for Multimodal Learning

面向多模态学习的自适应层级表示联盟

Chunlei Meng, Pengbin Feng, Jacqueline J. Pang, Chih-Ting Liao, Rong Fu, Zhaolu Kang, Zhongxue Gan, Chun Ouyang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.MM

AI总结 该研究针对多模态模型的语义粒度不匹配问题,提出自适应层级表示联盟框架,经六个基准实验验证,其性能优于强基线且在噪声、缺失模态场景下更鲁棒。

Comments This study has been accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24947 2026-08-28 cs.LG cs.AI 版本更新 83%

CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery

CAT-GS:通过校准门控与融合操作实现平衡多模态学习

Mahir Shahriar Tamim, Sharjil Khan, Md. Samiul Alim, Tanvir Ahmed Khan, Shafin Rahman, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 CAT-GS是一种无需修改模型的优化控制器,通过校准门控与融合操作解决多模态学习的三种失效模式,在多类基准上提升或匹配多模态准确率,且门控更平稳、融合冲突更少。

Comments This article is accepted in Neurocomputing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-28 cs.CL 版本更新 79%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL]( this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-28 cs.CV cs.CL 版本更新 62%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at this https URL (https://github.com/Labyrinth0419/ET-Prune)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-28 cs.LG cs.CL 版本更新 57%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19873 2026-08-28 cs.CV 版本更新 57%

SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation

SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应

Víctor Barreiro, Johannes Jakubik, Francisco Argüello, Dora B. Heras

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏