arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 20 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 20 篇

2608.26993 2026-08-28 cs.CV 新提交 89%

Aphanta: Diagnosing Task-Aligned Image-Edited Intermediates for Multimodal Reasoning

Aphanta:面向多模态推理的任务对齐图像编辑中间产物诊断框架

Hengyuan Xu, Wei Cheng, Yumeng Ji, Xuanyang Zhang, Xianfang Zeng, Gang Yu, Xingjun Ma

机构 * StepFun(阶跃星辰) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :MLLM(summary_cn,abstract);multimodal(title,abstract);分类 cs.CV

AI总结 本文提出Aphanta框架,用于诊断MLLM与图像编辑中间产物的任务对齐性,实验显示图像编辑是专用视觉工作空间,该框架可用于评估相关流水线效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26820 2026-08-28 cs.CV 新提交 87%

LLaVAFlow: Preserving Latent Alignment Flow for Parameter-Efficient Multimodal Fine-Tuning

LLaVAFlow:用于参数高效多模态微调的潜在对齐流保留方法

Muyao Yuan, Muyan Jiao, Jiangyong Ying, Weizhan Zhang, Yuanhong Zhang, Lan Ma, Yuan Gao, Haipeng Du

机构 * MOEKLINNS China Telecom(中国电信)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);cross-modal(abstract);分类 cs.CV

AI总结 针对多模态大语言模型微调的灾难性遗忘问题,本文提出即插即用的LLaVAFlow框架,通过信息论蒸馏保留跨模态对齐流,提升下游任务性能与泛化能力。

Comments Accepted by ACM Multimedia 2026 (ACM MM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26142 2026-08-28 cs.CL cs.AI 新提交 86%

Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation

位置即你所需:一种用于基于多模态大语言模型的指代表达分割的免费午餐式令牌压缩策略

Yuhan Liu, Yixiong Zou, Yuhua Li, Ruixuan Li

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对基于多模态大语言模型的指代表达分割任务的计算开销瓶颈,提出仅依赖位置信息的即插即用无训练令牌压缩方法PAYN,性能优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03611 2026-08-28 cs.AI cs.MM 版本更新 86%

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

面向含不完整观测的多模态情感分析,重新思考模态可靠性

Chunlei Meng, Jacqueline J. Pang, Pengbin Feng, Zhenyu Yu, Chun Ouyang, Zhongxue Gan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对含不完整观测的多模态情感分析,本文提出显式建模模态可靠性的MRCF框架,缓解可靠性不匹配与传播偏差,在多个公开情感数据集上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22863 2026-08-28 cs.MM 版本更新 85%

Adaptive Hierarchical Representation Alliance for Multimodal Learning

面向多模态学习的自适应层级表示联盟

Chunlei Meng, Pengbin Feng, Jacqueline J. Pang, Chih-Ting Liao, Rong Fu, Zhaolu Kang, Zhongxue Gan, Chun Ouyang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.MM

AI总结 该研究针对多模态模型的语义粒度不匹配问题,提出自适应层级表示联盟框架,经六个基准实验验证,其性能优于强基线且在噪声、缺失模态场景下更鲁棒。

Comments This study has been accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26879 2026-08-28 cs.LG cs.MM 新提交 83%

Mitigating Strong-Modality Collapse in Multimodal Learning via Inverted Asymmetric Fusion

通过反向非对称融合缓解多模态学习中的强模态坍塌问题

Mary Ogbuka Kenneth, Foaad Khosmood, Abbas Edalat

机构 * Imperial College London(帝国理工学院) California Polytechnic State University(加州州立理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM

AI总结 针对多模态学习中强模态坍塌导致模型难超单模态基准的问题,提出反向非对称融合(IAF)方法,在三类基准上验证其可保留主导模态性能且最高提升单模态基准8.25%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24947 2026-08-28 cs.LG cs.AI 版本更新 83%

CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery

CAT-GS:通过校准门控与融合操作实现平衡多模态学习

Mahir Shahriar Tamim, Sharjil Khan, Md. Samiul Alim, Tanvir Ahmed Khan, Shafin Rahman, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 CAT-GS是一种无需修改模型的优化控制器,通过校准门控与融合操作解决多模态学习的三种失效模式,在多类基准上提升或匹配多模态准确率,且门控更平稳、融合冲突更少。

Comments This article is accepted in Neurocomputing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26155 2026-08-28 cs.CL cs.AI 新提交 82%

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation

VFA:通过无视觉适配赋能多语言多模态大语言模型

Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多模态大语言模型的英语中心化问题,提出VFA框架,通过组合任务向量实现多语言增强与视觉对齐解耦,仅用少量数据就提升了多语言模型性能并保留原有能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27286 2026-08-28 cs.LG 新提交 82%

MM-Spectrum: Multimodal Multi-spectral Molecular Structural Elucidation with a Stable MoE Framework

MM-Spectrum:基于稳定MoE框架的多模态多光谱分子结构解析

Hai-tao Yu, Nan Min, Zheng Fang, Hongyu Zhan, Yusen Tan, Yuhan Wang, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southeast University(东南大学) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多光谱序列直接连接的性能下降问题,提出MM-Spectrum稳定MoE框架,引入模态感知路由与异质专家,在分子结构解析的多模态设置下取得显著改进。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26162 2026-08-28 cs.AI 新提交 79%

A Safety-Gated Multimodal AI Backend for Mental-Health Support: Hierarchical State Representation, Conservative Risk Fusion, and Controlled Generation in Anian

用于心理健康支持的安全门控多模态AI后端:Anian中的分层状态表示、保守风险融合与受控生成

Lei Wang, Xiao Wang, Lei Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出用于围产期心理健康支持的安全门控多模态AI后端Anian,其通过分层状态表示与保守风险融合实现安全门控,原型在多任务评估中表现优异,验证了框架内部可行性。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-28 cs.CL 版本更新 79%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL]( this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26436 2026-08-28 cs.LG 新提交 78%

NeoTriFuse: Reliability-Aware Multimodal Fusion under Missingness Heterogeneity for Neonatal Mortality Risk Prediction

NeoTriFuse:面向新生儿死亡率风险预测的缺失异质性下可靠性感知多模态融合

Jiyuan Tian, Qincheng Shen, Ye Lin, Yu Gao, Haohui Lu

机构 * The University of Sydney(悉尼大学) Charles Darwin University(查尔斯达尔文大学) Molly Wardaguga Institute for First Nations Birth Rights(莫莉·沃达古加原住民生育权利研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出NeoTriFuse框架,将缺失值作为可靠性信号动态调整模态贡献,联合优化死亡率与住院时长预测,在新生儿死亡率风险预测任务中取得优异性能。

Comments ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26622 2026-08-28 cs.RO 新提交 71%

Relaxation-Aware Multimodal Sensing of Soft Gripper Driven by Structure-Perception-Learning

基于结构-感知-学习的软夹持器的松弛感知多模态感知

Yanzhe Wang, Hao Wu, Ziyi Zheng, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Torch Kernel Co., Ltd.(炬芯科技股份有限公司)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 该研究针对软夹持器抓取力因粘弹性松弛衰减的问题,提出结构-感知-学习框架,结合变刚度设计与温度耦合粘弹性力表征,使280秒力控抓取误差降低80%至95%,实现稳定持续抓取。

Comments 11 pages, 9 figures. Published in Robotics: Science and Systems (RSS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26325 2026-08-28 cs.HC 新提交 71%

Calibration-Free Cuffless Blood Pressure Estimation Using Multimodal ECG-PPG Fusion on a Google Pixel Watch

基于谷歌Pixel Watch的多模态心电-光电容积脉搏波融合的无校准无袖带血压估计

Jathushan Kaetheeswaran, Boyi Ma, Ali Abedi, Shehroz S. Khan, Milad Lankarany

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 该研究利用谷歌Pixel Watch采集的数据,提出深度学习模型并融合多模态信号,实现无校准无袖带的血压估计,虽泛化性较好但肥胖个体误差更高,为消费级智能手表用于血压监测提供了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-28 cs.CV cs.CL 版本更新 62%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at this https URL (https://github.com/Labyrinth0419/ET-Prune)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26589 2026-08-28 cs.CV 新提交 57%

DPA-I2P: Depth-Guided Projective Alignment for Image-to-Point-Cloud Registration in Autonomous Driving

DPA-I2P:面向自动驾驶中图像与点云配准的深度引导投影对齐

Wenxin Zhang, Hang Li, Zhiwei Xu, Qiankun Dong, Gang Wang, Tao Li

机构 * Nankai University(南开大学) Haihe Lab of ITAI(海河人工智能与信息技术实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对自动驾驶中图像与点云配准的跨模态对应学习难题,提出DPA-I2P方法,通过RMDE、PVL与CQP提升配准性能,在KITTI、nuScenes数据集上较基线方法有显著提升,可迁移性更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26141 2026-08-28 cs.CL cs.LG 新提交 57%

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking

AdaThinking-E:用于自适应思考的单token熵调控

Zining Wang, Tongkun Guan, Boming Chen, Zhentao Guo, Jianqiang Liu, Chao Jin, Chen Duan, Kai Zhou, Pengfei Yan, Wei Shen, Xiaokang Yang

机构 * Meituan(美团) MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室) AI Institute(人工智能研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出AdaThinking-E强化学习框架,通过单token熵调控实现自适应思考,使模型在不同复杂度文档任务中兼顾准确率与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-28 cs.LG cs.CL 版本更新 57%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19873 2026-08-28 cs.CV 版本更新 57%

SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation

SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应

Víctor Barreiro, Johannes Jakubik, Francisco Argüello, Dora B. Heras

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-08-28 cs.IR 版本更新 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏