arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-28 至 2026-08-28 共收录 112 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 21 篇

2608.26142 2026-08-28 cs.CL cs.AI 新提交 86%

Position Is All You Need: A Free Lunch Token Compression Strategy for MLLM-based Referring Expression Segmentation

位置即你所需:一种用于基于多模态大语言模型的指代表达分割的免费午餐式令牌压缩策略

Yuhan Liu, Yixiong Zou, Yuhua Li, Ruixuan Li

专题命中 多模态训练与对齐 :MLLM(title,abstract);multimodal(abstract);分类 cs.CL、cs.AI

AI总结 针对基于多模态大语言模型的指代表达分割任务的计算开销瓶颈,提出仅依赖位置信息的即插即用无训练令牌压缩方法PAYN,性能优于现有方法。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03611 2026-08-28 cs.AI cs.MM 版本更新 86%

Rethinking Modality Reliability in Multimodal Sentiment Analysis with Incomplete Observations

面向含不完整观测的多模态情感分析,重新思考模态可靠性

Chunlei Meng, Jacqueline J. Pang, Pengbin Feng, Zhenyu Yu, Chun Ouyang, Zhongxue Gan

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI、cs.MM

AI总结 针对含不完整观测的多模态情感分析,本文提出显式建模模态可靠性的MRCF框架,缓解可靠性不匹配与传播偏差,在多个公开情感数据集上取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22863 2026-08-28 cs.MM 版本更新 85%

Adaptive Hierarchical Representation Alliance for Multimodal Learning

面向多模态学习的自适应层级表示联盟

Chunlei Meng, Pengbin Feng, Jacqueline J. Pang, Chih-Ting Liao, Rong Fu, Zhaolu Kang, Zhongxue Gan, Chun Ouyang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.MM

AI总结 该研究针对多模态模型的语义粒度不匹配问题,提出自适应层级表示联盟框架,经六个基准实验验证,其性能优于强基线且在噪声、缺失模态场景下更鲁棒。

Comments This study has been accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26879 2026-08-28 cs.LG cs.MM 新提交 83%

Mitigating Strong-Modality Collapse in Multimodal Learning via Inverted Asymmetric Fusion

通过反向非对称融合缓解多模态学习中的强模态坍塌问题

Mary Ogbuka Kenneth, Foaad Khosmood, Abbas Edalat

机构 * Imperial College London(帝国理工学院) California Polytechnic State University(加州州立理工大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);audio-visual(abstract);分类 cs.MM

AI总结 针对多模态学习中强模态坍塌导致模型难超单模态基准的问题,提出反向非对称融合(IAF)方法,在三类基准上验证其可保留主导模态性能且最高提升单模态基准8.25%

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24947 2026-08-28 cs.LG cs.AI 版本更新 83%

CAT-GS: Balanced Multimodal Learning via Calibrated Gating and Fusion Surgery

CAT-GS:通过校准门控与融合操作实现平衡多模态学习

Mahir Shahriar Tamim, Sharjil Khan, Md. Samiul Alim, Tanvir Ahmed Khan, Shafin Rahman, Nabeel Mohammed

机构 * North South University(北南大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.AI

AI总结 CAT-GS是一种无需修改模型的优化控制器,通过校准门控与融合操作解决多模态学习的三种失效模式,在多类基准上提升或匹配多模态准确率,且门控更平稳、融合冲突更少。

Comments This article is accepted in Neurocomputing Journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26155 2026-08-28 cs.CL cs.AI 新提交 82%

VFA: Empowering Multilingual MLLMs via Vision-Free Adaptation

VFA:通过无视觉适配赋能多语言多模态大语言模型

Yixia Li, Yaqing Shi, Zhiwen Ruan, Dongdong Zhang, Lingjie Jiang, Shaohan Huang, Yun Chen, Guanhua Chen, Furu Wei

机构 * Southern University of Science and Technology(南方科技大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);image-text(abstract);分类 cs.CL、cs.AI

AI总结 本研究针对多模态大语言模型的英语中心化问题,提出VFA框架,通过组合任务向量实现多语言增强与视觉对齐解耦,仅用少量数据就提升了多语言模型性能并保留原有能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27286 2026-08-28 cs.LG 新提交 82%

MM-Spectrum: Multimodal Multi-spectral Molecular Structural Elucidation with a Stable MoE Framework

MM-Spectrum:基于稳定MoE框架的多模态多光谱分子结构解析

Hai-tao Yu, Nan Min, Zheng Fang, Hongyu Zhan, Yusen Tan, Yuhan Wang, Jun Xia

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Southeast University(东南大学) Fudan University(复旦大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract)

AI总结 针对多光谱序列直接连接的性能下降问题,提出MM-Spectrum稳定MoE框架,引入模态感知路由与异质专家,在分子结构解析的多模态设置下取得显著改进。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26162 2026-08-28 cs.AI 新提交 79%

A Safety-Gated Multimodal AI Backend for Mental-Health Support: Hierarchical State Representation, Conservative Risk Fusion, and Controlled Generation in Anian

用于心理健康支持的安全门控多模态AI后端:Anian中的分层状态表示、保守风险融合与受控生成

Lei Wang, Xiao Wang, Lei Li

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI

AI总结 本文提出用于围产期心理健康支持的安全门控多模态AI后端Anian,其通过分层状态表示与保守风险融合实现安全门控,原型在多任务评估中表现优异,验证了框架内部可行性。

Comments 16 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-28 cs.CL 版本更新 79%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at [this URL](https://github.com/LAMDA-CL/EMNLP2026-CRAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26436 2026-08-28 cs.LG 新提交 78%

NeoTriFuse: Reliability-Aware Multimodal Fusion under Missingness Heterogeneity for Neonatal Mortality Risk Prediction

NeoTriFuse:面向新生儿死亡率风险预测的缺失异质性下可靠性感知多模态融合

Jiyuan Tian, Qincheng Shen, Ye Lin, Yu Gao, Haohui Lu

机构 * The University of Sydney(悉尼大学) Charles Darwin University(查尔斯达尔文大学) Molly Wardaguga Institute for First Nations Birth Rights(莫莉·沃达古加原住民生育权利研究所)

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 本文提出NeoTriFuse框架,将缺失值作为可靠性信号动态调整模态贡献,联合优化死亡率与住院时长预测,在新生儿死亡率风险预测任务中取得优异性能。

Comments ICONIP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26622 2026-08-28 cs.RO 新提交 71%

Relaxation-Aware Multimodal Sensing of Soft Gripper Driven by Structure-Perception-Learning

基于结构-感知-学习的软夹持器的松弛感知多模态感知

Yanzhe Wang, Hao Wu, Ziyi Zheng, Huixu Dong

机构 * School of Mechanical Engineering, Zhejiang University(浙江大学机械工程学院) Torch Kernel Co., Ltd.(炬芯科技股份有限公司)

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 该研究针对软夹持器抓取力因粘弹性松弛衰减的问题,提出结构-感知-学习框架,结合变刚度设计与温度耦合粘弹性力表征,使280秒力控抓取误差降低80%至95%,实现稳定持续抓取。

Comments 11 pages, 9 figures. Published in Robotics: Science and Systems (RSS 2026)

Journal ref Proceedings of Robotics: Science and Systems XXII, Sydney, Australia, July 13-17, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26325 2026-08-28 cs.HC 新提交 71%

Calibration-Free Cuffless Blood Pressure Estimation Using Multimodal ECG-PPG Fusion on a Google Pixel Watch

基于谷歌Pixel Watch的多模态心电-光电容积脉搏波融合的无校准无袖带血压估计

Jathushan Kaetheeswaran, Boyi Ma, Ali Abedi, Shehroz S. Khan, Milad Lankarany

专题命中 多模态训练与对齐 :multimodal(title)

AI总结 该研究利用谷歌Pixel Watch采集的数据,提出深度学习模型并融合多模态信号,实现无校准无袖带的血压估计,虽泛化性较好但肥胖个体误差更高,为消费级智能手表用于血压监测提供了可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01979 2026-08-28 cs.CV cs.CL 版本更新 62%

ET-Prune: Evidence-Aware Dynamic Budgeting for Visual Token Pruning in Text-Rich MLLMs

ET-Prune:面向文本丰富型多模态大语言模型的视觉 token 剪枝的证据感知动态预算分配

Zizhong Ding, Junxian Li, Kai Liu, Shaoqiu Zhang, Xiao Xiao, Linghe Kong, Yulun Zhang

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.CL

AI总结 ET-Prune 是一种无需训练的视觉 token 剪枝框架,通过证据分配实现动态预算,在文本丰富的多模态任务中,于约一半 token 保留量下,在 OCRBench-v2、MMBench v1.1 等基准上取得优于基线的性能,实现了质量与成本的良好平衡。

Comments Code and supplementary material is at https://github.com/Labyrinth0419/ET-Prune

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26589 2026-08-28 cs.CV 新提交 57%

DPA-I2P: Depth-Guided Projective Alignment for Image-to-Point-Cloud Registration in Autonomous Driving

DPA-I2P:面向自动驾驶中图像与点云配准的深度引导投影对齐

Wenxin Zhang, Hang Li, Zhiwei Xu, Qiankun Dong, Gang Wang, Tao Li

机构 * Nankai University(南开大学) Haihe Lab of ITAI(海河人工智能与信息技术实验室)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对自动驾驶中图像与点云配准的跨模态对应学习难题,提出DPA-I2P方法,通过RMDE、PVL与CQP提升配准性能,在KITTI、nuScenes数据集上较基线方法有显著提升,可迁移性更好。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26141 2026-08-28 cs.CL cs.LG 新提交 57%

AdaThinking-E: One-Token Entropy Regulation for Adaptive Thinking

AdaThinking-E:用于自适应思考的单token熵调控

Zining Wang, Tongkun Guan, Boming Chen, Zhentao Guo, Jianqiang Liu, Chao Jin, Chen Duan, Kai Zhou, Pengfei Yan, Wei Shen, Xiaokang Yang

机构 * Meituan(美团) MoE Key Lab of Artificial Intelligence(MoE人工智能重点实验室) AI Institute(人工智能研究院) School of Computer Science, Shanghai Jiao Tong University(上海交通大学计算机科学学院) MAIS&NLPR, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 提出AdaThinking-E强化学习框架,通过单token熵调控实现自适应思考,使模型在不同复杂度文档任务中兼顾准确率与效率

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-28 cs.LG cs.CL 版本更新 57%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01671 2026-08-28 cs.CL 57%

When Meaning Travels: A Granular Lens on Hybrid-MoE's Role in Idiomatic Understanding for Language Models

当意义旅行:混合专家模型在语言模型习语理解中的细粒度作用

Sarmistha Das, Vaibhav Vishal, Shreyas Guha, Amaan Ali, Kitsuchart Pasupa, Sriparna Saha

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Patna, India(印度理工学院帕纳瓦分校计算机科学与工程系) School of Information Technology, King Mongkut’s Institute of Technology Ladkrabang, Thailand(泰国拉差班国王理工大学信息科技学院)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 针对低资源东南亚语言中习语的文化隐喻复杂性,提出Varnika多模态习语语料库和混合专家模型HybridMoE,通过控制混合和掩码多模态嵌入缓解专家稀疏性,实现习语理解性能提升5-6%。

Journal ref Findings of the Association for Computational Linguistics: ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19873 2026-08-28 cs.CV 版本更新 57%

SIMPLER: Efficient Foundation Model Adaptation via Similarity-Guided Layer Pruning for Earth Observation

SIMPLER:通过相似性引导的层剪枝实现高效的地球观测基础模型适应

Víctor Barreiro, Johannes Jakubik, Francisco Argüello, Dora B. Heras

机构 * Centro Singular de Investigación en Tecnoloxías Intelixentes (CiTIUS), Universidade de Santiago de Compostela, Spain(智能技术研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学,西班牙) Departmento de Electrónica e Computación, Universidade de Santiago de Compostela, Spain(电子与计算系,圣地亚哥-德孔波斯特拉大学,西班牙) IBM Research Europe, Zurich, Switzerland(IBM欧洲研究院,瑞士苏黎世)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 SIMPLER通过在适应前选择有效的模型深度,减少推理和部署成本,同时在无需梯度、幅度启发式或超参数调优的情况下,通过预训练视觉变换器中更深层的表示稳定性,选择冗余层,实现参数减少79%且性能保留94%,提升训练和推理速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24232 2026-08-28 cs.IR 版本更新 50%

Strategy-Aware Parameter-Efficient Adaptation for LLM-based Auto-Bidding

基于大语言模型的自动出价的策略感知参数高效适配

Songyue Cai, Lianyu Wang, Shan Gu, Ziru Xu, Jian Xu, Xiaofeng Zhu, Bo Zheng

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 研究广告自动出价问题,提出SAGE框架,通过位置增强、文本对齐和约束门控LoRA三个组件,实现参数高效多模态对齐,在大规模基准实验中性能卓越,调整参数少,消融研究验证各组件贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他多模态 3 篇

2608.26715 2026-08-28 cs.HC 新提交 83%

RegulAR: Graph-Grounded Error Recognition and Assistance for Procedural Tasks in AR

RegulAR:面向增强现实中流程任务的基于图的错误识别与辅助

Yi-Lin Ye, Jindu Wang, Hiu Tung Wong, Shuchang Xu, Huamin Qu, Wong Kam-Kwai

专题命中 其他多模态 :MLLM(summary_cn,abstract);multimodal(abstract)

AI总结 RegulAR是一款结合分层依赖图与MLLM的AR任务助手,可识别流程任务错误并提供恢复指导,在被试内研究中被证实比仅用MLLM的基线系统更能帮助用户理解任务结构与恢复任务。

Comments 16 pages, 7 figures. Accepted to UIST 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06611 2026-08-28 cs.CV cs.RO 版本更新 57%

Accurate Measurement of 3D and 2D Circular Centers With Application to LiDAR-Camera Extrinsic Calibration

3D与2D圆心的精确测量及其在激光雷达-相机外参标定中的应用

Jiajun Jiang, Xiao Hu, Wancheng Liu, Wei Jiang

机构 * Thrust of Robotics and Autonomous Systems, The Hong Kong University of Science and Technology (Guangzhou)(机器人与自主系统研究所,香港科技大学(广州)) Lower Airspace Economy Research Institute, International Digital Economy Academy, ShenZhen(空域经济研究所,国际数字经济学院) Horizon-Continental Technology Corporation(Horizon-Continental技术公司) State Key Laboratory of Rail Traffic Control and Safety and the Beijing Engineering Research Center of EMC and GNSS Technology for Rail Transportation, School of Electronic and Information Engineering, Beijing Jiaotong University(轨道交通控制与安全国家重点实验室,北京交通大学电子信息工程学院,电磁兼容与GNSS技术轨道交通工程研究中心)

专题命中 其他多模态 :cross-modal(abstract);分类 cs.CV

AI总结 本文针对激光雷达-相机外参标定需求,提出结合共形几何代数估计器与RANSAC的圆心测量方法,提升了圆心测量精度并降低了外参标定误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27221 2026-08-28 cs.RO 新提交 50%

Tensegrity Continuum Robots Enable Task-Adaptive Morphologies for Cooperative Behaviors

张拉整体连续体机器人可实现任务自适应形态以达成协同行为

Mahmud Hasan Saikot, Sydney Spiegel, Sudheera Akalanka Kariyawasam, Andrew Stefka, Josh Chrisler, Jianguo Zhao

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究提出结合张拉整体柔顺主体与爪式连接机构的模块化可重构机器人,可自重构为不同形态完成协同任务,为多功能机器人群体应用奠定基础。

Comments 22 pages, 6 figures, Accepted to Nature Machine Intelligence

详情

展开后加载摘要…

URL PDF HTML 收藏