arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-31 至 2026-08-31 共收录 83 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态Agent 9 篇

2603.23149 2026-08-31 cs.AI 版本更新 57%

Describe-Then-Act: Proactive Agent Steering via Distilled Language-Action World Models

描述-然后-行动:通过蒸馏的语言-动作世界模型实现前瞻性智能体导航

Massimiliano Pappa, Luca Romani, Valentino Sacco, Alessio Palma, Stéphane Lathuilière, Fabio Galasso, Xavier Alameda-Pineda, Indro Spinelli

机构 * Sapienza University of Rome, Italy(罗马大学萨皮恩扎) Inria, Univ. Grenoble Alpes, CNRS, LJK(法国国家信息与自动化技术研究所)

专题命中 多模态Agent :cross-modal(abstract);分类 cs.AI

AI总结 本文提出DILLO模型,通过蒸馏方法实现无需视觉模拟的前瞻性智能体导航,提升任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28437 2026-08-31 eess.SY cs.RO 新提交 50%

LUCID: An Agentic AI Framework on Digital-Twin in the Loop for QoS-Guaranteeing Robotic Control

LUCID:一种用于QoS保障机器人控制的闭环数字孪生智能体AI框架

Hyeonsu Lyu, Minwoo Kim, Sehyun Ryu, Hyun Jong Yang

专题命中 多模态Agent :multimodal(abstract)

AI总结 LUCID是一种LLM智能体编排的云机器人框架,将TP-RRM动态编排于DITL环境,结合路径规划与RRM验证器,可适应动态条件并降低规划延迟,保障机器人控制的QoS。

Comments 10 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 多模态训练与对齐 13 篇

2509.19212 2026-08-31 cs.CL cs.AI 版本更新 88%

Steering Multimodal Large Language Models Decoding for Context-Aware Safety

面向上下文感知安全的多模态大语言模型解码引导

Zheyuan Liu, Zhangchen Xu, Guangyao Dou, Xiangchi Yuan, Zhaoxuan Tan, Radha Poovendran, Meng Jiang

机构 * University of Notre Dame(notre dame 大学) University of Washington(华盛顿大学) Johns Hopkins University(约翰霍普金斯大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型安全对齐的平衡难题,提出SafeCoDe解码框架,通过两阶段机制优化上下文敏感的弃权行为,在多基准实验中有效提升安全性能且保留模型有用性。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27867 2026-08-31 cs.AI 新提交 87%

CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning

CoRe-MoE:用于持续多模态指令调优的紧凑可混合混合专家模型

Runze Liu, Naibin Gu, Mingxu Ai, Yuqing Li, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(summary_cn,abstract_cn);分类 cs.AI

AI总结 针对持续多模态指令调优中 LoRA-MoE 参数开销大的问题,提出 CoRe-MoE 框架,通过复用方向基减少参数,在 MLLM 上性能提升达 5.90 点且参数仅为顺序 LoRA 的 1%。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28312 2026-08-31 cs.CV cs.CL 新提交 86%

AIM: Anchor Identity Features, Then Match for Multimodal Large Language Model Unlearning

AIM:锚定身份特征,再匹配以实现多模态大语言模型的遗忘

Wonjun Lee, Jaehyuk Jang, Kangwook Ko, Hee-Seon Kim, Changick Kim

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院(KAIST))

专题命中 多模态训练与对齐 :multimodal(title,abstract);MLLM(abstract,abstract_cn);分类 cs.CV、cs.CL

AI总结 针对删除阶段无法获取保留图像的多模态大语言模型身份遗忘场景,提出两阶段方法AIM,通过通用视觉提示锚定遗忘目标并结合Fisher约束,实现身份遗忘的同时保留非删除身份、先验知识与视觉感知。

Comments Accepted to Findings of the Association for Computational Linguistics: EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27971 2026-08-31 cs.CV 新提交 85%

GAAT: Geometry-Aware Alignment Transformer for Multimodal UAV Perception

GAAT:面向无人机多模态感知的几何感知对齐Transformer

Jingpu Yang, Debin Tang, Yilin Sun, Fengxian Ji, Jiahua Zhu, Wenrui Ding, Yufeng Wang

机构 * Beihang University(北京航空航天大学) Zhongguancun Academy(中关村学院) Northeastern University(东北大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);multimodal foundation model(abstract);分类 cs.CV

AI总结 本文提出面向无人机多模态感知的GAAT模型,引入syncPATC、MG-Sparse-MMA、RA-QCGCL等技术,结合UAVMeta与StateBench数据集,在六个下游任务上实现最优迁移性能,为无人机多模态感知提供支撑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00234 2026-08-31 cs.CL cs.AI 版本更新 84%

OmniFusion: Simultaneous Multilingual Multimodal Translations via Modular Fusion

OmniFusion: 通过模块融合实现多语言多模态翻译

Sai Koneru, Matthias Huck, Jan Niehues

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) SAP SE(SAP公司)

专题命中 多模态训练与对齐 :multimodal(title,abstract);multimodal foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出OmniFusion系统,通过融合预训练多模态基础模型与翻译LLM,实现语音、语音加图像及文本加图像的多语言多模态翻译,降低SimulST延迟并提升翻译质量。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02502 2026-08-31 cs.CL 版本更新 79%

CRAM: Centroid-Routing and Adaptive MoE for Multimodal Continual Instruction Tuning

CRAM:面向多模态持续指令调优的质心路由与自适应MoE

Jun-Tao Tang, Zhen-Hao Xie, Yu-Cheng Shi, Da-Wei Zhou

机构 * School of Artificial Intelligence, Nanjing University, China(南京大学人工智能学院) State Key Laboratory of Novel Software Technology, Nanjing University, China(南京大学新型软件技术国家重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CL

AI总结 提出CRAM方法,通过将任务特定模式隔离到独立模块、自适应秩实例化动态分配参数、质心路由激活现有专家以及正交惩罚约束更新方向,解决了多模态持续指令调优中任务竞争导致遗忘和参数效率低下的问题。

Comments Accepted to EMNLP 2026 (Main Conference). Code is available at this https URL (https://github.com/LAMDA-CL/EMNLP2026-CRAM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27950 2026-08-31 cs.IR 新提交 78%

Information-Guided Selective Modality-Interest Alignment for Multimodal Recommendation

面向多模态推荐的信息引导型选择性模态-兴趣对齐方法

Wenze Ma, Chenyu Sun, Yanmin Zhu, Qiwen Gu, Xuhao Zhao

专题命中 多模态训练与对齐 :multimodal(title,abstract)

AI总结 针对多模态推荐中模态信号选择不明确的问题,提出AMUR框架,通过优化模态图结构并选择性对齐跨模态兴趣语义,提升推荐性能且保留互补信息,经实验验证有效。

Comments Accepted at the 35th ACM International Conference on Information and Knowledge Management (CIKM 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03099 2026-08-31 eess.IV eess.SP 版本更新 78%

AirTF: Over-the-Air Token Fusion for Task-Oriented Multi-Modal Token Communications

AirTF:面向任务的多模态令牌通信的空中令牌融合

Bole Liu, Li Qiao, Minghui Wu, Yulin Shao, Zhen Gao

专题命中 多模态训练与对齐 :multi-modal(title,abstract)

AI总结 针对车联网中高维多模态传感数据传输面临的频谱瓶颈,提出AirTF框架。利用视觉变压器编码器提取语义令牌,通过共享无线信道并发传输,利用多址信道叠加特性空中融合多模态语义,提升频谱效率。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28058 2026-08-31 cs.CV cs.AI 新提交 73%

Dynamic Alignment Compensation for Hallucination Mitigation in Large Vision-Language Models

用于减轻大型视觉语言模型幻觉的动态对齐补偿

Kairong Yu, Zixin Zhu, Le Yu, Hongwei Wang

机构 * Zhejiang University(浙江大学) Southeast University(东南大学)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 针对大型视觉语言模型的幻觉问题,提出无需训练的推理时方法动态对齐补偿,结合分层语义补偿与序列语义校正,在9个多模态基准上可减少幻觉并保持整体性能。

Comments Accepted by EMNLP2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28092 2026-08-31 eess.IV cs.AI cs.CV cs.LG 新提交 62%

Do Medical Vision Models Reason About Anatomy? Probing the Spatial Inductive Biases of Learned Visual Representations

医学视觉模型是否对解剖结构进行推理?探究学习到的视觉表示的空间归纳偏置

Naren Akash, Neeraja Ramanan

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本研究构建SPAR-Bench探测任务,发现医学视觉模型仅记忆标准解剖结构,缺乏特定患者图像内结构对比的推理能力,池化探测会低估其表示能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24192 2026-08-31 cs.CV cs.AI 版本更新 62%

Talk in Pieces, See in Whole: Disentangled and Hierarchical Representation Learning in Language-based Object Detection

分段对话,整体感知:面向语言型目标检测的解耦分层表示学习

Sojung An, Kwanyong Park, Yong Jae Lee, Donghyun Kim

机构 * Korea University(韩国大学) University of Seoul(首尔大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 针对视觉-语言模型难以处理复杂语言查询的问题,提出TaSe框架,构建分层合成字幕数据集与三组件解耦模块,在OmniLabel基准上实现24%的性能提升。

Comments Accepted by EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17286 2026-08-31 cs.CV 版本更新 57%

HyperVision: A Channel-Adaptive Ground-Based Hyperspectral Vision Pre-trained Backbone

HyperVision: 一种通道自适应的地基高光谱视觉预训练骨干网络

Guanyiman Fu, Jingtao Li, Zihang Cheng, Zhuanfeng Li, Diqi Chen, Yan Xu, Xiangyu Liu, Fengchao Xiong, Jianfeng Lu, Chengrong Chen, Jun Zhou

机构 * Griffith University, Australia(格里菲斯大学,澳大利亚) Wuhan University, China(武汉大学,中国) Nanjing University of Science and Technology, China(南京理工大学,中国) Huaiyin Normal University, China(淮阴师范学院,中国) Massey University, New Zealand(马斯sey大学,新西兰)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 针对地基高光谱传感器配置差异、标签稀缺与不一致、数据集规模有限等问题,提出首个地基高光谱预训练骨干HyperVision,采用通道自适应动态嵌入、多源伪标签和跨模态知识蒸馏,在三个下游任务上取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27578 2026-08-31 physics.plasm-ph cs.LG 新提交 50%

Towards Large-Scale Heterogeneous Data Organization for Scientific Foundation Models: A Nuclear Fusion Case Study

面向科学基础模型的大规模异构数据组织:以核聚变研究为例

Nathaniel Chen, Kouroche Bouchiat, Peter Steiner, Azarakhsh Jalalvand, SangKyeun Kim, Egemen Kolemen

专题命中 多模态训练与对齐 :multi-modal(abstract)

AI总结 本文以核聚变研究为例,针对科学基础模型训练所需的大规模异构数据问题,表征了相关数据特性并分析了复杂度,提出了多模态波动数据表征模板,为相关领域提供了参考。

Comments Accepted at the 3rd Workshop on Navigating and Addressing Data Problems for Foundation Models (DATA-FM), ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 其他多模态 8 篇

2608.28517 2026-08-31 cs.CV 新提交 79%

Learning the Target Priors Before Image Translation: A Decoupled Training Paradigm for Cross-Modal Image Translation in Remote Sensing

遥感跨模态图像翻译前学习目标先验:一种解耦训练范式

Keyan Hu, Mingtao Wang, Ziyu Zhou, Tiandong Shi, Haifeng Li, Ji Qi, Chao Tao

专题命中 其他多模态 :cross-modal(title,abstract);分类 cs.CV

AI总结 该研究针对遥感跨模态图像翻译的联合学习缺陷,提出解耦范式LTP-BIT,先学目标先验再做源域条件控制,以少量参数实现SOTA性能,且在少配对样本下保留高实例保真度。

Comments 26 pages, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00046 2026-08-31 eess.IV cs.CV cs.LG 版本更新 79%

Mixture of Multicenter Experts in Multimodal AI for Debiased Radiotherapy Target Delineation

用于去偏放疗靶区勾画的多模态AI中的多中心专家混合模型

Yujin Oh, Sangjoon Park, Xiang Li, Pengfei Jin, Yi Wang, Jonathan Paly, Jason Efstathiou, Annie Chan, Jun Won Kim, Hwa Kyung Byun, Ik Jae Lee, Jaeho Cho, Chan Woo Wee, Peng Shu, Peilong Wang, Caiwen Jiang, Nathan Yu, Jason Holmes, Jong Chul Ye, Quanzheng Li, Wei Liu, Woong Sub Koom, Jin Sung Kim, Kyungsang Kim

机构 * Center for Advanced Medical Computing and Analysis (CAMCA), Department of Radiology, Massachusetts General Hospital (MGH) and Harvard Medical School(先进医学计算与分析中心(CAMCA)、放射科、麻省总医院(MGH)和哈佛医学院) Department of Radiation Oncology, Yonsei University College of Medicine(燕京大学医学院放射肿瘤科) Institute for Innovation in Digital Healthcare, Yonsei University(数字医疗创新研究所、燕京大学) Department of Radiation Oncology, Massachusetts General Hospital(麻省总医院放射肿瘤科) Department of Radiation Oncology, Gangnam Severance Hospital(江南松云医院放射肿瘤科) Department of Radiation Oncology, Yongin Severance Hospital(永兴松云医院放射肿瘤科) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Radiation Oncology, Mayo Clinic(梅奥诊所放射肿瘤科) Kim Jaechul Graduate School of AI, Korea Advanced Institute of Science and Technology(金 Jaechul人工智能研究生院、韩国科学技术院)

专题命中 其他多模态 :multimodal(title,abstract);分类 cs.CV

AI总结 针对医疗AI的偏差问题,提出无需跨机构数据共享的多中心专家混合(MoME)框架,结合各中心少样本数据训练的前列腺癌放疗靶区勾画模型,在中心差异大或数据有限场景下优于基线,可定制且适配资源受限环境。

Comments In Revission

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28469 2026-08-31 cs.IT eess.SP 新提交 78%

Distributed Cross-Layer Optimization for Covert Multi-Hop, Multi-Modal Networks: Exponentially Fast Convergence and Robust Tracking

隐蔽多跳多模态网络的分布式跨层优化:指数级快速收敛与鲁棒跟踪

Sirin Chakraborty, Andrea Panebianco, Yuchen Tian, Kevin S Chan, Fikadu Dagefu, Yin Sun, Ness B. Shroff

专题命中 其他多模态 :multi-modal(title,abstract)

AI总结 本文针对隐蔽多跳多模态无线网络,提出基于PP-ADMM的分布式跨层优化算法,实现指数级快速收敛,可在信道衰落与监测者移动下鲁棒跟踪,解决了基于DEP的隐蔽网络优化难题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27466 2026-08-31 cs.CL cs.AI 新提交 62%

PACE: Publisher-Adaptive Content Extraction via Agentic Automation

PACE:基于智能体自动化的发布者自适应内容提取

Zhanlin Liu, Munirathnam Srikanth

专题命中 其他多模态 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 PACE是一种智能体框架,可从代表性页面和用户需求学习发布者特定提取配置,在多模态提取任务中优于可扩展非手动基准,接近手动解析器质量,实现高效自适应内容提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18603 2026-08-31 cs.AI cs.CV 版本更新 62%

Doc-CoB: Enhancing Document Understanding with Visual Chain-of-Boxes Reasoning

Doc-CoB:通过视觉链式框推理增强文档理解

Ye Mo, Kai Ye, Xianwei Mao, Zirui Shao, Gang Huang, Bo Zhang, Hangdi Xing, Kehan Chen, Huan Zhou, Zixu Yan, Jiajun Bu, Sheng Zhou

机构 * Zhejiang Key Laboratory of Accessible Perception and Intelligent Systems, Zhejiang University(浙江可感知与智能系统重点实验室,浙江大学) Alibaba Group(阿里巴巴集团) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 提出Doc-CoB框架,通过粗到细的布局感知视觉推理,结合多模态大语言模型,逐步聚焦查询相关布局区域,提升文档理解性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27534 2026-08-31 stat.ME 新提交 50%

Bivariate geostatistical latent variable models for the analysis of antibody density data

用于分析抗体密度数据的双变量地质统计潜变量模型

Emanuele Giorgi, Jonas Wallin

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出双变量地质统计潜变量模型,用于分析抗体密度数据,可捕捉抗体反应的环境与宿主内相关性,经肯尼亚疟疾血清数据验证,忽略相关性会降低推断效果。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28514 2026-08-31 astro-ph.IM astro-ph.CO 新提交 50%

Fast and efficient nested sampling with BEST

基于BEST的快速高效嵌套采样方法

Andreas Nygaard

专题命中 其他多模态 :multimodal(abstract)

AI总结 该研究针对嵌套采样效率受限问题,在BEST中实现了基于TensorFlow的高效嵌套采样方法,通过批量活点更新等技术提升速度,经测试可准确计算贝叶斯证据,适用于向量化似然与模拟器推断。

Comments 22 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14049 2026-08-31 stat.ME 版本更新 50%

Tail-Aware Density Forecasting of Locally Explosive Time Series: A Neural Network Approach

尾敏感的局部爆炸性时间序列密度预测:一种神经网络方法

Elena Dumitrescu, Julien Peignon, Arthur Thomas

专题命中 其他多模态 :multimodal(abstract)

AI总结 本文提出一种基于神经网络的混合密度网络,用于预测具有局部爆炸性行为的时间序列,通过偏态t分布和自适应加权方案提升极端区域的密度估计精度。

详情

展开后加载摘要…

URL PDF HTML 收藏