arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-08-25 至 2026-08-25 共收录 23 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 23 篇

2501.04001 2026-08-25 cs.CV 版本更新 89%

Sa2VA: Marrying SAM2 with MLLM for Dense Grounded Understanding of Images and Videos

Sa2VA:将SAM2与多模态大语言模型结合用于图像与视频的密集接地理解

Haobo Yuan, Xiangtai Li, Tao Zhang, Yueyi Sun, Zilong Huang, Shilin Xu, Shunping Ji, Yunhai Tong, Lu Qi, Jiashi Feng, Ming-Hsuan Yang

机构 * University of California, Merced(加州大学默塞德分校) Bytedance Seed(字节跳动种子) Wuhan University(武汉大学) Peking University(北京大学)

专题命中 多模态训练与对齐 :MLLM(title,summary_cn);multi-modal(abstract);分类 cs.CV

AI总结 本研究提出Sa2VA,结合SAM2与MLLM实现图像视频密集接地理解,引入Ref-SAV数据集,在多任务中表现优异且可扩展至多款开源MLLM,代码模型已公开。

Comments Accepted by IEEE TPAMI. Code: this https URL (https://github.com/Bytedance/Sa2VA)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22863 2026-08-25 cs.MM 新提交 85%

Adaptive Hierarchical Representation Alliance for Multimodal Learning

面向多模态学习的自适应层级表示联盟

Chunlei Meng, Pengbin Feng, Jacqueline J. Pang, Chih-Ting Liao, Rong Fu, Zhaolu Kang, Zhongxue Gan, Chun Ouyang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);image-text(abstract);分类 cs.MM

AI总结 该研究针对多模态模型的语义粒度不匹配问题,提出自适应层级表示联盟框架,经六个基准实验验证,其性能优于强基线且在噪声、缺失模态场景下更鲁棒。

Comments This study has been accepted by EMNLP 2026 (Findings)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22312 2026-08-25 cs.CL 新提交 85%

Text-Anchored Semantic Perturbations for Transferable Jailbreak Attacks on Multimodal Large Language Models

面向多模态大语言模型的可迁移越狱攻击的文本锚定语义扰动

Wenyun Li, Guiping Cao, Xiangyuan Lan, Zheng Zhang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室) Pazhou Laboratory (Huangpu)(琶洲实验室(黄埔))

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL

AI总结 本研究针对多模态大语言模型易受越狱攻击的问题,提出TA-SPA黑盒越狱框架,通过文本锚定语义分解与语义保留增强实现可迁移攻击,在商业模型及防御下表现出竞争力,推动表征级安全对齐研究。

Comments Accept by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18919 2026-08-25 cs.CL cs.AI cs.CV 版本更新 82%

From Recognition to Reasoning: Advancing Multimodal Harmful Meme Detection via Chain-of-Thought Alignment

MemeMind: 一个具有链式推理的大型多模态数据集用于有害迷因检测

Hexiang Gu, Qifan Yu, Yuan Liu, Zikang Li, Saihui Hou, Jian Zhao, Zhaofeng He

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Beijing Normal University(北京师范大学) Zhongguancun Academy(中关村学院)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 本文提出MemeMind数据集,通过链式推理标注支持对迷因隐含意图的细粒度分析,并提出MemeGuard框架提升检测准确性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05154 2026-08-25 cs.CL cs.CV 版本更新 81%

RIG-RoPE: Relation-Stratified Multimodal Attention with Instance-Local Rotary Geometry and Representation-Aware Traversal Coordinates

RIG-RoPE:具有时长感知时间坐标的关系与实例门控旋转位置编码

Donggen Li

机构 * Sichuan University(四川大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 本研究针对多模态场景中静态多维位置分配的局限,提出RIG-RoPE机制,通过关系与实例门控及时长感知时间坐标优化位置编码,未增加可学习参数,确立了相关公式与验证路径。

Comments 26 pages, 2 figures, 4 tables. This revision adds matched, inference-only Qwen2-VL-2B native/RIG L1 mechanism evidence: exact text-only equivalence, exact RIG Gauge invariance, native Gauge sensitivity, and retained same-instance spatial effects. Task-level Qwen benchmarks, training gains, stable task improvement, universality, and empirical superiority remain unestablished

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02092 2026-08-25 cs.CV cs.MM 版本更新 81%

Deep Multimodal Fusion Detection through Spatial Mask and Channel Competition

基于空间掩码与通道融合的深度多模态融合检测

Guandi Wang, Ming Li, Yunsen Xing, Junle Liu

机构 * KTH Royal Institute of Technology(KTH皇家理工学院) University of Maryland, College Park(马里兰大学帕克分校)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.MM

AI总结 本文针对现有多模态融合检测的过拟合问题,提出Attention-Driven Complementarity Resampling框架,通过语义掩码交换与可学习通道竞争实现跨模态目标检测的性能提升,在多数据集上取得了有竞争力的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14782 2026-08-25 cs.CV cs.CL 版本更新 81%

Last But Not Least: Boundary Attention CalibratiON for Multimodal KV Cache Compression

最后但同样重要:用于多模态KV缓存压缩的边界注意力校准

Tianhao Chen, Yuheng Wu, Kelu Yao, Xiaogang Xu, Xiaobin Hu, Dongman Lee

机构 * KAIST(韩国科学技术院) Zhejiang Laboratory(之江实验室) The Chinese University of Hong Kong(香港中文大学) National University of Singapore(新加坡国立大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV、cs.CL

AI总结 针对多模态大语言模型长视觉上下文中KV缓存压缩导致关键证据丢失的问题,提出BACON方法,通过校准观察窗口注意力与最后查询注意力,并利用层内一致性和层间持久性抑制噪声,在激进压缩下平均提升7.5%性能。

Comments EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21797 2026-08-25 cs.LG cs.AI cs.SD eess.AS 版本更新 81%

Mitigating Sample-Level Imbalance via Probabilistic Separation for Adaptive Multimodal Fusion

量化多模态不平衡:一种基于GMM的自适应损失用于音频-视觉学习

Zhiwen Yu, Zhaocheng Liu, Xiaoqing Liu, Huanqiang Zeng, C. L. Philip Chen

机构 * South China University of Technology(南方科技大学)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.AI、eess.AS

AI总结 本文提出基于GMM的自适应损失,用于量化和缓解多模态学习中的样本级不平衡问题,通过双阶段框架提升音频-视觉学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23242 2026-08-25 cs.MM 新提交 79%

Mind the Couch! Eliciting MLLM Reasoning in Interior Design via Weak-to-Strong Task Vector Injection

留意沙发!通过弱到强任务向量注入激发多模态大语言模型在室内设计中的推理能力

Yuxuan Yang, Jingyao Wang, Luntian Mou

专题命中 多模态训练与对齐 :MLLM(title);multimodal(abstract);分类 cs.MM

AI总结 针对MLLMs在室内设计中因模态对齐问题产生的空间碰撞与审美不和谐,本文提出DART-I机制,通过弱到强任务向量注入引导MLLMs推理,无需微调即可实现精确推理,且经实验验证有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22979 2026-08-25 cs.AI 新提交 79%

SA-RSQ: A Versatile Sparse Representation Framework for Multi-modal Recommender Systems

SA-RSQ:一种适用于多模态推荐系统的通用稀疏表示框架

Xiang Wang, Shigang Quan, Tingzhen Chang, Kang Yang, Sitong Chen, Yabo Fan, Xingxing Wang, Zhaodian He

机构 * Tianjin University(天津大学) Meituan(美团) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 多模态训练与对齐 :multi-modal(title);multimodal(abstract);分类 cs.AI

AI总结 针对工业多模态推荐系统的存储与延迟开销问题,提出SA-RSQ稀疏表示框架,经实验验证其在重构性能与CTR间的权衡表现良好,在线测试实现CTR与CPM的相对提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21881 2026-08-25 cs.CV 新提交 79%

Region-Weighted Losses and Model Fusion for Cross-Modal PET Attenuation Correction

面向跨模态PET衰减校正的区域加权损失与模型融合

Khoa Tuan Nguyen, Joris Vankerschaver, Wesley De Neve

机构 * Center for Biosystems and Biotech Data Science, Ghent University Global Campus(根特大学全球校区生物系统与生物技术数据科学中心) Ghent University(根特大学)

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV

AI总结 针对BIC-MAC挑战赛,采用区域加权Carney衰减系数空间L₁损失、结合未配准DIXON MRI输入,通过两个独立模型的凸组合实现跨模态PET衰减校正,在公共验证排行榜总体排名第一。

Comments ntkhoa team submission for BIC-MAC MICCAI26 challenge ( this https URL (https://www.codabench.org/competitions/12555/#/results-tab) )

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17949 2026-08-25 cs.CV 版本更新 79%

SkyNative: A Native Multimodal Architecture for Remote Sensing Vision-Language Understanding

SkyNative: 一种面向遥感视觉证据推理的原生多模态框架

Xiao Yang, Ronghao Fu, Zhiwen Lin, Zhuoran Duan, Lang Sun, Jiaqi Liu, Jiashun Zhu, Jiasen Hu, Xu Na, Bo Yang

机构 * College of Computer Science and Technology, Jilin University, China(吉林大学计算机科学与技术学院) Key Laboratory of Symbolic Computation and Knowledge Engineering of Ministry of Education(教育部符号计算与知识工程重点实验室)

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.CV

AI总结 本文提出SkyNative,一种原生多模态框架,通过去除预训练视觉骨干,直接在语言模型token空间中表示图像为原始patch tokens,以提升遥感图像的细粒度空间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22429 2026-08-25 cs.AI 新提交 77%

Think with Structured Grounding: Perceptual Reinforcement Learning for Chart and Visual-Tabular Understanding

基于结构化接地的思考:面向图表与视觉表格理解的感知强化学习

Changjiang Jiang, Qiannian Zhao, Lei Xin, Jinxiang Xie, Preslav Nakov, Zhuohan Xie

机构 * Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Nanjing University(南京大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI

AI总结 针对MLLMs依赖外部工具感知图表等视觉内容的问题,提出TwSG框架,通过两阶段训练实现细粒度视觉推理,降低延迟并提升准确率与鲁棒性。

Comments Manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23479 2026-08-25 cs.CV 新提交 70%

Geometry-Driven Opti-Acoustic Co-Registration and View-Invariant Reflectivity Mapping for Side-Scan Sonar

侧扫声呐的几何驱动光声配准与视角不变反射率映射

Taqi Hamoda, Nuno Gracias

机构 * Computer Vision and Robotics Research Institute (ViCOROB)(计算机视觉与机器人研究学院(ViCOROB)) University of Girona(赫罗纳大学)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 针对侧扫声呐的光声配准难题,提出几何驱动框架,结合SfM、FBR算法与逆朗伯模型等技术,生成高精度多模态数据集,为底栖生境自监督学习奠定基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11269 2026-08-25 cs.CV cs.HC 版本更新 70%

Traits Run Deeper: Trait-Specific Asymmetric Fusion for Personality Assessment

特质更深:面向人格评估的特质特异性非对称融合

Jia Li, Qian Chen, Wei Wang, Xinyu Li, Zhenzhen Hu, Dongsheng Shao, Richang Hong, Meng Wang

机构 * Hefei University of Technology(合肥工业大学) Intelligent Interconnected Systems Laboratory of Anhui Province(安徽省智能互联系统实验室) Jianghuai Advanced Technology Center(江淮前沿技术中心) Anhui Provincial Industry Innovation Center of Humanoid Robots(安徽省人形机器人产业创新中心) Anhui Provincial Key Laboratory of Humanoid Robots(安徽省人形机器人重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 提出Traits Run Deeper框架,通过多模态基础表示、特质特异性非对称融合和分布校准回归模块,解决人格评估中模态偏好差异和标签偏差问题,在AVI Challenge 2026上MSE降低约25%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31192 2026-08-25 cs.CV 版本更新 70%

Specialist-Generalist Fusion with Outcome-Supervised Rationales for Deepfake Detection

语言训练深度伪造检测器的正则化能力

Benedikt Hopf, Zongwei Wu, Radu Timofte

机构 * Computer Vision Lab, CAIDAS, University of Würzburg(计算机视觉实验室,CAIDAS,乌尔姆大学)

专题命中 多模态训练与对齐 :MLLM(abstract,abstract_cn);分类 cs.CV

AI总结 提出利用多模态大语言模型的双编码器架构和两阶段训练,通过语言正则化缓解过拟合,提升深度伪造检测的泛化性和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17681 2026-08-25 cs.CV 版本更新 70%

Motion-Aware Vision-Reference Alignment for Referring Multi-Object Tracking

基于多模态大语言模型的视觉-运动-参考对齐的指称多目标跟踪

Weiyi Lv, Ning Zhang, Hanyang Sun, Haoran Jiang, Kai Zhao, Yixiao Gu, Jing Xiao, Dan Zeng

机构 * Shanghai University(上海大学) PAII Inc.(PAII公司)

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 VMRMOT通过多模态大语言模型实现视觉-运动-参考对齐,提升指称多目标跟踪的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22370 2026-08-25 cs.CV 新提交 57%

LiST: Local-Simplex Test-Time LoRA Fusion

LiST:局部单纯形测试时LoRA融合

Yihua Shao, Jia Li, Siyu Chen, Xinyu Luo, Yang Liu, Kecheng Chen, Xinwei Long, Lingyu Zhu, Fanhu Zeng, Maolin Wang, Ziyang Yan, Jingcai Guo, Hao Tang, Nicu Sebe, Zhenyi Wang

机构 * SUSTech(南方科技大学) PolyU(香港理工大学) CASIA(中国科学院自动化研究所) GDUT(广东工业大学) CityU(香港城市大学) BigAI(北京智源人工智能研究院) THU(清华大学) TAU(特拉维夫大学) PKU(北京大学) UniTrento(特伦托大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 LiST是一种无标签测试时LoRA融合框架,通过构建局部单纯形搜索样本特定融合权重,在多模态与语言基准上优于静态LoRA合并及传统测试时自适应方法,提升了未见过任务的鲁棒性。

Comments Accepted by EMNLP 2026 Finding

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22126 2026-08-25 cs.LG cs.CL 新提交 57%

Decoupled Physical Modeling and Execution for Physics Reasoning

用于物理推理的解耦物理建模与执行

Ye Zhang, Xuehang Guo, Rui Pan, Pengfei Yu, Denghui Zhang, Manling Li, Qingyun Wang

机构 * University of Pennsylvania(宾夕法尼亚大学) William & Mary(威廉玛丽学院) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊公司) Stevens Institute of Technology(史蒂文斯理工学院) Northwestern University(西北大学)

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL

AI总结 该研究提出解耦物理建模与执行的统一框架,通过两阶段后训练策略提升小型大语言模型物理推理性能,在多个基准上实现约3%的平均性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21445 2026-08-25 cs.CV 新提交 57%

ViTexSZ: Heterogeneous Vision-Text Knowledge Distillation for EEG Seizure Detection

ViTexSZ:用于脑电图癫痫发作检测的异构视觉-文本知识蒸馏框架

Chenxi Liu, Mingzhao Li, Yicong Liu, Hao Miao, Hongyuan Zhang, Ziyi Chen, Gaofeng Meng

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CV

AI总结 ViTexSZ是用于EEG癫痫发作检测的异构视觉-文本知识蒸馏框架,通过多模态大语言模型对齐异构EEG与临床语义,在四个数据集上实现最高准确率,相对第二优基线提升达12.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05782 2026-08-25 cs.CV 版本更新 57%

TCSA-UDA: Text-Driven Cross-Semantic Alignment for Unsupervised Domain Adaptation in Medical Image Segmentation

TCSA-UDA:基于文本的跨语义对齐用于医学图像分割中的无监督域适应

Lalit Maurya, Honghai Liu, Reyer Zwiggelaar

机构 * School of Computing, University of Portsmouth(朴茨茅斯大学计算学院) Department of Computer Science, Aberystwyth University(阿伯里斯特威斯大学计算机科学系)

专题命中 多模态训练与对齐 :cross-modal(abstract);分类 cs.CV

AI总结 本文提出TCSA-UDA框架,通过文本驱动的跨语义对齐方法,在医学图像分割中减少域偏移并提升跨模态一致性。

Comments Published in Neurocomputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21129 2026-08-25 astro-ph.EP astro-ph.IM 版本更新 50%

Transit Searches for Habitable-Zone Exoplanets with Artificial Intelligence

利用人工智能搜索宜居带系外行星的凌星观测

Qingtian Liu

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 本综述探讨人工智能在宜居带系外行星凌星信号搜索各环节的进展,指出其可提升分析效率、恢复弱信号,结合物理建模等能提高发现效率与可靠性。

Comments This paper has been withdrawn by the authors for administrative reasons related to our institutional research policy

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25194 2026-08-25 cs.LG 版本更新 50%

Localize and Neutralize: Gradient-guided Token Suppression against Visual Prompt Injection Attack

先定位再中和:梯度引导的令牌抑制对抗视觉提示注入攻击

Dongpeng Zhang, Ke Ma, Yangbangyan Jiang, Gaozheng Pei, Longtao Huang, Qianqian Xu, Qingming Huang

机构 * School of Advanced Interdisciplinary Sciences, UCAS(UCAS交叉学科研究院) School of Electronic, Electrical and Communication Engineering, UCAS(UCAS电子电气与通信工程学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全国家重点实验室) Alibaba Group(阿里巴巴集团) School of Computer Science and Technology, UCAS(UCAS计算机科学与技术学院) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Key Laboratory of Big Data Mining and Knowledge Management, UCAS(UCAS大数据挖掘与知识管理重点实验室)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对多模态大语言模型的视觉提示注入攻击,提出梯度令牌掩码(GTM)方法,通过梯度分析定位关键图像令牌并掩码中和,将攻击成功率降至接近零且计算开销极小。

详情

展开后加载摘要…

URL PDF HTML 收藏