arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-26 至 2025-11-26 共收录 9 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 9 篇

2511.17585 2025-11-26 cs.LG cs.AI cs.CV 84%

PaSE: Prototype-aligned Calibration and Shapley-based Equilibrium for Multimodal Sentiment Analysis

PaSE:原型对齐校准与基于Shapley的均衡用于多模态情感分析

Kang He, Boyu Chen, Yuzhe Ding, Fei Li, Chong Teng, Donghong Ji

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV、cs.AI

AI总结 PaSE通过原型对齐校准和基于Shapley的均衡框架,有效缓解多模态情感分析中的模态竞争问题,提升模型性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20167 2025-11-26 cs.MM 83%

FINE: Factorized multimodal sentiment analysis via mutual INformation Estimation

FINE: 通过互信息估计进行因子化多模态情感分析

Yadong Liu, Shangfei Wang

专题命中 多模态训练与对齐 :multimodal(title,abstract);cross-modal(abstract);分类 cs.MM

AI总结 本文提出了一种基于互信息估计的因子化多模态情感分析框架,通过分解模态为共享和独特表示,抑制噪声并提升情感表示质量,从而在多个数据集上优于现有方法。

Comments 15 pages, 9 figures, conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11895 2025-11-26 cs.CV 83%

Adversarial Robustness for Unified Multi-Modal Encoders via Efficient Calibration

通过高效校准实现统一多模态编码器的对抗鲁棒性

Chih-Ting Liao, Zhangquan Chen, Chunlei Meng, Tzu-Yu Huang, Xin Cao, Xu Zheng

机构 * UNSW Sydney(新南威尔士大学悉尼分校) Tsinghua University(清华大学) Fudan University(复旦大学) UTS(澳大利亚UTS大学) HKUST(GZ)(香港理工大学(广州))

专题命中 多模态训练与对齐 :multi-modal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本研究提出高效对抗校准框架,提升统一多模态编码器的对抗鲁棒性,同时保持清洁性能,提升47.3%的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19887 2025-11-26 cs.CV cs.AI 81%

Distilling Cross-Modal Knowledge via Feature Disentanglement

通过特征解耦进行跨模态知识蒸馏

Junhong Liu, Yuan Zhang, Tao Huang, Wenchao Xu, Renyu Yang

专题命中 多模态训练与对齐 :cross-modal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出频率解耦的跨模态知识蒸馏方法,通过利用频域特征解耦和平衡跨模态知识转移,提升蒸馏效果。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12121 2025-11-26 cs.LG cs.MM 79%

To Align or Not to Align: Strategic Multimodal Representation Alignment for Optimal Performance

对齐还是不对齐:为最佳性能的战略多模态表示对齐

Wanlong Fang, Tianle Zhang, Alvin Chan

专题命中 多模态训练与对齐 :multimodal(title,abstract);分类 cs.MM

AI总结 本文研究了显式对齐对模型性能的影响,提出可控对比学习模块,发现最佳对齐强度取决于数据冗余量,为优化单模态编码器提供指导。

Comments Accepted by AAAI 2026. This arXiv version includes additional details and extended appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20000 2025-11-26 eess.SP 78%

Cross-Modal Semantic Communication for Heterogeneous Collaborative Perception

跨模态语义通信用于异构协同感知

Mingyi Lu, Guowei Liu, Le Liang, Chongtao Guo, Hao Ye, Shi Jin

专题命中 多模态训练与对齐 :cross-modal(title,abstract)

AI总结 本文提出跨模态语义通信框架,通过统一语义空间实现异构传感器车辆间的高效协同感知,提升低信噪比环境下的感知性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19856 2025-11-26 cs.CV 70%

Temporal-Visual Semantic Alignment: A Unified Architecture for Transferring Spatial Priors from Vision Models to Zero-Shot Temporal Tasks

时间-视觉语义对齐:一种统一架构,用于从视觉模型中转移空间先验到零样本时间任务

Xiangkai Ma, Han Zhang, Wenzhong Li, Sanglu Lu

专题命中 多模态训练与对齐 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 TimeArtist通过时间-视觉语义对齐框架,实现从时间序列到高质量图像生成的跨模态转换,并在零样本时间任务中取得优异表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10109 2025-11-26 cs.CV 70%

Dream-IF: Dynamic Relative EnhAnceMent for Image Fusion

Dream-IF: 动态相对增强用于图像融合

Xingxin Xu, Bing Cao, Dongdong Li, Qinghua Hu, Pengfei Zhu

专题命中 多模态训练与对齐 :multi-modal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 Dream-IF通过动态相对增强框架提升图像融合质量,结合主导区域信息实现多模态图像的协同增强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15691 2025-11-26 q-fin.CP cs.AI cs.CL cs.LG 62%

Exploring the Synergy of Quantitative Factors and Newsflow Representations from Large Language Models for Stock Return Prediction

探索来自大语言模型的定量因素和新闻流表示的协同效应以预测股票收益率

Tian Guo, Emmanuel Hauptmann

专题命中 多模态训练与对齐 :multimodal(abstract);分类 cs.CL、cs.AI

AI总结 本文提出融合学习框架和混合模型,利用大语言模型生成的定量因素和新闻流表示,提升股票收益率预测和选择的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏