arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

共收录 545 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 多模态训练与对齐 545 篇

2606.12559 2026-06-12 physics.comp-ph cs.LG cs.NA math.NA physics.flu-dyn 新提交 50%

Feature-preserving Latent-EnKF for Data Assimilation of Flows with Shocks

保持特征的潜在EnKF用于含激波流动的数据同化

Hemanth Chandravamsi, Hangchuan Hu, Ponkrshnan Thiagarajan, Tamer A. Zaki

机构 * Department of Mechanical Engineering, Johns Hopkins University(约翰霍普金斯大学机械工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对含激波流动中EnKF因多模态统计产生伪振荡的问题,提出在学习的低维潜在空间进行集合更新以保持激波特征,并通过共享解码器恢复物理状态,数值实验验证了无伪振荡的准确特征恢复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10365 2026-06-10 cs.SD 新提交 50%

KFC-KWS: Keyframe Fusion with CTC for User-Defined Keyword Spotting

KFC-KWS: 基于CTC的关键帧融合用于用户自定义关键词唤醒

Jin Li, Wenbin Jiang, Ji Hu

机构 * School of Electronics and Information Engineering, Hangzhou Dianzi University(杭州电子科技大学电子信息学院) School of Communication Engineering, Hangzhou Dianzi University(杭州电子科技大学通信工程学院)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出KFC-KWS多模态框架,利用CTC引导的关键帧选择对齐音频、音素和文本模态,通过交叉注意力融合关键帧与全句表示,在LibriPhrase上达到98.73% AUC,困难子集上97.65% AUC和7.75% EER,有效区分易混淆关键词。

Comments Accepted by Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10227 2026-06-10 cs.LG 新提交 50%

Spatiotemporal Graph Transformer for 3D Neighborhood Interaction and Quality Prediction in Metal Additive Manufacturing

时空图Transformer用于金属增材制造中的3D邻域交互与质量预测

Joyce Karen Pelaez, Siqi Zhang, Hoo Sang Ko

机构 * Department of Industrial Engineering(工业工程系)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 提出一种时空图Transformer,通过加权网络表示和双注意力机制建模3D邻域交互,显著提升金属增材制造质量预测性能。

Comments Submitted to Journal of Intelligent Manufacturing, 23 pages, 10 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09092 2026-06-09 cs.LG 新提交 50%

From Shortcuts to Reasoning: Robust Post-Training of Theory of Mind with Reinforcement Learning

从捷径到推理:基于强化学习的心理理论鲁棒后训练

Jike Zhong, Yuxiang Lai, Ming Li, Yuheng Li, Wuao Liu, Behzad Dariush, Konstantinos Psounis, Shao-Yuan Lo

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对心理理论后训练中的捷径问题,提出Thinking-RFT方法,结合可验证奖励和显式推理链,在多个无捷径数据集上显著提升推理能力,尤其在复杂高阶推理和多模态场景中表现优异。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06970 2026-06-08 cs.IR 新提交 50%

SSRLive: Live Streaming Recommendation with Dynamic Semantic ID

SSRLive:基于动态语义ID的直播推荐

Teng Shi, Zhaoheng Li, Yuanhang Qu, Yi Liu, Lixiang Lai, Yuning Jiang

专题命中 多模态训练与对齐 :multimodal(abstract)

AI总结 针对直播推荐中静态语义ID无法反映内容动态变化、生成式方法忽略用户-主播交互信号的问题,提出SSRLive框架,结合生成模块(动态语义ID)与判别模块(交互增强),在真实部署中显著提升观看时长、GMV等指标。

详情

展开后加载摘要…

URL PDF HTML 收藏