arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2026-02-12 至 2026-02-12 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2503.16858 2026-02-12 cs.CL cs.AI 84%

MTBench: A Multimodal Time Series Benchmark for Temporal Reasoning and Question Answering

MTBench: 一种多模态时间序列基准,用于时间推理和问答

Jialin Chen, Aosong Feng, Ziyu Zhao, Juan Garza, Gaukhar Nurbek, Cheng Qin, Ali Maatouk, Leandros Tassiulas, Yifeng Gao, Rex Ying

机构 * Yale University, New Haven, CT, USA(耶鲁大学) McGill University, Montreal, QC, Canada(麦吉尔大学) University of Texas Rio Grande Valley, TX, USA(德克萨斯大学里奥格兰德谷分校)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CL、cs.AI

AI总结 MTBench是一种多模态时间序列基准,用于评估大型语言模型在金融和天气领域的时间推理和问答能力。

Comments 18 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10549 2026-02-12 cs.CV cs.AI 81%

Enhancing Weakly Supervised Multimodal Video Anomaly Detection through Text Guidance

通过文本引导增强弱监督多模态视频异常检测

Shengyang Sun, Jiashen Hua, Junyi Feng, Xiaojin Gong

机构 * School of Computer Science and Technology, Hangzhou Dianzi University(杭州电子科技大学计算机科学与技术学院) Alibaba Cloud(阿里云) College of Information Science and Electronic Engineering, Zhejiang University(浙江大学信息科学与电子工程学院)

专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出文本引导框架,通过多阶段文本增强和多尺度瓶颈Transformer融合模块,提升弱监督多模态视频异常检测的性能。

Comments Accepted by IEEE Transactions on Multimedia

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10897 2026-02-12 hep-ex 78%

Multi-Modal Track Reconstruction using Graph Neural Networks at Belle II

利用图神经网络进行多模态轨迹重建:Belle II实验

Lea Reuter, Tristan Brandes, Giacomo De Pietro, Torben Ferber

专题命中 视频多模态 :multi-modal(title,abstract)

AI总结 Belle II实验利用图神经网络和多模态输入提升轨迹重建效率和纯度,通过模拟验证效果。

Comments proceedings for ACAT25

详情

展开后加载摘要…

URL PDF HTML 收藏