arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-16 至 2025-12-16 共收录 14 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 14 篇

2512.12246 2025-12-16 cs.CV 83%

Moment and Highlight Detection via MLLM Frame Segmentation

通过MLLM帧分割进行时刻和亮点检测

I Putu Andika Bagas Jiwanta, Ayu Purwarianti

机构 * School of Electrical Engineering and Informatics(电气工程与信息学院) Institut Teknologi Bandung(万隆技术大学)

专题命中 视频多模态 :MLLM(title,abstract);multimodal(abstract);分类 cs.CV

AI总结 本文提出通过MLLM帧分割实现视频时刻和亮点检测,利用分割损失与因果LM损失结合,提升检测精度与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20268 2025-12-16 cs.CV cs.MM 81%

GMFVAD: Using Grained Multi-modal Feature to Improve Video Anomaly Detection

GMFVAD:利用细粒度多模态特征提升视频异常检测

Guangyu Dai, Dong Chen, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Zhengzhou University(郑州大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV、cs.MM

AI总结 GMFVAD通过细粒度多模态特征减少冗余信息,提升视频异常检测性能。

Comments Accepted for publication in the Proceedings of the ICONIP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13604 2025-12-16 cs.CV 79%

LongVie 2: Multimodal Controllable Ultra-Long Video World Model

LongVie 2: 多模态可控超长视频世界模型

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Junhao Zhuang, Chengming Xu, Jianfeng Feng, Yu Qiao, Yanwei Fu, Chenyang Si, Ziwei Liu

机构 * FDU(福建大学) NJU(南京大学) NTU(National University of Taiwan) NVIDIA(英伟达) THU(清华大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

AI总结 LongVie 2通过多模态引导、退化感知训练和历史-上下文引导,实现了超长视频的可控生成,支持连续视频生成长达五分钟,推动视频世界建模的统一发展。

Comments Project Page: https://vchitect.github.io/LongVie2-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13313 2025-12-16 cs.CV 70%

KlingAvatar 2.0 Technical Report

KlingAvatar 2.0 技术报告

Kling Team, Jialu Chen, Yikang Ding, Zhixue Fang, Kun Gai, Yuan Gao, Kang He, Jingyun Hua, Boyuan Jiang, Mingming Lao, Xiaohan Li, Hui Liu, Jiwen Liu, Xiaoqiang Liu, Yuan Liu, Shun Lu, Yongsen Mao, Yingchao Shao, Huafeng Shi, Xiaoyu Shi, Peiqin Sun, Songlin Tang, Pengfei Wan, Chao Wang, Xuebo Wang, Haoxian Zhang, Yuanxing Zhang, Yan Zhou

机构 * Kuaishou Technology(快手科技)

专题命中 视频多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV

AI总结 KlingAvatar 2.0 通过时空级联框架和多模态指令融合技术,实现了高效且高质量的长视频生成,提升了视觉清晰度和多模态对齐能力。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12560 2025-12-16 cs.CV cs.AI 62%

StreamingAssistant: Efficient Visual Token Pruning for Accelerating Online Video Understanding

StreamingAssistant: 为加速在线视频理解的高效视觉标记修剪

Xinqi Jin, Hanxun Yu, Bohan Yu, Kebin Liu, Jian Liu, Keda Tao, Yixuan Pei, Huan Wang, Fan Dang, Jiangchuan Liu, Weiqiang Wang

机构 * Tsinghua University(清华大学) Zhejiang University(浙江大学) Ant Group(蚂蚁集团) Westlake University(西湖大学) Beijing Jiaotong University(北京交通大学) Simon Fraser University(西蒙弗雷泽大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 StreamingAssistant通过高效视觉标记修剪技术,提升在线视频理解的准确性和效率,减少GPU内存使用和计算延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.14505 2025-12-16 cs.CV cs.AI cs.LG 62%

MusicInfuser: Making Video Diffusion Listen and Dance

MusicInfuser: 使视频扩散模型听音乐并跳舞

Susung Hong, Ira Kemelmacher-Shlizerman, Brian Curless, Steven M. Seitz

机构 * University of Washington(华盛顿大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 MusicInfuser通过调整预训练视频扩散模型,使视频能与指定音乐同步生成舞蹈,无需运动数据,训练高效且泛化能力强。

Comments Project page: https://susunghong.github.io/MusicInfuser

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13238 2025-12-16 cs.CV 57%

Ego-EXTRA: video-language Egocentric Dataset for EXpert-TRAinee assistance

Ego-EXTRA:视频语言眼动数据集用于专家-学员协助

Francesco Ragusa, Michele Mazzamuto, Rosario Forte, Irene D'Ambra, James Fort, Jakob Engel, Antonino Furnari, Giovanni Maria Farinella

机构 * Department of Mathematics and Computer Science - University of Catania(数学与计算机科学系 - 卡塔尼亚大学) Next Vision s.r.l. - Spinoff of the University of Catania(Next Vision公司 - 卡塔尼亚大学衍生机构) Meta Reality Labs Research(Meta现实实验室)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 Ego-EXTRA数据集通过专家-学员双向对话评估多模态大语言模型,揭示其在专家级帮助中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13015 2025-12-16 cs.CV 57%

What Happens Next? Next Scene Prediction with a Unified Video Model

接下来会发生什么?一种统一的视频模型用于下一场景预测

Xinjie Li, Zhimin Chen, Rui Zhao, Florian Schiffers, Zhenyu Liao, Vimal Bhat

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Amazon(亚马逊)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

AI总结 本文提出Next Scene Prediction任务,通过联合框架结合Qwen-VL和LTX,利用预训练、监督微调和强化学习提升视频模型的时间推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12462 2025-12-16 cs.LG cs.AI q-bio.NC 57%

Dynamical modeling of nonlinear latent factors in multiscale neural activity with real-time inference

多尺度神经活动中非线性潜在因子的动力学建模

Eray Erturk, Maryam M. Shanechi

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系) University of Southern California(南加州大学) Department of Computer Science(计算机科学系) Department of Biomedical Engineering(生物医学工程系) Neuroscience Graduate Program(神经科学研究生项目)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

AI总结 本研究提出了一种多尺度动态框架,用于实时解码多模态神经活动,通过非线性聚合不同时间尺度和分布的数据以提升解码性能。

Comments Published at the 39th Annual Conference on Neural Information Processing Systems 2025. Code is available at https://github.com/ShanechiLab/mrine

Journal ref NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06080 2025-12-16 cs.CV 57%

CAST-Phys: Contactless Affective States Through Physiological signals Database

CAST-Phys: 通过生理信号进行无接触情绪状态的数据库

Joaquim Comas, Alexander Joel Vera, Xavier Vives, Eleonora De Filippi, Alexandre Pereda, Federico Sukno

机构 * Department of Information and Communication Technologies, Pompeu Fabra University(信息与通信技术系,庞培法布拉大学) Eurecat Centre Tecnològic(埃鲁卡特技术中心)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 CAST-Phys数据库通过多模态远程生理信号实现无接触情绪识别,提供高质量的生理和面部数据以提升情绪识别技术。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00696 2025-12-16 q-bio.MN cs.AI cs.ET 57%

Hierarchical Molecular Language Models (HMLMs)

分层分子语言模型(HMLMs)

Hasi Hays, Yue Yu, William J. Richardson

机构 * Department of Chemical Engineering, University of Arkansas(化学工程系,亚拉巴马大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.AI

AI总结 HMLMs通过构建分子语言模型,将细胞信号传递建模为分子语言,利用分层注意力机制和跨尺度操作符整合多模态数据,提升对复杂信号网络的时间动态预测能力,推动精准医学发展。

Comments The current version includes minor revisions to the preprint v2 (arXiv preprint arXiv:2512.00696), Added the Supplementary materials section

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13073 2025-12-16 math.ST stat.TH 50%

Spectral Equivariance and Geometric Transport in Reproducing Kernel Hilbert Spaces: A Unified Framework for Orthogonal Polynomial and Kernel Estimation

谱等变性与几何传输在再生核希尔伯特空间中的统一框架:一种用于正交多项式和核估计的统一方法

Jocelyn Nembé

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文提出了一种基于双核空间的统一几何框架,通过谱等变性定理揭示了正交多项式估计器、核估计器和谱平滑方法之间的联系,为非参数估计提供了新的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13067 2025-12-16 math.PR cs.IT math.GR math.IT stat.CO 50%

Group-averaged Markov chains II: tuning of group action in finite state space

群平均马尔可夫链II:在有限状态空间中调节群作用

Michael C. H. Choi, Ryan J. Y. Lim, Youjia Wang

专题命中 视频多模态 :multimodal(abstract)

AI总结 本文研究了群平均马尔可夫链,分析了轨道核及其混合方法,并提出调节群作用的启发式方法,展示了GPG在信息投影中的应用及在不同模型中的混合性能。

Comments 44 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12318 2025-12-16 hep-ph hep-ex 50%

Interference Effects in Resonant Standard Model di-Higgs Production and Decay into $4b$ Final States: the Role of Machine Learning Analysis

共振标准模型双Higgs生产与衰变成4b最终态中的干涉效应:机器学习分析的作用

A. Hammad, S. Moretti, A. P. Przybyl, H. Waltari

专题命中 视频多模态 :multi-modal(abstract)

AI总结 该研究利用多模式Transformer机器学习分析,探讨共振标准模型双Higgs衰变成4b最终态中的干涉效应,发现其能提升显著性并适应复杂数据集,但忽视干涉可能导致错误结论。

详情

展开后加载摘要…

URL PDF HTML 收藏