arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-12-30 至 2025-12-30 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2512.23291 2025-12-30 cs.CV 83%

Multi-Track Multimodal Learning on iMiGUE: Micro-Gesture and Emotion Recognition

多轨多模态学习于iMiGUE:微手势与情绪识别

Arman Martirosyan, Shahane Tigranyan, Maria Razzhivina, Artak Aslanyan, Nazgul Salikhova, Ilya Makarov, Andrey Savchenko, Aram Avetisyan

机构 * Russian - Armenian University(俄罗斯-亚美尼亚大学) Sber AI Lab(Sber AI实验室) HSE University(俄罗斯高等经济大学) Innopolis University(Innopolis大学) ISP RAS Research Center for Trusted Artificial Intelligence(俄罗斯科学院可信人工智能研究中心)

专题命中 视频多模态 :multimodal(title,abstract);cross-modal(abstract);分类 cs.CV

AI总结 本文提出多模态框架,利用视频和骨骼姿态数据实现微手势识别和基于行为的情绪预测,通过交叉模态融合模块提升鲁棒性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22741 2025-12-30 cs.CL 83%

Text-Routed Sparse Mixture-of-Experts Model with Explanation and Temporal Alignment for Multi-Modal Sentiment Analysis

基于解释和时序对齐的文本引导稀疏专家混合模型用于多模态情感分析

Dongning Rao, Yunbiao Zeng, Zhihua Jiang, Jujian Lv

专题命中 视频多模态 :multi-modal(title,abstract);MLLM(abstract);分类 cs.CL

AI总结 本文提出基于解释和时序对齐的文本引导稀疏专家混合模型,用于提升多模态情感分析的性能。

Comments 9 pages, 9 figures, accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22226 2025-12-30 cs.CV cs.AI cs.CL cs.LG 67%

VideoScaffold: Elastic-Scale Visual Hierarchies for Streaming Video Understanding in MLLMs

VideoScaffold: 基于弹性尺度的视觉层次结构用于多模态大语言模型中的流媒体视频理解

Naishan Zheng, Jie Huang, Qingpei Guo, Feng Zhao

机构 * University of Science and Technology of China(中国科学技术大学) Ant Group(蚂蚁集团)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL、cs.AI

AI总结 VideoScaffold通过弹性尺度事件分割和层次事件整合,实现了流媒体视频理解中的细粒度到抽象事件推理的动态转换,提升多模态大语言模型的视频处理性能。

Comments 11 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10516 2025-12-30 cs.CV cs.AI 62%

CogStream: Context-guided Streaming Video Question Answering

CogStream: 基于上下文的流视频问答

Zicheng Zhao, Kangyu Wang, Shijie Li, Rui Qian, Weiyao Lin, Huabin Liu

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 本文提出CogStream任务,通过视觉流压缩和历史对话检索,解决流视频中关键信息识别与问答问题。

Comments Project page: https://github.com/LiamZhao326/CogStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22315 2025-12-30 cs.CV cs.AI 62%

VideoZoomer: Reinforcement-Learned Temporal Focusing for Long Video Reasoning

VideoZoomer: 用于长视频推理的强化学习时序聚焦

Yang Ding, Yizhen Zhang, Xin Lai, Ruihang Chu, Yujiu Yang

机构 * Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

AI总结 VideoZoomer通过强化学习实现动态时序聚焦,提升长视频推理性能和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13415 2025-12-30 cs.CV 57%

USTM: Unified Spatial and Temporal Modeling for Continuous Sign Language Recognition

USTM:统一的空间和时间建模用于连续手语识别

Ahmed Abul Hasanaath, Hamzah Luqman

机构 * College of Information and Computer Science(信息与计算机科学学院) King Fahd University of Petroleum and Minerals(国王法赫德石油矿物大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

AI总结 USTM通过结合Swin Transformer与轻量级时间适配器,实现高效的空间-时间建模,提升连续手语识别的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23093 2025-12-30 cs.HC 50%

Cogniscope: Modeling Social Media Interactions as Digital Biomarkers for Early Detection of Cognitive Decline

Cogniscope: 将社交媒体互动建模为数字生物标记物以早期检测认知衰退

Ananya Drishti, Mahfuza Farooque

专题命中 视频多模态 :multimodal(abstract)

AI总结 Cogniscope通过模拟社交媒体互动数据,研究认知健康的数字生物标记物,提供可控测试平台以评估早期认知衰退检测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏