arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-09-08 至 2025-09-08 共收录 7 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 7 篇

2509.04751 2025-09-08 cs.IR cs.LG 89%

Multimodal Foundation Model-Driven User Interest Modeling and Behavior Analysis on Short Video Platforms

Yushang Zhao, Yike Peng, Li Zhang, Qianyi Sun, Zhihui Zhang, Yingying Zhuang

专题命中 视频多模态 :multimodal(title,abstract);multimodal foundation model(title,abstract);cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.05265 2025-09-08 cs.AI 79%

MMoE: Robust Spoiler Detection with Multi-modal Information and Domain-aware Mixture-of-Experts

Zinan Zeng, Sen Ye, Zijian Cai, Heng Wang, Yuhan Liu, Haokai Zhang, Minnan Luo

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04714 2025-09-08 cs.SI 78%

ThumbnailTruth: A Multi-Modal LLM Approach for Detecting Misleading YouTube Thumbnails Across Diverse Cultural Settings

Wajiha Naveed, Zartash Afzal Uzmi, Zafar Ayyub Qazi

专题命中 视频多模态 :multi-modal(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04957 2025-09-08 cs.CV cs.MM cs.SD eess.AS 67%

Efficient Video-to-Audio Generation via Multiple Foundation Models Mapper

Gehui Chen, Guan'an Wang, Xiaowen Huang, Jitao Sang

机构 * School of Computer Science Technology, Beijing Jiaotong University Beijing China Beijing Key Laboratory of Traffic Data Mining Key Laboratory of Big Data \& Artificial Intelligence in Transportation, Ministry of Education Beijing China Technology, Beijing Jiaotong University Key Laboratory of Big Data \& Artificial Intelligence in Transportation, Ministry of Education

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV、cs.MM、eess.AS

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15298 2025-09-08 cs.CV 57%

TPA: Temporal Prompt Alignment for Fetal Congenital Heart Defect Classification

Darya Taratynova, Alya Almsouti, Beknur Kalmakhanbet, Numan Saeed, Mohammad Yaqub

机构 * Department of Machine Learning Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) Abu Dhabi, UAE(机器学习系,Mohamed bin Zayed人工智能大学(MBZUAI),阿布扎比,阿联酋) Department of Computer Vision Mohamed bin Zayed University of Artificial Intelligence (MBZUAI) Abu Dhabi, UAE(计算机视觉系,Mohamed bin Zayed人工智能大学(MBZUAI),阿布扎比,阿联酋)

专题命中 视频多模态 :image-text(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.03496 2025-09-08 cs.HC cs.AI 57%

Evaluating Temporal Patterns in Applied Infant Affect Recognition

Allen Chang, Lauren Klein, Marcelo R. Rosales, Weiyang Deng, Beth A. Smith, Maja J. Matarić

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments 8 pages, 6 figures, 10th International Conference on Affective Computing and Intelligent Interaction (ACII 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.18724 2025-09-08 cs.CL 57%

Large Language Models with Temporal Reasoning for Longitudinal Clinical Summarization and Prediction

Maya Kruse, Shiyue Hu, Nicholas Derby, Yifu Wu, Samantha Stonbraker, Bingsheng Yao, Dakuo Wang, Elizabeth Goldberg, Yanjun Gao

机构 * University of Colorado Anschutz Medical Campus(科罗拉多大学安舒茨医学校园) University of Colorado Boulder(科罗拉多大学波德分校) Northeastern University(东北大学)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏