arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-06 至 2025-08-06 共收录 6 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 6 篇

2508.03694 2025-08-06 cs.CV 79%

LongVie: Multimodal-Guided Controllable Ultra-Long Video Generation

Jianxiong Gao, Zhaoxi Chen, Xian Liu, Jianfeng Feng, Chenyang Si, Yanwei Fu, Yu Qiao, Ziwei Liu

机构 * Nanjing University(南京大学) Fudan University(复旦大学) S-Lab, Nanyang Technological University(南洋理工大学S实验室) NVIDIA(NVIDIA公司) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频多模态 :multimodal(title);multi-modal(abstract);分类 cs.CV

Comments Project page: https://vchitect.github.io/LongVie-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07454 2025-08-06 cs.CV 70%

How Can Objects Help Video-Language Understanding?

Zitian Tang, Shijie Wang, Junho Cho, Jaewook Yoo, Chen Sun

机构 * Brown University(布朗大学) Samsung Electronics(三星电子)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03009 2025-08-06 cs.CV cs.AI 62%

Enhancing Long Video Question Answering with Scene-Localized Frame Grouping

Xuyi Yang, Wenhao Zhang, Hongbo Jin, Lin Liu, Hongbo Xu, Yongwei Nie, Fei Yu, Fei Ma

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18688 2025-08-06 cs.CV cs.AI 62%

Video Is Worth a Thousand Images: Exploring the Latest Trends in Long Video Generation

Faraz Waseem, Muhammad Shahzad

机构 * University Of Reading(阅读大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

Comments 35 pages, 18 figures, Manuscript submitted to ACM

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03651 2025-08-06 cs.HC cs.AI 57%

Probing the Gaps in ChatGPT Live Video Chat for Real-World Assistance for People who are Blind or Visually Impaired

Ruei-Che Chang, Rosiana Natalie, Wenqian Xu, Jovan Zheng Feng Yap, Anhong Guo

机构 * University of Michigan(密歇根大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

Comments ACM ASSETS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03518 2025-08-06 cs.IR cs.LG 50%

Parameter-Efficient Single Collaborative Branch for Recommendation

Marta Moscati, Shah Nawaz, Markus Schedl

机构 * Institute of Computational Perception, Johannes Kepler University Linz(计算感知研究所,林茨约瑟夫·施密特大学) AI Lab, Linz Institute of Technology(林茨技术学院人工智能实验室)

专题命中 视频多模态 :multimodal(abstract)

Comments 5 pages

Journal ref Proceedings of the Nineteenth ACM Conference on Recommender Systems (RecSys'25), September 22-26, 2025, Prague, Czech Republic. ACM, New York, NY, USA

详情

展开后加载摘要…

URL PDF HTML 收藏