arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-03 至 2025-11-03 共收录 5 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 5 篇

2510.26978 2025-11-03 cs.CV cs.CL 62%

Semantic Frame Aggregation-based Transformer for Live Video Comment Generation

Anam Fatima, Yi Yu, Janak Kapuriya, Julien Lalanne, Jainendra Shukla

机构 * IIIT-Delhi, India(德里印度理工学院) Grenoble INP – Ensimag, France(法国格勒诺布尔INP–Ensimag)

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27558 2025-11-03 cs.RO cs.AI cs.LG 57%

Toward Accurate Long-Horizon Robotic Manipulation: Language-to-Action with Foundation Models via Scene Graphs

Sushil Samuel Dinesh, Shinkyu Park

机构 * Department of Electrical and Computer Engineering, King Abdullah University of Science and Technology (KAUST)(电气与计算机工程系,国王 Abdullah 科学与技术大学)

专题命中 视频多模态 :multimodal(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.01930 2025-11-03 cs.CV 57%

PROFIT: A Specialized Optimizer for Deep Fine Tuning

Anirudh S Chakravarthy, Shuai Kyle Zheng, Xin Huang, Sachithra Hemachandra, Xiao Zhang, Yuning Chai, Zhao Chen

机构 * GM Cruise LLC

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV

Comments technical report, 23 pages, NeurIPS 2025 poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27058 2025-11-03 cs.HC 50%

Adaptive Human-Computer Interaction Strategies Through Reinforcement Learning in Complex

Rui Liu, Yifan Zhuang, Runsheng Zhang

专题命中 视频多模态 :multimodal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.15395 2025-11-03 eess.SP 50%

FAST: Flexible and Adaptive Semantic Transmission for Resource-constrained Multi-user Generative Semantic Communication

Yiru Wang, Wanting Yang, Fangli Mou, Zehui Xiong, Zide Fan, Shiwen Mao, Tony Q. S. Quek

专题命中 视频多模态 :cross-modal(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏