arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-11-12 至 2025-11-12 共收录 3 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 3 篇

2511.07988 2025-11-12 cs.AI 83%

The One Where They Brain-Tune for Social Cognition: Multi-Modal Brain-Tuning on Friends

Nico Policzer, Cameron Braunstein, Mariya Toneva

机构 * Saarland University(萨尔兰大学) MPI for Software Systems(软件系统Max Planck研究所) University of British Columbia(不列颠哥伦比亚大学)

专题命中 视频多模态 :multi-modal(title,abstract);multimodal(abstract);分类 cs.AI

Comments 20 pages, 7 figures. Appearing at the NeurIPS 2025 Workshop on Interpreting Cognition in Deep Learning Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06958 2025-11-12 cs.CV 70%

VideoChat-R1: Enhancing Spatio-Temporal Perception via Reinforcement Fine-Tuning

Xinhao Li, Ziang Yan, Desen Meng, Lu Dong, Xiangyu Zeng, Yinan He, Yali Wang, Yu Qiao, Yi Wang, Limin Wang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Nanjing University(南京大学) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学) Shanghai Innovation Institute(上海创新研究院) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 视频多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08535 2025-11-12 cs.CV cs.AI 62%

Large Sign Language Models: Toward 3D American Sign Language Translation

Sen Zhang, Xiaoxiao He, Di Liu, Zhaoyang Xia, Mingyu Zhao, Chaowei Tan, Vivian Li, Bo Liu, Dimitris N. Metaxas, Mubbasir Kapadia

机构 * Rutgers University(罗格斯大学) Meta Reality Labs(Meta现实实验室) Qualcomm(高通公司) Walmart Global Tech(沃尔玛全球技术) Roblox PRISMS

专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏