arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

多模态大模型

跨文本、图像、视频、音频等模态的大模型与学习方法。

2025-08-20 至 2025-08-20 共收录 4 信号源:cs.CV, cs.CL, cs.AI, cs.MM, eess.AS

1. 视频多模态 4 篇

2508.13692 2025-08-20 cs.CV 79%

HumanPCR: Probing MLLM Capabilities in Diverse Human-Centric Scenes

Keliang Li, Hongze Shen, Hao Shi, Ruibing Hou, Hong Chang, Jie Huang, Chenghao Jia, Wen Wang, Yiling Wu, Dongmei Jiang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)、计算技术研究所、中国)

专题命中 视频多模态 :MLLM(title);multimodal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.07961 2025-08-20 cs.CV 57%

Geo4D: Leveraging Video Generators for Geometric 4D Scene Reconstruction

Zeren Jiang, Chuanxia Zheng, Iro Laina, Diane Larlus, Andrea Vedaldi

机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) Naver Labs Europe(Naver欧洲实验室)

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

Comments 17 pages, 6 figures, ICCV 2025 Highlight, Project page: https://geo4d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.00838 2025-08-20 cs.CV cs.LG 57%

Spatially-guided Temporal Aggregation for Robust Event-RGB Optical Flow Estimation

Qianang Zhou, Junhui Hou, Meiyi Yang, Yongjian Deng, Youfu Li, Junlin Xiong

机构 * Department of Automation, University of Science and Technology of China(自动化系,中国科学技术大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学) Department of Mechanical Engineering, City University of Hong Kong(机械工程系,香港城市大学) College of Computer Science, Beijing University of Technology(计算机科学学院,北京理工大学)

专题命中 视频多模态 :cross-modal(abstract);分类 cs.CV

Comments 11 pages, 8 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13205 2025-08-20 cs.CV eess.IV 57%

YOLO11-CR: a Lightweight Convolution-and-Attention Framework for Accurate Fatigue Driving Detection

Zhebin Jin, Ligang Dong

专题命中 视频多模态 :multi-modal(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏