2510.06509 2025-10-13 cs.CV 85% From Captions to Keyframes: KeyScore for Multimodal Frame Scoring and Video-Language Understanding Shih-Yao Lin, Sibendu Paul, Caren Chen 机构 * Amazon Prime Video(亚马逊Prime视频) 纠错 专题命中 视频理解 :video-language(title,abstract);video understanding(abstract);long video(abstract);分类 cs.CV Comments 10 pages, 4 figures 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2510.08818 2025-10-13 cs.CV cs.AI 70% D-CoDe: Scaling Image-Pretrained VLMs to Video via Dynamic Compression and Question Decomposition Yiyang Huang, Yizhou Wang, Yun Fu 机构 * Northeastern University(东北大学) 纠错 专题命中 视频理解 :video understanding(abstract);video-language(abstract);分类 cs.CV Comments This paper has been accepted to EMNLP 2025 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2510.09230 2025-10-13 cs.CV cs.AI cs.CL cs.LG 57% Diagnosing Shoulder Disorders Using Multimodal Large Language Models and Consumer-Grade Cameras Jindong Hong, Wencheng Zhang, Shiqin Qiao, Jianhai Chen, Jianing Qiu, Chuanyang Zheng, Qian Xu, Yun Ji, Qianyue Wen, Weiwei Sun, Hao Li, Huizhen Li, Huichao Wang, Kai Wu, Meng Li, Yijun He, Lingjie Luo, Jiankai Sun 机构 * Bytedance(字节跳动) ; Peking University(北京大学) ; Peking University People’s Hospital(北京大学人民医院) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; The Chinese University of Hong Kong(香港中文大学) 纠错 专题命中 视频理解 :video understanding(abstract);分类 cs.CV 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图