2510.08559 2025-10-10 cs.CV cs.AI 81% SciVideoBench: Benchmarking Scientific Video Reasoning in Large Multimodal Models Andong Deng, Taojiannan Yang, Shoubin Yu, Lincoln Spencer, Mohit Bansal, Chen Chen, Serena Yeung-Levy, Xiaohan Wang 机构 * University of Central Florida(中央佛罗里达大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) ; Stanford University(斯坦福大学) 纠错 专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV、cs.AI 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2510.08143 2025-10-10 cs.CV 79% UniMMVSR: A Unified Multi-Modal Framework for Cascaded Video Super-Resolution Shian Du, Menghan Xia, Chang Liu, Quande Liu, Xintao Wang, Pengfei Wan, Xiangyang Ji 机构 * Tsinghua University(清华大学) ; Huazhong University of Science and Technology(华中科技大学) ; Kling Team, Kuaishou Technology(快手科技 Kling 团队) 纠错 专题命中 视频多模态 :multi-modal(title,abstract);分类 cs.CV 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2506.01674 2025-10-10 cs.CV 79% MotionSight: Boosting Fine-Grained Motion Understanding in Multimodal LLMs Yipeng Du, Tiehan Fan, Kepan Nan, Rui Xie, Penghao Zhou, Xiang Li, Jian Yang, Zhenheng Yang, Ying Tai 机构 * Nanjing University(南京大学) ; ByteDance(字节跳动) ; Nankai University(南开大学) 纠错 专题命中 视频多模态 :multimodal(title,abstract);分类 cs.CV 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2510.07550 2025-10-10 cs.CV cs.AI 62% TRAVL: A Recipe for Making Video-Language Models Better Judges of Physics Implausibility Saman Motamed, Minghao Chen, Luc Van Gool, Iro Laina 机构 * Visual Geometry Group, University of Oxford(视觉几何组,牛津大学) 纠错 专题命中 视频多模态 :multimodal(abstract);分类 cs.CV、cs.AI 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2510.08508 2025-10-10 cs.CV 57% MoA-VR: A Mixture-of-Agents System Towards All-in-One Video Restoration Lu Liu, Chunlei Cai, Shaocheng Shen, Jianfeng Liang, Weimin Ouyang, Tianxiao Ye, Jian Mao, Huiyu Duan, Jiangchao Yao, Xiaoyun Zhang, Qiang Hu, Guangtao Zhai 机构 * Shanghai Jiao Tong University(上海交通大学) ; University of Electronic Science and Technology of China(电子科技大学) ; Bilibili Inc.(哔哩哔哩公司) 纠错 专题命中 视频多模态 :multimodal(abstract);分类 cs.CV 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图
2502.13925 2025-10-10 cs.CL 57% Beyond Single Frames: Can LMMs Comprehend Temporal and Contextual Narratives in Image Sequences? Xiaochen Wang, Heming Xia, Jialin Song, Longyu Guan, Yixin Yang, Qingxiu Dong, Weiyao Luo, Yifan Pu, Yiru Wang, Xiangdi Meng, Wenjie Li, Zhifang Sui 机构 * State Key Laboratory of Multimedia Information Processing, Peking University(多媒体信息处理国家重点实验室,北京大学) ; Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算机系) ; Tsinghua University(清华大学) ; ModelTC 纠错 专题命中 视频多模态 :multimodal(abstract);分类 cs.CL 详情 展开后加载摘要… URL PDF HTML 收藏 复制 复制简介 复制详情 生成图片 生成简图 生成详图