arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-11-25 至 2025-11-25 共收录 35 信号源:cs.CV, eess.IV, cs.MM

1. 长视频与时序推理 5 篇

2507.10510 2025-11-25 cs.NI cs.AI cs.HC cs.MM 57%

Chat with AI: The Surprising Turn of Real-time Video Communication from Human to AI

与AI聊天:从人类到AI的实时视频通信惊人转变

Jiangkai Wu, Zhiyuan Ren, Liming Liu, Xinggong Zhang

机构 * Peking University(北京大学)

专题命中 长视频与时序推理 :video understanding(abstract);分类 cs.MM

AI总结 本文提出了一种面向AI的实时视频通信方法,通过上下文感知视频流技术降低延迟并提升AI理解视频的准确性。

Comments 9 pages, 10 figures, Proceedings of the 24th ACM Workshop on Hot Topics in Networks (HotNets 2025), College Park, Maryland, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17932 2025-11-25 cs.CV cs.GR 57%

Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion

通过测试时自然视频补全实现从少量视角合成新视角

Yan Xu, Yixing Wang, Stella X. Yu

专题命中 长视频与时序推理 :video diffusion(abstract);分类 cs.CV

AI总结 通过测试时自然视频补全方法,从少量视角生成高质量新视角,无需场景特定训练,有效提升稀疏输入下的场景重建与视角生成质量。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频数据与评测 3 篇

2511.18382 2025-11-25 cs.CV 70%

ViMix-14M: A Curated Multi-Source Video-Text Dataset with Long-Form, High-Quality Captions and Crawl-Free Access

ViMix-14M:一个经过精心整理的多源视频-文本数据集,具有长形式、高质量的描述和无爬虫访问

Timing Yang, Sucheng Ren, Alan Yuille, Feng Wang

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 ViMix-14M是一个经过精心整理的多源视频-文本数据集,提供无爬虫访问、高质量描述和长形式文本,用于提升视频生成和多模态任务的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15065 2025-11-25 cs.CV cs.AI 57%

Reasoning via Video: The First Evaluation of Video Models' Reasoning Abilities through Maze-Solving Tasks

通过视频推理:首次评估视频模型在迷宫解决任务中的推理能力

Cheng Yang, Haiyuan Wan, Yiran Peng, Xin Cheng, Zhaoyang Yu, Jiayi Zhang, Junchi Yu, Xinlei Yu, Xiawu Zheng, Dongzhan Zhou, Chenglin Wu

机构 * DeepWisdom Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Renmin University of China(中国人民大学) University of Oxford(牛津大学) National University of Singapore(新加坡国立大学) Xiamen University(厦门大学) Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 本文首次评估视频模型在迷宫解决任务中的推理能力,提出VR-Bench基准,展示视频生成在空间推理中的潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18352 2025-11-25 cs.CV 57%

MagicWand: A Universal Agent for Generation and Evaluation Aligned with User Preference

MagicWand: 一个通用代理用于生成与评估,与用户偏好对齐

Zitong Xu, Dake Shen, Yaosong Du, Kexiang Hao, Jinghan Huang, Xiande Huang

机构 * Shanghai Jiao Tong University(上海交通大学) De Artificial Intelligence Lab(德人工智能实验室) The Chinese University of Hong Kong, Shenzhen China(香港中文大学(深圳))

专题命中 视频数据与评测 :video generation(abstract);分类 cs.CV

AI总结 MagicWand通过结合用户偏好数据集和先进生成模型,实现高质量内容生成与偏好对齐评估。

详情

展开后加载摘要…

URL PDF HTML 收藏