arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-27 至 2026-01-27 共收录 15 信号源:cs.CV, eess.IV, cs.MM

1. 视频理解 3 篇

2501.06835 2026-01-27 cs.CV 83%

X-LeBench: A Benchmark for Extremely Long Egocentric Video Understanding

X-LeBench:一个用于极长第一人称视频理解的基准数据集

Wenqi Zhou, Kai Cao, Hao Zheng, Yunze Liu, Xinyi Zheng, Miao Liu, Per Ola Kristensson, Walterio Mayol-Cuevas, Fan Zhang, Weizhe Lin, Junxiao Shen

机构 * University of Bristol(布里斯托大学) University of Manchester(曼彻斯特大学) University of Cambridge(剑桥大学) College of AI, Tsinghua University(清华大学人工智能学院) Meta Memories.ai Research(Memories.ai研究)

专题命中 视频理解 :video understanding(title,abstract);long video(abstract);分类 cs.CV

AI总结 X-LeBench通过模拟真实日常生活场景,构建了首个极长第一人称视频理解基准数据集,揭示了长视频理解中的关键挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17022 2026-01-27 cs.MM cs.AI cs.CV cs.CY 62%

AI-based System for Transforming text and sound to Educational Videos

基于AI的将文本和声音转换为教育视频的系统

M. E. ElAlami, S. M. Khater, M. El. R. Rehan

专题命中 视频理解 :video generation(abstract);分类 cs.CV、cs.MM

AI总结 本文提出基于GAN的AI系统,通过文本和语音转录、图像生成与视频合成,生成高质量的教育视频。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17818 2026-01-27 cs.CV 57%

ViTCoP: Accelerating Large Vision-Language Models via Visual and Textual Semantic Collaborative Pruning

ViTCoP: 通过视觉和文本语义协同剪枝加速大型视觉-语言模型

Wen Luo, Peng Chen, Xiaotao Huang, LiQun Huang

专题命中 视频理解 :video understanding(abstract);分类 cs.CV

AI总结 ViTCoP通过结合视觉和文本语义协同剪枝,有效降低大型视觉-语言模型的计算成本,提升推理效率和内存利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 视频生成 6 篇

2601.18698 2026-01-27 cs.CV 83%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12945 2026-01-27 cs.CL cs.CV 79%

LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video Generation

LLMPopcorn:探索大型语言模型作为流行微视频生成助手

Junchen Fu, Xuri Ge, Kaiwen Zheng, Alexandros Karatzoglou, Ioannis Arapakis, Xin Xin, Yongxin Ni, Joemon M. Jose

机构 * University of Glasgow(格拉斯哥大学) Shandong University(山东大学) Amazon(亚马逊) Telefónica Research(Telefónica研究院) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LLMPopcorn利用大型语言模型生成流行微视频,通过实验证明先进LLM可生成高流行度内容,并优化生成效果。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17067 2026-01-27 cs.CV cs.AI 79%

A Mechanistic View on Video Generation as World Models: State and Dynamics

视频生成作为世界模型的机制视角:状态与动态

Luozhou Wang, Zhifei Chen, Yihua Du, Dongyu Yan, Wenhang Ge, Guibao Shen, Xinli Xu, Leyi Wu, Man Chen, Tianshuo Xu, Peiran Ren, Xin Tao, Pengfei Wan, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tongji University(同济大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于状态构建和动态建模的视频生成新分类法,旨在提升视频生成模型的物理持续性和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 61%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16522 2026-01-27 cs.CV 57%

Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow

Adams-Bashforth-Moulton 解决方案用于 rectified 流中的反向和编辑

Yongjia Ma, Donglin Di, Xuan Liu, Xiaokai Chen, Lei Fan, Tonghua Su, Yue Gao

机构 * Li Auto(利亚 Auto) Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ABM求解器,通过多步预测校正和自适应步长调整提升rectified流模型的求解精度和编辑质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20655 2026-01-27 cs.CV 57%

Photography Perspective Composition: Towards Aesthetic Perspective Recommendation

摄影视角构图:迈向审美视角推荐

Lujian Yao, Siming Zheng, Xinbin Yuan, Zhuoxuan Cai, Pu Wu, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出摄影视角构图(PPC)方法,通过自动化数据集构建、视频生成和视角质量评估模型,解决视角变换数据稀缺和评估标准模糊的问题,帮助普通用户提升摄影构图能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 视频扩散模型 2 篇

2502.03502 2026-01-27 eess.IV cs.AI cs.GR 74%

DC-VSR: Spatially and Temporally Consistent Video Super-Resolution with Video Diffusion Prior

DC-VSR: 基于视频扩散先验的时空一致视频超分辨率

Janghyeok Han, Gyujin Sim, Geonung Kim, Hyun-seung Lee, Kyuha Choi, Youngseok Han, Sunghyun Cho

机构 * POSTECH Visual Display Business, Samsung Electronics(视觉显示业务,三星电子)

专题命中 视频扩散模型 :video diffusion(title);分类 eess.IV

AI总结 DC-VSR通过引入空间和时间注意力传播机制及细节抑制自注意力引导,实现了视频超分辨率的时空一致性与高质量纹理恢复。

Comments Equal contributions from first two authors

Journal ref In Proceedings of the Special Interest Group on Computer Graphics and Interactive Techniques Conference Conference Papers (SIGGRAPH Conference Papers 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16984 2026-01-27 cs.CV 57%

HiCache: A Plug-in Scaled-Hermite Upgrade for Taylor-Style Cache-then-Forecast Diffusion Acceleration

HiCache: 一种基于赫尔米特多项式的插件式泰勒风格缓存加速框架

Liang Feng, Shikang Zheng, Jiacheng Liu, Yuqi Lin, Qinming Zhou, Peiliang Cai, Xinyu Wang, Junjie Chen, Chang Zou, Yue Ma, Linfeng Zhang

专题命中 视频扩散模型 :video generation(abstract);分类 cs.CV

AI总结 HiCache通过基于赫尔米特多项式的插件式方法,提升扩散模型的推理速度和预测精度,实现5.55倍的加速并保持高质量输出。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 视频问答 2 篇

2509.17743 2026-01-27 cs.CV 84%

VideoPro: Adaptive Program Reasoning for Long Video Understanding

VideoPro: 针对长视频理解的自适应程序推理

Chenglin Li, Feng Han, Yikun Wang, Ruilin Li, Shuai Dong, Haowen Hou, Haitao Li, Qianglong Chen, Feng Tao, Jingqi Tong, Yin Zhang, Jiaqi Wang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 视频问答 :video understanding(title);long video(title);分类 cs.CV

AI总结 VideoPro通过自适应程序推理框架提升长视频理解的效率和可靠性,利用快慢推理机制和参数优化在视觉任务中取得更高准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09396 2026-01-27 cs.CV 57%

Too Many Frames, Not All Useful: Efficient Strategies for Long-Form Video QA

过多的帧,但并非都有用:长视频问答的高效策略

Jongwoo Park, Kanchana Ranasinghe, Kumara Kahatapitiya, Wonjeong Ryu, Donghyun Kim, Michael S. Ryoo

机构 * Stony Brook University(石溪大学) KAIST AI(韩国科学技术院人工智能研究所) Korea University(韩国大学)

专题命中 视频问答 :long video(abstract);分类 cs.CV

AI总结 LVNet通过高效的关键帧选择器提升长视频问答效率,实现四个基准数据集上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 动作与事件理解 1 篇

2601.18323 2026-01-27 cs.RO 71%

TC-IDM: Grounding Video Generation for Executable Zero-shot Robot Motion

TC-IDM:为可执行零样本机器人运动实现视频生成

Weishi Mi, Yong Bao, Xiaowei Chi, Xiaozhu Ju, Zhiyuan Qin, Kuangzhi Ge, Kai Tang, Peidong Jia, Shanghang Zhang, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) State Key Laboratory of Multimedia Information Processing(多媒体信息处理国家重点实验室) School of Computer Science, Peking University(北京大学计算机科学学院)

专题命中 动作与事件理解 :video generation(title)

AI总结 TC-IDM通过工具中心逆动力学模型实现视频生成,提升机器人零样本任务的执行能力与泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 视频数据与评测 1 篇

2501.08545 2026-01-27 cs.CV 70%

T2VEval: Benchmark Dataset and Objective Evaluation Method for T2V-generated Videos

T2VEval: 用于T2V生成视频的基准数据集和客观评估方法

Zelu Qi, Ping Shi, Shuqi Wang, Chaoyang Zhang, Fei Zhao, Zefeng Ying, Da Pan, Xi Yang, Zheqi He, Teng Dai

机构 * School of Information and Communication Engineering, Communication University of China, No.1 East Street, Dingfuzhuang, Chaoyang District, Beijing, China(信息与通信工程学院,中国传媒大学) Beijing Academy of Artificial Intelligence, No.150 Chengfu Road, Haidian District, Beijing, China(北京人工智能研究院)

专题命中 视频数据与评测 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 T2VEval提出了一种多分支融合方案,通过多维评估指标对T2V生成视频进行客观质量评估,提升视频生成模型的优化效果。

Comments This paper has been accepted by DISPLAYS

详情

展开后加载摘要…

URL PDF HTML 收藏