arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-01-27 至 2026-01-27 共收录 6 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 6 篇

2601.18698 2026-01-27 cs.CV 83%

Are Video Generation Models Geographically Fair? An Attraction-Centric Evaluation of Global Visual Knowledge

视频生成模型在地理上是否公平?一种以吸引力为中心的全球视觉知识评估

Xiao Liu, Jiawei Zhang

机构 * IFM Lab, Department of Computer Science University of California, Davis(信息融合实验室,计算机科学系加州大学戴维斯分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文通过GAP框架评估了文本到视频模型在地理公平性上的表现,发现模型在不同地区和文化群体中具有相对均匀的地理相关视觉知识,表明其在全球应用中的潜力。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12945 2026-01-27 cs.CL cs.CV 79%

LLMPopcorn: Exploring LLMs as Assistants for Popular Micro-video Generation

LLMPopcorn:探索大型语言模型作为流行微视频生成助手

Junchen Fu, Xuri Ge, Kaiwen Zheng, Alexandros Karatzoglou, Ioannis Arapakis, Xin Xin, Yongxin Ni, Joemon M. Jose

机构 * University of Glasgow(格拉斯哥大学) Shandong University(山东大学) Amazon(亚马逊) Telefónica Research(Telefónica研究院) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LLMPopcorn利用大型语言模型生成流行微视频,通过实验证明先进LLM可生成高流行度内容,并优化生成效果。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17067 2026-01-27 cs.CV cs.AI 79%

A Mechanistic View on Video Generation as World Models: State and Dynamics

视频生成作为世界模型的机制视角:状态与动态

Luozhou Wang, Zhifei Chen, Yihua Du, Dongyu Yan, Wenhang Ge, Guibao Shen, Xinli Xu, Leyi Wu, Man Chen, Tianshuo Xu, Peiran Ren, Xin Tao, Pengfei Wan, Ying-Cong Chen

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港理工大学(广州)) Tongji University(同济大学) Kuaishou Technology(快手科技)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出基于状态构建和动态建模的视频生成新分类法,旨在提升视频生成模型的物理持续性和因果推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08487 2026-01-27 cs.CV cs.AI cs.MA 61%

MAViS: A Multi-Agent Framework for Long-Sequence Video Storytelling

MAViS:一个用于长序列视频叙事的多智能体框架

Qian Wang, Ziqi Huang, Ruoxi Jia, Paul Debevec, Ning Yu

机构 * Virginia Tech(弗吉尼亚理工大学) Nanyang Technological University(南洋理工大学) Eyeline Studios(Eyeline工作室)

专题命中 视频生成 :video generation(abstract,comments);分类 cs.CV

AI总结 MAViS通过多智能体协作框架提升长序列视频生成的辅助能力、视觉质量和表达性,支持多模态输出。

Comments Video Generation Agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16522 2026-01-27 cs.CV 57%

Adams Bashforth Moulton Solver for Inversion and Editing in Rectified Flow

Adams-Bashforth-Moulton 解决方案用于 rectified 流中的反向和编辑

Yongjia Ma, Donglin Di, Xuan Liu, Xiaokai Chen, Lei Fan, Tonghua Su, Yue Gao

机构 * Li Auto(利亚 Auto) Harbin Institute of Technology(哈尔滨工业大学) University of New South Wales(新南威尔士大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出ABM求解器,通过多步预测校正和自适应步长调整提升rectified流模型的求解精度和编辑质量,无需额外训练。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20655 2026-01-27 cs.CV 57%

Photography Perspective Composition: Towards Aesthetic Perspective Recommendation

摄影视角构图:迈向审美视角推荐

Lujian Yao, Siming Zheng, Xinbin Yuan, Zhuoxuan Cai, Pu Wu, Jinwei Chen, Bo Li, Peng-Tao Jiang

机构 * vivo Mobile Communication Co., Ltd(vivo移动通信有限公司)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 本文提出摄影视角构图(PPC)方法,通过自动化数据集构建、视频生成和视角质量评估模型,解决视角变换数据稀缺和评估标准模糊的问题,帮助普通用户提升摄影构图能力。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏