arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2026-09-01 至 2026-09-01 共收录 10 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 10 篇

2608.30194 2026-09-01 cs.CV 新提交 88%

NoisEasier: Test-Time Noise Optimization for Text-to-Video Generation

NoisEasier:用于文本到视频生成的测试时噪声优化

Yujiang Pu, Yu Kong

机构 * Michigan State University(密歇根州立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 本研究提出NoisEasier框架,通过测试时噪声优化提升文本到视频生成的组合对齐效果,在多数据集实验中取得超10%平均增益,为可控文本到视频生成提供有效新范式。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31106 2026-09-01 cs.CV cs.SD 新提交 79%

DreamX-Creator: Democratizing Native Audio-Video Generation at 2K Resolution

DreamX-Creator:实现2K分辨率原生音视频生成的民主化

Jiashu Zhu, Yanhao Zheng, Ruitian Tian, Rujing Dang, Shen Zhang, Bingze Song, Jiachen Lei, Ruimin Lin, Jiahong Wu, Xiangxiang Chu

机构 * Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamX-Creator 1.0是基于7B生成器的紧凑原生联合音视频生成系统,通过多阶段训练与2K细化流水线实现2K分辨率同步音视频生成,性能达开源先进水平,旨在推动该领域研究民主化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29621 2026-09-01 cs.CV cs.AI 新提交 79%

CineForge: Self-Improving Agents for Long-Horizon Video Generation

CineForge:用于长时序视频生成的自改进智能体

Junxiang Liu, Lin Wang, Haiyu Shi, Hongxu Ma, Xiaoyu Yang, Chunjie Chen, Xiaoxiao Xu, Kaiqiao Zhan, Boao Wang, Shuizhou Shi, Tianyun Zhu, Jie Li, Jiangtong Li

机构 * Tongji University(同济大学) Kuaishou Technology(快手科技) Fudan University(复旦大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本研究提出CineForge框架,结合CineForge-Produce与CineForge-Evolve,通过CPPE策略演进机制提升长时序故事驱动视频生成效果,在CineScope指标及基准测试中表现优于现有方法,减少了审查LLM调用量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28694 2026-09-01 cs.CV 新提交 79%

SNF-Bench: Separating Static Drift from Natural Flow in Long-Horizon Fixed-Camera Video Generation

SNF-Bench:分离长视野固定相机视频生成中的静态漂移与自然流动

Matiur Rahman Minar, Seunghun Oh, Ganghyeon Jeong, Unsang Park

机构 * Sogang University(西江大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 SNF-Bench 是针对长视野固定相机视频生成的评估框架,可分离静态漂移与自然流动,实验发现全帧运动与静态区域漂移对输出排序几乎相反,其指标能针对性评估对应因素。

Comments Project page: https://minar09.github.io/snfbench/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15281 2026-09-01 cs.CV 版本更新 79%

StableWorld: Towards Stable and Consistent Long Interactive Video Generation

StableWorld: 向稳定和一致的长交互视频生成迈进

Ying Yang, Zhengyao Lv, Yujia Zeng, Tianlin Pan, Haofan Wang, Yueming Lyu, Binxin Yang, Hubery Yin, Chen Li, Jing Lyu, Ziwei Liu, Chenyang Si

机构 * PRLab, NJU(南京大学PRLab) HKU(香港大学) UCAS(中国科学技术大学) WeChat, Tencent Inc.(腾讯公司) NTU(国立清华大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 StableWorld通过动态帧淘汰机制提升长交互视频生成的稳定性和时间一致性,适用于多种生成框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29123 2026-09-01 cs.CV 新提交 74%

Dancing Stick Figures: An Introductory Dataset for Training Video Generation Models

跳舞的简笔画人物:用于训练视频生成模型的入门级数据集

Jin Hyuk Cho

机构 * Sprited(斯普里特公司) Dataset(数据集机构)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 本文针对视频生成模型训练的反馈循环长、数据难获取、评分粗糙三大痛点,构建了跳舞的简笔画人物数据集,该数据集规模适配单GPU训练,提供低预算训练流程,且含丰富标注以支持精准评估。

Comments 9 pages, 4 figures. Dataset, code, reference models, and Colab notebook are linked from the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13392 2026-09-01 cs.CV 版本更新 74%

A Study of the Design Space of Motion and Disocclusion Control in Video Generation

超越可见范围:通过代理动态图实现的遮挡感知编辑

Anran Qi, Changjian Li, Adrien Bousseau, Niloy J. Mitra

机构 * Inria - Université Côte d’Azur(法国国家信息与自动化技术研究院-埃克塞特大学) University of Edinburgh(爱丁堡大学) Adobe Research(Adobe研究部) UCL(伦敦大学学院)

专题命中 视频生成 :video generation(title);分类 cs.CV

AI总结 通过代理动态图实现遮挡感知编辑,结合运动规范与外观合成,实现可控的图像到视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14088 2026-09-01 cs.CV 版本更新 70%

VideoRAE: Taming Video Foundation Models for Generative Modeling via Representation Autoencoders

VideoRAE:通过表示自动编码器驯服用于生成建模的视频基础模型

Zhihao Xie, Junfeng Wu, Xinting Hu, Junchao Huang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huazhong University of Science and Technology(华中科技大学) Shenzhen Loop Area Institute(深圳河套学院) University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(abstract);text-to-video(abstract);分类 cs.CV

AI总结 研究视频生成模型潜在空间问题,提出VideoRAE,利用冻结视频基础编码器特征经1D自注意力投影仪压缩,支持多种潜在空间,通过多码本高维量化等实现强大重建,收敛快,验证了冻结VFM表示的有效性。

Comments Home page: https://zhxie0117.github.io/VideoRAE

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29469 2026-09-01 physics.optics 新提交 50%

Artificial Intelligence in a Photonic Temporal Processor

光子时间处理器中的人工智能

Youlve Chen, Jinlong Xiang, Yimin Hu, Yuchen Yin, Chaojun Xu, Zhengshun Lei, Xin Wang, Yufeng Zhang, Yixiao Zhu, Qunbi Zhuge, Junwen Zhang, Wei Chu, Tao Lin, Yikai Su, Zhipei Sun, Xuhan Guo

专题命中 视频生成 :video generation(abstract)

AI总结 该研究提出光子时间处理器,通过时空对偶性实现可扩展的光学神经网络,完成分类、图像视频生成等任务,性能优于现有系统,为下一代机器智能提供了新途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21385 2026-09-01 cs.HC 版本更新 50%

Beyond Reconstruction: What EEG-to-Video Decoding Actually Recovers

超越重建:脑电信号到视频解码究竟能恢复什么

Prajwal Singh, Anupam Sharma, Pankaj Pandey, Krishna Miyapuram, Shanmuganathan Raman

专题命中 视频生成 :video generation(abstract)

AI总结 本研究提出EEGVid框架用于脑电到动态视频的解码,发现脑电含视觉与情绪结构,当前重建仅反映粗粒度刺激级信息,三元组学习可优化脑电特征,生成器会主动利用脑电作为内容信号。

详情

展开后加载摘要…

URL PDF HTML 收藏