arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

2025-12-09 至 2025-12-09 共收录 9 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 9 篇

2512.07328 2025-12-09 cs.CV cs.AI 88%

ContextAnyone: Context-Aware Diffusion for Character-Consistent Text-to-Video Generation

ContextAnyone: 基于上下文的扩散模型用于一致的文本到视频生成

Ziyang Mai, Yu-Wing Tai

机构 * Dartmouth College(达特茅斯学院)

专题命中 视频生成 :video generation(title,abstract);text-to-video(title,abstract);分类 cs.CV

AI总结 ContextAnyone通过上下文感知扩散模型实现从文本和参考图像生成一致的角色视频,结合双引导损失和Gap-RoPE位置嵌入提升视觉质量和身份一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07831 2025-12-09 cs.CV 79%

UnityVideo: Unified Multi-Modal Multi-Task Learning for Enhancing World-Aware Video Generation

UnityVideo: 一体化多模态多任务学习以增强世界感知视频生成

Jiehui Huang, Yuechen Zhang, Xu He, Yuan Gao, Zhi Cen, Bin Xia, Yan Zhou, Xin Tao, Pengfei Wan, Jiaya Jia

机构 * HKUST(香港科技大学) CUHK(香港中文大学) Tsinghua University(清华大学) Kling Team, Kuaishou Technology(快手科技 Kling 团队)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 UnityVideo通过一体化多模态多任务学习提升视频生成的世界感知能力,引入动态噪声化和模态切换器,实现更全面的世界知识表示。

Comments Project Website https://jackailab.github.io/Projects/UnityVideo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07821 2025-12-09 cs.CV cs.AI 79%

WorldReel: 4D Video Generation with Consistent Geometry and Motion Modeling

WorldReel:基于一致几何和运动建模的4D视频生成

Shaoheng Fang, Hanwen Jiang, Yunpeng Bai, Niloy J. Mitra, Qixing Huang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Adobe Research(Adobe研究) University College London(伦敦大学学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WorldReel通过联合生成RGB帧和4D场景表示,实现了动态场景和移动摄像机下的4D一致视频生成,提升了几何一致性与运动一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07802 2025-12-09 cs.CV 79%

OneStory: Coherent Multi-Shot Video Generation with Adaptive Memory

OneStory: 通过自适应记忆实现连贯的多镜头视频生成

Zhaochong An, Menglin Jia, Haonan Qiu, Zijian Zhou, Xiaoke Huang, Zhiheng Liu, Weiming Ren, Kumara Kahatapitiya, Ding Liu, Sen He, Chenyang Zhang, Tao Xiang, Fanny Yang, Serge Belongie, Tian Xie

机构 * University of Copenhagen(哥本哈根大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 OneStory通过自适应记忆实现多镜头视频生成,提升叙事连贯性和生成质量。

Comments Project Page: https://zhaochongan.github.io/projects/OneStory

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06905 2025-12-09 cs.CV 79%

Scaling Zero-Shot Reference-to-Video Generation

缩放零样本参考到视频生成

Zijian Zhou, Shikun Liu, Haozhe Liu, Haonan Qiu, Zhaochong An, Weiming Ren, Zhiheng Liu, Xiaoke Huang, Kam Woh Ng, Tian Xie, Xiao Han, Yuren Cong, Hang Li, Chuyan Zhu, Aditya Patel, Tao Xiang, Sen He

机构 * Meta AI King's College London

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 Saber通过零样本框架实现高效参考到视频生成,无需显式数据,通过掩码训练和注意力模型提升泛化能力。

Comments Website: https://franciszzj.github.io/Saber/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06963 2025-12-09 cs.RO cs.AI cs.CV 57%

VideoVLA: Video Generators Can Be Generalizable Robot Manipulators

VideoVLA: 视频生成器可以成为通用的机器人操作器

Yichao Shen, Fangyun Wei, Zhiying Du, Yaobo Liang, Yan Lu, Jiaolong Yang, Nanning Zheng, Baining Guo

机构 * IAIR, Xi’an Jiaotong University(人工智能研究院、西安交通大学) Microsoft Research Asia(微软亚洲研究院) Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 VideoVLA通过将视频生成模型转化为机器人VLA操作器,实现了动作与视觉后果的双预测,提升机器人操作的泛化能力。

Comments Project page: https://videovla-nips2025.github.io

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems(NeurIPS2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06674 2025-12-09 cs.CV 57%

RunawayEvil: Jailbreaking the Image-to-Video Generative Models

RunawayEvil: 对图像到视频生成模型的劫持

Songping Wang, Rufan Qian, Yueming Lyu, Qinglong Liu, Linzhuang Zou, Jie Qin, Songhua Liu, Caifeng Shan

机构 * PRLab, Nanjing University(南京大学PRLab) Meituan(美团) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 RunawayEvil是一种针对图像到视频生成模型的多模态劫持框架,通过自我进化机制实现动态攻击策略,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06022 2025-12-09 cs.SD cs.MM 57%

DreamFoley: Scalable VLMs for High-Fidelity Video-to-Audio Generation

DreamFoley: 用于高保真视频到音频生成的可扩展视觉-语言模型

Fu Li, Weichao Zhao, You Li, Zhichao Zhou, Dongliang He

机构 * Bytedance Intelligent Creation Lab(字节跳动智能创作实验室) Zhejiang University(浙江大学)

专题命中 视频生成 :video generation(abstract);分类 cs.MM

AI总结 DreamFoley通过结合视觉-语言模型,提出了一种可扩展的视频到音频生成方法,实现了高保真音频生成并优化了训练效率与质量的平衡。

Comments 10 pages; Bytedance

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05969 2025-12-09 cs.CV cs.AI 57%

Video Models Start to Solve Chess, Maze, Sudoku, Mental Rotation, and Raven' Matrices

视频模型开始解决国际象棋、迷宫、数独、心理旋转和雷文矩阵任务

Hokin Deng

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :video generation(abstract);分类 cs.CV

AI总结 视频模型通过强化学习提升推理能力,在多项任务上达到60%的成功率。

Comments See $\href{https://grow-ai-like-a-child.com/video-reason/}{results}$ and $\href{https://github.com/hokindeng/VMEvalKit}{code}$

详情

展开后加载摘要…

URL PDF HTML 收藏