arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2604.09201 2026-04-13 cs.CV 83%

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV 83%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07402 2026-04-10 cs.LG eess.IV 83%

Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity

通过局部优化与表征连续性加速自回归视频生成模型训练

Yucheng Zhou, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 eess.IV

AI总结 本文提出局部优化与表征连续性方法,通过减少误差传播和提升生成视频一致性,使自回归视频生成模型训练效率提升一倍而不牺牲质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09646 2026-04-09 cs.CV 83%

VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification

VHOI:通过运动稠密化从稀疏轨迹生成可控的人-物交互视频

Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt

机构 * MPI for Informatics, SIC(马克斯·普朗克信息学研究所,SIC) VIA Center(VIA中心) Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 VHOI通过运动稠密化将稀疏轨迹转化为HOI掩码序列,再通过视频扩散模型生成可控的人-物交互视频,提出了一种新颖的HOI-aware运动表示,增强了模型对真实交互动态的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05961 2026-04-08 cs.CV 83%

HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation

HumANDiff: 关节化噪声扩散用于运动一致的人体视频生成

Tao Hu, Varun Jampani

机构 * Stability AI

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 HumANDiff通过关节化噪声采样、联合外观-运动学习和几何运动一致性学习,实现高保真人体视频生成,支持多样化的服装风格。

Comments Project page: https://taohuumd.github.io/projects/HumANDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16804 2026-04-03 cs.CV 83%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 83%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 83%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 83%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 83%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14255 2026-03-31 cs.CV 83%

Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

通过奖励引导优化实现身份保持的图像到视频生成

Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng

机构 * Huazhong University of Science and Technology(华中科技大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出IPRO框架,通过强化学习优化扩散模型,提升身份一致性。引入面部评分机制和KL散度正则化,改进性能并加速收敛。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27520 2026-03-31 cs.CV 83%

TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets

TokenDial: 通过时空token偏移实现文本到视频的连续属性控制

Zhixuan Liu, Peter Schaldenbrand, Yijun Li, Long Mai, Aniruddha Mahapatra, Cusuh Ham, Jean Oh, Jui-Hsien Wang

机构 * Adobe Research(Adobe研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 TokenDial通过在中间时空视觉patch-token空间中添加偏移实现文本到视频生成模型的连续属性控制,通过调整偏移量实现外观和运动动态的可预测编辑,优于现有基线。

Comments Project page: https://tokendial.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25746 2026-03-27 cs.CV 83%

ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling

ShotStream: 流式多镜头视频生成用于交互式叙事

Yawen Luo, Xiaoyu Shi, Junhao Zhuang, Yutian Chen, Quande Liu, Xintao Wang, Pengfei Wan, Tianfan Xue

机构 * MMLab, CUHK(MMLab,香港中文大学) Kuaishou Technology(快手科技) CPII under InnoHK(香港创科旗下CPII)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出ShotStream,一种新型因果多镜头架构,通过流式提示实现动态交互叙事,解决传统方法交互性差和延迟高的问题,实验表明其生成视频在亚秒延迟下达到16FPS,质量不低于传统双向模型。

Comments Project Page: https://luo0207.github.io/ShotStream/ Code: https://github.com/KlingAIResearch/ShotStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24835 2026-03-27 cs.CV 83%

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

DCARL:一种用于自回归长轨迹视频生成的分而治之框架

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出DCARL框架,通过分而治之策略结合VDMs的高保真生成能力,解决长轨迹视频生成中的视觉漂移和可控性问题,实现高质量且稳定的生成。

Comments 29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24570 2026-03-26 cs.CV cs.AI 83%

Anti-I2V: Safeguarding your photos from malicious image-to-video generation

Anti-I2V: 保护您的照片免受恶意图像到视频生成的威胁

Duc Vu, Anh Nguyen, Chi Tran, Anh Tran

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频扩散模型的恶意生成问题,Anti-I2V在L*a*b*和频域中操作,提升鲁棒性并聚焦显著像素,通过优化训练目标提升时间一致性与生成保真度,展现先进防御性能。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 83%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18600 2026-03-20 cs.CV 83%

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

通过跨模态上下文学习提升联合音频视频生成

Bingqi Ma, Linlong Lang, Ming Zhang, Dailan He, Xingtong Ge, Yi Zhang, Guanglu Song, Yu Liu

机构 * Vivix Group Limited(维维克斯集团有限公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出跨模态上下文学习方法,解决双流Transformer生成中模态交互不一致、训练不稳定等问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV 83%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20629 2026-03-17 cs.CV cs.LG 83%

Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning

统一的文本-图像到视频生成:一种无训练的灵活视觉条件方法

Bolin Lai, Sangmin Lee, Xu Cao, Xiang Li, James M. Rehg

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出无训练的FlexTI2V方法,通过局部图像块交换策略实现灵活的视觉条件,平衡创造力与保真度,验证其在文本-视频生成中的有效性。

Comments 27 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13770 2026-03-17 cs.CV 83%

PhysAlign: Physics-Coherent Image-to-Video Generation through Feature and 3D Representation Alignment

PhysAlign:通过特征和3D表示对齐实现物理一致的图像到视频生成

Zhexiao Xiong, Yizhi Song, Liu He, Wei Xiong, Yu Yuan, Feng Qiao, Nathan Jacobs

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 PhysAlign通过特征和3D表示对齐,解决图像到视频生成中的物理一致性问题,提升复杂物理推理和时间稳定性,同时保持零样本视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21145 2026-03-12 cs.CV 83%

TEAR: Temporal-aware Automated Red-teaming for Text-to-Video Models

TEAR:面向文本到视频模型的时序感知自动化红队测试

Jiaming He, Guanyu Hou, Hongwei Li, Zhicong Huang, Kangjie Chen, Yi Yu, Wenbo Jiang, Guowen Xu, Tianwei Zhang

机构 * University of Electronic Science and Technology of China(电子科学与技术大学) University of Manchester(曼彻斯特大学) Ant Group(蚂蚁集团) Nanyang Technological University(南洋理工大学) Jilin University(吉林大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 TEAR通过时序感知自动化红队测试框架,有效识别文本到视频模型中的安全风险,实验显示攻击成功率高达80%

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06408 2026-03-09 cs.CV cs.AI cs.GR 83%

Physical Simulator In-the-Loop Video Generation

物理模拟器闭环视频生成

Lin Geng Foo, Mark He Huang, Alexandros Lattas, Stylianos Moschoglou, Thabo Beeler, Christian Theobalt

机构 * Max Planck Institute for Informatics(马克斯·普朗克信息研究所) Singapore University of Technology and Design(新加坡科技设计大学) A*STAR(新加坡科技研究局) Google(谷歌) Saarbrücken Research Center for Visual Computing, Interaction and Artificial Intelligence(斯图加特视觉计算、交互与人工智能研究中心)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 PSIVG通过整合物理模拟器与扩散模型,生成符合物理规律的视频,提升生成视频的真实性和一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02049 2026-03-03 cs.CV 83%

WorldStereo: Bridging Camera-Guided Video Generation and Scene Reconstruction via 3D Geometric Memories

WorldStereo: 通过3D几何记忆桥接相机引导的视频生成与场景重建

Yisu Zhang, Chenjie Cao, Tengfei Wang, Xuhui Zuo, Junta Wu, Jianke Zhu, Chunchao Guo

机构 * Zhejiang University(浙江大学) Tencent Hunyuan(腾讯文心)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 WorldStereo通过3D几何记忆模块实现相机引导视频生成与3D场景重建的高效融合,提升多视角一致性与重建质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21188 2026-02-25 cs.CV 83%

Human Video Generation from a Single Image with 3D Pose and View Control

从单张图像生成人类视频:结合3D姿态和视角控制

Tiantian Wang, Chun-Han Yao, Tao Hu, Mallikarjun Byrasandra Ramalinga Reddy, Ming-Hsuan Yang, Varun Jampani

机构 * Electrical Engineering and Computer Science, University of California, Merced, CA 95343, United States.(电子工程与计算机科学系,加州大学默塞德分校) Stability AI, Los Angeles, CA 90067, United States.(Stability AI)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出HVG模型,通过3D姿态和视角控制从单张图像生成高质量多视角人类视频,解决了衣物褶皱和时空一致性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09609 2026-02-24 cs.CV 83%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08318 2026-02-24 cs.CV 83%

LinVideo: A Post-Training Framework towards O(n) Attention in Efficient Video Generation

LinVideo: 一种面向高效视频生成的O(n)注意力后训练框架

Yushi Huang, Xingtong Ge, Ruihao Gong, Chengtao Lv, Jun Zhang

机构 * Hong Kong University of Science and Technology(香港科技大学) Beihang University(北航) Sensetime Research(商汤科技研究院) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 LinVideo提出一种高效的无数据后训练框架,通过选择性迁移将部分自注意力模块替换为线性注意力,从而在保持性能的同时显著提升视频生成效率。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12271 2026-02-13 cs.CV cs.LG 83%

MonarchRT: Efficient Attention for Real-Time Video Generation

MonarchRT:实时视频生成中的高效注意力机制

Krish Agarwal, Zhuoming Chen, Cheng Luo, Yongqi Chen, Haizhong Zheng, Xun Huang, Atri Rudra, Beidi Chen

机构 * Carnegie Mellon University(卡内基梅隆大学) University at Buffalo(布法罗大学) Morpheus AI

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 MonarchRT通过结构化注意力参数化方法,实现高效实时视频生成,达到95%的注意力稀疏性,优于现有内核性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10113 2026-02-11 cs.CV 83%

ConsID-Gen: View-Consistent and Identity-Preserving Image-to-Video Generation

ConsID-Gen:视图一致且身份保持的图像到视频生成

Mingyang Wu, Ashirbad Mishra, Soumik Dey, Shuo Xing, Naveen Ravipati, Hansi Wu, Binbin Li, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯大学) eBay Inc.(eBay公司)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 ConsID-Gen通过视图辅助生成框架提升图像到视频生成的视图一致性和身份保持性。

Comments Project page: https://myangwu.github.io/ConsID-Gen

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08682 2026-02-11 cs.CV 83%

ALIVE: Animate Your World with Lifelike Audio-Video Generation

ALIVE: 用逼真音频视频生成动画你的世界

Ying Guo, Qijun Gan, Yifu Zhang, Jinlai Liu, Yifei Hu, Pan Xie, Dongjun Qian, Yu Zhang, Ruiqi Li, Yuqi Zhang, Ruibiao Lu, Xiaofeng Mei, Bo Han, Xiang Yin, Bingyue Peng, Zehuan Yuan

机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。

Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06959 2026-02-09 cs.CV 83%

CineScene: Implicit 3D as Effective Scene Representation for Cinematic Video Generation

CineScene:隐式3D作为电影视频生成的有效场景表示

Kaiyi Huang, Yukun Huang, Yu Li, Jianhong Bai, Xintao Wang, Zinan Lin, Xuefei Ning, Jiwen Yu, Pengfei Wan, Yu Wang, Xihui Liu

机构 * The University of Hong Kong(香港大学) Kling Team, Kuaishou Technology(快手技术 Kling 团队) Tsinghua University(清华大学) Zhejiang University(浙江大学) Microsoft Research Project Page(微软研究院项目页面)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 CineScene通过隐式3D场景表示实现电影视频生成,能生成动态主体且保持场景一致的高质量视频。

Comments Project website: https://karine-huang.github.io/CineScene/

详情

展开后加载摘要…

URL PDF HTML 收藏