arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2148 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2148 篇

2605.01725 2026-05-15 cs.CV cs.AI 83%

Motion-Aware Caching for Efficient Autoregressive Video Generation

面向运动的缓存机制用于高效的自回归视频生成

Jing Xu, Yuexiao Ma, Xuzhe Zheng, Xing Wang, Shiwei Liu, Chenqian Yan, Xiawu Zheng, Rongrong Ji, Fei Chao, Songwei Liu

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(多媒体可信感知与高效计算重点实验室,中国教育部,厦门大学) Max Planck Institute for Intelligent Systems(智能系统马克斯·普朗克研究所) ELLIS Institute Tübingen(图宾根ELLIS研究所) Tübingen AI Center(图宾根人工智能中心)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出MotionCache,通过利用帧间差异作为轻量级像素运动特征代理,优化自回归视频生成中的缓存重用策略,实现6.28倍和1.64倍的速度提升,同时保持生成质量。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06892 2026-05-11 cs.CV 83%

Not All Tokens Need 40 Steps: Heterogeneous Step Allocation in Diffusion Transformers for Efficient Video Generation

并非所有标记都需要40步:扩散变换器中的异质步分配用于高效视频生成

Ernie Chu, Vishal M. Patel

机构 * Johns Hopkins University(约翰霍普金斯大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出HSA算法,通过根据速度动态分配不同时间空间标记的步数预算,提升视频生成效率,实验表明在加速运行时表现优于现有方法。

Comments Project page: https://ernestchu.github.io/hsa

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06667 2026-05-08 cs.CV cs.AI cs.LG 83%

ActCam: Zero-Shot Joint Camera and 3D Motion Control for Video Generation

ActCam: 零样本联合摄像机和3D运动控制用于视频生成

Omar El Khalifi, Thomas Rossi, Oscar Fossey, Thibault Fouque, Ulysse Mizrahi, Philip Torr, Ivan Laptev, Fabio Pizzati, Baptiste Bellot-Gurlet

机构 * University of Oxford(牛津大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 ActCam通过零样本方法实现视频生成中演员动作与摄像机轨迹的联合控制,通过几何一致的条件生成提升摄像机适应性和动作真实性。

Comments SIGGRAPH 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.00658 2026-05-04 cs.CV 83%

UniVidX: A Unified Multimodal Framework for Versatile Video Generation via Diffusion Priors

UniVidX:一种基于扩散先验的统一多模态框架,用于 versatile 视频生成

Houyuan Chen, Hong Li, Xianghao Kong, Tianrui Zhu, Shaocong Xu, Weiqing Xiao, Yuwei Guo, Chongjie Ye, Lvmin Zhang, Hao Zhao, Anyi Rao

机构 * Beihang University(北京航空航天大学) Nanjing University(南京大学) Stanford University(斯坦福大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 UniVidX 提出一种统一多模态框架,通过扩散先验实现 versatile 视频生成,采用随机条件掩码、解耦门控LoRA和跨模态自注意力等设计,提升多模态一致性与生成性能。

Comments Project page: https://houyuanchen111.github.io/UniVidX.github.io/ Accepted to ACM Transactions on Graphics (Proceedings of SIGGRAPH 2026)

Journal ref ACM Trans. Graph. 45, 4, Article 51 (July 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21362 2026-04-24 cs.CV 83%

KD-CVG: A Knowledge-Driven Approach for Creative Video Generation

KD-CVG:一种基于知识的创意视频生成方法

Linkai Liu, Wei Feng, Xi Zhao, Shen Zhang, Xingye Chen, Zheng Zhang, Jingjing Lv, Junjie Shen, Ching Law, Yuchen Zhou, Zipeng Guo, Chao Gou

机构 * Sun Yat-sen University(中山大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出KD-CVG方法,通过构建广告创意知识库解决文本到视频模型在语义对齐和运动适应性方面的不足,提升创意视频生成效果。

Comments Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19720 2026-04-22 cs.CV 83%

ReImagine: Rethinking Controllable High-Quality Human Video Generation via Image-First Synthesis

ReImagine:重新思考通过图像优先合成实现可控高质量人类视频生成

Zhengwentai Sun, Keru Zheng, Chenghong Li, Hongjie Liao, Xihe Yang, Heyuan Li, Yihao Zhi, Shuliang Ning, Shuguang Cui, Xiaoguang Han

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)科学与工程学院) Future Network of Intelligence Institute, CUHK-Shenzhen, China(CUHK-深圳智能网络研究院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出通过图像优先合成方法,结合预训练图像模型与SMPL-X运动引导,生成高质量且时间一致的视频,同时释放人类数据集与辅助模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19473 2026-04-22 cs.CV 83%

TS-Attn: Temporal-wise Separable Attention for Multi-Event Video Generation

TS-Attn:多事件视频生成的时序可分离注意力

Hongyu Zhang, Yufan Deng, Zilin Pan, Peng-Tao Jiang, Bo Li, Qibin Hou, Zhiyang Dou, Zhen Dong, Daquan Zhou

机构 * Peking University(北京大学) Shenzhen Graduate School(深圳研究生院) Zhejiang University(浙江大学) Nankai University(南开大学) Massachusetts Institute of Technology(麻省理工学院) Nanjing University(南京大学) University of California, Santa Barbara(加州大学圣巴巴拉分校)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出TS-Attn机制,解决多事件视频生成中时序不一致与注意力冲突问题,提升生成质量,实验表明在两个数据集上效果显著。

Comments ICLR 2026, code available at: https://github.com/Hong-yu-Zhang/TS-Attn

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17397 2026-04-21 cs.CV cs.AI 83%

Speculative Decoding for Autoregressive Video Generation

推测解码用于自回归视频生成

Yuezhou Hu, Jintao Zhang

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文探讨了推测解码在自回归视频生成中的应用,通过引入SDVG框架,利用图像质量路由替代token验证,实现高效视频生成,同时保持高质量并提升生成速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09721 2026-04-21 cs.CV 83%

FrameDiT: Diffusion Transformer with Matrix Attention for Efficient Video Generation

FrameDiT:基于矩阵注意力的扩散变换器用于高效视频生成

Minh Khoa Le, Kien Do, Duc Thanh Nguyen, Truyen Tran

机构 * Applied Artificial Intelligence Initiative, Deakin University, Australia(德肯大学应用人工智能倡议,澳大利亚) FPT Smart Cloud, Vietnam(越南FPT智能云) Deakin University, Australia(德肯大学,澳大利亚)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Matrix Attention,通过将帧视为矩阵来处理视频生成中的时空动态,结合FrameDiT-G和FrameDiT-H模型,在保持效率的同时提升了视频质量和时间一致性。

Comments Code: https://github.com/minhkhoale/FrameDiT Accepted at CVPR 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12219 2026-04-15 cs.CV cs.AI 83%

Ride the Wave: Precision-Allocated Sparse Attention for Smooth Video Generation

乘风而行:面向平滑视频生成的精确分配稀疏注意力

Wentai Zhang, Ronghui Xi, Shiyao Peng, Jiayu Huang, Haoran Luo, Zichen Tang, Haihong E

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Nanyang Technological University(南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出PASA框架,通过动态预算分配、硬件对齐分组近似和随机选择偏置,实现高效且时间平滑的视频生成,减少视觉闪烁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10030 2026-04-14 cs.CV 83%

Prompt Relay: Inference-Time Temporal Control for Multi-Event Video Generation

提示中继:多事件视频生成的推理时时间控制

Gordon Chen, Ziqi Huang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S-Lab)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Prompt Relay方法,通过在交叉注意力机制中引入惩罚项,实现多事件视频生成中的细粒度时间控制,提升文本-视频对齐和视觉质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09201 2026-04-13 cs.CV 83%

CT-1: Vision-Language-Camera Models Transfer Spatial Reasoning Knowledge to Camera-Controllable Video Generation

CT-1:视觉-语言-相机模型将空间推理知识转移到相机可控的视频生成

Haoyu Zhao, Zihao Zhang, Jiaxi Gu, Haoran Chen, Qingping Zheng, Pin Tang, Yeyin Jin, Yuang Zhang, Junqi Cheng, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯) Xiamen University(厦门大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出CT-1模型,通过准确估计相机轨迹将空间推理知识转移到视频生成中,利用小波正则化损失和视频扩散模型提升相机控制精度,实验显示其生成的视频质量高且控制准确率提升25.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07966 2026-04-10 cs.CV 83%

Lighting-grounded Video Generation with Renderer-based Agent Reasoning

基于渲染的视频生成与基于代理的推理

Ziqi Cai, Taoyu Yang, Zheng Chang, Si Li, Han Jiang, Shuchen Weng, Boxin Shi

机构 * State Key Laboratory for Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) National Engineering Research Center of Visual Technology, School of Computer Science, Peking University(北京大学计算机学院国家视觉技术工程研究中心) Beijing Academy of Artificial Intelligence(北京智源人工智能研究院) OpenBayes Information Technology Co., Ltd.(北京开贝信息技术有限公司) School of Artificial Intelligence, Beijing University of Posts and Telecommunications(北京邮电大学人工智能学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出LiVER框架,通过显式3D场景属性条件生成可控视频,结合轻量条件模块和渐进训练策略,实现高保真和精确控制,适用于图像到视频和视频到视频的合成。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07402 2026-04-10 cs.LG eess.IV 83%

Accelerating Training of Autoregressive Video Generation Models via Local Optimization with Representation Continuity

通过局部优化与表征连续性加速自回归视频生成模型训练

Yucheng Zhou, Jianbing Shen

机构 * SKL-IOTSC, CIS, University of Macau(澳门大学智慧城市物联网国家重点实验室及计算机与信息科学系)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 eess.IV

AI总结 本文提出局部优化与表征连续性方法,通过减少误差传播和提升生成视频一致性,使自回归视频生成模型训练效率提升一倍而不牺牲质量。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09646 2026-04-09 cs.CV 83%

VHOI: Controllable Video Generation of Human-Object Interactions from Sparse Trajectories via Motion Densification

VHOI:通过运动稠密化从稀疏轨迹生成可控的人-物交互视频

Wanyue Zhang, Lin Geng Foo, Thabo Beeler, Rishabh Dabral, Christian Theobalt

机构 * MPI for Informatics, SIC(马克斯·普朗克信息学研究所,SIC) VIA Center(VIA中心) Google(谷歌)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 VHOI通过运动稠密化将稀疏轨迹转化为HOI掩码序列,再通过视频扩散模型生成可控的人-物交互视频,提出了一种新颖的HOI-aware运动表示,增强了模型对真实交互动态的理解与生成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05961 2026-04-08 cs.CV 83%

HumANDiff: Articulated Noise Diffusion for Motion-Consistent Human Video Generation

HumANDiff: 关节化噪声扩散用于运动一致的人体视频生成

Tao Hu, Varun Jampani

机构 * Stability AI

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 HumANDiff通过关节化噪声采样、联合外观-运动学习和几何运动一致性学习,实现高保真人体视频生成,支持多样化的服装风格。

Comments Project page: https://taohuumd.github.io/projects/HumANDiff/

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16804 2026-04-03 cs.CV 83%

InTraGen: Trajectory-controlled Video Generation for Object Interactions

InTraGen:基于轨迹的视频生成用于物体交互

Zuhao Liu, Aleksandar Yanev, Ahmad Mahmood, Ivan Nikolov, Saman Motamed, Wei-Shi Zheng, Xi Wang, Lei Sun, Luc Van Gool, Danda Pani Paudel

机构 * ETH Zurich(苏黎世联邦理工学院) Sun Yat-sen University(中山大学) Aalborg University(奥尔堡大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出InTraGen,通过引入四个新数据集和轨迹质量度量指标,改进多物体交互场景的轨迹引导视频生成,提升视觉真实性和定量性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21507 2026-04-01 cs.CV 83%

SVBench: Evaluation of Video Generation Models on Social Reasoning

SVBench:视频生成模型在社会推理中的评估

Wenshuo Peng, Gongxuan Wang, Tianmeng Yang, Chuanhao Li, Xiaojie Xu, Hui He, Kaipeng Zhang

机构 * Tsinghua University(清华大学) Shanda AI Research Tokyo(盛大人工智能研究院东京) Shanghai AI Lab(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Peking University(北京大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出SVBench基准,用于评估视频生成模型在社会推理能力上的不足,通过七大核心维度和免训练流程,评估七种先进模型,揭示表面合理性与深层社会推理能力间的差距。

Comments 10pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28353 2026-03-31 cs.CV 83%

VistaGEN: Consistent Driving Video Generation with Fine-Grained Control Using Multiview Visual-Language Reasoning

VistaGEN: 通过多视角视觉语言推理实现一致的驾驶视频生成与细粒度控制

Li-Heng Chen, Ke Cheng, Yahui Liu, Lei Shi, Shi-Sheng Huang, Hongbo Fu

机构 * Hong Kong University of Science and Technology(香港科技大学) Meituan, Inc.(美团) Beijing Normal University(北京师范大学)

专题命中 视频生成 :video generation(title,abstract);long video(abstract);分类 cs.CV

AI总结 本文提出VistaGEN,通过多视角视觉语言推理实现驾驶视频生成的细粒度控制与时空一致性,引入多视角视觉语言评估器和对象级细化模块,提升长视频生成质量与一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27866 2026-03-31 cs.CV 83%

Wan-R1: Verifiable-Reinforcement Learning for Video Reasoning

Wan-R1: 可验证强化学习用于视频推理

Ming Liu, Yunbei Zhang, Shilong Liu, Liwen Wang, Wensheng Zhang

机构 * Iowa State University(爱荷华州立大学) Tulane University(杜兰大学) Princeton University(普林斯顿大学)

专题命中 视频生成 :video reasoning(title,abstract);video generation(abstract);分类 cs.CV

AI总结 本文提出可验证奖励设计以提升视频推理的泛化能力,通过改进GRPO算法在流基视频模型中训练,验证奖励在复杂迷宫和机器人导航任务中显著提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09094 2026-03-31 cs.CV 83%

Chain of Event-Centric Causal Thought for Physically Plausible Video Generation

基于事件中心因果推理的物理合理视频生成

Zixuan Wang, Yixin Hu, Haolan Wang, Feng Chen, Yan Liu, Wen Li, Yinjie Lei

机构 * Sichuan University(四川大学) The University of Adelaide(阿德莱德大学) Hong Kong Polytechnic University(香港理工大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出基于事件链的因果推理和跨模态提示模块,用于生成物理合理视频,通过物理公式约束和时间对齐提示提升视频生成的因果连贯性与物理合理性。

Comments Accepted by CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14255 2026-03-31 cs.CV 83%

Identity-Preserving Image-to-Video Generation via Reward-Guided Optimization

通过奖励引导优化实现身份保持的图像到视频生成

Liao Shen, Wentao Jiang, Yiran Zhu, Jiahe Li, Tiezheng Ge, Zhiguo Cao, Bo Zheng

机构 * Huazhong University of Science and Technology(华中科技大学) Taobao & Tmall Group of Alibaba(阿里巴巴淘宝天猫集团) Alibaba Group(阿里巴巴集团)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出IPRO框架,通过强化学习优化扩散模型,提升身份一致性。引入面部评分机制和KL散度正则化,改进性能并加速收敛。

Comments accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27520 2026-03-31 cs.CV 83%

TokenDial: Continuous Attribute Control in Text-to-Video via Spatiotemporal Token Offsets

TokenDial: 通过时空token偏移实现文本到视频的连续属性控制

Zhixuan Liu, Peter Schaldenbrand, Yijun Li, Long Mai, Aniruddha Mahapatra, Cusuh Ham, Jean Oh, Jui-Hsien Wang

机构 * Adobe Research(Adobe研究院) Carnegie Mellon University(卡内基梅隆大学)

专题命中 视频生成 :text-to-video(title,abstract);video generation(abstract);分类 cs.CV

AI总结 TokenDial通过在中间时空视觉patch-token空间中添加偏移实现文本到视频生成模型的连续属性控制,通过调整偏移量实现外观和运动动态的可预测编辑,优于现有基线。

Comments Project page: https://tokendial.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25746 2026-03-27 cs.CV 83%

ShotStream: Streaming Multi-Shot Video Generation for Interactive Storytelling

ShotStream: 流式多镜头视频生成用于交互式叙事

Yawen Luo, Xiaoyu Shi, Junhao Zhuang, Yutian Chen, Quande Liu, Xintao Wang, Pengfei Wan, Tianfan Xue

机构 * MMLab, CUHK(MMLab,香港中文大学) Kuaishou Technology(快手科技) CPII under InnoHK(香港创科旗下CPII)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出ShotStream,一种新型因果多镜头架构,通过流式提示实现动态交互叙事,解决传统方法交互性差和延迟高的问题,实验表明其生成视频在亚秒延迟下达到16FPS,质量不低于传统双向模型。

Comments Project Page: https://luo0207.github.io/ShotStream/ Code: https://github.com/KlingAIResearch/ShotStream

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24835 2026-03-27 cs.CV 83%

DCARL: A Divide-and-Conquer Framework for Autoregressive Long-Trajectory Video Generation

DCARL:一种用于自回归长轨迹视频生成的分而治之框架

Junyi Ouyang, Wenbin Teng, Gonglin Chen, Yajie Zhao, Haiwei Chen

机构 * Institute for Creative Technologies(创意技术研究所) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出DCARL框架,通过分而治之策略结合VDMs的高保真生成能力,解决长轨迹视频生成中的视觉漂移和可控性问题,实现高质量且稳定的生成。

Comments 29 pages, 11 figures. Project page: https://junyiouy.github.io/projects/dcarl

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24570 2026-03-26 cs.CV cs.AI 83%

Anti-I2V: Safeguarding your photos from malicious image-to-video generation

Anti-I2V: 保护您的照片免受恶意图像到视频生成的威胁

Duc Vu, Anh Nguyen, Chi Tran, Anh Tran

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 针对图像到视频扩散模型的恶意生成问题,Anti-I2V在L*a*b*和频域中操作,提升鲁棒性并聚焦显著像素,通过优化训练目标提升时间一致性与生成保真度,展现先进防御性能。

Comments Accepted to CVPR 2026 (Main Conference)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20192 2026-03-23 cs.CV cs.AI 83%

LumosX: Relate Any Identities with Their Attributes for Personalized Video Generation

LumosX:通过身份与属性的关系实现个性化视频生成

Jiazheng Xing, Fei Du, Hangjie Yuan, Pengwei Liu, Hongbin Xu, Hai Ci, Ruigang Niu, Weihua Chen, Fan Wang, Yong Liu

机构 * Zhejiang University(浙江大学) DAMO Academy, Alibaba Group(阿里云达摩院) Hupan Lab(虎斑实验室) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 LumosX通过结合身份与属性关系,提升多主体个性化视频生成的精细度和一致性,采用数据与模型双改进策略,构建了全面的基准测试平台。

Comments ICLR 2026 Camera Ready Version. Code and Models: https://jiazheng-xing.github.io/lumosx-home/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18600 2026-03-20 cs.CV 83%

Improving Joint Audio-Video Generation with Cross-Modal Context Learning

通过跨模态上下文学习提升联合音频视频生成

Bingqi Ma, Linlong Lang, Ming Zhang, Dailan He, Xingtong Ge, Yi Zhang, Guanglu Song, Yu Liu

机构 * Vivix Group Limited(维维克斯集团有限公司)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出跨模态上下文学习方法,解决双流Transformer生成中模态交互不一致、训练不稳定等问题,提升生成质量与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20649 2026-03-20 cs.CV 83%

Infinity-RoPE: Action-Controllable Infinite Video Generation Emerges From Autoregressive Self-Rollout

Infinity-RoPE: 自动回归自回滚中涌现的无限视频生成

Hidir Yesiltepe, Tuna Han Salih Meral, Adil Kaan Akan, Kaan Oktay, Pinar Yanardag

机构 * Virginia Tech(弗吉尼亚理工学院)

专题命中 视频生成 :video generation(title,abstract);video diffusion(abstract);分类 cs.CV

AI总结 本文提出Infinity-RoPE,通过Block-Relativistic RoPE、KV Flush和RoPE Cut三个组件解决自回归视频扩散模型的三个瓶颈,实现无限时域、可控和电影级视频生成。

Comments CVPR 2026 | Project Page: https://infinity-rope.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20629 2026-03-17 cs.CV cs.LG 83%

Unified Text-Image-to-Video Generation: A Training-Free Approach to Flexible Visual Conditioning

统一的文本-图像到视频生成:一种无训练的灵活视觉条件方法

Bolin Lai, Sangmin Lee, Xu Cao, Xiang Li, James M. Rehg

专题命中 视频生成 :video generation(title,abstract);text-to-video(abstract);分类 cs.CV

AI总结 本文提出无训练的FlexTI2V方法,通过局部图像块交换策略实现灵活的视觉条件,平衡创造力与保真度,验证其在文本-视频生成中的有效性。

Comments 27 pages, 10 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏