arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6840 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2171 篇

2511.00511 2026-03-16 cs.CV 79%

ID-Crafter: VLM-Grounded Online RL for Compositional Multi-Subject Video Generation

ID-Crafter:基于视觉语言模型的在线强化学习多主体视频生成框架

Panwang Pan, Jingjing Zhao, Yuchen Lin, Chenguo Lin, Chenxin Li, Hengyu Liu, Tingting Shen, Yadong MU

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出ID-Crafter框架,通过层次化注意力机制、预训练视觉语言模型和在线强化学习,提升多主体视频生成中身份保持与语义一致性。

Comments Project page: https://angericky.github.io/ID-Crafter, Code: https://github.com/paulpanwang/IDCrafter

Journal ref CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00547 2026-03-16 cs.CV cs.AI 79%

Motion Dreamer: Boundary Conditional Motion Reasoning for Physically Coherent Video Generation

Motion Dreamer:基于物理一致视频生成的边界条件运动推理

Tianshuo Xu, Zhifei Chen, Leyi Wu, Hao Lu, Yuying Chen, Lihui Jiang, Bingbing Liu, Yingcong Chen

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出Motion Dreamer框架,通过分离运动推理与视觉合成,解决视频生成中边界条件运动推理的问题,提升运动合理性与视觉真实性。

Comments The authors have decided to withdraw this article due to the following reasons identified after publication: Experimental Errors: Significant inaccuracies were discovered in the experimental results concerning segmentation and depth estimation. Authorship Disputes: In addition to the technical issues, there are unresolved disagreements regarding the author sequence and contributions

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01685 2026-03-13 cs.CV 79%

FastLightGen: Fast and Light Video Generation with Fewer Steps and Parameters

FastLightGen: 用更少的步骤和参数实现快速轻量视频生成

Shitong Shao, Yufei Gu, Zeke Xie

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 FastLightGen通过同时压缩模型大小和推理步骤,实现快速轻量视频生成,实验表明其在受限预算下达到最优视觉质量并超越现有方法。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05927 2026-03-12 cs.CV cs.AI cs.RO 79%

World Models That Know When They Don't Know - Controllable Video Generation with Calibrated Uncertainty

能识别不确定性的世界模型 - 可控视频生成中的校准不确定性

Zhiting Mei, Tenny Yin, Micah Baker, Ola Shorinwa, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 提出C3方法,通过校准不确定性量化提升可控视频生成的可靠性与可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09883 2026-03-11 cs.CV 79%

DISPLAY: Directable Human-Object Interaction Video Generation via Sparse Motion Guidance and Multi-Task Auxiliary

DISPLAY:通过稀疏运动引导和多任务辅助实现可直接控制的人机交互视频生成

Jiazhi Guan, Quanwei Yang, Luying Huang, Junhao Liang, Borong Liang, Haocheng Feng, Wei He, Kaisiyuan Wang, Hang Zhou, Jingdong Wang

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DISPLAY通过稀疏运动引导和多任务辅助训练,实现高保真且可控的人机交互视频生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08850 2026-03-11 cs.CV 79%

HECTOR: Hybrid Editable Compositional Object References for Video Generation

HECTOR:混合可编辑组合对象引用用于视频生成

Guofeng Zhang, Angtian Wang, Jacob Zhiyuan Fang, Liming Jiang, Haotian Yang, Alan Yuille, Chongyang Ma

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 HECTOR通过混合可编辑组合对象引用,实现了视频生成中对复杂时空约束的高保真度满足和运动可控性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00586 2026-03-10 cs.CV 79%

WildActor: Unconstrained Identity-Preserving Video Generation

WildActor: 无约束身份保持视频生成

Qin Guo, Tianyu Yang, Xuanhua He, Fei Shen, Yong Zhang, Zhuoliang Kang, Xiaoming Wei, Dan Xu

机构 * The Hong Kong University of Science(香港科学与技术大学) National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 WildActor通过不对称注意力机制和视点自适应采样策略,在无约束视角下实现身份保持的人类视频生成。

Comments Project Page: https://wildactor.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07028 2026-03-10 cs.CR cs.CV 79%

Two Frames Matter: A Temporal Attack for Text-to-Video Model Jailbreaking

两个框架至关重要:一种针对文本到视频模型劫持的时序攻击

Moyang Chen, Zonghao Ying, Wenzhuo Xu, Quancheng Zou, Deyue Zhang, Dongdong Yang, Xiangzheng Zhang

机构 * College of Science, Mathematics and Technology, Wenzhou-Kean University(科学、数学与技术学院,温州市凯恩大学) State Key Laboratory of Complex & Critical Software Environment, Beihang University(复杂与关键软件环境国家重点实验室,北航) AI Security Lab(360人工智能安全实验室)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.CV

AI总结 本文提出TFM攻击方法,通过碎片化提示和隐式替换,提高文本到视频模型的劫持效果,显著提升攻击成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.12719 2026-03-10 cs.CV 79%

S2DiT: Sandwich Diffusion Transformer for Mobile Streaming Video Generation

S2DiT:用于移动流媒体视频生成的 Sandwich Diffusion Transformer

Lin Zhao, Yushu Wu, Aleksei Lebedev, Dishani Lahiri, Meng Dong, Arpit Sahni, Michael Vasilkovsky, Hao Chen, Ju Hu, Aliaksandr Siarohin, Sergey Tulyakov, Yanzhi Wang, Anil Kag, Yanyu Li

机构 * Snap Inc. Northeastern University(东北大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 S2DiT 通过高效注意力机制和 2-in-1 深度学习框架,在移动设备上实现高质量、高速度的流式视频生成。

Comments https://snap-research.github.io/S2DiT/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05449 2026-03-06 cs.CV cs.AI cs.GR 79%

RealWonder: Real-Time Physical Action-Conditioned Video Generation

RealWonder: 基于实时物理动作的视频生成

Wei Liu, Ziyu Chen, Zizhang Li, Yue Wang, Hong-Xing Yu, Jiajun Wu

机构 * Stanford University(斯坦福大学) University of Southern California(南加州大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 RealWonder通过物理模拟实现实时动作条件视频生成,利用3D重建、物理模拟和简化视频生成器,在单张图像基础上生成高质量视频,适用于多种物理场景。

Comments The first two authors contributed equally. The last two authors advised equally. Project website: https://liuwei283.github.io/RealWonder/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04291 2026-03-05 cs.CV cs.AI 79%

CubeComposer: Spatio-Temporal Autoregressive 4K 360° Video Generation from Perspective Video

CubeComposer: 从视角视频生成空间-时间自回归4K 360°视频

Lingen Li, Guangzhi Wang, Xiaoyu Li, Zhaoyang Zhang, Qi Dou, Jinwei Gu, Tianfan Xue, Ying Shan

机构 * The Chinese University of Hong Kong(香港中文大学) ARC Lab, Tencent PCG Project lead(腾讯PCG项目负责人)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 CubeComposer通过空间-时间自回归扩散模型实现4K分辨率360°视频生成,提升VR沉浸体验

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00976 2026-03-04 cs.CV 79%

PreciseCache: Precise Feature Caching for Efficient and High-fidelity Video Generation

PreciseCache: 用于高效且高保真的视频生成的精确特征缓存

Jiangshan Wang, Kang Zhao, Jiayi Guo, Jiayu Wang, Hang Guo, Chenyang Zhu, Xiu Li, Xiangyu Yue

机构 * MMLab, CUHK(香港中文大学MMLab) Tsinghua University(清华大学) Tongyi Lab, Alibaba(阿里巴巴通义实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 PreciseCache通过精确检测和跳过冗余计算,实现视频生成的高效且高质量推理。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00438 2026-03-04 cs.CV 79%

BindWeave: Subject-Consistent Video Generation via Cross-Modal Integration

BindWeave:通过跨模态整合实现主体一致的视频生成

Zhaoyang Li, Dongjun Qian, Kai Su, Qishuai Diao, Xiangyang Xia, Chang Liu, Wenfei Yang, Tianzhu Zhang, Zehuan Yuan

机构 * University of Science and Technology of China(中国科学技术大学) ByteDance(字节跳动) National Key Laboratory of Deep Space Exploration, Deep Space Exploration Laboratory(国家深空探测重点实验室,深空探测实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 BindWeave通过跨模态整合解决主体一致视频生成难题,利用MLLM-DiT框架提升生成视频的主体一致性和自然度。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20999 2026-03-03 cs.CV 79%

VII: Visual Instruction Injection for Jailbreaking Image-to-Video Generation Models

VII: 视觉指令注入用于劫持图像到视频生成模型

Bowen Zheng, Yongli Xiang, Ziming Hong, Zerong Lin, Chaojian Yu, Tongliang Liu, Xinge You

机构 * National Anti-Counterfeit Engineering Research Center, Huazhong University of Science and Technology(华中科技大学反伪工程研究中心) School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) Sydney AI Centre, The University of Sydney(悉尼大学AI中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 VII通过将恶意意图伪装为良性视觉指令,有效劫持图像到视频生成模型,实现高攻击成功率并降低拒绝率。

Comments Project page: https://Zbwwwwwwww.github.io/VII

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00466 2026-03-03 cs.CV 79%

DreamWorld: Unified World Modeling in Video Generation

DreamWorld: 视频生成中的统一世界建模

Boming Tan, Xiangdong Zhang, Ning Liao, Yuqing Zhang, Shaofeng Zhang, Xue Yang, Qi Fan, Yanyong Zhang

机构 * University of Science(科学技术大学) Shanghai Jiao Tong University, Shanghai, China.(上海交通大学) Nanjing University, Suzhou, China.(南京大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamWorld通过联合世界建模范式和约束退火技术,提升视频生成的世界一致性,优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22745 2026-03-02 cs.CV 79%

SPATIALALIGN: Aligning Dynamic Spatial Relationships in Video Generation

SPATIALALIGN: 视频生成中动态空间关系的对齐

Fengming Liu, Tat-Jen Cham, Chuanxia Zheng

机构 * College of Computing(计算学院) Data Science, Nanyang Technological University, 50 Nanyang Avenue, Singapore 639798(数据科学,南洋理工大学,50 Nanyang Avenue,新加坡639798)

专题命中 视频生成 :video generation(title);text-to-video(abstract);分类 cs.CV

AI总结 SPATIALALIGN通过引入DSR-SCORE和DPO方法,提升文本到视频生成中动态空间关系的对齐能力。

Comments Project page: https://fengming001ntu.github.io/SpatialAlign/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23203 2026-02-27 cs.CV cs.AI 79%

ColoDiff: Integrating Dynamic Consistency With Content Awareness for Colonoscopy Video Generation

ColoDiff:整合动态一致性与内容感知用于结肠镜视频生成

Junhu Fu, Shuyu Liang, Wutong Li, Chen Ma, Peng Huang, Kehao Wang, Ke Chen, Shengli Lin, Pinghong Zhou, Zeju Li, Yuanyuan Wang, Yi Guo

机构 * College of Biomedical Engineering, Fudan University(复旦大学生物医学工程学院) Fudan University Shanghai Cancer Center(复旦大学上海肿瘤中心) Endoscopy Center and Endoscopy Research Institute, Zhongshan Hospital, Fudan University(复旦大学中山医院内窥镜中心和内窥镜研究所) Shanghai Collaborative Innovation Center of Endoscopy(上海内窥镜协同创新中心)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ColoDiff通过整合动态一致性与内容感知,生成高质量的结肠镜视频,以缓解数据短缺并辅助临床分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21929 2026-02-26 cs.CV 79%

Geometry-as-context: Modulating Explicit 3D in Scene-consistent Video Generation to Geometry Context

几何作为上下文:调节显式3D以在场景一致视频生成中利用几何上下文

JiaKui Hu, Jialun Liu, Liying Yang, Xinliang Zhang, Kaiwen Li, Shuang Zeng, Yuanwei Li, Haibin Huang, Chi Zhang, Yanye Lu

机构 * Institute of Medical Technology, Peking University(北京大学医学技术学院) TeleAI MUST

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出几何作为上下文的方法,通过自回归模型迭代生成3D场景,提升视频生成的场景一致性和相机控制能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17404 2026-02-25 cs.CV 79%

MoSA: Motion-Coherent Human Video Generation via Structure-Appearance Decoupling

MoSA: 通过结构-外观解耦生成运动一致的人体视频

Haoyu Wang, Hao Tang, Donglin Di, Zhilu Zhang, Wangmeng Zuo, Feng Gao, Siwei Ma, Shiliang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(多媒体信息处理国家重点实验室,计算机学院,北京大学) School of Arts(艺术学院) Li Auto(力汽车) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 MoSA通过结构-外观解耦生成运动一致的人体视频,引入Human-Aware Dynamic Control模块和接触约束,提升细粒度控制与人-环境交互建模,实现更逼真的人体视频生成。

Comments Accepted by ICLR 2026. Project: https://hywang2002.github.io/MoSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19040 2026-02-24 cs.IR cs.AI cs.MM 79%

Adaptive Multi-Agent Reasoning for Text-to-Video Retrieval

自适应多智能体推理用于文本到视频检索

Jiaxin Wu, Xiao-Yong Wei, Qing Li

机构 * Shenzhen University(深圳大学) The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 视频生成 :text-to-video(title,abstract);分类 cs.MM

AI总结 本文提出自适应多智能体框架,通过动态协调检索、推理和查询重述智能体,提升文本到视频检索的零样本跨模态对齐与复杂查询处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.17863 2026-02-19 cs.CV cs.AI 79%

A Survey: Spatiotemporal Consistency in Video Generation

综述:视频生成中的时空一致性

Zhiyu Yin, Kehai Chen, Xuefeng Bai, Ruili Jiang, Juntao Li, Hongdong Li, Jin Liu, Yang Xiang, Jun Yu, Min Zhang

机构 * School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)计算机科学与技术学院) School of Computer Science and Engineering, Central South University(中南大学计算机科学与工程学院) Peng Cheng Laboratory(鹏城实验室) School of Computer Science and Technology, Soochow University(苏州大学计算机科学与技术学院)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文综述了视频生成中时空一致性的最新进展,涵盖生成模型、特征表示、训练策略等,探讨了未来研究方向和挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14941 2026-02-17 cs.CV cs.AI 79%

AnchorWeave: World-Consistent Video Generation with Retrieved Local Spatial Memories

AnchorWeave: 通过检索的局部空间记忆实现世界一致的视频生成

Zun Wang, Han Lin, Jaehong Yoon, Jaemin Cho, Yue Zhang, Mohit Bansal

机构 * Department of Computer Science, University of North Carolina, Chapel Hill(北卡罗来纳大学教堂山分校计算机科学系) Nanyang Technological University, Singapore(新加坡南洋理工大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 AnchorWeave通过检索局部空间记忆提升视频生成的长期场景一致性与视觉质量。

Comments Project website: https://zunwang1.github.io/AnchorWeave

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13637 2026-02-17 cs.CV 79%

DCDM: Divide-and-Conquer Diffusion Models for Consistency-Preserving Video Generation

DCDM:分而治之扩散模型用于保持一致性视频生成

Haoyu Zhao, Yuang Zhang, Junqi Cheng, Jiaxi Gu, Zenghui Lu, Peng Shu, Zuxuan Wu, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Tencent(腾讯)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DCDM通过分而治之的扩散模型,解决视频生成中的语义、几何和身份一致性问题,提升视频生成的连贯性和可控性。

Comments 7 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03796 2026-02-17 cs.CV 79%

3D-Aware Implicit Motion Control for View-Adaptive Human Video Generation

面向视图自适应的人体视频生成的3D感知隐式运动控制

Zhixue Fang, Xu He, Songlin Tang, Haoxian Zhang, Qingfeng Li, Xiaoqiang Liu, Pengfei Wan, Kun Gai

机构 * Kling Team, Kuaishou Technology(快手科技 Kling 团队) Tsinghua University(清华大学) CASIA

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 3DiMo通过隐式运动表示和视图丰富监督,提升视频生成中的人体运动保真度和视觉质量。

Comments Project Page: https://hjrphoebus.github.io/3DiMo/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12160 2026-02-13 cs.CV 79%

DreamID-Omni: Unified Framework for Controllable Human-Centric Audio-Video Generation

DreamID-Omni: 一体化框架用于可控的人-centric音频视频生成

Xu Guo, Fulong Ye, Qichao Sun, Liyang Chen, Bingchuan Li, Pengze Zhang, Jiawei Liu, Songtao Zhao, Qian He, Xiangwang Hou

机构 * Tsinghua University(清华大学) Intelligent Creation Lab, ByteDance(字节跳动智能创作实验室)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 DreamID-Omni提出了一种统一框架,通过双层解耦策略和多任务训练方案,实现对可控人-centric音频视频生成的高效控制。

Comments Project: https://guoxu1233.github.io/DreamID-Omni/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03213 2026-02-11 cs.CV 79%

ConsisDrive: Identity-Preserving Driving World Models for Video Generation by Instance Mask

ConsisDrive: 用于视频生成的实例掩码驾驶世界模型

Zhuoran Yang, Yanyong Zhang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 ConsisDrive通过实例掩码注意力和损失机制提升驾驶视频生成质量及自动驾驶性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05966 2026-02-06 cs.CV cs.AI 79%

LSA: Localized Semantic Alignment for Enhancing Temporal Consistency in Traffic Video Generation

LSA:局部语义对齐用于增强交通视频生成中的时间一致性

Mirlan Karimov, Teodora Spasojevic, Markus Braun, Julian Wiederer, Vasileios Belagiannis, Marc Pollefeys

机构 * Mercedes-Benz AG(梅赛德斯-奔驰集团) ETH Zurich(苏黎世联邦理工学院) Friedrich-Alexander University Erlangen-Nuremberg(埃朗根-纽伦堡弗里德里希-亚历山大大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 LSA通过局部语义对齐提升交通视频生成的时间一致性,无需外部控制信号。

Comments Accepted to IEEE IV 2026. 8 pages, 3 figures. Code available at https://github.com/mirlanium/LSA

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05827 2026-02-06 cs.CV cs.RO 79%

Sparse Video Generation Propels Real-World Beyond-the-View Vision-Language Navigation

稀疏视频生成推动现实世界超越视界视觉语言导航

Hai Zhang, Siqi Liang, Li Chen, Yuxian Li, Yukuan Xu, Yichao Zhong, Fu Zhang, Hongyang Li

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 本文提出SparseVideoNav,通过稀疏视频生成实现现实世界超越视界导航,显著提升导航效率和成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.13462 2026-02-05 cs.SD cs.MM eess.AS 79%

SAVGBench: Benchmarking Spatially Aligned Audio-Video Generation

SAVGBench: 多模态空间对齐音频视频生成基准测试

Kazuki Shimada, Christian Simon, Takashi Shibuya, Shusuke Takahashi, Yuki Mitsufuji

机构 * Sony AI(索尼人工智能) Sony Group Corporation(索尼集团)

专题命中 视频生成 :video generation(title,abstract);分类 cs.MM

AI总结 SAVGBench提出了一种新的基准测试方法,用于评估空间对齐音频视频生成任务的性能,通过引入专门的数据集和对齐度量标准,评估不同生成模型的对齐效果。

Comments 5 pages, 2 figures, accepted for publication in IEEE ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03793 2026-02-04 cs.RO cs.CV 79%

BridgeV2W: Bridging Video Generation Models to Embodied World Models via Embodiment Masks

BridgeV2W: 通过具身遮罩将视频生成模型与具身世界模型 bridging

Yixiang Chen, Peiyan Li, Jiabing Yang, Keji He, Xiangnan Wu, Yuan Xu, Kai Wang, Jing Liu, Nianfeng Liu, Yan Huang, Liang Wang

机构 * New Laboratory of Pattern Recognition (NLPR), Institute of Automation, Chinese Academy of Sciences(模式识别新实验室(NLPR),自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Shandong University(山东大学)

专题命中 视频生成 :video generation(title,abstract);分类 cs.CV

AI总结 BridgeV2W 通过具身遮罩将视频生成模型与具身世界模型结合,解决坐标空间动作与像素空间视频的不匹配问题,并提升视频生成质量与跨具身统一性。

详情

展开后加载摘要…

URL PDF HTML 收藏