arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 2158 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2158 篇

2607.25321 2026-07-29 cs.AI 新提交 78%

Physics-Grounded Fluid Video Generation with a Simulation Dataset and Dual-Stream Optical-Flow Supervision

基于模拟数据集和双流光流监督的物理基础流体视频生成

Ruijie Su, Yuanzhi Liang, Xiaohua Xie, Jianhuang Lai

机构 * Institute of Artificial Intelligence, China Telecom (TeleAI)(中国电信人工智能研究院)

专题命中 视频生成 :video generation(title);video diffusion(abstract)

AI总结 研究流体视频生成中模型违反物理原理的问题,构建含模拟与真实视频的数据集,引入双流图像到视频架构,通过光流监督增强模型,提升视频物理常识和质量得分,使模型内化连贯运动先验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01701 2026-07-03 cs.DC 新提交 78%

Arachne: Orchestrating Cascades for Efficient Text-to-Video Model Training

Arachne: 编排级联以实现高效文本到视频模型训练

Peng Yu, Yuankai Fan, Yang Qiu, Tian Li, Bihuan Chen, Yin Chen, Qizhen Weng

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 提出Arachne框架,通过将训练过程分解为细粒度计算单元(级联)并协调其分布式执行与同步,解决T2V模型训练中的负载不均和硬件利用率低问题,迭代时间最多减少65%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32028 2026-07-03 cs.RO 新提交 78%

DVG-WM: Disentangled Video Generation Enables Efficient Embodied World Model for Robotic Manipulation

DVG-WM:解耦视频生成实现高效机器人操作具身世界模型

Ziyu Shan, Zhenyu Wu, Xiaofeng Wang, Zheng Zhu, Ziwei Wang

机构 * Nanyang Technological University, Singapore(南洋理工大学(新加坡)) Beijing University of Posts and Telecommunications, Beijing, China(北京邮电大学(中国北京)) GigaAI

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出解耦视频生成世界模型(DVG-WM),将世界模型分解为动力学学习和视觉合成,通过流匹配直接映射动力学到视频潜变量,并引入潜变量退化机制再生接触细节,在LIBERO和真实平台实现高达3.97倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25496 2026-06-25 cs.IR 新提交 78%

Recommendation as Generation: Unifying Personalized Video Generation and Recommendation at Industrial Scale

推荐即生成:在工业规模上统一个性化视频生成与推荐

Yanhua Cheng, Bo Wang, Haotian Zhang, Xinyuan Gao, Zhihui Yin, Ben Xue, Yongzhi Li, Jieting Xue, Ye Ma, Minquan Wang, Jiahui Li, Tianyu Xu, Zhiqiang Liu, Xiao Lin, Shiyang Wen, Changcheng Li, Liu Liu, Quan Chen, Peng Jiang, Kun Gai

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出推荐即生成(RaG)范式,通过共享语义ID统一生成式推荐与视频生成,实现个性化视频按需生成,并在工业平台部署,广告收入提升1.87%。

Comments Project page: https://recommendation-as-generation.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22363 2026-06-23 cs.AI cs.LG cs.RO 新提交 78%

Reference-Free Assessment of Physical Consistency in World Model-based Video Generation

基于世界模型的视频生成中物理一致性的无参考评估

Yun Oh, Sukmin Yun

机构 * Hanyang University ERICA(汉阳大学ERICA校区)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。

Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19271 2026-06-18 cs.DC 新提交 78%

TurboServe: Serving Streaming Video Generation Efficiently and Economically

TurboServe: 高效经济地服务流式视频生成

Youhe Jiang, Haoxu Wang, Haotong Bao, Kai Jiang, Jianfei Chen, Jun Zhu, Fangcheng Fu, Jintao Zhang

专题命中 视频生成 :video generation(title,abstract)

AI总结 针对流式视频生成的会话时长和用户需求异构性,提出TurboServe系统,通过在线调度联合优化会话放置与GPU配置,采用迁移感知放置和负载驱动自动缩放,降低延迟和成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15319 2026-06-16 cs.DC 新提交 78%

Adaptive Resource Management and Quality Control for Streaming Video Generation

自适应资源管理与质量控制用于流式视频生成

Yifei Xia, Hao Yuan, Suhan Ling, Haoran Sun, Hanke Zhang, Xupeng Miao, Fangcheng Fu, Bin Cui

专题命中 视频生成 :video generation(title,abstract)

AI总结 针对自回归扩散Transformer在实时流式视频生成中的播放连续性SLO,提出基于播放余量的服务系统SlackServe,通过三级优先级队列、重新归位和弹性序列并行重新分配资源,并在质量下限下通过双模帕累托路由选择每块保真度配置,显著提升QoE并降低首块延迟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12576 2026-06-12 cs.CL 新提交 78%

Helping Figures Tell their Story! Paper-Grounded Video Generation Explaining Complex Scientific Figures

帮助图表讲述它们的故事!基于论文的视频生成解释复杂科学图表

Ishani Mondal, Javad Baghirov, Jordan Boyd-Graber

机构 * University of Maryland, College Park(马里兰大学学院市分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出MINARD流水线,从图表及其论文生成基于区域分解的叙述性视频,并发布FigTalk基准,在自动和人工评估中优于现有方法。

Comments Webpage: https://minard.vercel.app/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12028 2026-06-11 cs.RO 新提交 78%

VICX: Generalizable Robot Manipulation via Video Generation and In-Context Operator Network

VICX: 通过视频生成和上下文操作网络实现可泛化的机器人操作

Song Chen, Linyan Xiang, Ying Zhou, Liu Yang

机构 * National University of Singapore(新加坡国立大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出VICX框架,利用冻结视频生成模型生成视觉计划,并通过视频到轨迹的上下文操作网络(V2T-ICON)将其映射为机器人可执行轨迹,实现跨任务、跨本体泛化。

Comments The first two authors contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30895 2026-06-02 cs.CE 78%

CamGeo: Sparse Camera-Conditioned Image-to-Video Generation with 3D Geometry Priors

CamGeo: 基于稀疏相机条件的图像到视频生成与3D几何先验

Xuanyi Liu, Deyi Ji, Liqun Liu, Lanyun Zhu, Xuhang Chen, Qianxiong Xu, Peng Shu, Huan Yu, Jie Jiang, Feng Gao, Siwei Ma

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出CamGeo框架,通过从预训练视频到3D模型蒸馏3D几何知识,结合关键帧轨迹蒸馏、跨帧一致性蒸馏和三阶段课程学习,解决稀疏相机条件下图像到视频生成中的姿态漂移和运动不连续问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11790 2026-06-02 cs.AI cs.CL 78%

Beyond End-to-End Video Models: An LLM-Based Multi-Agent System for Educational Video Generation

超越端到端视频模型:基于LLM的多智能体系统用于教育视频生成

Lingyong Yan, Jiulong Wu, Dong Xie, Weixian Shi, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出LASEV,一种基于LLM的分层多智能体系统,通过将教育视频生成分解为多个专业智能体协作,解决端到端模型在逻辑严谨性和知识表示方面的不足,实现低成本、高吞吐量的自动化教学视频生产。

Comments Accepted at ACM SIGKDD 2026 (KDD '26), Applied Data Science Track. 10 pages, 2 figures, 5 tables. The project is available at \url{https://robitsg.github.io/LASEV}

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26918 2026-05-27 cs.CL 78%

Are Video Models Zero-Shot Learners and Reasoners in Education? EduVideoBench, A Knowledge-Skills-Attitude Benchmark for Educational Video Generation

视频模型是教育领域的零样本学习者和推理者吗?EduVideoBench:面向教育视频生成的知识-技能-态度基准

Unggi Lee, Hoyoung Ahn, Yoon Choi, Seonmin Eun, Jahyun Jeong, Seonmin Jin, Harmony Jung, Hye Jin Kim, Chaerin Lee, Hyunji Lee, Jeongjin Lee, Soohwan Lee, Young-Seok Oh, Jaehyeon Park, Sun-ok Ryu, Sunyoung Shin, Yoorim Son, Haeun Park, Yeil Jeong

机构 * Korea University Sejong Campus(韩国大学世宗校区) Cardiff Metropolitan University(卡迪夫 Metropolitan 大学) Seoul National University(首尔国立大学) Bugil Academy(Bugil 学院) Gyeonggi Provincial Office of Education(京畿省教育厅) Loughborough University(洛桑大学) Korea National University of Education(韩国教育大学) Korea University(韩国大学) Korean Educational Development Institute(韩国教育发展院) Sungshin Women’s University(顺天堂女子大学) Seoul National University of Education(首尔国立教育大学) Korea Institute for Curriculum and Evaluation(韩国课程评价院) Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 提出基于知识-技能-态度框架的教育视频生成基准EduVideoBench,评估五个前沿视频生成模型在教育有效性上的不足,并发现教育有效性是多维度的,单一元素不匹配即可使视频失效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21002 2026-05-19 cs.GR 78%

SURF: Signature-Retained Fast Video Generation

SURF: 保留特征的快速视频生成

Kaixin Ding, Xi Chen, Sihui Ji, Yuan Gao, Liang Hou, Xin Tao, Hengshuang Zhao

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出SURF框架,通过保留原始模型的显著特征,高效生成高分辨率视频,同时减少计算步骤,提升生成速度。

Comments Project Website: https://kxding.github.io/project/SURF/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27711 2026-05-01 cs.RO 78%

ExoActor: Exocentric Video Generation as Generalizable Interactive Humanoid Control

ExoActor:作为可泛化的交互人形控制的外向视频生成

Yanghao Zhou, Jingyu Ma, Yibo Peng, Zhenguo Sun, Yu Bai, Börje F. Karlsson

机构 * Beijing Academy of Artificial Intelligence (BAAI)(北京人工智能研究院)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出ExoActor框架,利用大规模视频生成模型的泛化能力,通过第三人称视频生成统一接口建模交互动态,将任务指令和场景上下文转化为可执行的人形行为序列,展示了其在新场景中的泛化能力。

Comments Work in progress. Project page: https://baai-agents.github.io/ExoActor/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01264 2026-04-14 cs.RO cs.AI 78%

LLM-based Realistic Safety-Critical Driving Video Generation

基于LLM的现实安全关键驾驶视频生成

Yongjie Fu, Ruijian Zha, Pei Tian, Xuan Di

机构 * Department of Civil Engineering and Engineering Mechanics, Columbia University(哥伦比亚大学土木工程与工程力学系) Department of Computer Science, Columbia University(哥伦比亚大学计算机科学系)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文提出利用LLM生成少样本代码实现安全关键驾驶场景生成,结合CARLA模拟器与Cosmos-Transfer1和ControlNet生成真实驾驶视频,提升自动驾驶测试效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27469 2026-03-31 cs.LG cs.AI 78%

KV Cache Quantization for Self-Forcing Video Generation: A 33-Method Empirical Study

KV缓存量化用于自驱动视频生成:一项33种方法的实证研究

Suraj Ranganath, Vaishak Menon, Anish Patnaik

机构 * University of California, San Diego(加利福尼亚大学圣迭戈分校)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文通过33种量化和缓存策略变体,研究自驱动视频生成中KV缓存压缩的影响,发现FlowCache启发的INT4软剪枝方法在压缩率和内存使用上表现优异,但高保真方法存在运行时或内存成本问题,需结合实际需求选择。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.18811 2026-03-20 cs.RO 78%

V-Dreamer: Automating Robotic Simulation and Trajectory Synthesis via Video Generation Priors

V-Dreamer:通过视频生成先验自动机器人仿真与轨迹合成

Songjia He, Zixuan Chen, Hongyu Ding, Dian Shao, Jieqi Shi, Chenxu Li, Jing Huo, Yang Gao

机构 * Nanjing University(南京大学) Northwestern Polytechnical University(西北工业大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 V-Dreamer通过视频生成先验自动构建仿真环境和可执行轨迹,利用大语言模型和3D生成模型生成物理合理的3D场景,并通过Sim-to-Gen模块实现高效轨迹合成。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09642 2026-03-03 cs.GR cs.AI 78%

Open-Sora 2.0: Training a Commercial-Level Video Generation Model in $200k

Open-Sora 2.0:在20万美元内训练一个商业级视频生成模型

Zangwei Zheng, Xiangyu Peng, Yuxuan Lou, Chenhui Shen, Tom Young, Xinying Guo, Binluo Wang, Hang Xu, Hongxin Liu, Mingyan Jiang, Wenjun Li, Yuhui Wang, Anbang Ye, Gang Ren, Qianran Ma, Wanying Liang, Xiang Lian, Xiwen Wu, Yuting Zhong, Zhuangyan Li, Chaoyu Gong, Guojun Lei, Leijun Cheng, Limin Zhang, Minghao Li, Ruijie Zhang, Silan Hu, Shijie Huang, Xiaokang Wang, Yuanheng Zhao, Yuqi Wang, Ziang Wei, Yang You

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家)

专题命中 视频生成 :video generation(title,abstract)

AI总结 Open-Sora 2.0通过低成本训练实现了商业级视频生成模型,展示了训练成本的可控性,并开源促进视频生成技术的普及与创新。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07823 2026-01-13 eess.SY cs.RO cs.SY 78%

Video Generation Models in Robotics -- Applications, Research Challenges, Future Directions

机器人中的视频生成模型——应用、研究挑战与未来方向

Zhiting Mei, Tenny Yin, Ola Shorinwa, Apurva Badithela, Zhonghe Zheng, Joseph Bruno, Madison Bland, Lihan Zha, Asher Hancock, Jaime Fernández Fisac, Philip Dames, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学) Temple University(Temple 大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 本文综述了视频生成模型在机器人学中的应用、研究挑战及未来方向,探讨了其在物理模拟、动作预测和策略评估中的作用及面临的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00996 2026-01-06 cs.CY cs.AI 78%

VEAT Quantifies Implicit Associations in Text-to-Video Generator Sora and Reveals Challenges in Bias Mitigation

VEAT量化文本到视频生成器Sora中的隐含关联并揭示缓解偏见的挑战

Yongxu Sun, Michael Saxon, Ian Yang, Anna-Maria Gueorguieva, Aylin Caliskan

机构 * University of Washington(华盛顿大学)

专题命中 视频生成 :text-to-video(title,abstract)

AI总结 VEAT量化Sora视频生成器中隐含的种族和性别关联,揭示去偏提示可能反噬的问题,强调T2V生成器需严格评估以避免代表性伤害。

Comments The International Association for Safe & Ethical AI (IASEAI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17883 2025-12-22 cs.HC 78%

Map2Video: Street View Imagery Driven AI Video Generation

Map2Video: 基于街景图像的AI视频生成

Hye-Young Jo, Mose Sakashita, Aditi Mishra, Ryo Suzuki, Koichiro Niinuma, Aakar Gupta

专题命中 视频生成 :video generation(title,abstract)

AI总结 Map2Video通过整合现实地理数据和AI视频生成技术,帮助电影制作者更高效地创建空间一致的视频内容。

Comments 15 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17756 2025-12-16 cs.LG cs.SY eess.SY 78%

SuperGen: An Efficient Ultra-high-resolution Video Generation System with Sketching and Tiling

SuperGen: 一种高效的超高清视频生成系统,支持草图和分块

Fanjiang Ye, Zepeng Zhao, Yi Mu, Jucheng Shen, Renjie Li, Kaijian Wang, Saurabh Agarwal, Myungjin Lee, Triston Cao, Aditya Akella, Arvind Krishnamurthy, T. S. Eugene Ng, Zhengzhong Tu, Yuke Wang

机构 * Rice University(里士满大学) Carnegie Mellon University(卡内基梅隆大学) University of Illinois Urbana Champaign(伊利诺伊大学厄巴纳-香槟分校) Texas A&M University(德克萨斯农工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco(思科公司) NVIDIA(英伟达公司) University of Washington(华盛顿大学)

专题命中 视频生成 :video generation(title,abstract)

AI总结 SuperGen通过分块技术实现高效超高清视频生成,无需额外训练,降低计算和内存成本,提升生成速度和质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.10678 2025-09-30 cs.GR 78%

T2Bs: Text-to-Character Blendshapes via Video Generation

Jiahao Luo, Chaoyang Wang, Michael Vasilkovsky, Vladislav Shakhrai, Di Liu, Peiye Zhuang, Sergey Tulyakov, Peter Wonka, Hsin-Ying Lee, James Davis, Jian Wang

专题命中 视频生成 :video generation(title);video diffusion(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19222 2025-09-24 cs.LG 78%

Video Killed the Energy Budget: Characterizing the Latency and Power Regimes of Open Text-to-Video Models

Julien Delavande, Regis Pierrard, Sasha Luccioni

机构 * Hugging Face

专题命中 视频生成 :text-to-video(title,abstract)

Comments 10 pages. Accepted as an oral presentation at the NeurIPS 2025 NextVid Workshop (San Diego, December 6, 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10255 2025-05-23 cs.GR cs.AI 78%

AniSora: Exploring the Frontiers of Animation Video Generation in the Sora Era

Yudong Jiang, Baohan Xu, Siqian Yang, Mingyu Yin, Jing Liu, Chao Xu, Siqi Wang, Yidi Wu, Bingwen Zhu, Xinwen Zhang, Xingyu Zheng, Jixuan Xu, Yue Zhang, Jinlong Hou, Huyang Sun

机构 * Bilibili Inc.(哔哩哔哩公司)

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19455 2025-04-24 cs.GR 78%

FLAP: Fully-controllable Audio-driven Portrait Video Generation through 3D head conditioned diffusion model

Lingzhou Mu, Baiji Liu, Ruonan Zhang, Guiming Mo, Jiawei Jin, Kai Zhang, Haozhi Huang

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09268 2025-02-17 cs.RO cs.LG 78%

GEVRM: Goal-Expressive Video Generation Model For Robust Visual Manipulation

Hongyin Zhang, Pengxiang Ding, Shangke Lyu, Ying Peng, Donglin Wang

专题命中 视频生成 :video generation(title,abstract)

Comments Published as a conference paper at ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.10076 2025-02-11 cs.AI cs.LG 78%

VideoAgent: Self-Improving Video Generation

Achint Soni, Sreyas Venkataraman, Abhranil Chandra, Sebastian Fischmeister, Percy Liang, Bo Dai, Sherry Yang

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.15456 2025-01-28 cs.HC 78%

"See What I Imagine, Imagine What I See": Human-AI Co-Creation System for 360$^\circ$ Panoramic Video Generation in VR

Yunge Wen

专题命中 视频生成 :video generation(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.13071 2024-07-19 cs.CY cs.CL cs.IR cs.LG cs.SI 78%

Analysing the Public Discourse around OpenAI's Text-To-Video Model 'Sora' using Topic Modeling

Vatsal Vinay Parikh

专题命中 视频生成 :text-to-video(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏