arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6808 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2156 篇

2604.00319 2026-04-02 cs.AI cs.MA 50%

Collaborative AI Agents and Critics for Fault Detection and Cause Analysis in Network Telemetry

协同AI代理与批评者用于网络遥测中的故障检测与原因分析

Syed Eqbal Alam, Zhan Shu

机构 * Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电气与计算机工程系) SheQAI Research(SheQAI研究)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种多代理联邦系统,通过AI代理与批评者协作完成网络遥测中的故障检测、严重性和原因分析等多模态任务,利用多时间尺度随机逼近技术保证收敛性,通信开销低且隐私保护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17808 2026-03-25 cs.RO cs.AI 50%

EVA: Aligning Video World Models with Executable Robot Actions via Inverse Dynamics Rewards

EVA:通过逆动力学奖励对齐视频世界模型与可执行机器人动作

Ruixiang Wang, Qingming Liu, Yueci Deng, Guiliang Liu, Zhen Liu, Kui Jia

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) DexForce Technology Co., Ltd.(DexForce技术有限公司)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出EVA框架,通过逆动力学奖励对齐视频世界模型与可执行动作,减少生成动作中的体感约束违规,提升下游任务执行成功率。

Comments Project page: https://eva-project-page.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19709 2026-03-25 cs.RO 50%

Morphology-Consistent Humanoid Interaction through Robot-Centric Video Synthesis

通过机器人中心视频合成实现形态一致的人形交互

Weisheng Xu, Jian Li, Yi Gu, Bin Yang, Haodong Chen, Shuyi Lin, Mingqian Zhou, Jing Tan, Qiwei Wu, Xiangrui Jiang, Taowen Wang, Jiawen Wen, Qiwei Liang, Jiaxi Zhang, Renjing Xu

机构 * Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen University(深圳大学) University of Cambridge(剑桥大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Dream2Act框架,通过生成视频合成实现零样本人形机器人交互,避免传统retargeting的形态差距问题,提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16860 2026-03-18 cs.RO 50%

DreamPlan: Efficient Reinforcement Fine-Tuning of Vision-Language Planners via Video World Models

DreamPlan: 通过视频世界模型高效强化微调视觉语言规划器

Emily Yue-Ting Jia, Weiduo Yuan, Tianheng Shi, Vitor Guizilini, Jiageng Mao, Yue Wang

机构 * USC Physical Superintelligence Lab(USC物理超智能实验室) Toyota Research Institute(丰田研究院)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamPlan通过视频世界模型高效强化微调视觉语言规划器,利用零样本VLM生成探索数据训练动作条件视频生成模型,再通过ORPO在虚拟环境中微调VLM,提升物体 manipulation 成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22407 2026-03-17 cs.AI cs.RO 50%

EMMA: Generalizing Real-World Robot Manipulation via Generative Visual Transfer

EMMA: 通过生成性视觉迁移实现现实世界机器人操作的泛化

Zhehao Dong, Xiaofeng Wang, Zheng Zhu, Yirui Wang, Yang Wang, Yukun Zhou, Boyuan Wang, Chaojun Ni, Runqi Ouyang, Wenkang Qin, Xinze Chen, Yun Ye, Guan Huang, Zhen Lu, Yue Yang

专题命中 视频生成 :video generation(abstract)

AI总结 EMMA通过生成性视觉迁移框架提升机器人操作的泛化能力,结合生成数据引擎与高效训练流程,实现多视角一致性和几何精度的提升,实验证明其在零样本场景下的显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00481 2026-03-10 cs.HC 50%

From Performers to Creators: Understanding Retired Women's Perceptions of Technology-Enhanced Dance Performance

从表演者到创作者:理解退休女性对技术增强舞蹈表演的认知

Danlin Zheng, Xiaoying Wei, Chao Liu, Quanyu Zhang, Jingling Zhang, Shihui Guo, Mingming Fan

专题命中 视频生成 :video generation(abstract)

AI总结 本文通过交互式舞蹈技术与AI生成内容,帮助退休女性克服年龄相关限制,提升舞台表现并成为表演共创者。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06190 2026-03-09 cs.RO 50%

DreamToNav: Generalizable Navigation for Robots via Generative Video Planning

DreamToNav: 通过生成式视频规划实现通用机器人导航

Valerii Serpiva, Jeffrin Sam, Chidera Simon, Hajira Amjad, Iana Zhura, Artem Lykov, Dzmitry Tsetserukou

机构 * Intelligent Space Robotics Laboratory, Skolkovo Institute of Science and Technology(智能空间机器人实验室,斯克尔科夫科学与技术研究所)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamToNav通过生成式视频规划实现通用机器人导航,利用自然语言提示生成精确运动路径,实现目标导向的自主导航。

Comments Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00110 2026-03-03 cs.RO 50%

Learning Physics from Pretrained Video Models: A Multimodal Continuous and Sequential World Interaction Models for Robotic Manipulation

从预训练视频模型中学习物理:一种多模态连续和序列世界交互模型用于机器人操作

Zijian Song, Qichang Li, Sihan Qin, Yuhao Chen, Tianshui Chen, Liang Lin, Guangrun Wang

机构 * Sun Yat-sen University(中山大学) Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) X-Era AI Lab(X-Era人工智能实验室) Guangdong University of Technology(广东工业大学)

专题命中 视频生成 :video generation(abstract)

AI总结 PhysGen通过预训练视频模型学习物理知识,实现机器人操作的连续和序列世界交互,优于现有基线方法。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06559 2026-02-24 cs.GT 50%

GenAI vs. Human Creators: Procurement Mechanism Design in Two-/Three-Layer Markets

生成式AI与人类创作者:跨域市场中的采购机制设计

Rui Ai, David Simchi-Levi, Haifeng Xu

专题命中 视频生成 :video generation(abstract)

AI总结 本文研究了生成式AI与人类创作者在跨域市场中的采购机制设计,揭示了数据中介带来的影响及对社会福利的负面影响,提出需政府监管以优化数据生态系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12636 2026-02-16 cs.LG cs.RO 50%

Dual-Granularity Contrastive Reward via Generated Episodic Guidance for Efficient Embodied RL

双粒度对比奖励 via 生成 episodic 引导 为高效 embodied RL

Xin Liu, Yixuan Li, Yuhui Chen, Yuxing Qin, Haoran Li, Dongbin Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出DEG方法,通过生成episodic引导实现高效具身RL,无需人工标注,提升样本效率和任务完成能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12128 2026-02-13 cs.AI 50%

HLA: Hadamard Linear Attention

HLA: Hadamard线性注意力

Hanno Ackermann, Hong Cai, Mohsen Ghafoorian, Amirhossein Habibian

机构 * Qualcomm AI Research(高通人工智能研究)

专题命中 视频生成 :video generation(abstract)

AI总结 HLA通过在计算成对相似性后应用非线性,提高线性注意力对softmax的近似精度,无需张量重塑,适用于大规模视频生成任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10717 2026-02-12 cs.RO 50%

Say, Dream, and Act: Learning Video World Models for Instruction-Driven Robot Manipulation

说、梦、做:学习视频世界模型以驱动指令式机器人操作

Songen Gu, Yunuo Cai, Tianyu Wang, Simo Wu, Yanwei Fu

机构 * Fudan University(复旦大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一种视频条件动作框架,通过生成稳健的视频模型和对抗性蒸馏,提升机器人操作中的预测能力和空间准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10105 2026-02-11 cs.RO 50%

DexImit: Learning Bimanual Dexterous Manipulation from Monocular Human Videos

DexImit:从单目人类视频中学习双臂灵巧操作

Juncheng Mu, Sizhe Yang, Yiming Bao, Hojin Bae, Tianming Wei, Linning Xu, Boyi Li, Huazhe Xu, Jiangmiao Pang

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) The Chinese University of Hong Kong(香港中文大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract)

AI总结 DexImit通过四阶段生成流程,将单目人类视频转化为物理合理的机器人数据,以解决双臂灵巧操作的泛化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.11261 2026-02-10 cs.CL 50%

Kahaani: A Multimodal Co-Creative Storytelling System

Kahaani:一种多模态协同创作叙事系统

Samee Arif, Muhammad Saad Haroon, Aamina Jamal Khan, Taimoor Arif, Agha Ali Raza, Awais Athar

机构 * Lahore University of Management Sciences(拉瓦尔大学管理科学学院) University of Michigan(密歇根大学) Strategize Labs(战略实验室)

专题命中 视频生成 :text-to-video(abstract)

AI总结 Kahaani通过多模态技术帮助儿童提升英语能力、学习生活教训并理解故事结构,采用协同创作方式提供沉浸式教育体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02725 2026-02-02 cs.AI 50%

Advances in Artificial Intelligence: A Review for the Creative Industries

人工智能进展:面向创意产业的综述

Nantheera Anantrasirichai, Fan Zhang, David Bull

机构 * Visual Information Laboratory, University of Bristol, Bristol, UK(布里斯托大学视觉信息实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文综述了自2022年以来人工智能在创意产业中的进展,探讨了生成式AI、大语言模型和扩散模型等技术对创意生产流程的影响,并分析了人类与AI协作的新趋势及面临的挑战。

Comments This is an updated review of our previous paper (see https://doi.org/10.1007/s10462-021-10039-7), and has been accepted by Artificial Intelligence Review journal

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20655 2026-01-29 cs.DC 50%

OnePiece: A Large-Scale Distributed Inference System with RDMA for Complex AI-Generated Content (AIGC) Workflows

OnePiece:一种基于RDMA的大型分布式推理系统,用于复杂AI生成内容(AIGC)工作流

June Chen, Neal Xu, Gragas Huang, Bok Zhou, Stephen Liu

专题命中 视频生成 :video generation(abstract)

AI总结 OnePiece通过RDMA优化和微服务分解,提升AIGC工作流的吞吐量和资源利用率,减少GPU资源消耗16倍。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20622 2026-01-29 cs.HC 50%

SketchDynamics: Exploring Free-Form Sketches for Dynamic Intent Expression in Animation Generation

SketchDynamics: 探索自由形式草图用于动画生成中的动态意图表达

Boyu Li, Lin-Ping Yuan, Zeyu Wang, Hongbo Fu

专题命中 视频生成 :video generation(abstract)

AI总结 SketchDynamics通过自由形式草图与AI交互,探索动态意图表达在动画生成中的应用,展示草图如何有效传达运动意图并指导视频生成。

Comments conditionally accepted by CHI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12128 2026-01-16 cs.LG cs.AI 50%

LaM-SLidE: Latent Space Modeling of Spatial Dynamical Systems via Linked Entities

通过链接实体进行空间动态系统的潜在空间建模:LaM-SLidE

Florian Sestak, Artur Toshev, Andreas Fürst, Günter Klambauer, Andreas Mayr, Johannes Brandstetter

机构 * ELLIS Unit, LIT AI Lab, Institute for Machine Learning, JKU Linz(ELLIS单位、LIT AI实验室、机器学习研究所、JKU林茨) Department of Engineering Physics and Computation, TUM(工程物理与计算系、技术大学慕尼黑) Emmi AI GmbH(Emmi AI公司) Clinical Research Institute for Medical AI, JKU Linz(医学人工智能临床研究所、JKU林茨)

专题命中 视频生成 :video generation(abstract)

AI总结 LaM-SLidE通过引入标识符表示,实现对空间动态系统潜在空间的建模,提升轨迹生成的效率与准确性。

Comments Project page: https://ml-jku.github.io/LaM-SLidE/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23003 2026-01-15 cs.LG cs.AI cs.SY eess.SY 50%

Physically Plausible Multi-System Trajectory Generation and Symmetry Discovery

物理合理多系统轨迹生成与对称性发现

Jiayin Liu, Yulong Yang, Vineet Bansal, Christine Allen-Blanchette

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出SPS-GAN,通过辛相空间GAN架构实现多系统轨迹生成与对称性发现,无需先验配置空间知识,通过物理动机项优化实现配置空间的稀疏表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02125 2026-01-06 cs.RO cs.AI 50%

SingingBot: An Avatar-Driven System for Robotic Face Singing Performance

SingingBot: 一种由虚拟角色驱动的机器人面部歌唱表演系统

Zhuoxiong Xu, Xuanchen Li, Yuhao Cheng, Fei Xu, Yichao Yan, Xiaokang Yang

专题命中 视频生成 :video generation(abstract)

AI总结 SingingBot通过虚拟角色驱动框架实现机器人面部歌唱的丰富情感表达,提出情感动态范围指标评估情感广度,实验表明其在情感表现和同步性方面优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15607 2025-11-18 cs.RO 50%

GRIM: Task-Oriented Grasping with Conditioning on Generative Examples

Shailesh, Alok Raj, Nayan Kumar, Priya Shukla, Andrew Melnik, Michael Beetz, Gora Chand Nandi

专题命中 视频生成 :video generation(abstract)

Comments Accepted to AAAI-26 (Oral). Project website: https://grim-tog.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16587 2025-11-18 cs.RO 50%

Human2Robot: Learning Robot Actions from Paired Human-Robot Videos

Sicheng Xie, Haidong Cao, Zejia Weng, Zhen Xing, Haoran Chen, Shiwei Shen, Jiaqi Leng, Zuxuan Wu, Yu-Gang Jiang

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19957 2025-10-24 cs.AI 50%

A new wave of vehicle insurance fraud fueled by generative AI

Amir Hever, Itai Orr

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07092 2025-10-09 cs.LG cs.AI cs.RO 50%

Generative World Modelling for Humanoids: 1X World Model Challenge Technical Report

Riccardo Mereu, Aidan Scannell, Yuxin Hou, Yi Zhao, Aditya Jitta, Antonio Dominguez, Luigi Acerbi, Amos Storkey, Paul Chang

机构 * Aalto University(阿alto大学) University of Edinburgh(爱丁堡大学) Deep Render(Deep Render公司) DataCrunch(DataCrunch公司) University of Helsinki(赫尔辛基大学)

专题命中 视频生成 :video generation(abstract)

Comments 6 pages, 3 figures, 1X world model challenge technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14794 2025-10-07 cs.DC cs.AI cs.LG 50%

Characterizing Mobile SoC for Accelerating Heterogeneous LLM Inference

Le Chen, Dahu Feng, Erhu Feng, Yingrui Wang, Rong Zhao, Yubin Xia, Pinjie Xu, Haibo Chen

机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(并行与分布式系统研究所,上海交通大学) Tsinghua University(清华大学) SenseTime Research(商汤科技研究院)

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.02367 2025-10-02 cs.LG 50%

SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration

Jintao Zhang, Jia Wei, Haofeng Huang, Pengle Zhang, Jun Zhu, Jianfei Chen

机构 * Dept. of Comp. Sci. & Tech.(计算机科学与技术系) Institute for AI(人工智能研究院) BNRist Center(BNRist中心) Tsinghua-Bosch Joint ML Center(清华大学-博世联合机器学习中心) THBI Lab(THBI实验室) Tsinghua University(清华大学)

专题命中 视频生成 :video generation(abstract)

Comments @inproceedings{zhang2025sageattention, title={SageAttention: Accurate 8-Bit Attention for Plug-and-play Inference Acceleration}, author={Zhang, Jintao and Wei, Jia and Zhang, Pengle and Zhu, Jun and Chen, Jianfei}, booktitle={International Conference on Learning Representations (ICLR)}, year={2025} }

Journal ref The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21385 2025-09-23 cs.HC 50%

Dynamic Vision from EEG Brain Recordings, How much does EEG know?

Prajwal Singh, Anupam Sharma, Pankaj Pandey, Krishna Miyapuram, Shanmuganathan Raman

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14178 2025-09-18 cs.RO 50%

\textsc{Gen2Real}: Towards Demo-Free Dexterous Manipulation by Harnessing Generated Video

Kai Ye, Yuhang Wu, Shuyuan Hu, Junliang Li, Meng Liu, Yongquan Chen, Rui Huang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Institute of Artificial Intelligence and Robotics for Society(深圳人工智能与机器人研究院) University of California, San Diego(加州大学圣地亚哥分校)

专题命中 视频生成 :video generation(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13903 2025-09-18 cs.RO 50%

PhysicalAgent: Towards General Cognitive Robotics with Foundation World Models

Artem Lykov, Jeffrin Sam, Hung Khang Nguyen, Vladislav Kozlovskiy, Yara Mahmoud, Valerii Serpiva, Miguel Altamirano Cabrera, Mikhail Konenkov, Dzmitry Tsetserukou

机构 * Intelligent Robotics Laboratory, Skolkovo Institute of Science and Technology (Skoltech)(斯克尔科夫科学与技术研究所智能机器人实验室)

专题命中 视频生成 :video generation(abstract)

Comments submitted to IEEE conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13164 2025-09-18 cs.RO cs.SY eess.SY 50%

TeraSim-World: Worldwide Safety-Critical Data Synthesis for End-to-End Autonomous Driving

Jiawei Wang, Haowei Sun, Xintao Yan, Shuo Feng, Jun Gao, Henry X. Liu

机构 * University of Michigan(密歇根大学) SaferDrive AI The University of Hong Kong(香港大学) Tsinghua University(清华大学) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract)

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏