arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视频大模型

视频理解、视频生成、视频语言模型和时序视觉推理。

共收录 6808 信号源:cs.CV, eess.IV, cs.MM

1. 视频生成 2156 篇

2607.08193 2026-07-10 cs.LG cs.AI 新提交 50%

Open-ended Multi-agent Autocurricula via Visual Inspection of Policies with Multi-modal LLMs

通过多模态大语言模型对策略进行视觉检查实现开放式多智能体自动课程

Lorenzo Pantè, Andrea Fanti, Roberto Capobianco

机构 * Sapienza University of Rome(罗马第一大学) Sony AI(索尼人工智能)

专题命中 视频生成 :video language model(abstract)

AI总结 研究强化学习中开放式多智能体自动课程设计难题,提出通过策略视觉检查(VIP)利用视频语言模型处理视频并提供课程建议,经星际争霸多智能体挑战赛实证,显示该方法能生成更有效课程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06401 2026-07-08 cs.AI 新提交 50%

A Definition and Roadmap for World Models

世界模型的定义与路线图

Xinyuan Chen, Haoyu Guo, Shi Guo, Bingqi Jiang, Chunhua Shen, Xing Shen, Tianfan Xue, Yufei Xue, Mulin Yu, Weinan Zhang, Bin Zhao, Bowen Zhou, Ming Zhou

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文针对人工智能领域对世界模型定义、预测内容及构建方式缺乏共识的问题,给出科学定义,讨论关键技术,提供分阶段路线图,以助力有效世界模型的开发。

Comments Technical report, 58 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01817 2026-07-03 cs.DC 新提交 50%

HCMS: Head-Chunked Multi-Stream Pipeline for Communication-Computation Overlap in Long-Sequence Parallel Attention

HCMS: 用于长序列并行注意力中通信-计算重叠的头分块多流流水线

Chao Yuan, Pan Li, Yingnan Sun, Jing Liu

专题命中 视频生成 :video generation(abstract)

AI总结 提出HCMS方法,通过将注意力头分块并利用双CUDA流实现细粒度通信-计算重叠,在长序列并行注意力中加速10%-17.5%。

Comments 11 pages, 4 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01766 2026-07-03 cs.AI 新提交 50%

SimWorlds: A Multi-Agent System for Dynamic 3D Scene Creation

SimWorlds: 一个用于动态3D场景创建的多智能体系统

Chunjiang Liu, Xiaoyuan Wang, Haoyu Chen, Yizhou Zhao, Ming-Hsuan Yang, László A. Jeni

机构 * Carnegie Mellon University(卡内基梅隆大学) Harvard University(哈佛大学) University of California, Merced(加州大学默塞德分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出多智能体框架SimWorlds,通过规划-编码-审查流程和运行时状态检查工具,从文本生成动态4D场景,并引入基准4DBuildBench评估视觉保真度和物理一致性。

Comments 20 pages, 3 figures. Project page: https://dynsimworlds.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02376 2026-07-01 cs.HC 版本更新 50%

Talking Surveys: How Photorealistic Embodied Conversational Agents Shape Response Quality, Engagement, and Satisfaction

对话式调查:逼真的具身对话代理如何影响回答质量、参与度和满意度

Matus Krajcovic, Peter Demcak, Eduard Kuric

专题命中 视频生成 :video generation(abstract)

AI总结 研究提出一种集成AI驱动视频生成、语音识别和大语言模型的虚拟化身对话调查工具,实验表明具身代理能显著提升回答信息量和详细度,提高参与效率,但对满意度无显著影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26587 2026-06-26 cs.LG cs.AI 新提交 50%

SharQ: Bridging Activation Sparsity and FP4 Quantization for LLM Inference

SharQ:桥接激活稀疏性与FP4量化用于LLM推理

Haoqian Meng, Yilun Luo, Yafei Zhao, Wenyuan Liu, Huaqing Zheng, Xindian Ma, Peng Zhang

机构 * School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院)

专题命中 视频生成 :video generation(abstract)

AI总结 提出SharQ方法,通过在线稀疏-稠密分解结合N:M稀疏性与FP4量化,无需训练即可恢复NVFP4与FP16之间43-63%的精度差距,并在RTX 5090上实现2.2-2.4倍延迟降低。

Comments 20 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24196 2026-06-25 cs.AI 新提交 50%

Navigating User Behavior toward Personalized Multimodal Generation

导航用户行为以实现个性化多模态生成

Hengji Zhou, Yufeng Liu, Ye Liu, Yong Xu, Lianghao Xia, Liqiang Nie

机构 * South China University of Technology(华南理工大学) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 视频生成 :video generation(abstract)

AI总结 提出NaviGen,通过双标识符编码用户行为并采用两阶段SFT+RL训练,将交互历史转化为可执行指令,提升个性化图像和视频生成质量。

Comments 16 pages, 15 figures, 5 tables. Code is available at https://github.com/iLearn-Lab/NaviGen

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24448 2026-06-24 cs.RO 新提交 50%

Supervise What Survives: Geometry-Guided VLA Adaptation from Synthetic Robot Videos

监督幸存信息:基于几何引导的合成机器人视频VLA适配

Danze Chen, Yanzhe Chen, Qiming Huang, Zhijun Cao, Chen Gao, Mike Zheng Shou

机构 * Show Lab, National University of Singapore(新加坡国立大学 Show Lab)

专题命中 视频生成 :video generation(abstract)

AI总结 提出GRA方法,从合成视频中提取几何信息(2D末端执行器路径点)监督视觉表征,仅用真实演示训练动作头,在真实机器人任务中优于伪动作基线。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24025 2026-06-24 cs.LG 新提交 50%

Information-Theoretic Classifier-Free Guidance with Adaptive Schedule Optimization

信息论分类器自由引导与自适应调度优化

Haobo Chen, Xiangxiang Xu, Yuheng Bu

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) University of Rochester(罗彻斯特大学)

专题命中 视频生成 :video generation(abstract)

AI总结 针对扩散模型中分类器自由引导(CFG)导致的多样性-覆盖权衡问题,提出基于信息论的CFG调度优化框架,通过清洁端点参考优化实际分布,在ImageNet-512和COCO上实现竞争性权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23296 2026-06-23 cs.RO 新提交 50%

IOI: Decoupling Kinematics and Physics for Interactive World Models

IOI: 解耦运动学与物理学的交互式世界模型

Chengyu Bai, Peidong Jia, Tiecheng Guo, Yukai Wang, Rui Ma, Fangyuan Zhao, Chunkai Fan, Xiaobao Wei, Jintao Chen, Hao Wang, Ying Li, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) Peking University(北京大学)

专题命中 视频生成 :video generation(abstract)

AI总结 提出IOI混合交互式世界模型,通过显式运动学先验与学习物理动力学解耦,实现精确控制对齐和物理合理视觉反馈,在RoboTwin基准上达到最优仿真性能与零样本泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20388 2026-06-19 cs.HC cs.AI cs.DB 新提交 50%

DataMagic: Transforming Tabular Data into Data Insight Video

DataMagic: 将表格数据转化为数据洞察视频

Yupeng Xie, Chen Ma, Zhenyang Wang, Liangwei Wang, Jiayi Zhu, Chuxuan Zeng, Zhouan Shen, Boyan Li, Yuyu Luo

机构 * HKUST (GZ)(香港理工大学(珠海)) China Unicom(中国联合网络通信集团)

专题命中 视频生成 :video generation(abstract)

AI总结 提出DataMagic系统,通过声明式规范DVSpec和多智能体架构,将原始表格数据和自然语言查询转化为叙事性数据洞察视频,并支持交互式探索。

Comments 5 pages, 3 figures, accepted at VLDB 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22748 2026-06-17 cs.AI 版本更新 50%

Agentic World Modeling: Foundations, Capabilities, Laws, and Beyond

代理世界建模:基础、能力、定律及更远

Meng Chu, Xuan Billy Zhang, Kevin Qinghong Lin, Lingdong Kong, Jize Zhang, Teng Tu, Weijian Ma, Ziqi Huang, Senqiao Yang, Wei Huang, Yeying Jin, Zhefan Rao, Jinhui Ye, Xinyu Lin, Xichen Zhang, Qisheng Hu, Shuai Yang, Leyang Shen, Wei Chow, Yifei Dong, Fengyi Wu, Quanyu Long, Bin Xia, Shaozuo Yu, Mingkang Zhu, Wenhu Zhang, Jiehui Huang, Haokun Gui, Runyi Li, Chenyu Tang, Dong Huang, Xuhang Chen, Rui Liu, Chengzu Li, Shiyi Du, Xu Huang, Haoxuan Che, Long Chen, Qifeng Chen, Wenya Wang, Wenxuan Zhang, Xiaojuan Qi, Yang Deng, Yanwei Li, Mike Zheng Shou, Zhi-Qi Cheng, See-Kiong Ng, Ziwei Liu, Philip Torr, Jiaya Jia

机构 * Hong Kong University of Science and Technology(香港科学与技术大学) National University of Singapore(新加坡国立大学) University of Oxford(牛津大学) Nanyang Technological University(南洋理工大学) Chinese University of Hong Kong(香港中文大学) University of Hong Kong(香港大学) University of Washington(华盛顿大学) University of Tokyo(东京大学) Carnegie Mellon University(卡内基梅隆大学) University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) Singapore University of Technology and Design(新加坡科技设计大学) Singapore Management University(新加坡管理学院) XGEN Labs(XGEN实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出'层次x定律'分类法,定义三个能力层级和四个约束领域,综合400余篇文献总结100余系统,分析方法、失败模式和评估实践,提出决策导向的评估原则和可复现评估包,展望从被动预测到重塑环境的代理世界建模路径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05160 2026-06-04 cs.RO 50%

GRAIL: Generating Humanoid Loco-Manipulation from 3D Assets and Video Priors

GRAIL: 从3D资产和视频先验生成人形机器人全身操作

Tianyi Xie, Haotian Zhang, Jinhyung Park, Zi Wang, Bowen Wen, Jiefeng Li, Xueting Li, Qingwei Ben, Haoyang Weng, Yufei Ye, David Minor, Tingwu Wang, Chenfanfu Jiang, Sanja Fidler, Jan Kautz, Linxi Fan, Yuke Zhu, Zhengyi Luo, Umar Iqbal, Ye Yuan

机构 * NVIDIA UCLA(加州大学洛杉矶分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出GRAIL全虚拟生成管线,利用3D资产和视频基础模型先验合成人机交互演示,无需物理搭建或遥操作,实现人形机器人全身操作策略的模拟到现实迁移。

Comments Project page: https://research.nvidia.com/labs/dair/grail/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 50%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 视频生成 :video generation(abstract)

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00133 2026-06-02 cs.LG cs.ET 50%

World Models: A Comprehensive Survey of Architectures, Methodologies, Reasoning Paradigms, and Applications

世界模型:架构、方法论、推理范式与应用的全面综述

Arif Hassan Zidan, Yi Pan, Hanqi Jiang, Ruiyu Yan, Wei Ruan, Zihao Wu, Lifeng Chen, Weihang You, Xinliang Li, Bowen Chen, Huawen Hu, Peilong Wang, Sizhuang Liu, Jing Zhang, Siyuan Li, Zhengliang Liu, Yu Bao, Lin Zhao, Lichao Sun, Dajiang Zhu, Xiang Li, Jinglei Lv, Quanzheng Li, Wei Liu, Tianming Liu, Wei Zhang

机构 * School of Computer and Cyber Sciences, Augusta University(奥古斯塔大学计算机与网络科学学院) School of Computing, University of Georgia(佐治亚大学计算机学院) Department of Biomedical Engineering, New Jersey Institute of Technology(新泽西理工学院生物医学工程系) Department of Radiology, Massachusetts General Hospital, Harvard Medical School(麻省总医院放射科,哈佛医学院) Department of Computer Science and Engineering, University of Texas at Arlington(德克萨斯大学阿灵顿分校计算机科学与工程系) Department of Graduate Psychology, James Madison University(詹姆斯麦迪逊大学研究生心理学系) Computer Science and Engineering, Lehigh University(莱斯大学计算机科学与工程系) School of Biomedical Engineering, The University of Sydney(悉尼大学生物医学工程学院) Tandon School of Engineering, New York University(纽约大学泰坦工程学院) Department of Radiation Oncology, City of Hope National Medical Center(城市希望国家医学中心放射肿瘤科) Department of Mayo Clinic Comprehensive Cancer Center, Mayo Clinics(梅奥诊所综合癌症中心,梅奥诊所) Savannah River Ecology Laboratory (SREL), University of Georgia(萨凡纳河生态实验室(SREL),佐治亚大学)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出一个多轴分类法,从架构、方法论、推理策略和应用领域四个维度系统综述世界模型,涵盖从早期认知科学基础到PlaNet、Dreamer系列、MuZero、Sora等里程碑系统,并指出未来方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20795 2026-06-01 cs.RO 50%

Learning Generalizable Robot Policy with Human Demonstration Video as a Prompt

以人类演示视频为提示学习可泛化的机器人策略

Xiang Zhu, Yichen Liu, Hezhong Li, Jianyu Chen

机构 * Tsinghua University, China(清华大学,中国) Shanghai Qi Zhi Institute, China(上海启智研究院,中国)

专题命中 视频生成 :video generation(abstract)

AI总结 提出两阶段框架,利用人类演示视频学习可泛化机器人策略,无需遥操作数据或微调即可执行新任务。

Comments Accepted to the IEEE International Conference on Robotics and Automation (ICRA), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28203 2026-05-28 cs.LG 50%

Refining Multidimensional Video Reward Models via Disentangled Influence Functions

通过解耦影响函数优化多维视频奖励模型

Muyao Wang, Zeke Xie, Hideki Nakayama

机构 * The University of Tokyo(东京大学) HKUST (Guangzhou)(香港科技大学(广州))

专题命中 视频生成 :text-to-video(abstract)

AI总结 针对文本到视频生成任务中训练样本在不同评估维度上可靠性不一致的问题,提出解耦影响框架以估计维度特定监督风险,并设计维度解耦剪枝与重加权策略,显著提升多维视频奖励模型与真实标注的对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27491 2026-05-28 cs.RO 50%

GE-Sim 2.0: A Roadmap Towards Comprehensive Closed-loop Video World Simulators for Robotic Manipulation

GE-Sim 2.0:迈向机器人操作综合闭环视频世界模拟器的路线图

Boxiang Qiu, Liliang Chen, Yue Liao, Nan Wang, Lintao Wang, Jiayi Luo, Wenzhi Zhao, Shengcong Chen, Di Chen, Ye Li, Chen Gao, Shuicheng Yan, Si Liu, Maoqing Yao, Guanghui Ren

机构 * AgiBot BUAA(北京航空航天大学) LV-NUS Lab(国立大学理工学院实验室) TJU(天津大学)

专题命中 视频生成 :video generation(abstract)

AI总结 提出GE-Sim 2.0,一种基于动作条件视频生成的闭环视频世界模拟器,通过重新训练数千小时真实机器人数据并新增状态专家、世界裁判和加速框架三个模块,实现高保真动作跟随和轨迹覆盖,在WorldArena排行榜上以2B参数超越专用模型和通用视频生成器,并验证了基于其生成轨迹和奖励训练的策略在真实世界中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16229 2026-05-26 cs.LG 50%

Factored Latent Action World Models

因子化潜在动作世界模型

Zizhao Wang, Chang Shi, Jiaheng Hu, Kevin Rohling, Roberto Martín-Martín, Amy Zhang, Peter Stone

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 视频生成 :video generation(abstract)

AI总结 提出因子化潜在动作模型(FLAM),通过将场景分解为独立因子并学习各自的潜在动作,提升了无动作视频中多实体动态建模的准确性和视频生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.11815 2026-05-26 cs.CY 50%

Video Deepfake Abuse: How Company Choices Predictably Shape Misuse Patterns

视频深度伪造滥用:公司选择如何可预测地塑造滥用模式

Max Kamachee, Stephen Casper, Michelle L. Ding, Rui-Jie Yew, Anka Reuel, Stella Biderman, Dylan Hadfield-Menell

专题命中 视频生成 :video generation(abstract)

AI总结 本文通过分析2025年视频生成模型,指出少数开放权重的模型成为生成逼真AIG-NCII视频的主要工具,并论证开发者与分发平台的责任,强调风险管理可显著影响未来滥用难度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 50%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03205 2026-05-19 cs.LG cs.NA math.NA math.ST stat.TH 50%

Transformers for Learning on Noisy and Task-Level Manifolds: Approximation and Generalization Insights

用于噪声和任务级流形学习的Transformer:近似和泛化见解

Zhaiming Shen, Alex Havrilla, Rongjie Lai, Alexander Cloninger, Wenjing Liao

机构 * School of Mathematics, Georgia Institute of Technology(佐治亚理工学院数学系) Department of Mathematics, Purdue University(普渡大学数学系) Department of Mathematics and Halicioğlu Data Science Institute, University of California, San Diego(加州大学圣地亚哥分校数学系和Halicioğlu数据科学研究所)

专题命中 视频生成 :video generation(abstract)

AI总结 本文研究了Transformer在噪声和任务级流形上的学习性能,证明了其在低维结构中泛化能力与任务级流形的内在维度密切相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04204 2026-04-28 cs.CY cs.AI cs.CL cs.HC cs.MA 50%

TeachMaster: Generative Teaching via Code

TeachMaster: 通过代码生成教学内容

Yuheng Wang, Runde Yang, Lin Wu, Jie Zhang, Jingru Fan, Tianle Zhou, Ruoyu Fu, Huatao Li, Ruijie Shi, Siheng Chen, Weinan E, Chen Qian

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出Generative Teaching paradigm,通过多智能体框架TeachMaster实现教学内容的自动化生成,提升生产效率并降低教育视频制作成本。

Comments Accepted to ACL 2026; https://www.teachmaster.cn/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19734 2026-04-22 cs.RO cs.AI 50%

UniT: Toward a Unified Physical Language for Human-to-Humanoid Policy Learning and World Modeling

UniT:迈向人类到人形机器人政策学习和世界建模的统一物理语言

Boyu Chen, Yi Chen, Lu Qiu, Jerry Bai, Yuying Ge, Yixiao Ge

机构 * XPENG Robotics(小鹏机器人) Tsinghua University(清华大学) The University of Hong Kong(香港大学)

专题命中 视频生成 :video generation(abstract)

AI总结 UniT通过三分支交叉重建机制建立统一物理语言,实现人类到人形机器人的跨身体迁移,提升政策学习和世界建模的效率与鲁棒性。

Comments Project page: https://xpeng-robotics.github.io/unit/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19194 2026-04-22 cs.GR 50%

sumo3Dviz: A three dimensional traffic visualisation

sumo3Dviz: 一种三维交通可视化

Kevin Riehl, Julius Schlapbach, Anastasios Kouvelas, Michail A. Makridis

专题命中 视频生成 :video generation(abstract)

AI总结 sumo3Dviz提供轻量级开源3D可视化工具,用于SUMO交通模拟,支持外部视角和第一人称视角,优化批量视频生成,适用于大规模场景可视化和教育演示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17820 2026-04-21 cs.SE 50%

Raven: Rethinking Automated Assessment for Scratch Programs via Video-Grounded Evaluation

Raven: 通过视频基础评估重新思考Scratch程序的自动化评估

Donglin Li, Daming Li, Hanyuan Shi, Jialu Zhang

专题命中 视频生成 :video generation(abstract)

AI总结 Raven通过视频生成规则替代传统断言,实现Scratch程序的自动化评估,提升评估的一致性和可扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10367 2026-04-14 cs.AI cs.SD 50%

Beyond Monologue: Interactive Talking-Listening Avatar Generation with Conversational Audio Context-Aware Kernels

超越独白:基于对话音频上下文感知核的交互式谈话-倾听虚拟角色生成

Yuzhe Weng, Haotian Wang, Xinyi Yu, Xiaoyan Wu, Haoran Xu, Shan He, Jun Du

机构 * University of Science and Technology of China(中国科学技术大学) iFLYTEK(科大讯飞)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出基于对话音频上下文感知核的交互式虚拟角色生成方法,通过引入多头高斯核解决谈话与倾听行为的时间尺度差异问题,构建了能同时处理双流音频输入的全双工虚拟代理,并在VoxHear数据集上验证了其在生成自然响应的全双工数字人类方面的优越性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07721 2026-04-10 cs.MA 50%

Sima 1.0: A Collaborative Multi-Agent Framework for Documentary Video Production

Sima 1.0:一种用于纪录片视频制作的协作多智能体框架

Zhao Song

专题命中 视频生成 :video generation(abstract)

AI总结 Sima 1.0通过多智能体系统优化纪录片视频制作流程,将任务分解为11个步骤,利用人类操作基础创作和录制,AI代理处理编辑、字幕优化等任务,减少生产负担,提升制作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07517 2026-04-10 cs.RO 50%

Grasp as You Dream: Imitating Functional Grasping from Generated Human Demonstrations

抓取如梦:从生成的人类示范中模仿功能抓取

Chao Tang, Jiacheng Xu, Haofei Lu, Bolin Zou, Wenlong Dong, Hong Zhang, Danica Kragic

机构 * Department of Robotics, Perception and Learning, KTH Royal Institute of Technology(KTH皇家理工学院机器人、感知与学习系) Shenzhen Key Laboratory of Robotics and Computer Vision, Southern University of Science and Technology(南方科技大学深圳市机器人视觉与感知重点实验室)

专题命中 视频生成 :video generation(abstract)

AI总结 本文提出GraspDreamer方法,利用视觉生成模型合成的人类示范实现零样本功能抓取,通过隐含的通用先验知识和动作优化,提升数据效率和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24587 2026-04-02 cs.LG cs.RO 50%

DreamerAD: Efficient Reinforcement Learning via Latent World Model for Autonomous Driving

DreamerAD:通过潜在世界模型实现高效的强化学习用于自动驾驶

Pengxuan Yang, Yupeng Zheng, Deheng Qian, Zebin Xing, Qichao Zhang, Linbo Wang, Yichen Zhang, Shaoyu Guo, Zhongpu Xia, Qiang Chen, Junyu Han, Lingyun Xu, Yifeng Pan, Dongbin Zhao

机构 * Institute of Automation, CAS(中国科学院自动化研究所) Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) School of Advanced Interdisciplinary Sciences, UCAS(中国科学院大学先进交叉科学学院) School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)

专题命中 视频生成 :video generation(abstract)

AI总结 DreamerAD通过压缩扩散采样将步骤从100步减少到1步,实现80倍加速并保持视觉可解释性,解决了自动驾驶中真实世界数据训练成本高和安全风险大的问题。

Comments authors update

详情

展开后加载摘要…

URL PDF HTML 收藏