arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

机器人 / 具身智能

机器人、具身智能、机器人学习、操作、导航和具身世界模型。

共收录 874 信号源:cs.RO, cs.AI, cs.CV, cs.LG

1. 机器人学习 874 篇

2607.23268 2026-07-28 cs.RO 新提交 57%

Sling2Sim2Real: One-Shot Elastic System Identification for Non-Destructive Slingshot Policy Learning

Sling2Sim2Real:用于无损弹弓策略学习的一次性弹性系统识别

Wonjae Kang, Geonwoo Kim, Minseok Song, Daehyung Park

机构 * School of Computing, Korea Advanced Institute of Science and Technology(韩国科学技术院计算机学院)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 针对弹性物体操纵中校准现实与模拟弹性行为的挑战,提出Sling2Sim2Real框架;通过多起点Real2Sim系统识别方法及模拟策略学习等,从单次无损交互识别弹性参数,实现准确策略学习与稳健泛化,减少现实交互量。

Comments Accepted by IROS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31493 2026-07-22 cs.RO 版本更新 57%

ChronoFlow-Policy: Unifying Past-Current-Future Interaction Flow in Visuomotor Policy Learning

ChronoFlow-Policy:在视觉运动策略学习中统一过去-当前-未来交互流

Bokai Lin, Yifu Xu, Xinyu Zhan, Hongjie Fang, Jialin Tian, Fu-Cheng Zhang, Yong-Lu Li, Cewu Lu, Lixin Yang

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院) Noematrix

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 提出ChronoFlow统一表示过去、当前和未来的交互动态,并基于此设计扩散策略ChronoFlow-Policy,在模拟和真实操作任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16998 2026-07-21 cs.RO 新提交 57%

User-Driven Learning from Demonstration: A Trajectory and Impedance Learning Method

用户驱动的示范学习:一种轨迹和阻抗学习方法

Zi-Qi Yang, Mehrdad R. Kermani

机构 * Department of Electrical and Computer Engineering, Western University(西安大略大学电气与计算机工程系)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 本文提出一种用户驱动的机器人示范学习方法,结合三维快速微分同胚匹配算法与基于动态系统的运动生成器,利用扩展卡尔曼滤波器补偿误差,引入阻抗参数化函数学习阻抗变化,经实验验证可减少用户工作量,确保动作精确再现并提升人机交互安全性。

Comments Accepted at IEEE International Conference on Automation Science and Engineering (CASE) 2026, 7 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13455 2026-07-16 cs.RO 新提交 57%

Reverse to Advance: Teleoperation-Cost Effective Hard Policy Learning from Reversed Easy Tasks

逆向推进:从逆向简单任务中进行遥操作成本有效的硬策略学习

Qiyuan Qiao, Ge Yuan, Can Wang, Dong Xu

机构 * The University of Hong Kong(香港大学)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 研究针对高质量遥操作数据集收集成本高的问题,提出通过逆向简单任务进行硬策略学习的框架,含闭环数据收集、分层数据细化和迭代策略学习方法,经实验验证该方法能高效稳定地训练复杂操作任务,提升硬任务成功率。

Comments 17 pages, 17 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15587 2026-07-16 cs.RO 版本更新 57%

Perfect Demo Makes Poor Teacher: Learning Robust Alignment from Critical Motion Segments

完美演示造就差劲教师:从关键运动片段学习鲁棒对齐

Mingyu Liu, Zeju Li, Jiuhe Shu, Hanqing Wang, Yuhao Chao, Hao Chen, Chunhua Shen

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) Nanjing University(南京大学)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04739 2026-07-07 cs.RO 新提交 57%

Spatial Attention: Adapting Execution Horizons for Diffusion Policies via Observation Sensitivity

空间注意力:通过观测敏感度调整扩散策略的执行范围

Che-Sang Park, Junsu Ha, Jianlong Fu, Frank C. Park

机构 * Robotics Laboratory, Seoul National University(首尔国立大学机器人实验室) Microsoft Research Asia(微软亚洲研究院)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 研究如何在机器人学习中自适应调整采样动作块的执行范围以平衡响应性和计算成本,引入空间注意力概念,通过预测未来值动态分配执行范围,实验表明该方法可提高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05941 2026-07-03 cs.RO 版本更新 57%

Latent Policy Barrier: Learning Robust Visuomotor Policies by Staying In-Distribution

潜在策略屏障:通过保持分布内学习鲁棒的视觉运动策略

Zhanyi Sun, Shuran Song

机构 * Stanford University(斯坦福大学)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 提出潜在策略屏障(LPB)框架,通过将专家演示的潜在嵌入作为隐式屏障,分离精确模仿与分布外恢复,利用基础扩散策略和动力学模型提升视觉运动策略的鲁棒性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32009 2026-07-01 cs.RO 新提交 57%

Human-as-Humanoid: Enabling Zero-Shot Humanoid Learning from Ego-Exo Human Videos with Human-Aligned Embodiments

人类作为人形机器人:通过人类对齐的具身从自我-外部人类视频实现零样本人形机器人学习

Xiaopeng Lin, Ruoqi Yang, Shijie Lian, Zhaolong Shen, Bin Yu, Changti Wu, Haibao Liu, Yuxiang Zhang, Hong Li, Qiyuan Su, Haochen Liu, Xuguo He, Yukun Shi, Cong Huang, Zhirui Zhang, Bojun Cheng, Kai Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) DeepCybo ZGCA ZGCI Harbin Institute of Technology(哈尔滨工业大学) Huazhong University of Science and Technology(华中科技大学) Beihang University(北京航空航天大学)

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 提出Human-as-Humanoid框架,通过对齐机器人本体、感知设置和动作标签接口,将大规模人类演示视频转化为可执行的动作监督,实现高自由度人形机器人的零样本学习。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29570 2026-06-30 cs.RO 57%

Hierarchical Policy Learning via Spectral Decomposition

基于谱分解的层次化策略学习

Shuxin Cao, Liquan Wang, Walker Byrnes, Yiye Chen, Yilun Du, Animesh Garg

专题命中 机器人学习 :manipulation(abstract);分类 cs.RO

AI总结 提出Causal Spectral Policy (CSP),利用离散余弦变换将机器人动作分解为低频全局轨迹和高频精细修正,实现因果粗到细的动作生成,在精密操作任务中优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24049 2026-06-24 cs.RO 新提交 57%

SPACE: Enabling Learning from Cross-Robot Data Toward Generalist Policies

SPACE:从跨机器人数据中学习通用策略

Haeone Lee, Byeongguk Jeon, Suchae Jeong, Jian Kim, Kimin Lee

机构 * KAIST(韩国科学技术院) Config Yonsei University(延世大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 提出SPACE框架,通过笛卡尔状态增量作为通用动作表示,结合动作适配器处理机器人动力学差异,实现跨本体和硬件的策略学习,显著优于直接预测控制命令的方法。

Comments Project page: http://haeone.site/space-website

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20394 2026-06-19 cs.RO math.OC 新提交 57%

Agentic AutoResearch forSpace Autonomy: An Auditable, LLM-Driven Research Agent for Aerospace Control Problems

面向空间自主性的智能体自动研究:用于航空航天控制问题的可审计、LLM驱动的研究代理

Amit Jain, Richard Linares

机构 * Department of Aeronautics and Astronautics(航空航天学系)

专题命中 机器人学习 :navigation(abstract);分类 cs.RO

AI总结 提出AutoResearch框架,利用大语言模型作为离线研究代理,自动迭代开发航天控制策略,并通过内置可信层审计结果,消除种子噪声影响,在交会和对接问题上验证了有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16696 2026-06-16 cs.RO 新提交 57%

VENOM: Versatile Embodied Network for Omni-bodied Motion tracking

VENOM: 用于全身运动追踪的多功能具身网络

Siddharth Padmanabhan, Kazuki Miyazawa, Takato Horii

机构 * Graduate School of Engineering Science, University of Osaka(大阪大学工学研究科)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 提出VENOM,一种基于GPT的跨具身全身运动追踪模型,在仿真中实现多个人形机器人的全身运动追踪,无需分离上下身控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05645 2026-06-10 cs.RO 版本更新 57%

Discrete-WAM: Unified Discrete Vision-Action Token Editing for World-Policy Learning

Discrete-WAM:面向世界-策略学习的统一离散视觉-动作标记编辑

Ziyang Yao, Haochen Liu, Yuncheng Jiang, Zeyu Zhu, Zibin Guo, Jingru Wang, Tianle Liu, Jianwei Cui, Kuiyuan Yang, Hongwei Xie, Jingwei Zhao, Guang Chen, Hangjun Ye

机构 * Xiaomi EV(小米电动车)

专题命中 机器人学习 :world model(abstract);分类 cs.RO

AI总结 提出Discrete-WAM,通过将未来视觉状态和自车动作对齐为离散标记,构建统一离散扩散框架,实现世界建模、世界-动作策略和分层决策策略的联合学习,支持可控生成和反事实推理,提升自动驾驶决策可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09476 2026-06-09 cs.RO 新提交 57%

Goal Sets, Not Goal States: Queryable Robot Goals through Goal-Set Hindsight Relabeling

目标集,而非目标状态:通过目标集事后重标记实现可查询的机器人目标

Carlos Vélez García, Miguel Cazorla, Jorge Pomares

机构 * INESCOP(西班牙鞋类及相关技术研究所) University of Alicante(阿利坎特大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 提出目标集事后重标记(GS-HER),将事后重标记从单目标状态推广到谓词级目标集,通过可查询的二值谓词解耦成功条件与状态维度,提升离线GCRL在冗余维度下的性能,并实现单一模型支持多目标谓词。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01649 2026-06-04 cs.CV 57%

PhyScene3D: Physically Consistent Interactive 3D Tabletop Scene Generation

PhyScene3D:物理一致的交互式3D桌面场景生成

Weixing Chen, Zhuoqian Feng, Yang Liu, Yexin Zhang, Yifan Wen, Yinghong Liao, Weichao Qiu, Guanbin Li, Liang Lin

机构 * Sun Yat-sen University, China(中山大学) Peng Cheng Laboratory(鹏城实验室) Guangdong Key Laboratory of Big Data Analysis and Processing(广东省大数据分析与处理重点实验室) Huawei(华为)

专题命中 机器人学习 :robotic(abstract);分类 cs.CV

AI总结 提出PhyScene3D框架,通过认知拓扑推理链和物理感知去噪对齐,解决3D桌面场景生成中的物理一致性问题,显著降低碰撞率。

Comments 23 pages, 5 figures, accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1809.07874 2026-06-04 math.OC cs.RO cs.SY eess.SY 57%

Task-Driven Estimation and Control via Information Bottlenecks

基于信息瓶颈的任务驱动估计与控制

Vincent Pacelli, Anirudha Majumdar

机构 * Princeton University(普林斯顿大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出了一种基于信息瓶颈理论的任务驱动估计与控制框架,通过任务相关的变量构建高效表示,并设计了在线算法进行状态估计以实现鲁棒的控制策略。

Comments 9 pages, 4 figures, abridged version accepted to ICRA2019; Incorporates changes in final conference submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01851 2026-06-03 cs.RO 57%

PHASOR: Phase-Anchored Universal Action Representations for Humanoid Embodiments

PHASOR: 面向人形本体的相位锚定通用动作表示

Kihyun Kim, Chaeyun Kim, Jongho Shin, Taeyoun Kwon, Junghyun Kim, Mijin Koo, Haon Park

机构 * AIM Intelligence Seoul National University(首尔国立大学) LG Electronics(LG电子) MAUM AI OpenMind

专题命中 机器人学习 :robot policy(abstract);分类 cs.RO

AI总结 提出PHASOR方法,通过将动作嵌入空间分解为相位流形和姿态分支,并结合运动语义蒸馏,构建跨本体的通用动作表示,实现人形机器人的跨本体检索和下游任务性能提升。

Comments * Equal contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
1108.4698 2026-06-03 cs.RO cs.SY eess.SY math.OC 57%

Least Squares Temporal Difference Actor-Critic Methods with Applications to Robot Motion Control

最小二乘时序差分演员-评论家方法及其在机器人运动控制中的应用

Reza Moazzez Estanjini, Xu Chu Ding, Morteza Lahijanian, Jing Wang, Calin A. Belta, Ioannis Ch. Paschalidis

专题命中 机器人学习 :robotics(abstract);分类 cs.RO

AI总结 针对最大化到达某些状态同时避免其他状态的概率的马尔可夫决策过程问题,提出一种基于最小二乘时序差分学习的演员-评论家近似动态规划算法,并证明其收敛到参数空间中的驻点。

Comments Technical report accompanying an accepted paper to CDC 2011

详情

展开后加载摘要…

URL PDF HTML 收藏
1103.4342 2026-06-03 cs.RO cs.SY eess.SY math.OC 57%

MDP Optimal Control under Temporal Logic Constraints

时序逻辑约束下的MDP最优控制

Xu Chu Ding, Stephen L. Smith, Calin Belta, Daniela Rus

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 针对马尔可夫决策过程(MDP),提出一种在给定线性时序逻辑(LTL)规范下自动生成控制策略的方法,并引入优化命题以最小化期望成本,通过动态规划算法合成最优或次优策略。

Comments Technical report accompanying the CDC2011 submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.31075 2026-06-01 cs.CV 57%

Task-Focused Memorization for Multimodal Agents

面向多模态智能体的任务聚焦记忆

Tao Zou, Yichen He, Tian Qiu, Yuan Lin, Hang Li

机构 * Fudan University(复旦大学)

专题命中 机器人学习 :embodied agent(abstract);分类 cs.CV

AI总结 提出基于强化学习的任务聚焦记忆策略学习框架TaskMem,通过两阶段训练使多模态智能体在流式观测中动态选择任务相关记忆,在三个流式基准上VQA准确率提升5.3%-7.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25326 2026-05-26 cs.CV 57%

Perceive-then-Plan: Layout-as-Policy for Monocular 3D Scene Layout Estimation

感知-然后-规划:以布局为策略的单目3D场景布局估计

Junwei Zhou, Yu-Wing Tai

机构 * Department of Computer Science(计算机科学系) Dartmouth College(达特茅斯学院)

专题命中 机器人学习 :manipulation(abstract);分类 cs.CV

AI总结 提出Perceive-then-Plan框架,通过视觉语言模型将单目3D布局估计转化为感知与迭代规划问题,以布局为策略(LaP)学习动作序列逐步优化场景假设,生成更物理一致且与观测对齐的3D布局。

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24922 2026-05-26 cs.RO 57%

MuJoCoUni:Persistent Batched Runtime Primitives for MuJoCo

MuJoCoUni:MuJoCo的持久化批处理运行时原语

Yufei Jia, Junzhe Wu

机构 * Tsinghua University(清华大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 提出MuJoCoUni,一个用于在线机器人学习和批处理物理评估的MuJoCo下游发行版,通过BatchEnvPool提供有状态环境执行的运行时原语,支持高吞吐并行执行并保持上游语义。

Comments Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23856 2026-05-25 cs.RO 57%

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

专题命中 机器人学习 :robot policy(abstract);分类 cs.RO

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18743 2026-05-21 cs.AI 57%

WorldString: Actionable World Representation

WorldString: 可行动态世界表征

Kunqi Xu, Jitao Li, Jianglong Ye, Tianshu Tang, Isabella Liu, Sifei Liu, Xueyan Zou

机构 * CalTech(加州理工学院) UC San Diego(南加州大学) Tsinghua University - IEI Lab(清华大学-IEI实验室) NVIDIA(英伟达)

专题命中 机器人学习 :world model(abstract);分类 cs.AI

AI总结 本文提出WorldString,一种能够通过点云或RGB-D视频流直接学习现实物体状态流形的神经架构,为构建可行动态世界模型提供基础构建块。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17001 2026-05-14 cs.RO 57%

Unify Robot Actions in Camera Frame

在摄像机坐标系中统一机器人动作

Sicheng Xie, Lingchen Meng, Zijie Diao, Haidong Cao, Zhiying Du, Shuyuan Tu, Jiaqi Leng, Qiuyue Wang, Mingsheng Li, Shuai Bai, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学) Shanghai Innovation Institute(上海创新研究院) Qwen Team, Alibaba Inc.(通义实验室,阿里巴巴公司)

专题命中 机器人学习 :robot learning(abstract);分类 cs.RO

AI总结 本文提出CalibAll方法,通过摄像机外参标注统一不同机器人平台的动作表示,提升跨平台学习性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00775 2026-05-13 cs.RO cs.SY eess.SY 57%

SAGAS: Semantic-Aware Graph-Assisted Stitching for Offline Temporal Logic Planning

SAGAS:语义感知的图辅助拼接用于离线时序逻辑规划

Ruijia Liu, Ancheng Hou, Xiang Yin

机构 * School of Automation and Intelligent Sensing(自动化与智能感知学院)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 SAGAS结合符号合成的组成性和从离线轨迹学习的数据驱动可达结构,实现零样本泛化,无需任务特定奖励或在线交互。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03600 2026-05-12 cs.RO 57%

Scalable and Efficient Continual Learning from Demonstration via a Hypernetwork-generated Stable Dynamics Model

通过超网络生成的稳定动力学模型实现可扩展且高效的示范学习

Sayantan Auddy, Jakob Hollenstein, Matteo Saveriano, Antonio Rodríguez-Sánchez, Justus Piater

机构 * Faculty of Electrical Engineering and Computer Science, Technical University of Berlin(电气工程与计算机科学系,柏林技术大学) Department of Computer Science, University of Innsbruck(计算机科学系,因斯布鲁克大学) Digital Science Center (DiSC), University of Innsbruck(数字科学中心(DiSC),因斯布鲁克大学) Department of Industrial Engineering, University of Trento(工业工程系,特伦托大学) Singular Research Center on Intelligent Systems (CiTIUS), University of Santiago de Compostela(智能系统研究中心(CiTIUS),圣地亚哥-德孔波斯特拉大学)

专题命中 机器人学习 :robotic(abstract);分类 cs.RO

AI总结 本文提出一种稳定的持续学习方法,利用超网络生成轨迹学习动力学模型和Lyapunov函数,提升稳定性与准确性,通过任务嵌入减少训练时间,实验证明其在多任务学习中优于现有方法。

Comments To appear in IEEE Transactions on Cognitive and Developmental Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22449 2026-05-12 cs.AI 57%

Emergence of Physical Intelligence via Controllable Information Production

通过可控信息生成实现物理智能的涌现

Tristan Shah, Stas Tiomkin

机构 * Department of Computer Science(计算机科学系) Texas Tech University(德克萨斯技术大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.AI

AI总结 本文提出可控信息生成框架,将内在动机与最优控制统一,揭示价值函数结构与柯莫哥罗夫-辛恩熵的联系,展现物理智能源于可控混沌边缘的驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01234 2026-05-05 cs.CV 57%

TT4D: A Pipeline and Dataset for Table Tennis 4D Reconstruction From Monocular Videos

TT4D:一个用于从单目视频中进行乒乓球4D重建的流水线和数据集

Nima Rahmanian, Daniel Kienzle, Thomas Gossard, Dvij Kalaria, Rainer Lienhart, Shankar Sastry

机构 * University of California, Berkeley(加州大学伯克利分校) University of Augsburg(奥格斯堡大学) University of Tübingen(图宾根大学)

专题命中 机器人学习 :robot learning(abstract);分类 cs.CV

AI总结 本文提出TT4D数据集,通过创新的重建流水线实现大规模高精度乒乓球比赛重建,解决单目视频中遮挡和视角变化带来的重建难题,支持虚拟回放和机器人学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14897 2026-04-28 cs.CV 57%

Seer: Language Instructed Video Prediction with Latent Diffusion Models

Seer:基于潜在扩散模型的语言指导视频预测

Xianfan Gu, Chuan Wen, Weirui Ye, Jiaming Song, Yang Gao

机构 * Shanghai Qi Zhi Institute(上海启智研究院) IIIS, Tsinghua University(清华大学人工智能研究院) Shanghai AI Lab(上海人工智能实验室) NVIDIA

专题命中 机器人学习 :robot policy(abstract);分类 cs.CV

AI总结 Seer通过扩展预训练文本到图像扩散模型的时间轴,提出高效模型以实现文本条件视频预测,提升机器人未来预测能力,实验表明其在多个数据集上性能优越。

Comments 31 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏