arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9881 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9200 篇

2607.17454 2026-07-21 cs.RO 新提交 79%

Test-Time Scaling for World Action Models via Zero-Shot Geometric Evaluation

通过零样本几何评估实现世界行动模型的测试时缩放

Zesen Zhao, Minkyoung Cho, Hui shen, Boyuan Zheng, Kunxiao Gao, Yulong Cao, Z. Morley Mao

机构 * University of Michigan(密歇根大学) NVIDIA(英伟达)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 研究针对世界行动模型,提出无需训练的选择性测试时缩放框架\methodgated,基于预测未来的跨视图深度重投影一致性排序,经实验验证该方法能提高任务成功率,同时减少额外采样决策点,还识别出相关失败模式。

Comments Extened version of CVPR 2026 EAI workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05133 2026-07-07 cs.CV 新提交 79%

UNIVERSE: Unified Video Action Models for Autonomous Driving with Flexible Mask-Modulated Modality Generation

UNIVERSE:面向自动驾驶的基于灵活掩码调制模态生成的统一视频动作模型

Mengmeng Liu, Diankun Zhang, Jiuming Liu, Jianfeng Cui, Hongwei Xie, Guang Chen, Hangjun Ye, Francesco Nex, Hao Cheng, Michael Ying Yang

机构 * University of Twente(特温特大学) Xiaomi EV(小米汽车) University of Cambridge(剑桥大学) University of Bath(巴斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 针对现有方案难以将视频建模收益迁移至轨迹生成的问题,提出单掩码调制扩散Transformer的统一模型,通过模态解耦掩码实现直接的视频监督,大幅提升跨域动作泛化与推理效率。

Comments 18 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02640 2026-07-07 cs.SD cs.AI cs.NI 新提交 79%

Metronome: Bound the Cache, Keep the Beat for Real-Time Interaction Model Serving

节拍器:限制缓存,为实时交互模型服务保持节奏

Jiaying Meng, Bojie Li

机构 * Pine AI(松果人工智能公司)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 研究实时交互模型服务问题,核心方法是限制会话驻留状态。主要贡献是消除崩溃,使每帧延迟成为单调负载信号,在线准入控制器可发现可调度并发,还能用一阶模型预测崩溃时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02503 2026-07-03 cs.RO 新提交 79%

VT-WAM: Visual-Tactile World Action Model for Contact-Rich Manipulation

VT-WAM: 面向密集接触操作的视觉-触觉世界动作模型

Shuai Tian, Yupeng Zheng, Yuhang Zheng, Songen Gu, Yujie Zang, Yuxing Qin, Weize Li, Haoran Li, Wenchao Ding, Dongbin Zhao

机构 * SKL-MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所复杂系统管理与控制国家重点实验室) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) TARS Robotics National University of Singapore(新加坡国立大学) Fudan University(复旦大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出VT-WAM,在统一流匹配框架中联合学习视觉预测、触觉变形预测和动作预测,通过非对称混合Transformer注意力和接触门控注意力引导,在六项真实密集接触操作任务中平均成功率71.67%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 79%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21088 2026-06-23 cs.RO 新提交 79%

MV-WAM: Manifold-Aware World Action Model with Value Augmentation

MV-WAM: 具有价值增强的流形感知世界动作模型

Jintao Chen, Peidong Jia, Qingpo Wuwu, Jiaming Liu, Mengfei Du, Chun-Kai Fan, Xiaowei Chi, Hao Chen, Chengyu Bai, Zezhong Qian, Hao Wang, Jiajun Cao, Weishi Mi, Xiaozhu Ju, Jian Tang, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出MV-WAM框架,通过跨模态因果掩码、流形感知优化和进度价值调节机制,联合建模视觉预测、动作生成和价值估计,在分布外场景中提升动作泛化能力,在仿真和真实机器人任务上显著优于基线。

Comments 20 pages, 9 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17906 2026-06-17 cs.RO 新提交 79%

WAM-RL: World-Action Model Reinforcement Learning with Reconstruction Rewards and Online Video SFT

WAM-RL:基于重建奖励和在线视频SFT的世界-动作模型强化学习

Zezhong Qian, Xiaowei Chi, Yu Qi, Haozhan Li, Zhi Yang Chen, Shanghang Zhang

机构 * State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Northeastern University(东北大学) Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出WAM-RL框架,通过强化学习联合优化世界模型和动作模型,解决长时域任务中仅优化动作模型的不足,首次将强化学习引入世界-动作范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08555 2026-06-15 cs.RO 新提交 79%

FAWAM: Force-Aware World Action Models for Closed-Loop Contact-Rich Manipulation

FAWAM: 面向闭环密集接触操作的力感知世界动作模型

Haotian He, Zeyu Yan, Qipeng Liu, Ning Guo, Wenzhao Lian

机构 * School of Mathematical Sciences, Peking University(北京大学数学科学学院) School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出FAWAM,在感知、预测和闭环执行三个层次融入力信息,通过联合预测动作与末端扳手及残差校正模块,提升密集接触操作的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12987 2026-06-12 cs.CV cs.AI cs.LG cs.RO 新提交 79%

Diffusion Transformer World-Action Model for AV Scene Prediction

扩散Transformer世界-动作模型用于自动驾驶场景预测

Ruslan Sharifullin, Benjamin Jiang, Kai Xi Chew

机构 * Stanford University(斯坦福大学)

专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 提出紧凑潜世界模型,结合扩散Transformer(DiT)预测未来场景,在nuScenes上实现4.8倍更好的KID,并实现动作可控性(转向ρ=0.81)。

Comments 10 pages, 9 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10040 2026-06-11 cs.RO 版本更新 79%

Efficient-WAM: A 1B-Parameter World-Action Model with Low-Cost Future Imagination

Efficient-WAM: 一种具有低成本未来想象能力的10亿参数世界-动作模型

Jiajun Li, Tiecheng Guo, Yifan Ye, Rongyu Zhang, Xiaowei Chi, Qianpu Sun, Ying Li, Yunfan Lou, Yan Huang, Zhihe Lu, Meng Guo, Shanghang Zhang

机构 * The University of Hong Kong(香港大学) Peking University(北京大学) Muka Robotics(Muka机器人) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Efficient-WAM,通过紧凑视频专家、稀疏视频潜变量和非对称去噪降低未来想象成本,在保持控制性能的同时实现30倍推理加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08737 2026-06-09 cs.RO 新提交 79%

Dream-Tac: A Unified Tactile World Action Model for Contact-Rich Robot Manipulation

Dream-Tac: 用于接触丰富机器人操作任务的统一触觉世界动作模型

Yunfan Lou, Yifan Ye, Yankai Fu, Jun Cen, Xiaowei Chi, Yaoxu Lyu, Peidong Jia, Sirui Han, Zhihe Lu, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Nanjing University(南京大学) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出Dream-Tac统一触觉世界动作模型,通过接触门控视觉-触觉融合和接触感知注意力偏置,联合建模动作、未来视觉观察和触觉动态,在六项接触丰富操作任务中平均动作准确率提升31.7%。

Comments 16 pages,13 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08242 2026-06-09 cs.CV 新提交 79%

Light-WAM: Efficient World Action Models with State-Fusion Action Decoding

Light-WAM:基于状态融合动作解码的高效世界动作模型

Ziang Li, Dongzhou Cheng, Yibin Wang, Shiyue Wang, Xiaoyang Xu, Lingxuan Weng, Juan Wang, Jiaqi Wang

机构 * Wuhan University(武汉大学) Shanghai Innovation Institute(上海创新研究院) Southeast University(东南大学) Fudan University(复旦大学) East China Normal University(华东师范大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出轻量级世界动作模型Light-WAM,通过紧凑视频骨干和降维潜空间未来视频监督降低训练成本,并引入状态融合动作专家实现高效动作预测,在LIBERO和RoboTwin 2.0上取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07089 2026-06-08 cs.RO 新提交 79%

Dreaming when Necessary: Advancing World Action Models with Adaptive Multi-Modal Reasoning

必要时做梦:通过自适应多模态推理推进世界行动模型

Yinzhou Tang, Jingbo Xu, Yu Shang, Zihao Song, Chen Gao, Wei Wu, Yong Li

机构 * Tsinghua University(清华大学) Manifold AI

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出AdaWAM,通过轻量动态路由器自适应触发文本或视觉推理,提升长时复杂任务中的推理效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03188 2026-06-03 cs.RO 79%

GeoSem-WAM: Geometry- and Semantic-Aware World Action Models

GeoSem-WAM:几何与语义感知的世界动作模型

Fulong Ma, Daojie Peng, Wenjun Yue, Jiahang Cao, Bintao Wang, Qiang Zhang, Jun Ma

机构 * HKUST(GZ)(香港科技大学(广州)) HKU(香港大学) USTC(中国科学技术大学) SDU(山东大学) X-Humaniod

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出GeoSem-WAM框架,通过几何和语义监督增强潜在表示,在统一潜在空间中联合捕捉场景动态、空间几何和语义上下文,避免测试时显式未来展开或视频生成,提升动作预测准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28544 2026-05-28 cs.CV 79%

DriveWAM: Video Generative Priors Enable Scalable World-Action Modeling for Autonomous Driving

DriveWAM: 视频生成先验实现自动驾驶的可扩展世界-动作建模

Chen Shi, Jinrui Xu, Shaoshuai Shi, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing(Voyager Research,滴滴出行)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 提出DriveWAM,通过将预训练视频扩散Transformer适配为自回归视频-动作策略,并引入场景演化驾驶引导和选择性KV记忆,实现可扩展的世界-动作建模,在NAVSIM和PhysicalAI基准上取得强规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23856 2026-05-25 cs.RO 79%

Point Tracking Improves World Action Models

点跟踪改进了世界动作模型

Jiarui Guan, Wenshuai Zhao, Yue Pei, Ziliang Chen, Arno Solin, Juho Kannala

机构 * Aalto University(阿alto大学) ELLIS Institute Finland(ELLIS研究所芬兰) University of Oulu(奥卢大学) Sun Yat-sen University(中山大学) Peng Cheng Laboratory(鹏城实验室) Beihang University(北京航空航天大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 提出联合像素与跟踪的世界动作模型JOPAT,通过预测2D点跟踪和动作来提升机器人策略学习,在长时域、遮挡和离屏运动任务上优于纯像素方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06247 2026-05-08 cs.RO 79%

CKT-WAM: Parameter-Efficient Context Knowledge Transfer Between World Action Models

CKT-WAM: 在世界动作模型之间高效传递上下文知识

Yuhua Jiang, Yijun Guo, Hongbing Yang, Guojun Lei, Nuo Chen, Yinuo Zhang, Shaoqiang Yan, Bo Lin, Feifei Gao, Biqing Qi

机构 * Tsinghua University(清华大学) LivsynRobotics Shanghai AI Laboratory(上海人工智能实验室)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 CKT-WAM通过文本嵌入空间中的紧凑上下文传递教师WAM知识,提升零样本泛化能力,在LIBERO-Plus上达到86.1%的成功率,且在现实任务中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19043 2026-05-08 cs.AI 79%

Learning Lifted Action Models from Unsupervised Visual Traces

从无监督视觉轨迹中学习提升的动作模型

Kai Xi, Stephen Gould, Sylvie Thiébaux

机构 * School of Computing, The Australian National University(澳大利亚国立大学计算机学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文提出一种深度学习框架,通过无监督视觉轨迹学习状态预测、动作预测及提升的动作模型,并引入混合整数线性规划防止预测崩溃,提升模型在多领域中的全局一致性。

Comments Accepted to the 36th International Conference on Automated Planning and Scheduling (ICAPS-26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.25859 2026-05-05 cs.RO 79%

Privileged Foresight Distillation: Zero-Cost Future Correction for World Action Models

特权预见蒸馏:世界动作模型的零成本未来修正

Pengcheng Fang, Hongli Chen, Xiaohao Cai

机构 * The University of Southampton(南安普顿大学) The University of Queensland(昆士兰大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 本文提出特权预见蒸馏,通过将未来信息作为可压缩的修正项进行蒸馏,提升世界动作模型在无未来信息下的表现,实验证明其在LIBERO和RoboTwin任务中有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.26489 2026-04-30 cs.LG cs.IR 79%

Understanding DNNs in Feature Interaction Models: A Dimensional Collapse Perspective

理解特征交互模型中的DNN:从维度崩溃视角出发

Jiancheng Wang, Mingjia Yin, Hao Wang, Enhong Chen

机构 * University of Science Technology of China \& State Key Laboratory of Cognitive Intelligence Hefei China Technology of China \& State Key Laboratory of Cognitive Intelligence

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

AI总结 本文从维度鲁棒性角度探讨DNN在特征交互模型中的有效性,通过实验验证并分析DNN缓解嵌入维度崩溃的机制。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26259 2026-04-16 cs.IR cs.AI cs.CL 79%

Working Notes on Late Interaction Dynamics: Analyzing Targeted Behaviors of Late Interaction Models

晚期交互动力学工作笔记:分析晚期交互模型的目标行为

Antoine Edy, Max Conti, Quentin Macé

机构 * Illuin Technology(Illuin技术)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 本文研究了晚期交互检索中长度偏差和最大相似性操作符外的相似性分布,揭示了因果模型和双向模型的实际性能瓶颈。

Comments Accepted at The 1st Late Interaction Workshop (LIR) @ ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08685 2026-04-13 cs.AI 79%

RAMP: Hybrid DRL for Online Learning of Numeric Action Models

RAMP:用于在线学习数字动作模型的混合深度强化学习

Yarin Benyamin, Argaman Mordoch, Shahaf S. Shperberg, Roni Stern

机构 * Ben-Gurion University of the Negev(内盖夫本-古里安大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 RAMP通过环境交互在线学习数字规划动作模型,结合深度强化学习策略、动作模型学习和规划,形成正反馈循环提升求解能力和计划质量。

Comments Accepted as a workshop paper at the Adaptive and Learning Agents (ALA) Workshop at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01570 2026-04-03 cs.RO 79%

Boosting Vision-Language-Action Finetuning with Feasible Action Neighborhood Prior

通过可行动作邻域先验提升视觉-语言-动作微调

Haochen Niu, Kanyu Zhang, Shuyu Yin, Qinghai Guo, Peilin Liu, Fei Wen

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Technologies(华为技术有限公司)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.RO

AI总结 本文提出FAN引导正则化方法,通过调整模型输出分布以匹配FAN几何特性,提升VLA适应的样本效率和泛化能力。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26360 2026-03-30 cs.RO 79%

Realtime-VLA V2: Learning to Run VLAs Fast, Smooth, and Accurate

Realtime-VLA V2:学习以快速、平滑和准确地运行VLAs

Chen Yang, Yucheng Hu, Yunchao Ma, Yunhuan Yang, Jing Tan, Haoqiang Fan

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO

AI总结 本文提出Realtime-VLA V2,通过校准、规划与控制及学习方法,实现机器人在真实任务中高速、高精度和高灵活性的VLAs运行。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05815 2026-03-09 cs.RO 79%

Hierarchical Latent Action Model

层次化潜在动作模型

Hanjung Kim, Lerrel Pinto, Seon Joo Kim

机构 * Yonsei University(延世大学) New York University(纽约大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO

AI总结 HiLAM通过建模长期时间信息,从无动作视频中发现高层次潜在技能,提升了动态技能发现的鲁棒性。

Comments ICLR 2026 Workshop - 2nd Workshop on World Models: Understanding, Modelling and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08946 2026-03-04 q-bio.BM cs.LG 79%

Physically Valid Biomolecular Interaction Modeling with Gauss-Seidel Projection

基于高斯-塞德尔投影的物理有效生物分子相互作用建模

Siyuan Chen, Minghao Guo, Caoliwen Wang, Anka He Chen, Yikun Zhang, Jingjing Chai, Yin Yang, Wojciech Matusik, Peter Yichen Chen

机构 * University of British Columbia(不列颠哥伦比亚大学) MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) NVIDIA(英伟达) Peking University(北京大学) Foundry Biosciences(Foundry 生物科技) University of Utah(犹他大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.LG

AI总结 本文提出了一种基于高斯-塞德尔投影的生物分子相互作用建模方法,通过强制物理有效性约束提升结构准确性,实现高效且稳定的去噪过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01700 2026-03-03 cs.RO 79%

TacMamba: A Tactile History Compression Adapter Bridging Fast Reflexes and Slow VLA Reasoning

TacMamba: 一种连接快速反射与慢速VLA推理的触觉历史压缩适配器

Zhenan Wang, Yanzhe Wang, Meixuan Ren, Peng Li, Yang Liu, Yifei Nie, Limin Long, Yun Ye, Xiaofeng Wang, Zhen Zhu, Huixu Dong

机构 * Zhejiang University(浙江大学) GigaAI Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO

AI总结 TacMamba通过触觉历史压缩器和双阶段训练策略,实现高频率触觉数据与低频视觉推理的高效融合,提升实时任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00615 2026-03-03 cs.RO 79%

TGM-VLA: Task-Guided Mixup for Sampling-Efficient and Robust Robotic Manipulation

TGM-VLA:基于任务的混合学习用于高效且鲁棒的机器人操作

Fanqi Pu, Lei Jiang, Wenming Yang

机构 * Shenzhen International Graduate School, Tsinghua University, Shenzhen, China(清华大学深圳国际研究生院) The National and Local Co-Build Humanoid Robotics Innovation Center(国家级与地方共建人形机器人创新中心)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO

AI总结 TGM-VLA通过优化关键帧采样策略和引入颜色反转投影模块,提升机器人操作任务的效率和鲁棒性。

Comments 8 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20577 2026-02-25 cs.CV 79%

Efficient and Explainable End-to-End Autonomous Driving via Masked Vision-Language-Action Diffusion

高效的端到端自动驾驶:通过掩码视觉-语言-动作扩散

Jiaru Zhang, Manav Gagvani, Can Cui, Juntong Peng, Ruqi Zhang, Ziran Wang

机构 * Institute for Physical Artificial Intelligence (IPAI), Purdue University(物理人工智能研究所(IPAI)、普渡大学) College of Engineering, Purdue University(工程学院、普渡大学) Department of Computer Science, Purdue University(计算机科学系、普渡大学)

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.CV

AI总结 MVLAD-AD通过掩码视觉-语言-动作扩散模型,提升自动驾驶的效率与规划精度,实现高效且可解释的端到端自动驾驶。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20383 2026-01-29 cs.CV 79%

HINT: Hierarchical Interaction Modeling for Autoregressive Multi-Human Motion Generation

HINT: 用于自回归多人体运动生成的分层交互建模

Mengge Liu, Yan Di, Gu Wang, Yun Qu, Dekai Zhu, Yanyan Li, Xiangyang Ji

机构 * Tsinghua University(清华大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV

AI总结 HINT通过分层交互建模提出了一种自回归框架,实现多人体运动生成,提升了交互建模的精度和长序列的连贯性。

详情

展开后加载摘要…

URL PDF HTML 收藏