arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 594 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 594 篇

2606.31167 2026-07-01 cs.RO cs.AI 新提交 88%

MIRTH: Mutual-Information Reasoning with Temporal Hubs for Vision-Language-Action Agents

MIRTH:面向视觉-语言-动作智能体的基于互信息推理的时间枢纽

Hao Sun, Yu Song, Shiyu Teng, Ziwei Niu, Yen-Wei Chen

机构 * College of Information Science and Engineering, Ritsumeikan University(立命馆大学信息科学与工程学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(title);分类 cs.RO、cs.AI

AI总结 提出MIRTH框架,通过双尺度时间记忆枢纽、互信息优化的潜在推理令牌和并行动作解码,解决VLA模型的时间短视、推理鸿沟和推理低效问题,在LIBERO和真实机器人上达到SOTA并展现错误恢复能力。

Comments Accepted as main conference paper at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14772 2026-06-16 cs.CV cs.AI 新提交 88%

ScoutVLA: UAV-Centric Active Perception via a Dual-Expert VLA Model for Open-World Embodied Question Answering

ScoutVLA:面向开放世界具身问答的无人机中心主动感知双专家VLA模型

Wenhao Lu, Zhengqiu Zhu, Xiaofeng Wang, Xiaoran Zhang, Yatai Ji, Yong Zhao, Yue Hu, Yingzhen Nie, Jinlong Zhu, Zheng Zhu

机构 * National Key Laboratory of Digital Intelligent Modeling and Simulation, National University of Defense Technology(国防科技大学数字智能建模与仿真国家重点实验室) GigaAI

专题命中 VLA模型 :VLA(title,title_cn);vision-language-action(abstract);action model(abstract);分类 cs.CV、cs.AI

AI总结 针对无人机在室外具身问答中细粒度视角调整不足的问题,提出ScoutVLA模型,采用解耦双专家架构(视觉语言专家推断语义意图,动作专家生成连续视角调整轨迹),并通过知识隔离机制平衡连续控制与语义推理,在仿真和真实实验中显著优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12396 2026-06-11 cs.CV cs.RO 新提交 88%

VLGA: Vision-Language-Geometry-Action Models for Autonomous Driving

VLGA:用于自动驾驶的视觉-语言-几何-动作模型

Jin Yao, Dhruva Dixith Kurra, Tom Lampo, Zezhou Cheng, Danhua Guo, Burhan Yaman

机构 * Uber AV Labs(Uber自动驾驶实验室) University of Virginia(弗吉尼亚大学)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV

AI总结 提出VLGA模型,通过引入几何作为第四模态,利用逐像素点图回归损失监督,实现密集3D世界重建,在nuScenes和Bench2Drive上达到SOTA。

Comments Project page: https://yaojin17.github.io/VLGA/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27138 2026-07-30 cs.RO cs.AI cs.CV 新提交 88%

DLAM: Distributional Latent Actions with Temporal Constraints

DLAM:带时间约束的分布隐式动作模型

Zuojin Tang, Feifan Luo, Haoyun Liu, Botai Yuan, Dekang Qi, Ronghan Chen, Yandan Yang, Tong Lin, Xinyuan Chang, Mu Xu, Bin Liu, De Ma, Zhiheng Ma

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 该研究针对VLA模型数据稀缺问题,提出带时间约束的分布隐式动作模型DLAM,通过特定约束优化隐式动力学,提升了视频重建效果及机器人操作任务的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06836 2026-06-08 cs.RO cs.AI cs.CV 新提交 88%

Think Like a Pilot: Fine-Grained Long-Horizon UAV Navigation

像飞行员一样思考:细粒度长时程无人机导航

Xiangyi Zheng, Xiangyu Wang, Qinan Liao, Zimu Tang, Yue Liao, Dongyue Lyu, Guodong Wang, Junjie Liu, Si Liu

机构 * Colab Beihang University(北航) Meituan(美团) National University of Singapore(新加坡国立大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出FLIGHT基准和FLIGHT VLA异步架构,通过低频飞行员推理VLM与高频扩散动作模型解耦,实现无人机长时程语义指令下的平滑连续飞行控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17043 2026-06-16 cs.RO cs.LG 新提交 87%

Hierarchical Advantage Weighting for Online RL Fine-Tuning of VLAs from Sparse Episode Outcomes

基于层级优势加权的在线RL微调VLA策略从稀疏回合结果

Tongyan Fang, Siyuan Huang, Naiyu Fang, Ganlong Zhao, Zhongjin Luo, Jianbo Liu, Xiaogang Wang, Ying Dong, Hongsheng Li

机构 * ACE Robotics Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) The Chinese University of Hong Kong(香港中文大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO、cs.LG

AI总结 提出层级优势加权行为克隆(HABC),通过分离生存性和效率目标并自适应平衡,解决稀疏二元结果下VLA策略在线微调中的信用分配问题,在三个双臂接触任务上将成功率从12-44%提升至38-92%。

Comments Website: https://acerobotics-vla.github.io/HABC-Website

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16697 2026-08-18 cs.AI 新提交 87%

FabriMAE I Trust Myself? Self-Evaluating VLA Action Generation with Markov Attention Entropy

FabriMAE:我相信自己吗?基于马尔可夫注意力熵的视觉-语言-动作模型动作自评估

Aniri, Chen Yilin, Jinhe Bi, Junfei Guo, Donglai Ran, Xu Bian, Zengjie Jin, Yujun Wang, Yijun Tian, Volker Tresp, Fei Shen, Tat-Seng Chua, Yunpu Ma

机构 * National University of Singapore(新加坡国立大学) Ludwig Maximilian University of Munich(慕尼黑大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Amazon(亚马逊) East China University of Science and Technology(华东理工大学) Mese Technology Limited Co., Ltd.(迈泽科技有限公司) FabriX team at Youibot Robotics Co., Ltd.(优必科技有限公司FabriX团队)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.AI

AI总结 本研究针对视觉-语言-动作模型的动作自评估难题,提出基于马尔可夫注意力熵(MAE)的自评估框架,构建LIBERO-Reflect基准,实验显示MAE性能优于现有方法,还提升了PI系列动作选择的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04927 2026-07-07 cs.RO cs.AI 新提交 87%

DSWAM: A Dual-System World Action Foundation Model for Fine-Grained Robot Manipulation

DSWAM:用于细粒度机器人操作的双系统世界行动基础模型

Jian Zhu, Jianjun Zhang, Taiyi Su, Tianbin Liu, Zhangyuan Wang, Kai Xie, Zitai Huang, Chong Ma, Youzhang He, Tianjian Wang, Hanyang Wang, Weihao Ding, Yi Xu

机构 * AIRC, Midea Group(美的集团美云智数) Tongji University(同济大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在复杂任务指令分解及VLA与WAM执行能力对比方面的不足,引入DSWAM,通过双系统结合,利用视觉历史和任务提示预测子任务,经多种训练及加速等实现细粒度机器人操作并进行公平对比。

Comments 13 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22997 2026-07-28 cs.RO cs.AI cs.GR cs.LG 新提交 87%

Real2Sim2Real for Vision-Language-Action Manipulation: An AMD ROCm-Based Pipeline

用于视觉-语言-动作操纵的Real2Sim2Real:基于AMD ROCm的管道

Qing Yang, Xun Wang, Ziguan Wang, Zhenjiang Li, Hongqiang Wang, Dongdong Weng

机构 * AMD AIG Team(AMD人工智能团队) Beijing Institute of Technology(北京理工大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG

AI总结 本文针对视觉-语言-动作操纵提出基于AMD ROCm的Real2Sim2Real技术栈,涵盖多硬件计算,由开放软件栈统一。通过四个演示表明无需CUDA锁定生态系统,展示了在多硬件平台上的相关成果,且管道可在特定硬件和平台上原生运行并重现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06595 2026-06-16 astro-ph.HE astro-ph.GA 新提交 87%

VLA Observations Confirm AT 2023mfm as an Off-nuclear Tidal Disruption Event

VLA观测确认AT 2023mfm为核外潮汐瓦解事件

Wenkai Li, Collin T. Christy, Kate D. Alexander, Itai Sfaradi, Xinya Huang, Ning Jiang, Tanmoy Laskar, Andrew Mummery, Noah Franz, Adelle J. Goodwin, Walter W. Golay, Raffaella Margutti, Ryan Chornock, Jiazheng Zhu, Sjoert van Velzen, Yvette Cendes, Wenbin Lu, Jimmy Lynch

专题命中 VLA模型 :VLA(title,title_cn)

AI总结 利用高分辨率VLA射电成像,确认AT 2023mfm为核外潮汐瓦解事件,并揭示其与宿主星系核的偏移,验证了射电成像在识别核外TDE候选体中的有效性。

Comments 4 pages, 1 figure, published in RNAAS

Journal ref Res. Notes AAS 10 (2026) 153

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15139 2026-08-18 cs.RO 新提交 86%

StructRL: Structured Action-Space Exploration for Flow-Based VLAs

StructRL:面向基于流的视觉-语言-动作模型的结构化动作空间探索

Jiarui Yang, Bin Zhu, Jingjing Chen, Na Zou, Yanwei Fu, Jianggang Zhu, Yu-Gang Jiang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学) Singapore Management University(新加坡管理大学)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO

AI总结 StructRL通过将策略随机性重定位至动作空间的三个耦合设计,解决基于流的VLA模型的结构化噪声稀释问题,在模拟与真实任务上提升了探索效率及OOD性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09771 2026-08-11 cs.RO 新提交 86%

SLIM-0.5B: Learning Action-Grounded Predictive Latents for Robot Manipulation

SLIM-0.5B:学习机器人操作的动作基础预测隐变量

Jingkai Wang, Zihan Tang, Gu Zhang, Mingyu Cao, Jiapeng Chen, Jingjiao Zhao, Xiansheng Chen, Pengwei Wang, Lemao Liu, Dejing Dou

机构 * Fudan University(复旦大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Tsinghua University(清华大学) Renmin University of China(中国人民大学)

专题命中 VLA模型 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);action model(abstract,abstract_cn);分类 cs.RO

AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。

Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03563 2026-08-05 cs.RO 新提交 86%

Unified Visuomotor Targets: Supervising VLAs Beyond Physical Actions

统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作

Zhenyang Feng, Unnat Jain

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性

Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16938 2026-07-21 cs.CV cs.AI cs.LG cs.RO 新提交 86%

What Do They See? Interpreting Complex Road Scenarios Through the Eyes of Vision-Language-Action Models for Safe and Trustworthy Autonomous Vehicle Learning

他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习

Kalpana Panda, Wesley Maia, Vinti Agarwal, Ross Greer

机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) University of California, Merced(加州大学默塞德分校)

专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI

AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23938 2026-06-24 cs.AI cs.CL 新提交 86%

Neuro-Symbolic Drive: Rule-Grounded Faithful Reasoning for Driving VLAs

神经符号驱动:基于规则忠实推理的驾驶VLA

Xiangbo Gao, Xiukun Huang, Boyu Lu, Junge Zhang, Mengjie Mao, Jiachen Li, Wei Xiong, Zhengzhong Tu

机构 * Texas A&M University(德克萨斯农工大学) Carnegie Mellon University(卡内基梅隆大学) University of Maryland(马里兰大学) University of California, Riverside(加利福尼亚大学河滨分校) University of Pittsburgh(匹兹堡大学)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.AI

AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08520 2026-06-09 cs.RO 新提交 86%

Two Bridges, One Pathway: From VLMs to Generalizable VLAs with Embodied Trajectory-Coupled Data

两座桥梁,一条路径:从VLM到具有具身轨迹耦合数据的可泛化VLA

Linqi Yin, Shiduo Zhang, Shenling Qiu, Chenxin Li, Zhaoyang Fu, Lei Xiao, Xiang Wang, Chenchen Yang, Zhe Xu, Pengfang Qian, Jingjing Gong, Xipeng Qiu, Xuanjing Huang, Yu-Gang Jiang

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO

AI总结 提出具身轨迹耦合(ETC)数据作为中间桥梁,通过三阶段训练策略(分布桥接、目标桥接、保留适应)将视觉语言模型(VLM)逐步转化为可泛化的视觉语言动作模型(VLA),解决从VLM到VLA的双重鸿沟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03231 2026-08-05 cs.RO cs.AI 新提交 86%

Structure-Aware Robust Fine-Tuning: Defending Vision-Language-Action Robots Against Physical Attention Hijacking

结构感知鲁棒微调:防御视觉-语言-动作机器人抵御物理注意力劫持

Jinquan Zhang, Dongfu Yin, Run Yang, Yufeng Yan, Zhen Tian, F. Richard Yu

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 本研究针对视觉-语言-动作机器人面临的物理注意力劫持攻击,提出注意力引导语义破坏攻击方法,并开发结构感知鲁棒微调防御方法,大幅降低攻击失败率并提升真实机械臂操控成功率。

Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29613 2026-08-03 cs.RO cs.CL cs.CV 新提交 86%

WCM: A World Critic Model for Vision-Language-Action Reinforcement Learning

WCM:用于视觉-语言-动作强化学习的世界评论者模型

Senyu Fei, Xiaopeng Yu, Siyin Wang, Xianzhong Zhao, Jingjing Gong, Xipeng Qiu

机构 * Tongji University(同济大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08182 2026-07-10 cs.CV cs.AI 新提交 86%

LEEVLA: Seeing What Matters in Latent Environment Evolution for Vision-Language-Action

LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素

Qi Lyu, Baicheng Liu, Xudong Wang, Jiahua Dong, Lianqing Liu, Zhi Han

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04591 2026-07-07 cs.RO cs.AI 新提交 86%

Simple-to-Complex Structured Demonstrations for Vision-Language-Action Learning

用于视觉-语言-动作学习的从简单到复杂的结构化演示

Xinchuan Qiu, Yi Yu

机构 * Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 研究视觉-语言-动作模型中演示的收集与组织问题,提出用双臂机器人平台的从简单到复杂结构化演示收集策略,依三原则组织数据,提升了学习效率与稳定性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03449 2026-07-07 cs.RO cs.AI 新提交 86%

HiMe: Hierarchical Embodied Memory for Long-Horizon Vision-Language-Action Control

HiMe:用于长距离视觉-语言-动作控制的分层具身记忆

Li Ji, Siyin Wang, Pengfang Qian, Xiaopeng Yu, Yihai Tian, Zhaoye Fei, Jingjing Gong, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) East China Normal University(华东师范大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02092 2026-07-07 cs.RO cs.AI 新提交 86%

Guided Action Flow: Q-Guided Inference for Flow-Matching Vision-Language-Action Policies

引导动作流:面向流匹配视觉-语言-动作策略的Q引导推理

Liuhaichen Yang, Zhuang Jiang, Chenchao Sheng, Zezhi Tang

机构 * Department of Computer Science, University College London(计算机科学系,伦敦大学学院) Department of Mechanical Engineering, University College London(机械工程系,伦敦大学学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出Guided Action Flow框架,通过冻结预训练策略并利用学习到的动作块评论家引导逆向流采样,在LIBERO任务中单任务评论家将成功率从68.0%提升至82.0%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31144 2026-07-01 cs.RO cs.AI 新提交 86%

A Modular Vision-Language-Action Robotics Framework for Indoor Environments

面向室内环境的模块化视觉-语言-动作机器人框架

Anindya Jana, Snehasis Banerjee, Arup Sadhu, Ranjan Dasgupta

机构 * TCS Research, Tata Consultancy Services(塔塔咨询服务公司TCS研究部) CMU(卡内基梅隆大学)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI

AI总结 提出模块化架构,集成环境建图、问题处理和导航,通过双流并行处理(语义体素建图与语言分类)实现自然语言指令驱动的自主任务执行。

Comments IEEE IROS 2025 Workshop on Generative AI for Robotics and Smart Manufacturing

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19531 2026-06-19 cs.CV cs.RO 新提交 86%

ImageWAM: Do World Action Models Really Need Video Generation, or Just Image Editing?

ImageWAM:世界动作模型真的需要视频生成,还是只需要图像编辑?

Yuyang Zhang, Wenyao Zhang, Zekun Qi, He Zhang, Haitao Lin, Jingbo Zhang, Yao Mu, Xiaokang Yang, Wenjun Zeng, Xin Jin

机构 * Shanghai Jiao Tong University(上海交通大学) Eastern Institute of Technology(东方理工学院) Tencent Robotics X(腾讯机器人X) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院)

专题命中 VLA模型 :action model(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV

AI总结 提出ImageWAM框架,利用预训练图像编辑模型替代视频生成进行机器人动作预测,通过编辑去噪的KV缓存作为世界动作上下文,在多个模拟和真实实验中优于基线,计算量降至1/6,延迟降至1/4。

Comments Project Page: https://zhangwenyao1.github.io/ImageWAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15768 2026-06-16 cs.RO cs.AI 新提交 86%

LaWAM: Latent World Action Models for Efficient Dynamics-Aware Robot Policies

LaWAM: 用于高效动力学感知机器人策略的潜在世界行动模型

Jialei Chen, Kai Wang, Kang Chen, Shuaihang Chen, Feng Gao, Wenhao Tang, Zhiyuan Li, Weilin Liu, Zhuyu Yao, Boxun Li, Yuanbo Xu, Chao Yu

机构 * Tsinghua University(清华大学) Jilin University(吉林大学) Nankai University(南开大学) Peking University(北京大学) Harbin Institute of Technology(哈尔滨工业大学) Zhongguancun Academy(中关村学院) Striding.AI Infinigence AI

专题命中 VLA模型 :action model(title,abstract);vision-language-action(abstract);VLA(abstract_cn);分类 cs.RO、cs.AI

AI总结 提出LaWAM模型,通过潜在视觉子目标预测场景变化,实现动力学感知的机器人控制,在多个基准上达到最优或竞争性成功率,且推理延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11743 2026-06-11 cs.RO cs.GR cs.LG 新提交 86%

TacCoRL: Integrating Tactile Feedback into VLA via Simulation

TacCoRL: 通过仿真将触觉反馈集成到视觉-语言-动作模型中

Siyu Ma, Yuqi Liang, Chang Yu, Yunuo Chen, Hao Su, Yixin Zhu, Yin Yang, Chenfanfu Jiang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) University of California, San Diego(加利福尼亚大学圣迭戈分校) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学) University of Utah(犹他大学)

专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 提出TacCoRL框架,通过仿真与真实联合训练和强化学习,将触觉反馈注入视觉-语言-动作策略,在接触密集型任务中平均成功率提升22.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26095 2026-06-25 cs.RO cs.AI cs.CV 新提交 86%

Learning Action Priors for Cross-embodiment Robot Manipulation

跨具身机器人操作的动作先验学习

Dong Jing, Tianqi Zhang, Jiaqi Liu, Jinman Zhao, Zelong Sun, Li Erran Li, Zhiwu Lu, Mingyu Ding

机构 * Renmin University of China(中国人民大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Toronto(多伦多大学) Amazon(亚马逊)

专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.AI

AI总结 提出两阶段训练框架,先通过流匹配预训练动作模块学习跨具身时间运动结构,再迁移至VLA训练,提升数据效率与任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13026 2026-08-14 cs.RO 新提交 85%

Temporal GRPO: Beyond Trajectory-Level Credit in Vision-Language-Action Reinforcement Learning

时间差分GRPO:超越视觉-语言-动作强化学习中的轨迹级信用分配

Yao Zhou, Hang Gao, Fengge Wu, Changwen Zheng, Wenwen Qiang

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 针对视觉-语言-动作强化学习中轨迹级信用混叠问题,提出时间差分GRPO方法,在RoboTwin 2.0和LIBERO-Long上提升了任务性能与样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09381 2026-08-11 cs.RO 新提交 85%

JEPA-WAM: Learning Vision-Language-Action Policies with Joint-Embedding World Modeling

JEPA-WAM:基于联合嵌入世界建模的视觉-语言-动作策略学习

Yihan Lin, Jiawei He, Shifeng Bao, Chen Zhao, Yang Li, Xiaobo Wang, Yan Wang, Cheng Chi, Jing Zhang

机构 * XYZ Embodied AI(XYZ具身智能)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract,abstract_cn);action model(abstract);分类 cs.RO

AI总结 该研究提出JEPA-WAM,一种构建于预训练V-JEPA空间的隐式WAM,通过共享预测器耦合隐式转移预测与动作生成,在LIBERO-Plus等数据集上取得优异的机器人操作策略性能,且泛化能力强。

Comments 22 pages, 7 figures. Project page: https://spritewithoutice.github.io/JEPA_WAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06965 2026-08-10 cs.RO 新提交 85%

Cross-View Action Consistency for Camera-Robust Vision-Language-Action Policies

面向相机鲁棒性的视觉-语言-动作策略的跨视图动作一致性

Bingqi Huang, Bingchuan Wei, Xuan Wang, Yingkai Cai, Zhaokui Wang

机构 * Tsinghua University(清华大学) Informatics Institute, University of Amsterdam(阿姆斯特丹大学信息学研究所) Faculty of Science, Vrije Universiteit Amsterdam(阿姆斯特丹自由大学理学院)

专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO

AI总结 本研究针对视觉-语言-动作策略的相机鲁棒性问题,提出跨视图动作一致性正则化方法,在LIBERO-Plus数据集及真实机器人任务上均显著提升了相机扰动下的策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏