arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

共收录 9157 信号源:cs.RO, cs.CV, cs.AI, cs.LG

1. VLA模型 9157 篇

2607.29235 2026-08-03 cs.RO cs.AI cs.SY eess.SY 新提交 81%

FBFM: A Training-Free Asynchronous Feedback Mechanism for Flow-Matching in World-Action Models Execution

FBFM:一种用于世界-动作模型执行中流匹配的无训练异步反馈机制

Peize Li, Ruimeng Zhang, Ru Zhang, Cong Huang, Kai Chen, Shanghang Zhang

机构 * Peking University(北京大学) Tsinghua University(清华大学) Zhongguancun Academy(中关村学院) Zhongguancun Institute of Artificial Intelligence(中关村人工智能研究院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 该研究针对世界-动作模型分块反馈时间粒度粗、无法逐时间步纠错的问题,提出无训练异步反馈机制FBFM,在两类WAM上使LIBERO等任务成功率提升超5%,实现开环流生成与闭环真实世界动力学的桥接。

Comments 29 pages, 5 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28993 2026-08-03 cs.RO cs.CV 新提交 81%

ST-WAM: Semantic-Temporal World Action Model for Robust Manipulation under Visual Distribution Shifts

ST-WAM:面向视觉分布偏移下鲁棒操作的语义-时间世界动作模型

Mingxin Wang, Bin Hu, Bin Qian, Kaitao Jiang, Haoning Wu, Feng Yan, Bowen Jing, Ruiyang Hao, Enyi Wang, Kangning Niu, Yandan Yang, Mu Xu, Yan Wang, Houde Liu, Tianlun Li

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 该研究针对视觉分布偏移下机器人操作的鲁棒性问题,提出ST-WAM模型,采用DINOv3等技术,在多个基准测试中取得优异性能,大幅提升了偏移场景下的零样本操作表现。

Comments 9 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15207 2026-07-17 cs.LG cs.RO 新提交 81%

BadWAM: When World-Action Models Dream Right but Act Wrong

BadWAM:当世界-动作模型想得对但做得错时

Qi Li, Xingyi Yang, Xinchao Wang

机构 * National University of Singapore(新加坡国立大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.LG

AI总结 研究针对世界-动作模型(WAMs)提出BadWAM框架,用于建模和评估世界-动作漂移攻击,包括仅动作攻击和保持想象攻击,通过不同标准刻画攻击面,评估结果显示能大幅降低任务成功率,揭示WAM漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27677 2026-07-14 cs.RO cs.CV 版本更新 81%

DIM-WAM: World-Action Modeling with Diverse Historical Event Memory

DIM-WAM:基于多样化历史事件记忆的世界-动作建模

Kai Wang, Zhaopeng Gu, Yixiang Chen, Yuan Xu, Qisen Ma, Jiabing Yang, Zhaowen Li, Yan Huang, Liang Wang, Peng Su

机构 * NLPR, CASIA(中国科学院自动化研究所模式识别国家重点实验室) Yinwang Intelligent Technology(银旺智能科技) FiveAges(五龄科技)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出DIM-WAM,一种记忆增强的世界-动作模型,通过多尺度历史上下文、局部未来动态和全局任务进度解决长期遗忘问题,在RMBench和真实机器人任务上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09185 2026-07-13 cs.CV cs.RO 新提交 81%

Causally Debiased Latent Action Model for Embodied Action Conditioned World Models

用于具身动作条件世界模型的因果去偏潜行动模型

Yufan Wei, Kun Zhou, Lingjun Mao, Zijun Zhang, Ziming Xu, Ziqiao Xi, Shuang Liang, Ruobing Han, Yuchen Yan, Xinyue Wang, Fan Feng, Biwei Huang

机构 * Aether AI University of California, San Diego(加州大学圣地亚哥分校)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 研究针对动作条件世界模型学习需大量标记数据的问题,提出基于潜行动模型的因果去偏框架CD-LAM,通过三个微调目标改进模型,提升了潜行动可控性等多方面性能,减少了机器人动作适应更新次数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08436 2026-07-10 cs.RO cs.AI 新提交 81%

EgoWAM: World Action Models Beyond Pixels with In-the-Wild Egocentric Human Data

EgoWAM:利用野外自我中心人类数据超越像素的世界行动模型

Baoyu Li, Xinchen Yin, Mengying Lin, Yixin Zhang, Danfei Xu

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究利用野外自我中心人类数据训练机器人操纵模型,引入EgoWAM框架,固定部分设置仅改变世界预测目标,比较不同方法。结果表明WAM协同训练更有效,DINO和3D流提升显著,为机器人操纵提供新训练思路。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05468 2026-07-08 cs.RO cs.AI 新提交 81%

Learning 4D Geometric Priors for Inference-Efficient World Action Models

学习用于高效推理世界行动模型的4D几何先验

Jianjun Zhang, Jian Zhu, Taiyi Su, Chong Ma, Zitai Huang, Yi Xu, Hanli Wang

机构 * Midea AI Research Centers(美的人工智能研究中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 研究针对世界行动模型在捕捉操作所需几何信息不足的问题,提出MECo-WAM模型,通过注入4D几何先验、采用多专家协同训练等方法,在不增加推理成本的情况下提升了机器人操作性能。

Comments 9 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.14048 2026-07-08 cs.CV cs.RO 新提交 81%

WAM4D: Fast 4D World Action Model via Spatial Register Tokens

WAM4D:通过空间注册令牌实现快速4D世界动作模型

Ying Li, Xiaobao Wei, Jiajun Cao, Hao Wang, Xiaowei Chi, Chengyu Bai, Qianpu Sun, Jiajun Li, Xiaojie Zhang, Peidong Jia, Jian Tang, Sirui Han, Shanghang Zhang

机构 * Peking University(北京大学) The Hong Kong University of Science and Technology(香港科技大学) Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出WAM4D,利用轻量级空间注册令牌将预训练几何先验迁移至因果视频-动作变换器,实现高效4D世界动作建模,在RoboTwin 2.0和真实操作任务中提升空间一致性并保持快速推理。

Comments 15 pages, 7figures, 9tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03461 2026-07-07 cs.CV cs.LG 新提交 81%

WorldBagel: Uncovering the Power of Unified Multimodal Models for Vision-Language-Action-World Modeling

WorldBagel:揭示统一多模态模型在视觉-语言-动作-世界建模中的力量

Zelin Zhao, Min Shi, Bo Yuan, Haotian Xue, Jialuo Li, Lama Moukheiber, Humphrey Shi, Yongxin Chen

机构 * Georgia Institute of Technology(佐治亚理工学院)

专题命中 VLA模型 :vision-language-action(title,abstract);分类 cs.CV、cs.LG

AI总结 研究统一多模态模型在视觉-语言-动作-世界建模中的作用,基于BAGEL构建WorldBagel框架,通过多任务机器人操作等实验,发现统一不仅便利,更是学习有效模型的关键因素。

Comments Rejected by ECCV 2026, Arxiv Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16533 2026-07-07 cs.AI cs.CV 新提交 81%

Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI

Kairos: 面向物理AI的原生世界模型栈

Kairos Team, Fei Wang, Shan You, Qiming Zhang, Tao Huang, Zuoyi Fu, Zhisheng Zheng, Yunlong Xi, Feng Lv, Xiaoming Wu, Zeyu Liu, Cong Wan, Pu Li, Ruiqing Yang, Xiaoou Li, Wei Wang, Kangkang Zhu, Yuwei Zhang, Shi Fu, Zheng Zhang, Xiaoning Wu, Xuzeng Fan, Dacheng Tao, Xiaogang Wang

机构 * Kairos Team(Kairos团队)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.AI

AI总结 提出Kairos原生世界模型栈,通过跨具身数据课程、混合线性时间注意力架构和部署感知系统协同设计,实现世界知识获取、长时程状态保持与高效执行,在具身世界模型等基准上达到顶级性能。

Comments Kairos Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29908 2026-06-30 cs.RO cs.AI 81%

Pondering the Way: Spatial-perceiving World Action Model for Embodied Navigation

沉思之道:面向具身导航的空间感知世界动作模型

Hong Chen, Daqi Liu, Zehan Zhang, Haiguang Wang, Tianhao Lu, Longfei Yan, Haiyang Sun, Fangzhen Li, Hongwei Xie, Bing Wang, Guang Chen, Hangjun Ye, Yihua Tan

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 提出SWAM,一种任务中心联合观测-动作生成框架,通过单次推理同时生成中间RGB-D序列和对应动作轨迹,解决现有世界模型规划器依赖候选、计算开销大和动作-视觉不一致的问题,在成功率、轨迹精度和推理效率上显著超越两阶段方法。

Comments ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13977 2026-06-30 cs.RO cs.AI 81%

WoVR: World Models as Reliable Simulators for Post-Training VLA Policies with RL

WoVR:基于世界模型的可靠模拟器用于训练后VLA策略的强化学习

Zhennan Jiang, Shangqing Zhou, Yutong Jiang, Zefang Huang, Mingjie Wei, Yuhui Chen, Tianxing Zhou, Zhen Guo, Hao Lin, Quanlu Zhang, Yu Wang, Haoran Li, Chao Yu, Dongbin Zhao

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出WoVR框架,通过可控动作条件视频世界模型和关键帧初始化回放提升模拟稳定性,实现稳定长周期模拟回放和有效策略优化,取得优于LIBERO的性能。

Comments 25pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27374 2026-06-26 cs.RO cs.CV 新提交 81%

World Action Models Enable Continual Imitation Learning with Recurrent Generative Replays

世界行动模型通过循环生成重放实现持续模仿学习

Manish Kumar Govind, Dominick Reilly, Smit Patel, Hieu Le, Srijan Das

机构 * University of North Carolina at Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出循环生成重放(REGEN)框架,利用世界行动模型(WAM)生成伪重放轨迹,使机器人策略在不存储原始演示的情况下复习先前任务,在仿真和真实实验中减少50%灾难性遗忘,接近真实重放性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13494 2026-06-12 cs.RO cs.CV 新提交 81%

NavWAM: A Navigation World Action Model for Goal-Conditioned Visual Navigation

NavWAM:用于目标条件视觉导航的导航世界动作模型

Daichi Azuma, Taiki Miyanishi, Koya Sakamoto, Shuhei Kurita, Yaonan Zhu, Petr Khrapchenkov, Motoaki Kawanabe, Yusuke Iwasawa, Yutaka Matsuo

机构 * The University of Tokyo(东京大学) National Institute of Informatics(国立信息学研究所) AIRoA ATR

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 提出NavWAM,一种扩散变换器策略,通过联合学习未来观测、目标进度值和动作块,将导航世界模型预测直接转化为可执行动作,在离线基准和真实机器人部署中优于基于规划的世界模型基线。

Comments Project page: https://dachii-azm.github.io/navwam/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01847 2026-06-02 cs.RO cs.LG 81%

The Lie We Tell: Correcting the Euclidean Fallacy in Vision Language Action Policies via Score Matching on Tangent Space

我们说的谎言:通过切空间上的分数匹配纠正视觉-语言-动作策略中的欧几里得谬误

Bing-Cheng Chuang, I-Hsuan Chu, Bor-Jiun Lin, YuanFu Yang, Min Sun, Chun-Yi Lee

机构 * National Taiwan University(台湾大学)

专题命中 VLA模型 :vision language action(title);vision-language-action(abstract);分类 cs.RO、cs.LG

AI总结 针对扩散视觉-语言-动作策略将SE(3)位姿表示为平坦R^12向量导致的欧几里得谬误,提出Lie Diffuser Actor (LDA)框架,通过左不变SDE注入噪声、在切空间预测分数并利用指数映射回缩样本,从根本上消除流形漂移、保证坐标框架等变性和测地线最优性,在CALVIN ABC→D上平均任务长度从3.27提升至3.51。

Comments ICML 2026 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02259 2026-05-28 cs.LG cs.CV 81%

Segment to Focus: Guiding Latent Action Models in the Presence of Distractors

聚焦分割:在干扰物存在下引导潜在动作模型

Marcus Fechner, Hamza Adnan, Constantin C. Lüth, Matthew T. Jackson, Alexey Zakharov, J. Marius Zöllner

机构 * Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) University of Oxford(牛津大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.CV、cs.LG

AI总结 针对动作相关视觉干扰导致潜在动作模型失效的问题,提出MaskLAM方法,利用分割基础模型(如SAM)零样本获取智能体掩码,限制重建目标于智能体像素,迫使潜在动作编码内源动态,显著提升下游策略性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23987 2026-05-26 cs.AI cs.RO 81%

Beyond Predefined Learning Objects: A Thinking-Learning Interaction Model for Up-to-Date Autonomous Robot Learning

超越预定义学习对象:面向最新自主机器人学习的思维-学习交互模型

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(成都信息科技大学计算机学院)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 针对自主机器人在开放环境中无法依赖预定义学习对象的问题,提出一种思维-学习交互模型,通过思维指导学习(识别变化、选择证据、组织训练、规划验证)和学习促进思维(更新知识、经验、策略、推理)的双向机制,实现输入特征发现、输出类别扩展、模型更新和动作例程重构,实验验证了模型在特征适应、新类别形成、模型更新和动作优化上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19352 2026-05-20 q-bio.NC cs.AI cs.LG 81%

Brain alignment of reasoning and action representations from vision-language and action models during naturalistic gameplay

在自然主义游戏过程中,视觉语言和动作模型的推理与动作表示的脑部对齐

Subba Reddy Oota, Anant Khandelwal, Khushbu Pahwa, Satya Sai Srinath Namburi, Tanmoy Chakraborty, Bapi S. Raju, Manish Gupta

机构 * Independent(独立) Microsoft Research(微软研究院) AWS AI Labs(AWS人工智能实验室) GE HealthCare(通用电气医疗) IIT Delhi(德里理工学院) IIIT-Hyderabad(海得拉巴理工学院) Microsoft(微软)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了在自然主义游戏过程中,视觉语言模型和大动作模型的推理与动作表示在脑部活动中的对齐情况,发现动作聚焦和推理聚焦的提示影响模型内部表示与fMRI脑活动的对齐程度。

Comments 21 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22963 2026-05-12 cs.RO cs.AI 81%

Commanding Humanoid by Free-form Language: A Large Language Action Model with Unified Motion Vocabulary

通过自由形式语言控制人形机器人:一个统一动作词汇的大型语言动作模型

Zhirui Liu, Kaiyang Ji, Ke Yang, Yahao Fan, Jingyi Yu, Ye Shi, Jingya Wang

机构 * ShanghaiTech University(上海科技大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出Humanoid-LLA模型,通过统一的人形机器人动作词汇解决语言与动作数据稀缺及物理稳定性问题,实现自由语言指令到全身动作的直接转换,提升人形机器人在真实环境中的泛化能力和动作多样性。

Comments Project page: https://humanoidlla.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06222 2026-05-12 cs.RO cs.AI 81%

When to Trust Imagination: Adaptive Action Execution for World Action Models

何时相信想象:为世界动作模型的自适应动作执行

Rui Wang, Yue Zhang, Jiehong Lin, Kuncheng Luo, Jianan Wang, Zhongrui Wang, Xiaojuan Qi

机构 * Southern University of Science and Technology(南方科技大学) The University of Hong Kong(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本文提出FFDC和混合时间 horizon训练,通过预测-观察一致性实现自适应动作执行,提升机器人在复杂场景中的鲁棒性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07514 2026-05-11 cs.RO cs.CV 81%

Is the Future Compatible? Diagnosing Dynamic Consistency in World Action Models

未来是否兼容?世界动作模型中的动态一致性诊断

Bo-Kai Ruan, Teng-Fang Hsiao, Ling Lo, Hong-Han Shuai

机构 * National Yang Ming Chiao Tung University

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 本文研究了世界动作模型中动作-状态一致性作为可靠性指标的重要性,提出了一种无需额外训练的共识策略提升规划效果。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11135 2026-04-14 cs.RO cs.LG 81%

AIM: Intent-Aware Unified world action Modeling with Spatial Value Maps

AIM: 基于意图的统一世界动作建模与空间价值图

Liaoyuan Fan, Zetian Xu, Chen Cao, Wenyao Zhang, Mingqi Yuan, Jiayu Chen

机构 * INFIFORCE Intelligent Technology Co., Ltd.(英飞睿智科技有限公司) The University of Hong Kong(香港大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.LG

AI总结 AIM通过显式空间接口解决视频模型与动作生成间的结构不匹配问题,利用预训练视频生成模型和意图因果注意力机制,实现高成功率的机器人控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25661 2026-04-08 cs.RO cs.CV 81%

Fast-dVLA: Accelerating Discrete Diffusion VLA to Real-Time Performance

Fast-dVLA:加速离散扩散VLA以实现实时性能

Wenxuan Song, Jiayi Chen, Shuai Chen, Jingbo Wang, Pengxiang Ding, Han Zhao, Yikai Qin, Xinhu Zheng, Donglin Wang, Yan Wang, Haoang Li

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ShanghaiTech University(上海科技大学) Shanghai Institute of Technical Physics, CAS(中国科学院上海技术物理研究所) AIR, Tsinghua University(清华大学智能产业研究院) Westlake University(西湖大学) Zhejiang University(浙江大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.CV

AI总结 本文提出一种方法,通过分离辅助任务训练目标,在参数空间中提升通用能力与任务特定动作分布,从而在减少计算开销的同时提高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16195 2026-03-19 cs.CV cs.RO 81%

S-VAM: Shortcut Video-Action Model by Self-Distilling Geometric and Semantic Foresight

S-VAM:通过自蒸馏几何和语义前瞻性构建快捷视频动作模型

Haodong Yan, Zhide Zhong, Jiaguan Zhu, Junjie He, Weilin Yuan, Wenxuan Song, Xin Gong, Yingjie Cai, Guanyi Zhao, Xu Yan, Bingbing Liu, Ying-Cong Chen, Haoang Li

机构 * The Hong Kong University of Science Technology (Guangzhou) Huawei Foundation Model Department

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.CV

AI总结 S-VAM通过自蒸馏策略实现单次前向传递生成几何和语义表示,提升动作预测效率,实验证明在复杂环境中优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.13335 2026-03-17 cs.CV cs.AI 81%

Information-Theoretic Constraints for Continual Vision-Language-Action Alignment

信息论视角下的持续视觉-语言-动作对齐约束

Libang Zhao, Qixin Zeng, Hongyin Zhang, Donglin Wang

机构 * Westlake University, China(西湖大学) University of Southampton, UK(南安普顿大学)

专题命中 VLA模型 :vision-language-action(title);VLA(abstract);分类 cs.CV、cs.AI

AI总结 本文提出Info-VLA框架,通过两个互补约束保持跨模态信息结构,解决持续学习中视觉语言动作对齐退化问题,实验表明其在任务保持与适应性上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15882 2026-02-19 cs.RO cs.AI 81%

FUTURE-VLA: Forecasting Unified Trajectories Under Real-time Execution

FUTURE-VLA:在实时执行下统一轨迹预测

Jingjing Fan, Yushan Liu, Shoujie Li, Botao Ren, Siyuan Li, Xiao-Ping Zhang, Wenbo Ding, Zhidong Deng

机构 * Department of Automation, Tsinghua University(自动化系,清华大学) Shenzhen International Graduation School, Tsinghua University(深圳国际研究生院,清华大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学) School of Mechanical and Aerospace Engineering, Nanyang Technological University(机械与航空航天工程学院,南洋理工大学)

专题命中 VLA模型 :VLA(title,abstract);分类 cs.RO、cs.AI

AI总结 FUTURE-VLA通过实时执行实现统一轨迹预测,采用双效效率范式提升时空信息密度,实现实时预测与人机交互机制,取得多项任务的高成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00564 2026-01-30 cs.LG cs.AI 81%

Scaling Offline Model-Based RL via Jointly-Optimized World-Action Model Pretraining

通过联合优化的世界-动作模型扩展离线模型基于的强化学习

Jie Cheng, Ruixi Qiao, Yingwei Ma, Binhua Li, Gang Xiong, Qinghai Miao, Yongbin Li, Yisheng Lv

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Alibaba Group(阿里巴巴集团)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 JOWA通过联合优化的世界-动作模型扩展离线RL,实现高效泛化和高性能

Comments Accepted by ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16065 2026-01-23 cs.CV cs.RO 81%

DTP: A Simple yet Effective Distracting Token Pruning Framework for Vision-Language Action Models

DTP: 一种简单而有效的干扰令牌修剪框架用于视觉-语言动作模型

Chenyang Li, Jieyuan Liu, Bin Li, Bo Gao, Yilin Yuan, Yangfan He, Yuchen Li, Jingqun Tang

机构 * Australian National University(澳大利亚国立大学) University of California, San Diego(加州大学圣地亚哥分校) Chinese Academy of Sciences(中国科学院) Beijing Institute of Graphic Communication(北京印刷学院) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Baidu Search(百度搜索) Bytedance(字节跳动)

专题命中 VLA模型 :action model(title);VLA(abstract);分类 cs.RO、cs.CV

AI总结 DTP框架通过动态修剪干扰令牌提升视觉-语言动作模型的任务成功率,适用于多种新型VLA模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09749 2026-01-16 cs.SE cs.AI cs.LG 81%

R-LAM: Reproducibility-Constrained Large Action Models for Scientific Workflow Automation

R-LAM:具有可重复性约束的大型动作模型用于科学工作流自动化

Suriya Sureshkumar

机构 * 1, Department of AI \& Data Science, RMK Engineering College, Chennai, India

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 R-LAM通过引入结构化动作模式、确定性执行策略和显式溯源跟踪,提升科学工作流自动化的可重复性和可靠性。

Comments 9 pages, 3 figures, 1 Table, 2 Artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08713 2025-12-05 cs.LG cs.AI cs.IR 81%

Beyond KAN: Introducing KarSein for Adaptive High-Order Feature Interaction Modeling in CTR Prediction

超越KAN:引入KarSein用于CTR预测中的自适应高阶特征交互建模

Yunxiao Shi, Wujiang Xu, Haimin Zhang, Qiang Wu, Min Xu

机构 * University of Technology Sydney(悉尼技术大学) Rutgers University(罗格斯大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI、cs.LG

AI总结 KarSein通过自适应高阶特征交互建模方法,提升CTR预测的准确性和效率,同时保持参数紧凑与解释性。

Comments Under review by TOIS

详情

展开后加载摘要…

URL PDF HTML 收藏