OmniManip: Towards General Robotic Manipulation via Object-Centric Interaction Primitives as Spatial Constraints
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
Comments ACL 2024 System Demonstration
专题命中 VLA模型 :vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
基于世界模型的视频生成中物理一致性的无参考评估
机构 * Hanyang University ERICA(汉阳大学ERICA校区)
专题命中 VLA模型 :VLA(abstract,abstract_cn);分类 cs.RO、cs.AI、cs.LG
AI总结 提出结合相对与绝对方法的无参考度量,用于评估生成视频的物理一致性,无需人工投票或真实参考,通过DROID-SLAM和SEA-RAFT量化不一致性,过滤后视频任务成功率提升超8%,并实现时空定位。
Comments Accepted to the 2nd 3D-LLM/VLA Workshop, CVPR 2026
WorldDiT:用于世界和动作建模的统一扩散架构
专题命中 VLA模型 :action model(title);分类 cs.RO、cs.LG
AI总结 研究提出WorldDiT统一扩散架构,结合动作生成与视觉世界建模,不依赖大型预训练VLM动作主干,在四个LIBERO模拟套件中表现出色,处于帕累托前沿,为未来扩展研究提供了低于十亿参数的基线。
Comments 9 pages, 4 figures
EgoGenesis:基于在线锚定投影记忆与Action-3D RoPE的自我中心世界-动作建模
机构 * Shanghai Jiao Tong University(上海交通大学) ; Alibaba Group(阿里巴巴集团) ; Tianji KernalMind Co., Ltd.(天机芯智有限公司) ; The Hong Kong University of Science and Technology(香港科技大学) ; Southeast University(东南大学) ; Renmin University of China(中国人民大学) ; The University of Tokyo(东京大学)
专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI
AI总结 本文提出EgoGenesis模拟器,通过在线锚定投影记忆与Action-3D RoPE合成自我中心操作视频,扩充训练数据,显著提升了真实机器人单臂、双臂任务的分布外操作成功率。
Comments project page: https://egogenesis.github.io/
以5Hz思考,20Hz行动:用于闭环驾驶的异步快慢视觉-语言-动作推理
机构 * The University of Tokyo(东京大学) ; TIER IV, Inc.(TIER IV公司) ; Huawei(华为)
专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI
AI总结 研究针对大语言模型用于闭环驾驶时推理延迟与车辆控制速率冲突的问题,提出快慢架构,慢系统用冻结主干处理历史,快专家基于缓存和当前帧回归航路点,经训练在CARLA上提升路线完成率,降低误差且可零样本转移。
Comments 13 pages, 5 figures, 4 tables
FDRMFL:基于信息最大化和对比学习的多模态联邦特征提取模型
机构 * School of Computing and Data Science, The University of Hong Kong(计算与数据科学学院,香港大学)
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
AI总结 针对非IID数据分布下联邦回归的多模态特征提取难题,提出FDRMFL框架,通过统一的四项局部目标应对挑战,实验表明该框架能有效降低平均MSE,在六种联邦算法中表现最佳。
Comments Accepted author manuscript; published version DOI: 10.1016/j.asoc.2026.115874
Journal ref Applied Soft Computing 202 (2026) 115874
知识包容的自适应物理信息神经网络用于微生物相互作用建模
机构 * University of Melbourne(墨尔本大学) ; Academia Sinica(中央研究院)
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
AI总结 提出一种知识包容的自适应PINN框架,通过整合文本和网络结构知识改进微生物群落建模,在真实和模拟数据集上性能提升最高53%。
Comments 33 pages
GROW: 将GRPO与状态-动作建模对齐以适用于开放世界VLM智能体
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; East China Normal University(华东师范大学) ; Zhejiang Normal University(浙江师范大学) ; Shandong Normal University(山东省师范大学)
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
AI总结 本文提出GROW框架,通过将收集的轨迹分解为状态-动作样本,并在样本间计算优势,解决了标准GRPO在多轮RL中因需要完整轨迹导致上下文过长和噪声的问题,实验表明其在超过800个Minecraft任务中取得SOTA性能。
AEGIS:锚定强化梯度隔离用于知识保留的视觉-语言-动作微调
机构 * Independent Researcher(独立研究者)
专题命中 VLA模型 :vision-language-action(title);分类 cs.CV、cs.LG
AI总结 本文提出AEGIS方法,通过层间梯度投影保留预训练的视觉问答能力,避免因梯度不对称导致的性能下降,无需额外数据或缓冲区。
TwinMixing:一种面向多任务分割的洗牌感知特征交互模型
机构 * University of Information Technology(信息技术大学) ; Vietnam National University(越南国立大学)
专题命中 VLA模型 :action model(title);分类 cs.CV、cs.AI
AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。
Journal ref Results in Engineering 30 (2026) 109982
潜在世界动作建模:端到端自动驾驶的潜在世界建模
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Chongqing Chang’an Technology Co., Ltd(重庆长安科技有限公司) ; School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; College of AI, Tsinghua University(清华大学人工智能学院) ; Zhongguancun Academy(中关村学院)
专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV
AI总结 本文提出Latent-WAM框架,通过空间感知和动态感知的潜在世界表示实现高效端到端自动驾驶,实验显示在NAVSIM v2和HUGSIM上取得新的SOTA结果。
通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调
机构 * UC Berkeley(伯克利大学)
专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI
AI总结 通过参数合并实现视觉-语言-动作机器人策略的鲁棒微调,使策略在保持泛化能力的同时有效学习新技能。
Journal ref The Fourteenth International Conference on Learning Representations 2026
AsyncVLA: 一种异步VLA用于边缘设备上的快速稳健导航
机构 * University of California, Berkeley(加州大学伯克利分校) ; Toyota Motor North America(丰田汽车北美公司) ; Princeton University(普林斯顿大学)
专题命中 VLA模型 :VLA(title);分类 cs.RO、cs.LG
AI总结 AsyncVLA通过异步框架结合远程大模型与本地轻量级模块,实现边缘设备上的高效稳健导航,成功率达40%。
Comments 13 pages, 9 figures, 2 tables
受动力学启发的结构幻想用于蛋白质-蛋白质相互作用建模
机构 * Department of Computer Science(计算机科学系) ; Stanford University(斯坦福大学) ; School of Engineering(工程学院) ; Westlake University(西湖大学)
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
AI总结 本文提出Refine-PPI框架,通过结构细化模块和概率密度云网络,解决突变蛋白质结构获取困难和动态几何不确定性建模问题。
Journal ref Transactions on Machine Learning Research 2025
专题命中 VLA模型 :vision-language-action(title);分类 cs.RO、cs.AI
Comments 18 pages, 11 figures
机构 * Prime Intellect
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
机构 * University of Birmingham(伯明翰大学) ; Queen Mary University of London(伦敦大学女王学院) ; Aston University(阿斯顿大学) ; United Kingdom National Nuclear Laboratory Ltd.(英国国家核实验室有限公司)
专题命中 VLA模型 :action model(title);分类 cs.RO、cs.AI
Comments Accepted at Human-Centered Robot Autonomy for Human-Robot Teams (HuRoboT) at IEEE RO-MAN 2025, Eindhoven, the Netherlands
专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
Comments The code and data are available at https://github.com/CRIPAC-DIG/GraphCTR
Journal ref Mach. Intell. Res. (2025)
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
Comments Published as a conference paper at NeurIPS 2024
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
Comments 8 pages, 3 figures
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
Comments arXiv admin note: text overlap with arXiv:2301.01089
专题命中 VLA模型 :action model(title);分类 cs.RO、cs.AI
专题命中 VLA模型 :action model(title);分类 cs.AI、cs.LG
Comments Accepted at ICPR 2022, 8 pages, 1 figure, 6 tables
专题命中 VLA模型 :action model(title);分类 cs.CV、cs.LG
专题命中 VLA模型 :action model(title);分类 cs.RO、cs.CV
Comments 7 pages, 3 figures, 4 tables, accepted at ICRA 2021
云能驱动自动驾驶吗?跨5G和6G卸载自动驾驶的基础设施可行性
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract)
AI总结 探讨云能否驱动自动驾驶,通过耦合通信限制、GPU服务模型等构建分析框架,应用于纽约市,研究发现通信、计算、成本依次起约束作用,延迟决定模型可行性,成本决定是否经济。
Comments 25 pages, 10 figures
!帝国,小型甚大阵:数据投毒对开源机器人技术的影响
机构 * Duale Hochschule Baden-Württemberg, Ravensburg(巴登-符腾堡双元制应用技术大学拉文斯堡分校)
专题命中 VLA模型 :vision language action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 研究视觉语言动作模型的触发词数据投毒对开源机器人技术的影响,通过在真实任务中对小型甚大阵进行实验,发现少量投毒样本可嵌入后门致机器人失效,攻击具实用性、低成本且隐蔽。
Comments Accepted at KI2026. Repo: https://github.com/StefanBuhler/ImperioVLAPoisoning