iFlyBot-VLA Technical Report
机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
机构 * iFlyTek Reasearch and Development Group(iFlyTek 研发部)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
机构 * Cognitive AI Lab(认知人工智能实验室) ; Cognitive AI Lab, IAI MIPT(认知人工智能实验室,IAI MIPT)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 13 pages, 6 figures
机构 * MIPT(莫斯科物理技术学院) ; AIRI(人工智能研究院)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.AI
机构 * Peking University(北京大学) ; Renmin University of China(中国人民大学) ; BeingBeyond
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG
Comments 37 pages
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments 25 pages, 6 figures, NeurIPS 2024
StructRL:面向基于流的视觉-语言-动作模型的结构化动作空间探索
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Fudan University(复旦大学) ; Singapore Management University(新加坡管理大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract,abstract_cn);分类 cs.RO
AI总结 StructRL通过将策略随机性重定位至动作空间的三个耦合设计,解决基于流的VLA模型的结构化噪声稀释问题,在模拟与真实任务上提升了探索效率及OOD性能。
SLIM-0.5B:学习机器人操作的动作基础预测隐变量
机构 * Fudan University(复旦大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; Tsinghua University(清华大学) ; Renmin University of China(中国人民大学)
专题命中 VLA模型 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);action model(abstract,abstract_cn);分类 cs.RO
AI总结 SLIM-0.5B是0.5B参数的紧凑机器人操作策略,通过自监督掩码轨迹预测学习动作基础预测隐变量,性能优于或匹配大型基线,参数量少、推理延迟低、内存占用小。
Comments 18 pages, 11 figures. Project page: https://kzz1031.github.io/slim-project-page/
统一视觉运动目标:监督视觉语言智能体(VLA)超越物理动作
专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO
AI总结 本研究针对VLA模型训练中视觉语言高级表示与机器人低级动作的不匹配问题,提出UVT统一视觉运动目标,无需改动架构或额外数据,在仿真与真实双臂任务中提升了VLA的训练效率、性能与鲁棒性
Comments Accepted at IROS 2026. Project page: https://unified-visuomotor-targets.github.io/
VEGA: 从野外自我中心视频中通过几何轨迹监督学习导航VLA
机构 * University of Maryland, College Park(马里兰大学帕克分校)
专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO
AI总结 提出VEGA方法,利用未标注的自我中心视频通过重建场景几何生成障碍感知轨迹,训练流匹配VLA导航策略,在VEGA-Bench上碰撞减少33.0%,真实世界成功率提升至少150.0%。
他们看到了什么?通过视觉-语言-动作模型的视角解读复杂道路场景以实现安全可靠的自动驾驶学习
机构 * Birla Institute of Technology and Science, Pilani(贝拉理工科学学院皮拉尼分校) ; University of California, Merced(加州大学默塞德分校)
专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 研究自动驾驶模型内部逻辑不透明问题,提出反事实消融框架CVAA,通过移除摄像头图像中物体创建反事实集评估模型响应差异,应用于阿尔帕马约1轨迹预测器,分析物体因果影响,还通过可解释性技术深入理解模型,创建可解释驾驶系统巩固人机信任。
MobileManiBench:简化移动操作模型验证
机构 * Microsoft Research Asia(微软亚洲研究院) ; University of Sydney(悉尼大学) ; Tsinghua University(清华大学)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 提出仿真优先框架MobileManiBench,基于NVIDIA Isaac Sim和强化学习自动生成多样化移动操作轨迹,包含300K条轨迹,用于验证VLA模型在真实部署前的性能。
Comments Accepted to ECCV 2026
神经符号驱动:基于规则忠实推理的驾驶VLA
机构 * Texas A&M University(德克萨斯农工大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Maryland(马里兰大学) ; University of California, Riverside(加利福尼亚大学河滨分校) ; University of Pittsburgh(匹兹堡大学)
专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.AI
AI总结 提出神经符号驱动框架,利用规则规划器的决策轨迹监督驾驶VLA,实现推理与运动生成的因果耦合,显著降低轨迹误差和碰撞率。
两座桥梁,一条路径:从VLM到具有具身轨迹耦合数据的可泛化VLA
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院)
专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO
AI总结 提出具身轨迹耦合(ETC)数据作为中间桥梁,通过三阶段训练策略(分布桥接、目标桥接、保留适应)将视觉语言模型(VLM)逐步转化为可泛化的视觉语言动作模型(VLA),解决从VLM到VLA的双重鸿沟。
冻结的VLA已经知道关于成功的信息:对基础机器人策略中价值类结构的探测研究
机构 * Peking University(北京大学) ; China Agricultural University(中国农业大学)
专题命中 VLA模型 :VLA(title_cn,summary_cn);分类 cs.RO
AI总结 通过线性探测从冻结的VLA特征中预测蒙特卡洛结果目标,发现其编码了成功信息,并可用于测试时动作选择提升成功率。
Comments 14 pages, 1 figure, 11 tables. Equal contribution: Jiachen Zhang, Junnan Nie, and Junyi Lao. Corresponding author: Songfang Huang. Preprint
视觉-语言-动作模型在受限的同时能够泛化到新指令
机构 * Independent(独立)
专题命中 VLA模型 :VLA(summary_cn,abstract);vision-language-action(abstract);action model(abstract);分类 cs.RO
AI总结 本文提出通过操控VLA内部表示实现不同任务行为的重组,通过文本潜在表示插值提升泛化能力,实验表明其在新指令任务中表现优异,但存在空间过拟合问题。
基于视觉-语言-动作模型的自动驾驶场景响应式人机协同运动规划的自然语言指令
机构 * University of California, Merced(加州大学默塞德分校)
专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 本研究利用视觉-语言-动作模型,通过指令条件规划提升自动驾驶的鲁棒性和轨迹对齐性能。
一种具有视觉提示的视觉-语言-动作模型用于越野自动驾驶
专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO
AI总结 本文提出OFF-EMMA模型,通过视觉提示和COT-SC策略提升越野自动驾驶轨迹规划的准确性和鲁棒性。
视觉-语言-动作模型的任务适应:2025 BEHAVIOR挑战第一名解决方案
机构 * Independent Researchers(独立研究者)
专题命中 VLA模型 :vision-language-action(title);action model(title);分类 cs.RO、cs.CV、cs.AI
AI总结 本文提出了一种视觉-动作策略,通过相关噪声和混合层注意力等创新,实现了在2025 BEHAVIOR挑战中对50种家庭任务的高效处理。
Comments 2025 NeurIPS Behavior Challenge 1st place solution
LatBot: 从大规模物体操作视频中提炼通用潜在动作用于视觉-语言-动作模型
机构 * Institute of Microelectronics, Chinese Academy of Sciences(中国科学院微电子研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; Microsoft Research(微软研究院)
专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO
AI总结 LatBot通过整合动作预测和潜在动作分解,提升视觉-语言-动作模型在现实世界和模拟环境中的泛化与迁移能力。
Comments Project Page: https://mm-robot.github.io/distill_latent_action/
CoC-VLA: 深入研究对抗域转移以实现可解释的自动驾驶 via 链式因果视觉语言动作模型
机构 * Lanzhou University(兰州大学) ; National University of Singapore(新加坡国立大学) ; University of Science and Technology of China(中国科学技术大学)
专题命中 VLA模型 :VLA(title,abstract);action model(title);分类 cs.RO
AI总结 CoC-VLA通过链式因果视觉语言动作模型实现对抗域转移,提升自动驾驶的可解释性和长尾场景处理能力。
机构 * School of Data Science, Fudan University(复旦大学数据科学学院) ; Huawei Noah’s Ark Lab(华为诺亚实验室)
专题命中 VLA模型 :VLA(title,abstract);vision-language-action(title);分类 cs.CV
机构 * Shenyang Institute of Automation(沈阳自动化研究所) ; Chinese Academy of Sciences(中国科学院) ; Shandong Normal University(山东师范大学) ; Department of Production Engineering(生产工程系) ; Royal Institute of Technology (KTH)(皇家理工学院(KTH)) ; University of Chinese Academy of Sciences(中国科学院大学) ; Department of Intelligent Systems(智能系统系)
专题命中 VLA模型 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.AI
Comments Accepted to IAI 2025 (International Conference on Industrial Artificial Intelligence), Shenyang, China, Aug 21 - 24, 2025. Preprint (before IEEE copyright transfer)
机构 * Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);分类 cs.RO
Comments 8 pages, 5 figures, 3 tables
机构 * Jilin University(吉林大学) ; Harvard University(哈佛大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Huazhong University of Science and Technology(华中科技大学) ; Southern University of Science and Technology(南方科技大学) ; Lehigh University(莱斯大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 VLA模型 :vision-language-action(title,abstract);action model(title);分类 cs.RO
Comments 20 pages, 8 figures
SAFE-Pruner: 语义注意力引导的未来感知令牌剪枝用于高效视觉-语言-动作操控
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV
AI总结 针对视觉-语言-动作模型推理加速中现有剪枝方法忽略深层视觉信息的问题,提出SAFE-Pruner框架,通过引入未来层注意力线索和语义注意力一致性实现前瞻性令牌剪枝,在仿真和真实实验中取得最高1.89倍加速且成功率下降小于1.7%。
Comments Accepted to ECCV 2026
结构感知鲁棒微调:防御视觉-语言-动作机器人抵御物理注意力劫持
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 本研究针对视觉-语言-动作机器人面临的物理注意力劫持攻击,提出注意力引导语义破坏攻击方法,并开发结构感知鲁棒微调防御方法,大幅降低攻击失败率并提升真实机械臂操控成功率。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026)
WCM:用于视觉-语言-动作强化学习的世界评论者模型
机构 * Tongji University(同济大学) ; Shanghai Innovation Institute(上海创新研究院) ; Fudan University(复旦大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.CV
AI总结 该研究针对视觉-语言-动作强化学习中评论者与机器人部分可观测性不匹配的问题,提出WCM模型,联合预测未来潜态与值估计,在149个仿真任务和7个真实任务上均实现最优性能与泛化性。
LEEVLA:在视觉-语言-动作的潜在环境演化中洞察关键要素
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.CV、cs.AI
AI总结 研究针对视觉-语言-动作模型难以应对复杂动态场景的问题,提出LEEVLA架构,引入漂移引导动态优先级和结构化特征流生成,构成“何处-如何”训练框架,实验表明该方法优于现有方法,强调了关键要素引导和结构化推理的重要性。
用于视觉-语言-动作学习的从简单到复杂的结构化演示
机构 * Graduate School of Advanced Science and Engineering, Hiroshima University(广岛大学先进科学与工程研究生院)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 研究视觉-语言-动作模型中演示的收集与组织问题,提出用双臂机器人平台的从简单到复杂结构化演示收集策略,依三原则组织数据,提升了学习效率与稳定性。
Comments 20 pages
HiMe:用于长距离视觉-语言-动作控制的分层具身记忆
机构 * Fudan University(复旦大学) ; Shanghai Innovation Institute(上海创新研究院) ; East China Normal University(华东师范大学)
专题命中 VLA模型 :vision-language-action(title,abstract);VLA(abstract,abstract_cn);分类 cs.RO、cs.AI
AI总结 针对视觉-语言-动作模型处理非马尔可夫任务的不足,提出HiMe分层具身记忆框架,解耦智能为高频执行器等,引入动态知识系统,平衡实时执行与思考规划冲突,提升长距离任务成功率。