Extraction and Analysis of Clinically Important Follow-up Recommendations in a Large Radiology Dataset
专题命中 数据集与评测 :action model(abstract)
Comments Under Review at American Medical Informatics Association Fall Symposium'2019
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
专题命中 数据集与评测 :action model(abstract)
Comments Under Review at American Medical Informatics Association Fall Symposium'2019
专题命中 数据集与评测 :action model(abstract)
Comments 87 pages
专题命中 数据集与评测 :action model(abstract)
Comments 9 pages, 6 figures, ICLASS 2018, 14th Triennial International Conference on Liquid Atomization and Spray Systems, Chicago, IL, USA, July 22-26, 2018
专题命中 数据集与评测 :action model(abstract)
Comments Accepted to appear at the SIGIR 2018 workshop on eCommerce
专题命中 数据集与评测 :action model(abstract)
专题命中 数据集与评测 :action model(abstract)
Comments Released all code and data products on our github pages (https://github.com/nyusngroup/SESNspectraLib and https://github.com/nyusngroup/SESNtemple). Accepted by ApJ. 15 pages, 7 figures, 3 tables. No major changes, but more references & discussion
专题命中 数据集与评测 :action model(abstract)
专题命中 数据集与评测 :action model(abstract)
Comments Accepted at the COLING 2016 Workshop on Noisy User-generated Text (WNUT)
专题命中 数据集与评测 :VLA(abstract)
Comments 28 pages, 12 figures, ApJ accepted
专题命中 数据集与评测 :VLA(abstract)
Comments 41 pages, 19 figures, ApJ accepted; corrected minor typo in Table 1
在机器人操作中建立仿真到现实泛化:基于视觉-语言-动作模型的实证研究
机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) ; Shenzhen Loop Area Institute(深圳河套学院)
专题命中 部署与泛化 :vision-language-action(title,abstract);action model(title);VLA(abstract);分类 cs.RO、cs.AI
AI总结 本文通过四个维度探讨仿真到现实泛化的决定因素,提出评估协议并释放资源以建立标准化基准,提升机器人操作策略的泛化能力。
机构 * Tsinghua University(清华大学) ; State Key Lab of General Artificial Intelligence, BIGAI(通用人工智能国家重点实验室,BIGAI) ; Peking University(北京大学) ; Astribot Inc.(Astribot公司)
专题命中 部署与泛化 :vision-language-action(title);action model(title);VLA(abstract);分类 cs.RO
Comments Website: https://controlvla.github.io
SABER:一种可扩展的动作基于具身数据集用于真实世界VLA适应
机构 * DreamVu
专题命中 部署与泛化 :VLA(title,title_cn);robot foundation model(abstract);分类 cs.RO、cs.CV
AI总结 SABER通过高保真零售机器人动作数据集提升真实世界零售任务的机器人性能,采用多流动作表示方法,实现29.3%的成功率,优于微调基线。
迈向可及的物理AI:基于LoRA的VLA模型在现实机器人控制中的微调
机构 * Independent Researchers(独立研究者)
专题命中 部署与泛化 :VLA(title,abstract);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 本文提出基于LoRA的VLA模型微调方法,使大规模VLA模型能在消费级GPU上高效运行,实现在低成本机器人平台上的现实部署。
HY-Embodied-0.5:面向现实世界代理的具身基础模型
机构 * Tencent Robotics X(腾讯机器人X实验室) ; HY Vision Team(HY视觉团队)
专题命中 部署与泛化 :embodied foundation model(title);vision-language-action(abstract);VLA(abstract);分类 cs.CV
AI总结 本文提出HY-Embodied-0.5,旨在提升现实世界代理的具身智能能力,通过混合Transformer架构和迭代自演化训练方法,实现高效和强大的模型变体,验证了其在多个基准测试中的优越性能。
RoboGene: 通过多样性驱动的代理框架提升VLA预训练以生成现实任务
机构 * Beijing Innovation Center of Humanoid Robotics(北京人形机器人创新中心) ; The School of Advanced Manufacturing and Robotics, Peking University(北京大学先进制造与机器人学院) ; Beijing Institute of Technology(北京理工大学) ; The School of Mechanical Engineering and Automation, Beihang University(北航机械工程与自动化学院) ; State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学多媒体信息处理国家重点实验室)
专题命中 部署与泛化 :VLA(title,abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 RoboGene通过多样性驱动的代理框架生成多样化、物理合理的机器人操作任务,提升VLA预训练效果。
ICR-Drive:面向端到端语言驱动自动驾驶的指令反事实鲁棒性
机构 * Texas Tech University(德克萨斯科技大学) ; Bosch Center for Artificial Intelligence (BCAI)(博世人工智能中心(BCAI))
专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);embodied foundation model(abstract);分类 cs.CV
AI总结 提出ICR-Drive框架,通过生成四类扰动指令(改写、歧义、噪声、误导)并基于CARLA仿真评估,揭示语言条件驾驶模型对指令变化的脆弱性。
Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2026, pp. 872-880
MolmoAct2:面向现实部署的动作推理模型
机构 * Allen Institute for AI(艾伦人工智能研究所) ; University of Washington(华盛顿大学) ; National University of Singapore(新加坡国立大学) ; University of Pennsylvania(宾夕法尼亚大学) ; Johns Hopkins University(约翰霍普金斯大学) ; Amazon(亚马逊公司) ; University of Michigan(密歇根大学) ; University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
专题命中 部署与泛化 :vision-language-action(abstract,abstract_cn);VLA(abstract,abstract_cn);分类 cs.RO
AI总结 本文提出MolmoAct2,一个完全开放的动作推理模型,通过改进架构和引入新数据集,在五个方面提升性能,展示了在多个基准测试中优于现有模型的成果。
Comments 31 pages, project page: https://allenai.org/blog/molmoact2
专题命中 部署与泛化 :vision-language-action(abstract);VLA(abstract);action model(abstract);embodied foundation model(abstract)
Zero-WAM:基于人类视频的上下文世界-动作建模用于开放式任务泛化
专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.CV
AI总结 Zero-WAM是基于人类视频的因果视频-动作模型,通过提出自动流水线构建HumanGen数据集、引入IFP目标,在RoboTwin 2.0仿真7个未见任务上平均成功率达47.0%,实现机器人操作零样本跨任务泛化。
EWAM:一种用于具身智能闭环在线自适应的增强世界动作模型
机构 * Astronex Robotics ; Nanjing University of Information Science and Technology(南京信息工程大学)
专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO、cs.AI
AI总结 提出EWAM架构,基于冻结的Cosmos3骨干网络,通过四个轻量级神经层实现零样本在线自适应,无需微调或额外演示数据,显著减少新任务布局的部署数据需求。
通过权重空间元学习实现机器人策略自适应
机构 * ItalAI ; University of Verona(威尼斯大学) ; Sapeinza University of Rome(罗马萨佩因扎大学)
专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 提出WIZARD框架,通过权重空间元学习从语言指令和演示视频生成任务特定LoRA参数,无需微调即可适应新任务,在LIBERO上性能提升高达14倍。
WAM-Nav:面向统一视觉导航的非对称潜在世界-动作建模
机构 * Nanjing University(南京大学) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; University of Chinese Academy of Sciences(中国科学院大学) ; FiveAges ; National University of Defense Technology(国防科技大学) ; Tsinghua University(清华大学) ; GigaAI
专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO
AI总结 提出WAM-Nav,一种联合学习动作生成与潜在视觉预测的非对称扩散Transformer模型,通过共享扩散Transformer实现长时程动作与短时程视觉预测的联合扩散,并引入双流上下文条件机制和目标对齐模块,在统一策略下支持图像目标、点目标和无目标导航,在ClutterScenes和InternScenes基准上分别提升15.7%和3.3%的成功率,并在真实环境中实现85%的任务成功率。
HiMem-WAM: 用于机器人操作的分层记忆门控世界动作模型
机构 * The University of Hong Kong(香港大学) ; INFIFORCE ; Huazhong University of Science and Technology(华中科技大学) ; Tsinghua University(清华大学) ; Wuhan University(武汉大学) ; Southern University of Science and Technology(南方科技大学)
专题命中 部署与泛化 :action model(title,abstract);分类 cs.RO
AI总结 提出分层记忆门控世界动作模型HiMem-WAM,通过分层潜在动作框架和边界触发记忆更新,提升长时域机器人操作的任务相关记忆与泛化鲁棒性。
RADAR:通过现实动态、空间-物理智能和自主评估进行视觉-语言-动作泛化基准测试
机构 * Sun Yat-sen University(中山大学) ; Guangdong Key Laboratory of Big Data Analysis(广东大数据分析与处理重点实验室) ; X-Era AI Lab(X-Era人工智能实验室) ; Guangdong University of Technology(广东工业大学)
专题命中 部署与泛化 :vision-language-action(title);VLA(abstract);分类 cs.RO
AI总结 RADAR通过现实动态、空间-物理智能和自主评估,系统评估VLA模型在现实环境中的泛化能力,揭示其在物理动态和空间推理上的脆弱性。
Comments 12 pages, 11 figures, 3 tables
RL能为VLA泛化带来什么?一项实证研究
机构 * Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) ; Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) ; Department of Electronic Engineering, Tsinghua University(清华大学电子工程系)
专题命中 部署与泛化 :VLA(title,abstract);分类 cs.LG
AI总结 本研究通过实证分析发现,PPO在提升VLA的语义理解和执行鲁棒性方面优于SFT,同时保持视觉鲁棒性,为VLA泛化提供了有效的方法。
Comments Accepted by NeurIPS 2025
RoboBRIDGE:一种将策略桥接至鲁棒现实世界机器人智能体的模块化框架
机构 * Sungkyunkwan University(成均馆大学)
专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 该研究针对视觉-语言-动作模型部署为机器人智能体的缺陷,提出 RoboBRIDGE 模块化框架,通过五大协同模块结合预训练 VLAs 构建鲁棒智能体,在多基准和现实场景中性能优于现有方案。
Comments Accepted to IROS 2026. 8 pages, 6 figures
FlowDAgger:在潜在空间中对生成式机器人策略进行人工参与的自适应调整
机构 * Microsoft Research(微软研究院) ; University of Washington(华盛顿大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 部署与泛化 :VLA(abstract_cn);robot foundation model(abstract);action model(abstract);分类 cs.RO、cs.LG
AI总结 研究针对预训练生成式机器人策略在实际部署中出现的问题,提出FlowDAgger方法,通过动作反转从人工干预获取监督,在模拟及现实操纵中评估,该方法优于基线且能保留预训练技能,为机器人基础模型自适应调整提供实用路径。
检索后再引导:生成式视觉-语言-动作模型的在线成功记忆用于测试时适应
机构 * College of Artificial Intelligence, Xi’an Jiaotong University(西安交通大学人工智能学院) ; One Robotics ; Shenzhen University of Advanced Technology(深圳先进技术大学)
专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 本文提出一种在线成功记忆引导的测试时适应框架,用于生成式视觉-语言-动作模型,在重复或缓慢变化的环境中通过重用成功经验提升可靠性。
通过锚点中心适应摆脱机器人操作中的多样性陷阱
机构 * National University of Singapore(新加坡国立大学) ; Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) ; Institude for Information Research, A STAR(A*STAR信息研究所)
专题命中 部署与泛化 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI
AI总结 本文提出锚点中心适应方法,通过稳定策略骨架和选择性扩展覆盖范围,解决多样性陷阱问题,提升任务可靠性和成功率。
Comments 21 pages, 8 figures