A broadband search for coherent radio emission in cataclysmic variables
对激变变星的宽带相干无线电发射的搜索
专题命中 VLA模型 :VLA(summary_cn,abstract)
AI总结 研究通过分析VLA观测数据,发现6个激变变星表现出宽频和窄频高极化变射,推测为电子循环辐射或等离子体辐射,可能源自磁场或密度变化区域。
视觉与机器人
视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。
对激变变星的宽带相干无线电发射的搜索
专题命中 VLA模型 :VLA(summary_cn,abstract)
AI总结 研究通过分析VLA观测数据,发现6个激变变星表现出宽频和窄频高极化变射,推测为电子循环辐射或等离子体辐射,可能源自磁场或密度变化区域。
PRTS:通过对比表示实现的原始推理与任务系统
机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信) ; Tsinghua University(清华大学) ; Shanghai Jiao Tong University(上海交通大学) ; Fudan University(复旦大学)
专题命中 VLA模型 :VLA(abstract,abstract_cn);vision-language-action(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 PRTS通过目标引导强化学习重构预训练过程,学习统一嵌入空间以评估物理可行性,提升机器人任务执行与长期规划能力。
Comments 38 pages, 12 figures
解耦动作专家:将任务知识限制在条件路径中
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 本文提出解耦训练方法,将任务知识限制在条件路径中,使动作主干网络无任务依赖,通过Diffusion Policy验证,证明动作专家编码较少任务特定知识。
Alpamayo-R1: 联结推理与动作预测以实现通用的自动驾驶在长尾场景
机构 * NVIDIA
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG
AI总结 Alpamayo-R1通过整合因果推理与轨迹规划,提升了自动驾驶在长尾场景中的规划准确性和安全性。
Motus:一个统一的潜在动作世界模型
机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) ; Peking University(北京大学) ; Horizon Robotics
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG
AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments Accepted to RSS 2025. Code is available at https://github.com/OpenDriveLab/UniVLA
机构 * KAIST(韩国科学技术院) ; University of Washington(华盛顿大学) ; Microsoft Research(微软研究院) ; NVIDIA(英伟达) ; Allen Institute for AI(人工智能算法研究所)
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);action model(abstract);分类 cs.RO、cs.CV、cs.LG
Comments ICLR 2025 Website: https://latentactionpretraining.github.io
专题命中 VLA模型 :vision-language-action(abstract);VLA(abstract);robot foundation model(abstract);分类 cs.RO、cs.AI、cs.LG
Comments Authors are listed alphabetically. Project leads are Linxi "Jim" Fan and Yuke Zhu. For more information, see https://developer.nvidia.com/isaac/gr00t
LAP:语言-动作预训练实现零样本跨躯体迁移
机构 * Princeton University(普林斯顿大学)
专题命中 VLA模型 :VLA(abstract,comments);vision-language-action(abstract);action model(abstract);分类 cs.RO、cs.AI
AI总结 LAP通过语言-动作预训练实现零样本跨躯体迁移,首次在无需特定躯体微调的情况下达到显著的迁移效果,提升性能达两倍。
Comments Project website: https://lap-vla.github.io
4DGS-WAM:基于4D高斯溅射的以对象为中心的世界动作模型,连接过去与未来
机构 * The Chinese University of Hong Kong(香港中文大学) ; Shanghai Academy of AI for Science(上海人工智能科学研究院) ; Fudan University(复旦大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 本研究提出基于4D高斯溅射的以对象为中心的世界动作模型4DGS-WAM,将2D观测转为持久4D表示,复用静态内容以聚焦动态对象演化,在KITTI-MOT上完成短程预测与过去重建评估。
Comments This is a work in progress
SANTS:面向世界动作模型的状态自适应调度器
机构 * Fudan University(复旦大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Deep Computing Era Technology Co., Ltd(深计算时代科技有限公司)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 提出状态自适应噪声轨迹调度器(SANTS),通过根据视频状态动态选择去噪深度来优化视频到动作的扩散策略,在保持控制性能的同时大幅降低推理延迟。
Comments 13 pages, 5 figures, 8 tables. Project page: https://advanced-robotics-lab.github.io/SANTS/
GlanceWAM:面向世界-动作模型的稀疏测试时想象方法
机构 * Virginia Tech(弗吉尼亚理工大学) ; Drexel University(卓克索大学) ; Northeastern University(东北大学) ; Purdue University(普渡大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 该研究提出GlanceWAM,通过异步解耦视频DiT的想象与控制,打破世界-动作模型的速度-成功率困境,在RoboCasa、LIBERO基准测试中表现优异,推理速度达48ms/块。
用于精准单步动作生成的统一条件-动作建模
机构 * NTU(南洋理工大学) ; HKU(香港大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 该研究提出UCA-Flow统一条件-动作建模框架,通过共享令牌空间与改进双路监督方案,提升机器人单步动作生成的成功率与推理速度。
TacWAM:锚点引导的力学感知触觉世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 该研究提出TacWAM,通过空间对齐融合触觉编码器、触觉历史编码器及锚点引导三模态注意力,在四项真实接触操作任务上使平均成功率达75.0%,远超最强基线37.5个百分点。
Comments 8 pages, 4 figures, 2 tables
ReWorld:为世界动作模型学习更好的表示
机构 * Huazhong University of Science and Technology(华中科技大学) ; Xiaomi EV(小米汽车)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 提出ReWorld框架,通过优化中间表示(未来预测监督、跨模态对齐、难负样本监督)提升自动驾驶世界动作模型的规划性能,在nuScenes和NAVSIM上取得显著提升。
Comments 15 pages,5 figures
音频交互模型
机构 * NTU(国立新加坡大学) ; NUS(新加坡国立大学) ; CUHK(香港大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.AI
AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。
Comments Next generation of LALMs
HiTac-WAM:一种用于接触丰富型机器人操作的分层触觉世界动作模型
机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; ImprintX Robotics(ImprintX机器人公司) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 本文提出HiTac-WAM这一分层触觉世界动作模型,通过分层结构建模触觉状态的物理依赖关系,在机器人接触操作任务中提升了预测精度与操作成功率。
Comments 8 pages, 7 figures, and 3 tables
SimWAM:一种用于端到端自动驾驶的简单世界动作模型
机构 * Huazhong University of Science & Technology(华中科技大学) ; Dongfeng Research & Development Institute(东风研发院)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 SimWAM是一种仅将视频生成用作训练信号的简单WAM,通过联合流匹配协同训练视频与动作专家,在NAVSIM上达91.5 PDMS且延迟更低,可零样本迁移至nuScenes,为高效自动驾驶提供可靠基线。
Comments The code and model weights are available at https://github.com/H-EmbodVis/SimWAM/
JEPA-WAM:机器人操作中世界-动作模型的阶段级联合嵌入预测
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 该研究针对通用机器人策略未明确建模任务阶段级未来的问题,提出JEPA-WAM模型,在50个RoboTwin 2.0任务上实现90.25%的整体成功率,成功减少了平均执行步骤数。
实时世界动作模型:通过异步部署实现平滑执行的实证研究
机构 * Motubrain Team(Motubrain团队)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 本文针对世界动作模型推理延迟导致机器人执行不连续的问题,通过10Hz双机械臂机器人对比6种异步部署策略,发现前缀条件生成可在任务性能、速度与平滑度间实现最佳平衡,为高延迟世界动作模型的实时部署提供了指导。
MobileWAM:用前瞻链将世界动作模型(WAM)与移动操作任务对接
机构 * Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院(AIR)) ; Shanghai Jiao Tong University(上海交通大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; AIR Wuxi Innovation Center, Tsinghua University(清华大学AIR无锡创新中心) ; The University of Adelaide(阿德莱德大学) ; Wuhan University(武汉大学) ; Southeast University(东南大学) ; Beijing Jiaotong University(北京交通大学) ; Fudan University(复旦大学) ; Li Auto(理想汽车) ; School of Information, Renmin University of China(中国人民大学信息学院)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 MobileWAM是一种混合Transformer架构,通过前瞻链(CoF)解决移动操作的异质动态问题,在ManiSkill-HAB上超越SOTA策略,可微调至真实移动操作机器人且泛化性强。
Tactile-WAM:具有触觉非对称注意力的触觉感知世界动作模型
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; The University of Hong Kong(香港大学) ; Shenzhen Loop Area Institute(深圳河套学院) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 针对接触丰富操作中视觉预测不完整的问题,提出Tactile-WAM,通过触觉非对称注意力机制(TAAM)在保护视觉预测的同时利用触觉信息生成动作,整体成功率提升38.9%。
Comments Submitted to RSS2026 WorkShop Tactile for FM
SelfWAM:一种用于快速机器人控制的自 grounded 统一世界动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 SelfWAM是一种基于MoT架构的统一自 grounded WAM,通过联合预测动作等改进机器人控制,在RoboTwin 2.0等实验中提升了策略性能与推理速度。
FlowPilot:面向敏捷无人机导航的实时世界-动作建模
机构 * Beijing Institute of Technology(北京理工大学) ; Zhongguancun Academy(中关村学院) ; Shanghai Jiao Tong University(上海交通大学) ; The University of Hong Kong(香港大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 FlowPilot是一种基于流匹配的紧凑世界-动作模型,采用双流混合Transformer,在三级深度金字塔数据上训练,可实现敏捷无人机实时导航,性能优于基线,能在杂乱环境中以5.5m/s速度运行。
Comments 8 pages, 9 figures, 2 tables, submitted to IEEE Robotics and Automation Letters (RA-L)
解耦视觉-触觉前瞻:面向世界动作模型的神谕引导式接口发现
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 针对接触丰富的操纵任务中视觉与触觉跨模态接口未被充分探索的问题,提出OVTF框架与AFM模型,在UniVTAC基准7项任务中,AFM平均成功率优于IFM与UniVTAC-ACT。
Comments 6 pages, 3 figures, 2 tables
LeapBot-WA:通过预测性潜在对齐实现的世界锚定动作模型
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 研究针对世界动作模型依赖像素级视频生成的瓶颈,提出LeapBot-WA,通过预测性潜在对齐建立新范式,引入ISAE弥合模态差距,设计MoT架构,在多数据集上表现出色,实现高效强大的潜在中心范式及零样本鲁棒性和现实世界迁移。
DC-WAM:用于世界-动作模型的以动态为中心的视觉监督与推理
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 研究如何让基于RGB的世界-动作模型从外观主导的重建转向交互诱导的视觉动态,提出DC-WAM框架,通过重新分配监督和计算,结合时间差分流匹配等方法,提升策略性能,尤其在多种分布外扰动下表现出色。
$N_0$-TWAM:用于丰富接触操作的触觉原生世界-动作模型扩展
机构 * NeoteAI Team(NeoteAI团队) ; Fudan TEAI Team(复旦大学TEAI团队)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 研究提出$N_0$-TWAM用于丰富接触操作,通过视觉-触觉联合训练大规模预训练,采用NeoForce表示、引入触觉接触事件及非对称混合变压器架构,在多任务中展现强大能力,为细粒度操作奠定基础,代码等将公开。
GeoWorldAD:用于自动驾驶的几何世界行动模型
机构 * Nanyang Technological University(南洋理工大学) ; Xiaomi EV(小米汽车) ; Zhejiang University(浙江大学) ; Harvard University(哈佛大学)
专题命中 VLA模型 :action model(title,abstract);分类 cs.RO
AI总结 研究自动驾驶中安全高效规划决策问题,提出GeoWorldAD模型,通过在自我对齐3D空间中规划轨迹、用潜在未来几何标记预测场景演变,并逐步聚合多尺度几何线索,实验证明该模型在自动驾驶方面性能先进。
PerceptDrive:用于端到端自动驾驶的具有自适应专家路由的感知先验世界-动作建模
机构 * Tsinghua University(清华大学) ; AMap, Alibaba Group(高德软件有限公司,阿里巴巴集团)
专题命中 VLA模型 :action model(title,abstract);分类 cs.CV
AI总结 研究针对自动驾驶中感知基础模型的问题,提出PerceptDrive框架,将教师提炼先验和观察潜变量输入可训练模型,经特定分支处理、先验保留及场景条件路由,实验表明其性能领先,证实相关方法的有效性及对先验的依赖。