arXivDaily arXiv每日学术速递 周一至周五更新

视觉与机器人

VLA / 视觉-语言-动作模型

视觉-语言-动作模型、机器人基础模型和语言条件机器人控制。

2026-08-24 至 2026-08-24 共收录 2 信号源:cs.RO, cs.CV, cs.AI, cs.LG
2608.20114 2026-08-24 cs.AI cs.RO 版本更新 82%

DECOWAM: Decoupled Whole-Body World-Action Model for Legged Mobile Manipulation

DECOWAM:用于腿式移动操作的解耦全身世界-动作模型

Siyuan Ma, Boshi Zhang, Yutian Zhang, Qinglian Wu, Jiaqi Zhai, Dong Wei, Qiaojun Yu

机构 * Tsinghua University(清华大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Harbin Institute of Technology(哈尔滨工业大学) Hangzhou Yunshenchu Technology Co., Ltd. (DEEP Robotics)(杭州云神初科技有限公司(深智机器人))

专题命中 VLA模型 :action model(title,abstract);分类 cs.RO、cs.AI

AI总结 本研究提出DECOWAM模型,通过解耦全身动作因素提升移动操作的视觉与动作预测性能,在真实机器人数据集ARMDOG上验证了其在协调性和鲁棒性上的优势。

Comments 8 pages, 5 figures. Introduces DECOWAM, a decoupled whole-body world-action model for legged mobile manipulation, and the ARMDOG real-robot dataset

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05121 2026-08-24 cs.SD cs.AI cs.CL cs.MM eess.AS 版本更新 79%

Audio Interaction Model

音频交互模型

Zhifei Xie, Zihang Liu, Ze An, Xiaobin Hu, Yue Liao, Ziyang Ma, Dongchao Yang, Mingbao Lin, Deheng Ye, Shuicheng Yan, Chunyan Miao

机构 * NTU(国立新加坡大学) NUS(新加坡国立大学) CUHK(香港大学)

专题命中 VLA模型 :action model(title,abstract);分类 cs.AI

AI总结 提出一种统一的在线大型音频语言模型Audio-Interaction,通过始终在线的感知-决策-响应循环实现实时音频交互,并构建了StreamAudio-2M数据集和Proactive-Sound-Bench基准,在保持主流音频任务性能的同时解锁了实时ASR、流式音频指令跟随和主动帮助等能力。

Comments Next generation of LALMs

详情

展开后加载摘要…

URL PDF HTML 收藏