arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-01-01 至 2026-01-01 共收录 1 信号源:cs.CV, cs.AI, cs.LG

1. GUI与屏幕智能体 1 篇

2512.24321 2026-01-01 cs.CV cs.RO 57%

UniAct: Unified Motion Generation and Action Streaming for Humanoid Robots

UniAct:面向人形机器人的统一动作生成与动作流

Nan Jiang, Zimo He, Wanhe Yu, Lexi Pang, Yunhao Li, Hongjie Li, Jieming Cui, Yuhan Li, Yizhou Wang, Yixin Zhu, Siyuan Huang

机构 * Institute for AI, Peking University(人工智能研究院,北京大学) Beijing Institute for General Artificial Intelligence (BIGAI)(北京通用人工智能研究院) School of Psychological and Cognitive Sciences, Peking University(心理学与认知科学学院,北京大学) School of Computer Science, Peking University(计算机科学学院,北京大学) Yuanpei College, Peking University(元培学院,北京大学) School of Foreign Languages, Peking University(外语学院,北京大学) School of EECS, Peking University(电子工程与科学学院,北京大学) Huazhong University of Science and Technology(华中科技大学) State Key Lab of General AI(通用人工智能国家重点实验室) Nat’l Eng. Research Center of Visual Technology(视觉技术国家工程研究中心) Beijing Key Laboratory of Behavior and Mental Health, Peking University(北京行为与心理健康重点实验室,北京大学) Embodied Intelligence Lab, PKU-Wuhan Institute for Artificial Intelligence(具身智能实验室,北京大学-武汉人工智能研究院)

专题命中 GUI与屏幕智能体 :MLLM(abstract);分类 cs.CV

AI总结 UniAct通过统一感知与控制框架,实现人形机器人在多模态指令下的高效动作生成与实时执行,提升零样本跟踪成功率19%。

Comments Project page: https://jnnan.github.io/uniact/

详情

展开后加载摘要…

URL PDF HTML 收藏