Xiaomi-Robotics-U0: Unified Embodied Synthesis with World Foundation Model
小米机器人-U0:基于世界基础模型的统一具身合成
机构 * Xiaomi Robotics(小米机器人)
AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。
大厂专区
小米机器人-U0:基于世界基础模型的统一具身合成
机构 * Xiaomi Robotics(小米机器人)
AI总结 研究针对基础模型应用于具身场景受限问题,提出小米机器人-U0多模态自回归模型,将具身生成扩展为基础图像和视频生成的形式,联合优化多种生成任务,在多方面取得领先成果,证明基础世界模型可用于具身智能。
UMoE:在特定领域训练中解锁每个专家
机构 * Qwen Team(通义千问团队) ; DeepSeek-AI(渊亭科技) ; Thinking Machines Lab(思维机器实验室) ; LLM-Core Xiaomi(小米大语言模型核心团队)
AI总结 研究针对特定领域训练中专家池不合理问题,提出UMoE流程,先修剪低显著性专家,再扩展专家池,最后应用标准SFT,该方法在多架构、多领域及多基准测试中优于直接SFT,能转化冗余容量,提升训练效果。
用于快速和高保真虚拟试穿的结构-细节解耦自回归生成
机构 * Huazhong University of Science and Technology(华中科技大学) ; Wuhan Institute of Technology(武汉工程大学) ; Xiaomi EV(小米汽车)
AI总结 研究虚拟试穿问题,提出STAR-VTON框架,通过解耦潜在空间结构合成与像素空间细节恢复,结合匹配信息细化器,实现高效高保真虚拟试穿,其中VAR-VTON效率高,像素空间细化器能有效恢复细节。