腾讯ARC联手港科大攻克世界模型!提出几何原生GAE,漫游误差直接减半
香港科技大学、腾讯与香港大学等机构联合推出几何原生自编码器GAE,攻克了世界模型在长程三维漫游中容易变形穿模的结构缺陷。研究团队将几何基础模型的多层级表征融入视频潜在空间,从底层赋予生成模型强三维几何先验。在权威真实室内与室外漫游评测中,G
香港科技大学、腾讯与香港大学等机构联合推出几何原生自编码器GAE,攻克了世界模型在长程三维漫游中容易变形穿模的结构缺陷。研究团队将几何基础模型的多层级表征融入视频潜在空间,从底层赋予生成模型强三维几何先验。在权威真实室内与室外漫游评测中,G
加利福尼亚大学伯克利分校、伊利诺伊大学厄巴纳-香槟分校与西北大学等机构联合推出具身视触觉世界模型DexTacWAM,赋予双臂灵巧机器人敏锐的指尖感知与物理预判能力。研究团队将预训练视频模型与触觉压缩技术结合,使机器人单任务仅需约百次示范即可
利用通用多模态大模型控制机械臂通常需要收集成千上万条昂贵的机器人专业轨迹进行专门微调。清华大学联合腾讯混元等机构研发了免微调离散动作映射架构RoboDawn。该系统仅凭单次自然动作示范与原生指令接口,便将现成大模型在物理机械臂上的操作成功率
具身智能机器人以往高度依赖前向摄像头视觉,在暗光视线受阻或转角盲区场景下极易丧失对目标的追踪定位。北京大学联合阿里巴巴与清华大学等机构联合推出了首个具身空间声学大模型OmniEcho。该模型赋予智能体感知三维声场与实时双耳声源定位的能力,在
动作扩散策略为机器人带来极佳的柔顺控制与多模态泛化,但其高昂计算开销难以满足双足人形机器人的机载实时性要求。哈尔滨工业大学联合上海创新研究院、清华大学与上海交通大学等机构研发了轻量化动作预测扩散架构PredActor。该策略在低算力机载芯片
深空漫游车在松软异星土壤中极易发生车轮下陷打滑,依赖人工延时干预严重限制了探索范围与移动效率。南加州大学联合NASA喷气推进实验室与华盛顿州立大学等机构推出了面向火星行驶的端到端自监督通行评估模型。该系统在毅力号真实火星车跨越500个火星日
人形机器人实现全身协调操作长期依赖昂贵笨重的全身外骨骼遥操设备,严重制约了技能采集效率。浙江大学联合香港具身智能实验室、Mondo Robotics与香港中文大学等机构推出了全套低成本全身技能迁移框架Whole-Body UMI。该方案仅凭
西北大学、华盛顿大学、新加坡国立大学、微软提出Grounded Action Model,让机器人先把语言、点或框指定的目标变成带尺度的3D表示,再预测动作。在双臂YAM机器人视觉变化测试中,它20次成功17次,对照模型只成功4次。
伊利诺伊大学厄巴纳-香槟分校、加州大学伯克利分校、西北大学提出DexTacWAM,让双手机器人同时预测视觉变化和十个指尖的接触变化。它在六项接触密集任务上全部取得最高分,平均70.6分,而最强基线为38.0分。
东京大学团队推出LunaDrive,把基于氮化镓器件的高压驱动器装到扁平无刷电机背部。系统在96伏下实现连续30安、峰值80安和最高3110赫兹电频率,并用100伏电池完成高速负载举升,验证高压关节的短时动态能力。
卡内基梅隆大学、上海交通大学、中国科学技术大学和香港大学提出MAAP,让多只机械臂在操作时主动移动腕部相机。双臂实机放置实验中,它20次成功14次,固定视角ACT为0次,动作同时承担观察任务。
KE:SAI、苏黎世联邦理工学院、英伟达研究院和斯坦福大学团队提出OPTED,用只看高清地图与车辆框的教师策略,给看相机画面的端到端驾驶模型做闭环后训练。两种学生模型的驾驶分数分别提高1.6倍和9.5倍,受控实验所需仿真交互约少三个数量级。
东北大学和体验机器人研究所团队提出UNI,用四轮助行器加智能手机收集轮式导航示范,不必带着目标机器人逐段遥操作。团队走出37.2公里真实轨迹,用这些数据微调视觉导航模型后,保留示范上的轨迹预测误差下降17.4%—24.8%,并把策略闭环迁移
中国科学技术大学、腾讯和香港科技大学团队提出PART:给它一个目标形状和零件库,模型会决定该选哪些部件、需要几个,再预测每块零件的六自由度姿态。团队用超过8万个形状训练,系统还能处理场景布局、图像目标和真实扫描输入,把找零件与拼形状合成一次
南洋理工大学、香港大学和中国科学院团队提出RotateIt,让单臂机器人抓起衣服后绕固定点快速旋转,借惯性张力分开重叠布层。策略只在仿真中训练,面对八件没见过的真实衣物仍取得75.6%展开成功率,展开状态还能直接交给自动折叠程序。
清华大学、小米机器人、苏黎世联邦理工学院和慕尼黑工业大学团队提出平稳搬运液体容器的分层策略。系统先在仿真中生成抓取与路径,再用液体模拟筛掉会倾倒或剧烈晃动的轨迹;相比RVT-2+DP,域内成功率高10.49%,最难域外设置高21.66%。结
银河通用、上海期智研究院、上海科技大学和上海交通大学提出PASSAGE,让人形机器人根据机载感知自主选择跨越、侧身或下蹲等穿越动作。系统用100小时场景对齐的人体运动训练,50次未见实机场景均到达目标,其中45次没有接触障碍;测试规模和环境
东京大学、纽约大学、Google DeepMind和日本理化学研究所等团队做出WetRobo:实验人员只需用自然语言下任务,Codex便观察现场、改写并执行机械臂程序。它在真实实验室完成三项任务,瓶盖任务还跨两个实验室成功;但这些仍是受控设
南加州大学、斯坦福大学、麻省理工学院、加州大学圣迭戈分校等机构推出Neverwhere,把超过60个真实室内外场景重建成可闭环运行的机器人考场。视觉运动控制器能在部署前反复接受台阶、沟槽和障碍测试,失败条件也能复现。论文还发现,只靠3D高斯
清华大学、大连理工大学、香港中文大学提出Weave,让人形机器人从人类示范学习边走、边保持平衡、边用双手操作物体。策略同时控制29个身体关节和12个手指关节,在九种物体的训练交互上成功率达到92.5%,无需额外训练执行未见序列时达到65.0