佐治亚理工让机器人从失败中学习,叠杯成功率从40%升到90%
机器人模仿人类示范学会叠杯后,第一次操作失败通常不会让它自动变聪明:失败动作不能直接拿来继续模仿。佐治亚理工提出Q-Planning,冻结原有的数十亿参数行为克隆策略,只训练一个约10亿参数的价值函数。五轮实机自我改进后,叠杯成功率从40%
机器人模仿人类示范学会叠杯后,第一次操作失败通常不会让它自动变聪明:失败动作不能直接拿来继续模仿。佐治亚理工提出Q-Planning,冻结原有的数十亿参数行为克隆策略,只训练一个约10亿参数的价值函数。五轮实机自我改进后,叠杯成功率从40%
同样是纸杯,空杯需要轻捏,装满后又要增加抓力;外观相近的易拉罐,也可能因为重量不同而滑落。小米机器人团队提出ViTacPhys,让机械手在抓取时显式判断物体的质量等级、刚度和接触摩擦等级,再据此调整动作。真实抓取中,它在训练分布内物体上的总
人形机器人把球打出去不算难,既保持职业网球动作风格,又在真实硬件上稳定击球更难。上海人工智能实验室、上海交通大学、诺亦腾机器人、越疆机器人等机构提出AdaPT,从转播视频学习发球与回合动作,并把策略部署到宇树G1和1.7米越疆Atom。
音乐生成模型通常先把波形压进连续潜变量,再在潜空间生成。压缩率提高后,高频容易消失,左右声道空间感变窄,相位也会出现不连续。阿里巴巴通义千问、莫纳什大学提出ear-VAE2,直接在复杂频谱上编码,并按频段分别修正幅度和相位。
用手机随手拍一段人物视频,想得到能从任意方向观看的动态模型,单目画面缺少背面与侧面信息。浙江大学、蚂蚁集团、香港中文大学、香港科技大学等机构提出4DAnyone,先生成多视角一致视频,再把它提升为4D高斯泼溅表示。
智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。
四足机器人装上机械臂后,摄像头会随底盘移动,手臂动作也会改变画面。清华大学、上海人工智能实验室、哈尔滨工业大学、云深处科技等机构提出DECOWAM,分别建模相机自运动、底盘和机械臂动作,再联合预测未来视频与控制。
文本生成3D要么逐个预测形状Token,速度慢且前面出错后难以修正;要么反复更新完整3D表示,计算量随精度增加。浙江大学、加州大学伯克利分校、武汉大学等机构提出Block3D,把形状序列切成连续块,块之间自回归、块内并行去噪。
第一人称视频中,手经常被物体挡住,甚至短暂伸出画面。南洋理工大学、香港中文大学、上海交通大学、ACE Robotics等机构提出DreamHand,把视频扩散模型当作确定性几何编码器,用完整片段恢复连续双手3D轨迹。
机器人视频很多,带精确动作标签的数据却很少。小米汽车、复旦大学、清华大学、武汉大学等机构联合发表这项系统实证研究:在统一框架中比较41种隐式动作模型设计,追踪哪些选择真正改善下游操作,而不只让视频重建指标更漂亮。
让视频模型把绳结解开、让齿轮按规则转动,或沿迷宫走到出口,画面好看不等于过程正确。微软研究院、清华大学、麻省理工学院、伊利诺伊大学厄巴纳-香槟分校等机构提出VGI-Bench,用27项任务、810个实例测试视频生成模型能否通过连续画面完成视
给出多张人物参考照,再要求AI把所有人放进同一张合影,人数一多就容易漏人、重复或贴上一张原脸。腾讯混元、复旦大学、香港大学联合提出WithEveryone,把身份、位置和姿态先做成结构化计划,再据此生成最多包含10个指定身份的群像。
固定训练题库会被智能体逐渐做熟,继续强化学习只是在重复已经会的任务。华盛顿大学、斯坦福大学、卡内基梅隆大学、麻省理工学院等机构提出SPADE,让同一个模型同时扮演“环境设计者”和“推理智能体”,生成可执行环境并随学习进度调整难度。
把数学、代码、指令遵循等多个强化学习专家蒸馏到一个学生模型,短答案任务可能先停滞,长答案领域却持续占用大部分Token更新。清华大学AIR、字节Seed提出Open-MOPD,在SmolLM3-3B-Base的受控实验中,把相对路由专家集合
智能体先选对一个Skill文件,后续执行却失败,普通结果奖励会连同正确选择一起惩罚。上海交通大学、小红书提出SkillGate,把“选哪个Skill”和“拿Skill完成任务”分成两条互不重叠的信用通道。五项智能体基准上,9B策略的试验成功
机器人把面包放到目标位置,并不代表任务真的成功:抓得太松会滑落,抓得太紧会把软物体压坏,外部相机有时看不出两者差别。拓境智能、清华大学、卡内基梅隆大学等机构提出SoftVTBench,收集4000条视触觉演示,专门评估可变形物体操作中的形变
GPT-5 mini操作同一批网页组件,只把观察与动作方式从无障碍树换成纯截图坐标,任务成功率就从83.1%降到48.9%。杜克大学、亚马逊AGI旧金山实验室提出ComponentBench,把按钮组、筛选表格、拖拽和富文本编辑器等97类组
照片已经拍完,还能向左换机位、拉长焦距、调高曝光,并让同一物体在所有新视角里保持一致。南京大学、vivo提出ReX-Shot,从一张参考图同时控制视角、连续焦距和色温、曝光、饱和度等摄影参数,论文系统达到接近实时的交互速度。
九名参与者听到句子后在键盘上输入,脑磁图设备连续记录大脑活动。Meta AI、巴黎高师、法国国家科学研究中心等机构据此训练Brain2Qwerty v2,在不植入电极的情况下解码自然句子,跨参与者平均词错误率达到39%。
给系统一段真实音乐,它要决定什么时候抬手、哪根鼓槌打哪面鼓,还要让肩膀和躯干看起来像人在演奏。迪士尼研究工作室、特拉维夫大学、苏黎世联邦理工提出一套音频驱动的扩散模型,把身体自然度和鼓槌落点精度分开优化,生成动作可达到厘米级落点控制。