UCLA等让人形机器人边走边抓:15万条仿真轨迹训练,实机成功率73.3%
让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。
自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾
把人物外套换色、在肩膀上加一只鹦鹉,再替换背景,现有视频编辑数据通常会把三项操作拆成三个样本。腾讯发布CoinVE-200K,把2至5种原子编辑组合进同一条指令,目标同时覆盖人物、物体和背景。
没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。
给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。
编程智能体在真实仓库里会压缩上下文、反复调用工具、重启环境,训练器很难精确知道哪些Token由当前策略生成。华为、香港中文大学提出LEGO-RL,在不改动Agent内部控制流的前提下,把OpenHands SDK、Claude Code和O
训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型
自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。
扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。
机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。
剑桥大学团队提出RigidBench,用模拟器给视频生成模型建立可核对的刚体运动标准答案。8款模型在同一批100个样本上接受10项测量,没有一个模型在全部指标领先;更反常的是,模型平均SSIM越高,3D轨迹误差反而越大,相关系数达到0.89
上海人工智能实验室、复旦大学和中国科学技术大学等机构联合提出MegaParts,用自回归大模型生成由语义零件组成的3D物体。系统支持最多300个部件、最长25.6万Token序列,生成的门、抽屉、钢琴键等部件保持独立,便于后续移动、替换和制
香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%
北京大学、北京航空航天大学和京东科技联合提出AppliancePlan,让机器人结合说明书、当前画面和操作状态规划家电任务。团队构建覆盖22类家电的数据集;论文报告,7B模型在RealAppliance-Bench开放规划上超过最佳基线10
上海交通大学、腾讯优图实验室和浙江大学联合发布PersonaShot,专门评估人物在多镜头AI视频中的叙事连续性。基准包含约1000个多镜头片段和16项指标。团队发现,高观感画质并不保证切镜后的物理状态、情绪变化和镜头关系保持连贯。
南京大学、蚂蚁集团和阿里巴巴达摩院联合提出BaguanHR,目标是训练0.1度全球高分辨率天气模型。论文报告,在72小时预报范围内,其合成加真实数据版本在超过85%的受测时段优于IFS-HRES;训练数据翻倍时,72小时预报RMSE下降4.
香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确
斯坦福大学、麻省理工学院和Scale AI联合提出SPD,把灵巧手的大规模操作数据采集放进VR仿真。5名操作者在一周内积累75小时多任务轨迹,模型预训练后,只用1—2小时真实演示微调,就能迁移到56自由度的双手灵巧机器人上。
上海创新研究院、智元Finch和香港中文大学联合提出τ0-VLA,让机器人在决定下一项子任务时按难度分配推理计算:简单步骤直接执行,困难或后果重要的步骤先生成多个候选,再借助世界模型比较。模型使用40115小时异构真实世界数据训练,并在多种
腾讯Hy Frontier团队提出开源GUI智能体UI-Mate:用户先录一遍操作,它把录像整理成可复用的子任务流程,再对着实时屏幕执行。论文在OSWorkerBench的33项同任务示范子集中报告,一次示范将严格成功率从17.2%提高到3