人形机器人踩空也能站稳:GigaBrain跌倒恢复率99.3%
人形机器人按着坐椅指令下蹲时,椅子可能已经被移走;踢腿动作也可能让自己的四肢互相碰撞。GigaBrain-WBC-0.5把动作、下一时刻身体状态和下一条可行动作分布放进同一个因果Transformer里,让控制器在执行前识别不合理指令并收回
人形机器人按着坐椅指令下蹲时,椅子可能已经被移走;踢腿动作也可能让自己的四肢互相碰撞。GigaBrain-WBC-0.5把动作、下一时刻身体状态和下一条可行动作分布放进同一个因果Transformer里,让控制器在执行前识别不合理指令并收回
五指机械手要完成插销,得先找到物体、抓稳、在手中调整方向,再把它对准孔位。英伟达、密歇根大学提出ADEPT:先用通用“物体重定向”任务预训练,再用一套稳定后训练方案学习具体操作。论文的Kuka-Allegro插销实验中,五个随机种子全部训练
让人形机器人走到陌生目标前、保持平衡并伸手抓取,需要把视觉导航、全身控制和操作连在一起。加州大学洛杉矶分校、艾伦人工智能研究所、华盛顿大学等机构提出FetchMan,在超过15万个仿真场景中训练,并把策略零样本部署到真实宇树G1。
自动驾驶仿真把相机移到训练轨迹之外,3D高斯溅射生成的道路、建筑和车道线容易变形;向场景插入车辆后,前景还可能与背景错位。清华大学人工智能产业研究院、浙江大学、长城汽车、上海交通大学等机构提出SPVC,用一套两阶段视频扩散模型修复跨数据集驾
把人物外套换色、在肩膀上加一只鹦鹉,再替换背景,现有视频编辑数据通常会把三项操作拆成三个样本。腾讯发布CoinVE-200K,把2至5种原子编辑组合进同一条指令,目标同时覆盖人物、物体和背景。
没有标准答案时,让模型给自己打分很容易把原有偏见越练越强。埃克塞特大学、字节跳动、约翰斯·霍普金斯大学、加州大学圣迭戈分校等机构提出Co-RL,让多个不共享参数的模型互相提供强化学习奖励,并用不同模型家族、规模和训练样本降低共同犯错。
给AI完整实验路线时,它能沿步骤执行;只给研究问题,让它自己决定方法,成绩迅速下滑。清华大学、麻省理工学院、哈佛大学、微软研究院等机构发布ASI-Bench,用60项项目级任务测试AI探索未知、选择方法并产出可验证结果的能力。
编程智能体在真实仓库里会压缩上下文、反复调用工具、重启环境,训练器很难精确知道哪些Token由当前策略生成。华为、香港中文大学提出LEGO-RL,在不改动Agent内部控制流的前提下,把OpenHands SDK、Claude Code和O
训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型
自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。
扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。
机器人换一副机械臂,原有世界模型往往就要重新学习动作含义。英伟达、布朗大学、哥伦比亚大学、哈佛大学等机构提出Hydra-0,把关节角、末端位姿等机器人专属命令转换成画面中的像素运动轨迹,让不同形态的机器人共享一种视觉动作接口。
剑桥大学团队提出RigidBench,用模拟器给视频生成模型建立可核对的刚体运动标准答案。8款模型在同一批100个样本上接受10项测量,没有一个模型在全部指标领先;更反常的是,模型平均SSIM越高,3D轨迹误差反而越大,相关系数达到0.89
上海人工智能实验室、复旦大学和中国科学技术大学等机构联合提出MegaParts,用自回归大模型生成由语义零件组成的3D物体。系统支持最多300个部件、最长25.6万Token序列,生成的门、抽屉、钢琴键等部件保持独立,便于后续移动、替换和制
香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%
北京大学、北京航空航天大学和京东科技联合提出AppliancePlan,让机器人结合说明书、当前画面和操作状态规划家电任务。团队构建覆盖22类家电的数据集;论文报告,7B模型在RealAppliance-Bench开放规划上超过最佳基线10
上海交通大学、腾讯优图实验室和浙江大学联合发布PersonaShot,专门评估人物在多镜头AI视频中的叙事连续性。基准包含约1000个多镜头片段和16项指标。团队发现,高观感画质并不保证切镜后的物理状态、情绪变化和镜头关系保持连贯。
南京大学、蚂蚁集团和阿里巴巴达摩院联合提出BaguanHR,目标是训练0.1度全球高分辨率天气模型。论文报告,在72小时预报范围内,其合成加真实数据版本在超过85%的受测时段优于IFS-HRES;训练数据翻倍时,72小时预报RMSE下降4.
香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确
斯坦福大学、麻省理工学院和Scale AI联合提出SPD,把灵巧手的大规模操作数据采集放进VR仿真。5名操作者在一周内积累75小时多任务轨迹,模型预训练后,只用1—2小时真实演示微调,就能迁移到56自由度的双手灵巧机器人上。