小鹏机器人把一段人类视频变成多种机器人训练经验
南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准
南洋理工大学、新加坡科技研究局、小鹏机器人和浙江大学等机构提出AnyWorld:不用成对拍摄人类与机器人示范,就能把一段第一视角人类交互重组为不同机器人本体、相机视角和场景下的机器人原生视频。生成数据随后用于RoboCasa GR1桌面基准
清华大学、Galbot、北京大学和上海期智研究院等机构联合提出RoboGesture,让宇树G1人形机器人在听取语音时实时生成与内容相符的手势。团队同时建设了覆盖300多类动作的数据集,并把语音理解、流式动作生成和实体安全控制接成一套完整系
视觉Transformer处理高分辨率图片时,全注意力要让每个图像Token与所有Token交互,计算量增长很快。北京大学、小米、香港大学等机构发现,全注意力中的不同注意力头会分别关注前景物体和背景,并据此设计Ariadne混合注意力。
输入一张普通RGB照片,模型同时输出单目深度和表面法线。萨里大学、帝国理工学院等机构提出GeoNeXt,把预训练视频生成模型改造成统一几何学习器:原图是第一帧,深度与法线成为后续“几何帧”,三者沿同一去噪过程生成。
输入商品图、卖点文案和尺寸要求,模型不再输出一张难修改的扁平图片,而是直接写出可渲染的HTML/CSS广告。阿里巴巴、同济大学等机构提出CommerceVibe,让商品图片保持原样引用,文字以原生元素存在,运营人员可以继续换图、改字和调整布
没有机械臂和夹爪,四足机器人也能用肩部、机身或腿接触椅子,把它推到指定位置。比萨大学、苏黎世联邦理工学院、英伟达等机构提出接触引导的多评论家强化学习方法,覆盖推箱、搬椅和开洗碗机三类非抓取移动操作任务。
一只五指机器人手,16个转动关节由7个电机通过腱绳驱动,论文给出的整手重量为374克、物料成本为314美元。Chestnut Robotics、加州理工学院等机构推出Aero Hand Open,并把机械设计、仿真模型、强化学习环境和真机部
长视频做三维重建,最直接的办法是让模型不断回看过去所有画面,代价是内存和计算随视频长度增长。阿里巴巴高德视觉团队提出ABot-Recon,只固定保留第一帧和最近10帧,就能连续估计相机轨迹、深度与场景点云。
拍好的一段单目视频,输入一条新的六自由度相机轨迹,模型就沿新机位重新生成画面。浙江大学、Manifold Tech、上海科技大学、剑桥大学等机构提出Manifold4D,处理视频换机位重拍时最容易出现的几何漂移和相机控制误差。
同一笔训练预算,是把驾驶视频模型做得更大,还是让现有模型多看几遍数据?法雷奥AI与索邦大学的研究团队提出VATIX缩放研究,覆盖从100万到约90亿参数的视频扩散模型,并在最高5500小时驾驶数据上改变训练曝光量,得到一组面向固定数据池的缩
智能体训练常把任务写成一条信息完整的指令,真实用户却会追加条件、改变方向,看到工具结果后再指出错误。对1.6万条真实会话的分析显示,75.9%包含两轮或更多用户发言,多轮会话的用户发言中位数达到10轮。
一个机器人模型换到预训练阶段从未见过的人形本体,只用20%的下游轨迹就拿到49.5%的任务成功率,高于GR00T-N1.6使用全部下游数据时的47.6%。这项结果来自VLAct,一套把持续预训练重点从“继续堆机器人数据”转向“先把表示学好”
人形机器人走几级台阶并不罕见,难的是在长距离中持续处理台阶、斜坡、窄落脚点和感知噪声。中国科学技术大学、X-Humanoid、清华大学等机构提出SOLO,仅用胸前深度相机和本体感知零样本部署,完成1.5公里连续户外路线。
软件智能体常靠截图理解界面,再模拟鼠标点击和键盘输入。上海交通大学、北京通用人工智能研究院提出Agent-Software Interaction Layer,即ASIL,用结构化JSON状态替代像素观察,用可执行语义动作替代坐标点击。
给机器人一张目标房间的俯视布局,它需要从第一视角找到家具、抓起、搬运并摆到正确位置。北京理工大学提出具身场景重排规划ESRP,并构建ESRP-Bench,包含超过5400组初始—目标场景和8200个物体。
自回归视频模型按片段向后生成,人物或物体离开镜头几十秒后再出现,颜色、形状和位置很容易变化。斯坦福大学、北京大学、字节跳动等机构提出Ring Forcing,通过环形训练、历史压缩和稀疏位置编码,让模型使用分钟级远距离信息。
同一个人物视频,既可以用来识别情绪,也可以测试视频生成、声音克隆和人物抠像。深圳大学、中科院自动化所、清华大学、华为等机构推出HUG-VIS,用8400段同步视频、音频、文本和透明度蒙版,把四类任务放在同一套受控素材上比较。
用户只说“规划三天旅行”,没有主动填写酒店档次、饮食口味和景点偏好,智能体还能给出贴合个人习惯的计划吗?美团、北京航空航天大学、北京理工大学等机构提出Behavior2Trip,让模型从历史点击、收藏和预订行为中推断偏好,再调用工具生成行程
视频世界模型离开一个场景再返回时,如果新画面与第一次访问高度相似,常被解释为“记住了”。阿里巴巴、同济大学、上海交通大学提出R2M-Bench,指出模型只要几乎不移动,也能得到漂亮的绝对相似度。
车载激光雷达的一次扫描只占目标三维体积约1%,其余位置既没有几何信息,也没有类别标签。复旦大学、卡内基梅隆大学提出生成式语义场景补全GSSC,用一套离散扩散框架同时合成训练数据、从噪声生成完整场景,并修正已有模型的输出。