首尔大学先把机器人画进视频再预测未来,世界模型能适配未见过的机械臂
机器人世界模型通常直接接收关节或末端动作向量,再预测未来画面。换一台机械臂,向量含义和运动学关系都可能变化。首尔大学、RLWRLD团队提出RoFacto:先让控制器把命令变成名义轨迹,再把机器人几何渲染进相机画面,视频模型只学习物体如何响应
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
机器人世界模型通常直接接收关节或末端动作向量,再预测未来画面。换一台机械臂,向量含义和运动学关系都可能变化。首尔大学、RLWRLD团队提出RoFacto:先让控制器把命令变成名义轨迹,再把机器人几何渲染进相机画面,视频模型只学习物体如何响应
图像理解需要语义,图像生成需要纹理细节,统一多模态模型常用两套不同表示。腾讯混元、香港中文大学、香港城市大学、厦门大学团队提出Twins,把ViT语义特征与VAE潜变量拼成同一组连续视觉Token,在不增加序列长度的情况下同时服务理解、重建
多任务模型执行左转、右转、直行或刹车时,通常会完整运行同一套骨干网络,即使部分计算与当前任务无关。香港科技大学、华为诺亚方舟实验室、香港科技大学(广州)团队把任务命令直接变成硬件执行掩码,在FPGA闭环驾驶实验中将端侧延迟降低51%至59%
同一块月面可能同时有可见光、地形、温度、雷达和重力数据,但不同仪器的分辨率、覆盖与物理含义不一样。剑桥大学、德国航空航天中心、SPAIDER SPACE、帝国理工学院等团队提出LunarFM,把三次月球任务、六种仪器的18个输入通道对齐到一
Qwen、GLM和MiniMax可以各自当老师,但它们切分文字的Token规则不同,教师给出的概率分布不能直接交给同一个学生模型。中国科学院大学、快手KwaiKAT团队、浙江大学、香港中文大学提出BPM,把不同Tokenizer的输出搬到共
机械臂把物体插进狭窄接口时,相机可能看不到接触点,真正决定成败的是压力、摩擦和细微位移。上海科技大学、InstAdapt团队提出ViTacWorld,让世界模型根据机器人动作同时预测未来画面和触觉反馈,再用生成轨迹扩充插接、剥离等任务的训练
受试者在磁共振扫描仪里观看数字人面部视频,模型再根据fMRI信号重建身份外观、表情、头部姿态和连续运动。复旦大学、西湖大学、浙江大学、南洋理工大学团队提出fMRI2Face,并构建62856组脑信号与1920×1080视频配对样本。
一只机械手在灯前摆动,墙上的影子可以拼出手势字母,也能模仿鹿、孔雀、鸭子和狼的动作。杜克大学团队让21自由度灵巧手学习“自己的关节怎么改变影子”,再从目标图片或视频反推机械手动作,把影子变成机器人的表达媒介。
同样是Claude Opus 4.7和Codex GPT-5.5配合写代码,谁先写、谁来审,结果并不对称。加州大学戴维斯分校、约翰斯·霍普金斯大学、加州州立大学长滩分校团队在116道LiveCodeBench中高难度题上测试发现:Claud