英伟达斯坦福给自动驾驶请了个无渲染老师,仿真交互少千倍
KE:SAI、苏黎世联邦理工学院、英伟达研究院和斯坦福大学团队提出OPTED,用只看高清地图与车辆框的教师策略,给看相机画面的端到端驾驶模型做闭环后训练。两种学生模型的驾驶分数分别提高1.6倍和9.5倍,受控实验所需仿真交互约少三个数量级。
KE:SAI、苏黎世联邦理工学院、英伟达研究院和斯坦福大学团队提出OPTED,用只看高清地图与车辆框的教师策略,给看相机画面的端到端驾驶模型做闭环后训练。两种学生模型的驾驶分数分别提高1.6倍和9.5倍,受控实验所需仿真交互约少三个数量级。
东北大学和体验机器人研究所团队提出UNI,用四轮助行器加智能手机收集轮式导航示范,不必带着目标机器人逐段遥操作。团队走出37.2公里真实轨迹,用这些数据微调视觉导航模型后,保留示范上的轨迹预测误差下降17.4%—24.8%,并把策略闭环迁移
中国科学技术大学、腾讯和香港科技大学团队提出PART:给它一个目标形状和零件库,模型会决定该选哪些部件、需要几个,再预测每块零件的六自由度姿态。团队用超过8万个形状训练,系统还能处理场景布局、图像目标和真实扫描输入,把找零件与拼形状合成一次
谷歌、苏黎世联邦理工学院、微软和洛桑联邦理工学院团队提出SplashSplat,并建立真实飞溅液体基准:20个场景由七台同步4K相机以60fps拍摄。系统把短暂水流重建成可从新视角观看的动态3D,还能做时间插值和无需重新优化的风格迁移。
Astronex Robotics和南京信息工程大学推出Astronex-World 1.0:输入文字或首帧后,用户可以持续控制相机、动作与角色类型,还能在生成中途插入事件。因果版以832×480、24fps输出,在一张NVIDIA L20
南洋理工大学、香港大学和中国科学院团队提出RotateIt,让单臂机器人抓起衣服后绕固定点快速旋转,借惯性张力分开重叠布层。策略只在仿真中训练,面对八件没见过的真实衣物仍取得75.6%展开成功率,展开状态还能直接交给自动折叠程序。
英伟达、南洋理工大学和麻省理工学院团队提出SoL-Pi,让自动研究循环直接优化Coding Agent外层框架。在51项EdgeBench任务上,它与Pi表现相近,却把记录到的Token流量减少44.7%—49.0%,API成本约降三分之一
DeepSeek推出多模态模型DeepSeek-V4.1-Flash,主干参数为552B,最长支持100万Token上下文。它把全局KV缓存降到每Token 890字节,约为DeepSeek-V4-Flash的1/4;持久缓存约降到1/8,
清华大学、小米机器人、苏黎世联邦理工学院和慕尼黑工业大学团队提出平稳搬运液体容器的分层策略。系统先在仿真中生成抓取与路径,再用液体模拟筛掉会倾倒或剧烈晃动的轨迹;相比RVT-2+DP,域内成功率高10.49%,最难域外设置高21.66%。结
深圳大学、中国科学院深圳先进技术研究院、中国科学院大学和中国铁塔推出ReFigBench,让多模态编码智能体把1000张真实arXiv概览图重建成可编辑PPT。实验覆盖10种模型与工作流配置:专用流程常让截图更像原图,却在所有配置中抹掉原生
OPPO AI中心推出HearInContext,用3764个中英文语义样例测试语音识别能否根据对话上下文区分同音词。微调Qwen3-ASR-1.7B后,中文和英文隐式上下文目标词召回分别提高11.0和11.5个百分点,而AISHELL-1
复旦大学、新加坡国立大学和腾讯团队提出一套MiniMax-H3跨模态物理推理评测,包含517个样例。模型要把文字、图像、声音和前缀视频中的不完整线索拼在一起,最终总体成功率41.97%;其中视频决策推理最高为56.00%,音频消歧最低仅27
Google Research、Google DeepMind、加州大学洛杉矶分校和纽约大学分析2518条长任务智能体轨迹,人工标注6967个错误并归为78类。六个前沿模型担任评判器时,表现最好的也不能在三分之一以上的轨迹中正确定位首个错误
浙江大学与电子科技大学提出EvoSkill-GUI,让操作手机和电脑的智能体在部署时根据失败轨迹修改Skill,不增加模型训练。它在MobileWorld、AndroidWorld和OSWorld上对多个基础模型带来提升,三项基准的最大增益
中国科学技术大学与微软亚洲研究院提出PULSE,把学习型图像压缩的解码端压缩到5.2 kMAC/像素,并用整数线性CDF预测器实现跨平台逐比特一致的熵编码。论文测试中,单线程CPU解码一张1080p图像耗时126毫秒;该数字依赖具体硬件、图
银河通用、上海期智研究院、上海科技大学和上海交通大学提出PASSAGE,让人形机器人根据机载感知自主选择跨越、侧身或下蹲等穿越动作。系统用100小时场景对齐的人体运动训练,50次未见实机场景均到达目标,其中45次没有接触障碍;测试规模和环境
SeedLeap.ai推出5B参数世界模型Zing-0.5,让用户同时用键盘动作和在线文字指令改变正在生成的画面。论文报告它以832×480分辨率达到24 FPS,服务器租赁成本估算约每流分钟0.009美元;不过长期状态保持和动作后果仍有限
东京大学、纽约大学、Google DeepMind和日本理化学研究所等团队做出WetRobo:实验人员只需用自然语言下任务,Codex便观察现场、改写并执行机械臂程序。它在真实实验室完成三项任务,瓶盖任务还跨两个实验室成功;但这些仍是受控设
腾讯、清华大学、中国科学院大学提出Video-HolmesV2,专门检查长视频AI能否把画面与声音放进同一条证据链。模型不只要选对答案,还要给出准确的视听时间位置,靠剧情常识猜中也会暴露。在这套新测试中,强专有模型准确率仍低于60%;团队还
宾夕法尼亚大学、Snap、阿卜杜拉国王科技大学提出PhysStream,让视频生成不必在开始前写死全部动作。用户可以在生成过程中给某个物体追加速度方向,模型再继续合成多物体运动。它用位置图和跟踪图保存场景状态,在合成基准上将运动分布距离降低