腾讯港中文等提出ForgeWM:一步生成可玩的游戏世界,回放还能继续精修
扩散世界模型画面越精细,往往要去噪越多步,玩家按键后只能等待;压到一步生成,速度上去了,细节和稳定性又容易下降。腾讯PCG、香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等团队提出ForgeWM,训练1、2、4步不同速度的学生模型
从最新学术论文中提炼值得关注的技术进展、实验结果和产业信号。
扩散世界模型画面越精细,往往要去噪越多步,玩家按键后只能等待;压到一步生成,速度上去了,细节和稳定性又容易下降。腾讯PCG、香港中文大学、复旦大学、上海人工智能实验室、香港科技大学等团队提出ForgeWM,训练1、2、4步不同速度的学生模型
静态桌面上慢慢抓取,模型多想半秒未必出事;面对滚动、摆动或即将离开的目标,等图像编码和动作生成完成,机会已经过去。上海交通大学团队提出ReflexVLA,把未来运动预测、多帧视觉融合和低延迟推理放进同一策略,并发布包含6类高速动态任务的Re
视频模型可以生成很像游戏的画面,却常在连续操控后让角色穿地、漂走或动作失真。Alaya Lab、上海创智学院、华中科技大学等团队提出Marionette,不让神经网络同时猜物理状态和像素,而是先生成276维显式3D角色状态,再由零参数几何桥
AI科研Agent可以一口气提出很多实验,但算力真正花在哪里,往往比想法数量更决定最终成绩。Meta FAIR、牛津大学、伦敦大学学院等团队提出Research Preference Models(RPM),专门比较候选研究动作并挑选更有希
捷克理工大学视觉识别团队提出ReImageNet,重新检查ImageNet-1k的5万张验证图,发现约12%的原标签错误,33.3%的图片天然包含多个类别,还有3.8%根本找不到合适的ImageNet类别。换用新标签后,多模态大模型准确率普
让AI连续研究24小时,真正棘手的不是多写几段代码,而是路线走偏后能否及时止损、保留好结果并从可靠节点重新出发。华为诺亚方舟实验室推出ScienceFlow,通过可执行状态快照、证据驱动回退和资源感知调度组织长时程科研Agent,在完整ML
斯坦福大学、康奈尔大学等机构的研究者提出Twin。面对从未见过规则的小游戏,它让AI一边试玩、一边把观察到的状态变化写成可执行代码,为每个游戏建立“数字孪生”,先在内存中验证路线,再提交真正计分的动作。在ARC-AGI-3中,Twin总得分
给AI一张人物、宠物或物品照片,再要求它换姿势、换场景,通常需要大规模合成“参考图—目标图”配对数据。百度、DGIST、KAIST等团队提出CRAFT,只使用1万张彼此独立的参考图训练,不需要预先制作目标合成图,却能同时保持主体身份和文本指
机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在
香港科技大学iComAI Lab与Vivix Group团队提出Omni-LiveAvatar,把联合音视频扩散模型改造成少步自回归生成器,在单张NVIDIA H200上完成分钟级流式生成,速度达到21.99 FPS,相比LTX-2快33倍
人拿起杯子可能是自己喝,也可能准备递给机器人。若等物体已经伸到面前才判断,机械臂反应会显得迟钝;过早误判又可能突然伸手。阿里巴巴、浙江大学等团队提出PassGen,先生成未来的RGB-D递物视频来判断意图,并利用Hand2Bot真实数据中的
主流视频生成模型通常先训练一个自编码器,把像素压进潜空间,再让扩散模型从头学习其中的语义。牛津大学与新加坡国立大学提出V-RAE,直接复用冻结视觉基础模型的表征来构建视频潜空间,使生成训练最多加快6倍,并在Kinetics-600上取得19
图生视频有一张高质量首帧做视觉锚点,通常比只靠一句提示词更容易生成稳定画面。Adobe、上海人工智能实验室、上海交通大学、南洋理工大学和复旦大学等团队开源HPSD,让同一个图文生视频模型先以“带首帧老师”提供高质量方向,再让纯文本学生沿自己
世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频
把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的
一个月前把钥匙放在哪、某次做饭先拿了什么、不同日期见过谁——人会把零散经历串成长期记忆,多模态模型却常在短视频问答里被高估。华为、南京大学和天津大学推出EgoMonth,收集20名参与者跨20至120天的300多小时第一视角视频,用1443
自动驾驶模型如果每次思考要717毫秒,车辆一秒只能更新约1.4次决策。普林斯顿大学与加州大学圣迭戈分校提出FlashDrive,把Alpamayo 1.5-10B视觉—语言—动作模型在单张GPU上的端到端延迟压到151毫秒,频率升至6.6H
一把电钻不是不可编辑的整体,而应该由机身、电池、钻头等零件组成;这些零件单独看要完整,装回去又不能留下裂缝。华为与上海交通大学团队开源SCULPT,像雕塑家从材料上逐次切割一样,从完整3D形状中迭代取出部件,并根据物体复杂度自动决定零件数量
“穿过走廊,在画旁边左转,再停到书架前。”这类指令对轮式机器人已不轻松,换成人形机器人还要同时处理步态、碰撞和身体尺寸。VinMotion与南加州大学提出HumanoidVLN,在4种人形平台、933条路线中评测语言导航,并把宇树G1带到真
把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A