阿里&浙大提出TTPO:无标签测试时训练让Qwen3-1.7B从38.0%升至45.2%
模型遇到新题时,通常只能多采样几次再投票,不能在没有标准答案的情况下可靠更新参数。浙江大学、阿里巴巴提出测试时策略优化TTPO,让模型把自己的多次解答分成“同意多数结果”和“反对多数结果”两组,用不同目标继续学习。
模型遇到新题时,通常只能多采样几次再投票,不能在没有标准答案的情况下可靠更新参数。浙江大学、阿里巴巴提出测试时策略优化TTPO,让模型把自己的多次解答分成“同意多数结果”和“反对多数结果”两组,用不同目标继续学习。
看懂一张街景,并不等于能沿着街道走到目的地。上海交通大学、美团、新加坡国立大学等机构提出UrbanGround,把真实尺度城市地理数据装进可交互的Unity环境,专门检验多模态大模型在连续移动中能否认路、记路并调整路线。
长任务中,机器人要记住哪些物体已经移动、当前动作是否失败,以及下一步会不会挡住后续操作。卡内基梅隆大学提出R³,让视觉语言模型在每次低层动作前用自然语言分析场景、进度与替代计划,再把文字指导交给操作策略。
拧瓶盖时,摄像头能看到机械臂位置,却很难判断软夹爪是否已经压紧;力和触觉传感器又会增加布线、标定和成本。清华大学、南方科技大学、哈尔滨工业大学提出VISTA-Policy,从合规夹爪的三维形变场中提取接触反馈。
商家计划下周增加广告预算时,普通时间序列模型往往仍沿着历史销量往前画线。阿里巴巴、中国科学技术大学、香港科技大学(广州)提出CEDAR,直接学习“当前状态—商家行动—下一状态”的转换,再单独修正节日和热点带来的偏差。
机器人只模仿动作,可能学会在训练画面里伸手,却没有形成稳定的三维结构与物体运动表示。图灵智新、中科院自动化所、清华大学等机构提出GaussianDream++,训练时要求视觉语言动作模型重建当前3D世界并预测未来,部署时再移除重建头。
数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内
低清商品图里的针织花纹已经糊成一片,生成式超分常会补出看似清晰、实际不存在的纹理。阿里淘天集团、中国科学院大学提出GraftSR,不让模型凭经验猜细节,而是读取同一件商品的另一张高清照片,把可确认的纹理移到目标位置。
“把开场压到3秒、第二段踩音乐重拍、总时长不超过30秒”不是一句文字建议,而是一组必须能落到时间线的操作。港中大(深圳)、vivo AI Lab、北京大学等机构提出RefineCut,训练8B开源权重模型输出剪辑补丁,再由确定性验证器检查每
模型能说出苹果在画面左侧,不代表它能用绘图工具准确圈住苹果。北京大学、清华大学、商汤研究院提出EASEL,要求多模态智能体不断观察参考图和当前画布,再输出笔刷位置、颜色、粗细等参数,直到重建目标。
拖动一个物体的三维轨迹、改变相机运动,再让视频继续往后生成,过去通常要分给不同模型处理。北京大学、腾讯混元提出4DStreamCtrl,把相机、物体和深度都编码成三维点轨迹,在一次前向计算中完成联合控制。
同一个“把面包拿起来”任务,单臂机器人、双臂机器人和人手使用的关节、控制器与动作维度完全不同。小米具身智能团队、澳门大学提出UCAG-P,把这些动作先换算成相机能观察到的手腕、末端执行器和抓取中心轨迹,再交给不同机器人的运动学模块执行。
从带尺寸标注的正交工程图生成CAD代码,早期一个工作平面、孔径或拉伸深度出错,后面所有操作都会跟着偏。复旦大学、字节跳动提出IterCAD,让模型在生成中间CAD后重新查看几何结果,决定继续修改还是停止。
工具型智能体一旦执行发邮件、改文件或支付等操作,事后识别风险往往已经太晚。上海人工智能实验室、北京航空航天大学、复旦大学、中国人民大学等机构提出StepGuard,在每次工具调用前检查动作,也能对完成后的整条轨迹做审计。
智能体执行长任务时,聊天记录越来越长,未完成目标容易被淹没,检索到的技能也可能与当前状态错位。新加坡国立大学、斯坦福大学、牛津大学、普林斯顿大学提出Recuris,把工作记忆和经验记忆耦合,并让失败证据反向推动局部技能更新。
不给AI智能体分配固定角色,也不让中央调度器指定下一步,只提供一个可检验的研究目标,它们会不会自己形成研究路线?来自DualverseAI、剑桥大学、香港大学、加州大学圣迭戈分校的研究团队共同提出并评测了开放世界多智能体环境Station。
扩散模型先在视觉分词器的潜空间里去噪,再把潜变量解码成图像。分词器即使能高质量重建图片,也不一定让后续去噪容易。复旦大学、阿里巴巴提出AffineTok,把潜空间中的语义组织方式纳入训练目标。
给AI一组“变化前—变化后”的图片,再给一张新图,让它照着示例完成同类编辑。现有视觉上下文学习擅长颜色、材质和外观迁移,却常忽略物体结构、相互作用和环境条件。北京大学、商汤研究院、浙江大学提出TransPhy,把任务拆成物理规则推断和结果渲
机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。
输入一句文字,同时生成画面和匹配的声音,省掉了视频生成后再配音的串联步骤,但联合模型也把两种模态的计算成本叠到一起。浙江大学、清华大学、新加坡国立大学等机构提出TurboT2VA,用蒸馏与推理优化加速190亿参数的LTX-2音视频模型。