微软等发布Agent Lightning 1.0:6000条样本把编程智能体提升14.6个百分点
训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型
训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型
自动生成综述最容易出现的不是少写一篇论文,而是分类、论点、引用和段落之间彼此脱节。浙江大学、上海交通大学提出Deep Academic Survey(DAS),把论文分析与专题写作拆开,并用可回退的状态记录组织、写作和审校过程。
香港科技大学(广州)和腾讯联合提出VibeWorlding:用户用文字或图片描述场景,智能体自行理解意图、检索3D资产、调整布局,并根据多视角渲染结果继续修改。论文的6828条查询中,GPT-5.5和Qwen3.8-Max成功率都低于60%
北京大学、北京航空航天大学和京东科技联合提出AppliancePlan,让机器人结合说明书、当前画面和操作状态规划家电任务。团队构建覆盖22类家电的数据集;论文报告,7B模型在RealAppliance-Bench开放规划上超过最佳基线10
香港中文大学、蚂蚁集团和清华大学等机构联合发布VideoGAIA,把视频问答从“看完选答案”改成多轮调查:模型要反复观察视频、调用外部工具、搜索开放世界信息并整合证据。271项任务中,包括GPT-5.5和Kimi-K3在内的所有受测模型准确
腾讯Hy Frontier团队提出开源GUI智能体UI-Mate:用户先录一遍操作,它把录像整理成可复用的子任务流程,再对着实时屏幕执行。论文在OSWorkerBench的33项同任务示范子集中报告,一次示范将严格成功率从17.2%提高到3
AI科研Agent可以一口气提出很多实验,但算力真正花在哪里,往往比想法数量更决定最终成绩。Meta FAIR、牛津大学、伦敦大学学院等团队提出Research Preference Models(RPM),专门比较候选研究动作并挑选更有希
让AI连续研究24小时,真正棘手的不是多写几段代码,而是路线走偏后能否及时止损、保留好结果并从可靠节点重新出发。华为诺亚方舟实验室推出ScienceFlow,通过可执行状态快照、证据驱动回退和资源感知调度组织长时程科研Agent,在完整ML
斯坦福大学、康奈尔大学等机构的研究者提出Twin。面对从未见过规则的小游戏,它让AI一边试玩、一边把观察到的状态变化写成可执行代码,为每个游戏建立“数字孪生”,先在内存中验证路线,再提交真正计分的动作。在ARC-AGI-3中,Twin总得分
机器人遇到昏暗环境、透明物体或精细几何关系时,不一定要让一个大模型硬扛所有视觉难题。星尘智能、清华大学、香港中文大学等团队提出ART,让视觉—语言—动作模型在执行过程中按需调用分割、深度等外部视觉工具。基于3万条工具增强轨迹训练后,ART在
世界模型生成的视频可能每一帧都很漂亮,但让AI玩家转身、开门、绕一圈再回来,房间结构和物体状态还能对得上吗?快手、香港中文大学、香港大学和浙江大学推出PlayWorld,用Agent玩家在171个交互场景里实测9个世界模型,把评估从“看视频
把胸片、鸟鸣、显微图、3D结构和运动轨迹交给AI,它能否不靠人类先整理成表格,直接提出假设、运行分析并写成论文?牛津大学与新加坡国立大学提出OmniScientist,在5个学科的36组真实数据上完成从感知到论文的全流程,直接读取原始模态的
把一篇长论文交给AI,它不仅能排出一张会议海报,还会像设计团队一样反复预览、找错、局部修改。美团、北京大学、清华大学、上海交通大学、香港中文大学等团队开源AutoDesign:一次完整运行约40分钟,调用工具253次、完成11次有效编辑,A
阿里通义、上海科技大学、香港科技大学等团队提出AVA-Encoder,把视频编码成知识图谱,再从图谱重建回视频。图中的文本节点记录镜头层级、状态和剧情信息,资产层链接图像、音频与视频,Agent可以查询人物、定位片段或修改关系,而不必每次重
一个模型扮演游戏角色得82分,究竟是忘了世界观、说错人物关系,还是没有完成玩家交代的目标?快手GameMind Lab开源TRACE Bench,把角色设定提前拆成固定检查表,再用用户Agent对话并保存逐轮证据。它在更少对话轮次中覆盖99
东京大学团队提出360CityArena,用602段360度视频重建东京秋叶原的85条街道,为具身Agent准备了175项城市探索任务。环境保留商店招牌、路口、楼宇和密集街景,不是用简化3D模型搭的规整迷宫。
清华大学、澳门科技大学、东南大学、爱丁堡大学和FellouAI等团队提出浏览器Agent基准CAP。它不只检查Agent能否打开页面并点击按钮,而是要求跨多个网站完成长流程,处理复杂控件和动态视觉内容。
医疗AI在一道选择题上答对,不代表它能完成一次真正的接诊。Google DeepMind联合多家医院提出ResidencyRL,让模型在最长60轮对话、最多8次工具调用的模拟门诊中练习问诊、检查、诊断、治疗和记录。在97个病例的医生盲评中,
网页智能体点完几下按钮,再返回一句“任务完成”,并不代表它真的按用户要求做对了。谷歌与加州大学洛杉矶分校推出WebRider,在42个真实网站上构造4096份可检查的“意图合同”。最强配置有99.2%的任务能够正常停机,但同时满足全部合同门
智能体完成一段几十轮任务后只得到成功或失败总分,训练算法往往把同一奖励广播给每一步,难以区分真正扭转结果的动作。清华大学、浙江大学和美团提出AgentOPSD,把信用重新分配到每一轮。