把AI扔进真实办公室,证据找到率从90.4%跌到74.5%
哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学提出WorkWorlds:先固定员工真正能访问的完整组织状态,再把任务交给智能体。192组匹配评估中,完整工作环境让证据访问率从90.4%降到74.5
哈佛大学、Agent Evaluation Science、Raycaster、斯坦福大学提出WorkWorlds:先固定员工真正能访问的完整组织状态,再把任务交给智能体。192组匹配评估中,完整工作环境让证据访问率从90.4%降到74.5
复旦大学、阿里巴巴通义应用业务组提出RPMem,把每次会话编译成独立于模型底座的潜在记忆,再递归合并并映射为LoRA参数。Qwen3-8B在PERMA上达到85.52%,比最强参数记忆和文本记忆基线高5.32和12.98个百分点。
中科院信息工程研究所、中关村实验室、小米汽车、阿里巴巴达摩院提出GameReplica:不给智能体源码、说明书或现成轨迹,只允许它看截图并操作目标游戏,再写出可运行复刻。基准含125项任务、25款受控游戏和5类核心机制。
伊利诺伊大学厄巴纳-香槟分校、微软研究院和微软提出BI-Agent,让智能体自己找表、转换数据、建立关联并回答商业问题。前沿模型在BI-Bench准确率不足50%,专用智能体最高提升40个百分点,完整流程而非单次查询成为评测对象。
小米、北京大学、香港大学和中国人民大学提出CodeMidas,只读取源码,就把3185个代码库转成5545项可执行训练任务,覆盖23种语言。使用这些环境训练后,MiMo-V2.5在论文选定的五项编程基准上均有提升,也减少了对现成工单的依赖。
英伟达推出NemotronLabs VoiceChat,把流式听、说、打断处理、反馈识别和工具调用放进统一语音架构。论文报告用户打断后的接管率为100%,短促反馈后恢复回答的比例为93%,工具选择F1达到82.5%,重点转向真实对话节奏。
Adobe与布朗大学提出Designer-RSI:不更新模型权重,让设计智能体从自己完成和失败的任务中扩展外部技能库。五轮演化后,技能从76项增至139项;在Claude-Sonnet-4上的GenEval2执行成功率由72.7%升至99.
英伟达、南洋理工大学和麻省理工学院团队提出SoL-Pi,让自动研究循环直接优化Coding Agent外层框架。在51项EdgeBench任务上,它与Pi表现相近,却把记录到的Token流量减少44.7%—49.0%,API成本约降三分之一
深圳大学、中国科学院深圳先进技术研究院、中国科学院大学和中国铁塔推出ReFigBench,让多模态编码智能体把1000张真实arXiv概览图重建成可编辑PPT。实验覆盖10种模型与工作流配置:专用流程常让截图更像原图,却在所有配置中抹掉原生
Google Research、Google DeepMind、加州大学洛杉矶分校和纽约大学分析2518条长任务智能体轨迹,人工标注6967个错误并归为78类。六个前沿模型担任评判器时,表现最好的也不能在三分之一以上的轨迹中正确定位首个错误
浙江大学与电子科技大学提出EvoSkill-GUI,让操作手机和电脑的智能体在部署时根据失败轨迹修改Skill,不增加模型训练。它在MobileWorld、AndroidWorld和OSWorld上对多个基础模型带来提升,三项基准的最大增益
东京大学、纽约大学、Google DeepMind和日本理化学研究所等团队做出WetRobo:实验人员只需用自然语言下任务,Codex便观察现场、改写并执行机械臂程序。它在真实实验室完成三项任务,瓶盖任务还跨两个实验室成功;但这些仍是受控设
佐治亚理工学院、新加坡国立大学、北卡罗来纳州立大学等机构推出CADWorld,把七个电脑智能体送进FreeCAD完成200项机械设计任务。任务覆盖11类工作流,结果不看它点了多少按钮,而是直接检查保存文件的尺寸、约束、结构和制造状态。领先智
牛津大学、斯坦福大学、新加坡国立大学等机构提出PaperDoctor,让AI不再只给论文打分,而是定位原文、解释问题并给出修改方案。30篇在写论文的作者共评估1299条反馈,对其中证据判断的接受率为70.6%。这套系统还会检查代码和按优先级
百度提出VideoXAgent,让AI面对小时级视频时先按问题检索,再调用字幕、画面和音频工具取证。它用约5万Token智能体上下文,在Video-MME-Long、LVBench和MINERVA分别达到85.1%、76.5%和65.7%;
北京航空航天大学、阿里巴巴提出ProactiveBench,专门测试视频AI什么时候该开口。六个系统中有四个“提前响应”比“错过事件”更常见,比例从2.1倍到28倍;基准揭示的是受控视频任务中的时间判断,不等同于真实产品已造成同等风险。
乔治亚理工学院提出Recursive Code World Models,让视觉语言编程智能体从一张参考图生成可执行3D场景代码。它先搭整体,再递归进入局部补建筑和关系,最后回到全局修边界;中世纪村落实验的PSNR从16.8升到19.0,但
Adobe Research、伍斯特理工学院提出CamPilot,让多个智能体先规划故事、镜头角度、相机运动和焦点,再按拍摄脚本生成多镜头视频。团队从14,581部视频整理99,975个镜头用于训练和评测;成绩来自自建CamEval与自动指
腾讯Hy基础模型前沿团队、新加坡国立大学等机构提出T1,让122B混合专家模型在真实云端终端里连续调用工具300多步。它在Terminal-Bench 2.1上解决64.0%的任务,同一测试框架下高于GPT-5.4的54.8%;测试在隔离沙
Quome、华盛顿大学等机构提出“世界时间计算”:把领域规则写成可执行程序,自动生成带精确答案的训练轨迹。0.5B模型在60个训练世界学习后,对20个未见世界的诊断准确率提高29个百分点;收益主要出现在符号状态和短步推理,像素任务、长链任务