网页会搜、SQL会写,顶级AI合起来却只过一半
Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet
Snowflake AI Research、休斯敦大学、加州大学洛杉矶分校、香港大学等机构的研究团队制作HybridDeepResearch,让AI必须同时查网页和SQL数据库才能回答380道题。GLM-5.2、Claude Sonnet
上海交通大学、上海人工智能实验室、阿里巴巴、清华大学联合提出MemForest,把智能体历史记忆按事件组织成树,再逐步合并重复节点。M3-Agent在两项多模态基准上压缩50%记忆后保留99.7%表现,检索加速2.24倍。比例是论文五套基准
威斯康星大学麦迪逊分校、微软研究院、佐治亚理工学院联合提出ExecCritic,把代码测试和源码修复交给两个分别训练的Qwen角色。两者组合在SWE-bench Verified解决72.6%的任务,比原始无测试基线高11.4个百分点;但质
Practical Systems团队用一个可验证的LLM程序进化循环改写圆堆积求解器,在15轮内以27.72美元模型调用成本,改进Packomania中N=101至114范围的10项已知纪录。结果由零容差检查并被数据库接受,但只针对可变半
南京大学、华为、天津大学与不列颠哥伦比亚大学团队提出语言轨迹编码LTE,把长视频中的物体位置、状态与语义压成可查询记忆。论文报告8.7至26.1倍压缩,24小时视频查询低于1秒;但在SMB上的两类成功率只有45.3%和48.7%,长时记忆远
上海交通大学与浙江大学团队提出CUA-Universe,让同一个电脑智能体在图形界面与命令行之间选择操作。9B模型在OSWorld上的成功率提升16.8个百分点,同时步骤减少57%。结果来自特定虚拟机应用和基准任务,说明混合工具有效,但不等
阿里通义、清华大学提出Terminal-Universe,把代码智能体留下的一次性操作轨迹还原成可重复运行的终端环境。系统从公开轨迹构建3.73万个环境,训练Qwen3.5-27B后,单轮与多轮基准分别提升11.9和13.8分;恢复过程包含
Adobe Research、卡内基梅隆大学、佐治亚理工学院、东北大学等机构提出VeriPhy,逐条检查生成视频违反了哪项物理要求、错误出现在何时。149段核心视频含304条人工缺陷,它解释了228条,对比评测器为164条;同骨干直接提示也
北京大学王选计算机研究所与MemoraX AI联合提出GraphMemix,将长期多模态记忆检索重构为查询驱动的“证据森林”组合优化,在四项基准上取得61.55%的平均Judge Accuracy。
百度、华中科技大学联合提出RILA,让网页生成智能体把代码放进真实浏览器运行,重放参考操作后再按错误反馈修改。配套训练流程把Qwen3.5-9B在IWR-Bench上的得分从40.40%提高到57.52%,高于论文所测的Kimi-K2.6和
魏茨曼科学研究所、麻省理工学院提出FoldingAgent,让视觉语言模型从折纸演示视频反推出可执行的参数化折叠程序。在PurelandFold基准上,完整序列完成率为100%,已完成步骤的编译成功率为96%。
腾讯微信AI与南加州大学提出AlgoWorlds,用240个可验证环境测试工具智能体能否做出全局最优决策。七款前沿模型大多能提交可行方案,但表现最好的Claude Opus 4.8精确最优率也只有38.61%。
同济大学、快手科技和复旦大学提出CineForge,让长视频制作智能体从一次次完整制作记录中提炼可复用策略。经过跨故事演化后,CineScope-Metric由4.024提高到4.380,在新故事上的复审大模型调用减少37.0%。
浙江大学和苹果提出PaperGym,把每篇论文转成一套研究计划训练环境,并发布2万条实例。按同一训练方案得到的Qwen3-8B在ResearchQA上达到73.48,高于论文所列的更大模型Kimi K2.6;这一比较只对应单项评测,不代表综
阿里巴巴通义千问团队、香港科技大学和淘宝天猫集团推出E-Commerce Bench,让18款前沿大模型从10万元启动资金出发,连续经营365天线上商店。GPT-5.6 Sol的年末资产最高,均值达到1431425元,但它在欺诈规避维度只排
谷歌、北京大学、加州大学洛杉矶分校和伊利诺伊大学厄巴纳-香槟分校联合提出PaperBanana-Interact,让AI像设计协作者一样根据作者反馈反复修改论文图。与多轮基线相比,系统的质量分提高11.9至18.6分,遗忘旧要求的分数下降3
输入商品图、卖点文案和尺寸要求,模型不再输出一张难修改的扁平图片,而是直接写出可渲染的HTML/CSS广告。阿里巴巴、同济大学等机构提出CommerceVibe,让商品图片保持原样引用,文字以原生元素存在,运营人员可以继续换图、改字和调整布
智能体训练常把任务写成一条信息完整的指令,真实用户却会追加条件、改变方向,看到工具结果后再指出错误。对1.6万条真实会话的分析显示,75.9%包含两轮或更多用户发言,多轮会话的用户发言中位数达到10轮。
软件智能体常靠截图理解界面,再模拟鼠标点击和键盘输入。上海交通大学、北京通用人工智能研究院提出Agent-Software Interaction Layer,即ASIL,用结构化JSON状态替代像素观察,用可执行语义动作替代坐标点击。
给机器人一张目标房间的俯视布局,它需要从第一视角找到家具、抓起、搬运并摆到正确位置。北京理工大学提出具身场景重排规划ESRP,并构建ESRP-Bench,包含超过5400组初始—目标场景和8200个物体。