让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍
处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。
处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。
一段视频平均88.8分钟,问题没有选择项,还可能要求模型回忆半小时前的画面或主动发出提醒。香港科技大学、小红书、香港大学和香港中文大学推出StreamArena,用243段完整视频和3646个开放题测试流式视频智能体。
微软与上海交通大学、复旦大学、南京大学、清华大学、香港大学、北京大学等机构发布Argus,一个面向长程推理的持久智能体运行时。模型权重不变,系统通过角色分工、项目状态、验证记录和控制策略积累经验。
阿里巴巴、浙江大学、北京航空航天大学和字节跳动团队发布MetaVideoAgent,让长视频问答智能体根据目标视频类型自动修改自己的处理流程。四轮进化后,八类视频的宏平均准确率从38.44%升到51.47%。
长视频编辑智能体要连续做素材选择、剪切、排序、字幕和导出,最终成片出炉后才得到好坏评价。阿里巴巴、中国科学技术大学等机构提出GRPB,把同一任务多版成片的相对排名,重新分配给中间编辑片段,用于训练9B参数的Crayotter。
论文公开页面未披露作者机构。Video-DeepResearch团队研究的任务要求模型先在连续画面里找到人物或物体,再去网页补充外部知识;团队发现,现有智能体常跳过视觉工具直接搜索文字,或凭模型记忆作答。新系统因此分阶段开放工具,强制先完成
上海财经大学与复旦大学研究者的一项开源社区模拟发现,引入编码智能体后,完成任务数增加39%,中位完成时间从45分钟缩短到20分钟;同一批工作留下的公共知识更难被后续开发者利用,标准化检索中的覆盖率只有22.3%,真实人类语料为81.1%。
带长期记忆的AI智能体会把历史交互写入数据库,后续遇到相似问题再检索。香港科技大学团队提出的MAFIA攻击只通过普通查询和写入接口投放恶意记录,在论文测试中最高取得90.7%的攻击成功率,并把审计检测率压到不超过7.4%。
亚马逊研究人员用AI智能体模拟营销A/B测试,并拿67项历史实验验证预测结果。未经校准的系统能判断部分效果方向,方向重合度为0.70,但会系统性高估改版带来的影响。
Sakana AI与FARS等团队提出的一项自动科研基准,让Sakana AI v1、Sakana AI v2、CycleResearcher和Data-to-Paper围绕15个研究提案各写一篇论文,再让GPT-5.4、Gemini和Cl
北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.9
蚂蚁集团团队提出MAGA,把分别擅长手机、桌面和网页操作的GUI智能体蒸馏到同一个Qwen3-VL模型中。8B版本在三套基准上的平均成功率为51.2%,比论文中最强的统一模型基线高2个百分点,接近三个领域教师模型50.9%的平均水平。
亚马逊Health AI团队用1200个模拟患者场景测试10款基础模型。表现最强的模型综合得分为4.25分,满分5分;分诊项目的最高通过率为88%,最弱模型只有32%。
研究人员重新检查了150条被公开基准判定为失败的电脑操作轨迹,发现其中15.3%的“FAIL”结论有问题:10.7%属于评测器漏判,4.7%是任务或环境本身已经损坏。
阿里巴巴MAI-UI团队发布Qwen-UI-Agent技术报告,把手机、电脑、网页和DeepSearch任务放进同一套GUI智能体体系。论文报告的27B版本在MobileWorld-Real实机手机测试中取得92.2%的成功率,在Andro
会操作电脑的智能体,最缺的不是模型,而是能放手让它操作的软件。真实应用有登录门槛和真实用户,点错一步成本高昂,拿来训练又贵又慢、无法复现;可换成固定网页和截图当题库,模型又会很快把答案背下来。微软研究院(Microsoft Research
面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯
AISLE联合中欧技术研究所和马萨里克大学推出了HoF-Bench,一个基于真实AI发现漏洞的基准测试。基准包含8个代码库的95个CVE(通用漏洞披露),在严格协议下,最便宜的配置只需66美元就找到了70个CVE,而GPT-5.6 luna
浙江大学、新加坡国立大学、上海交通大学和美团联合提出了SkillRise,一个面向跨任务技能演化的统一强化学习框架。在ALFWorld、WebShop和ScienceWorld三个基准上,SkillRise在Pass@1指标上相比最强基线提
香港中文大学和澳门理工大学联合发布了TREK(Travel Reasoning and Evaluation Kit),一个用于评估LLM智能体旅行规划能力的基准。在15个LLM智能体的评估中,即使是最强的GPT-5.6也只在46.2%的可