arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

工具调用、任务执行、编程与多智能体协作。

2608.06183 AI基础设施

让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍

处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。

东南大学、国家EDA技术创新中心等
让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍文章封面
2608.05703 Agent

视频智能体看一小时后还记得什么?小红书等团队做了场硬测

一段视频平均88.8分钟,问题没有选择项,还可能要求模型回忆半小时前的画面或主动发出提醒。香港科技大学、小红书、香港大学和香港中文大学推出StreamArena,用243段完整视频和3646个开放题测试流式视频智能体。

香港科技大学、香港大学、香港中文大学等
视频智能体看一小时后还记得什么?小红书等团队做了场硬测文章封面
2608.05144 Agent

智能体跑得久还要会掉头:Argus修复任务约78%,代价是1.41倍Token

微软与上海交通大学、复旦大学、南京大学、清华大学、香港大学、北京大学等机构发布Argus,一个面向长程推理的持久智能体运行时。模型权重不变,系统通过角色分工、项目状态、验证记录和控制策略积累经验。

上海交通大学、复旦大学、南京大学、清华大学等
智能体跑得久还要会掉头:Argus修复任务约78%,代价是1.41倍Token文章封面
2608.04587 Agent

让视频智能体自己改代码:四轮进化后准确率从38.44%升至51.47%

阿里巴巴、浙江大学、北京航空航天大学和字节跳动团队发布MetaVideoAgent,让长视频问答智能体根据目标视频类型自动修改自己的处理流程。四轮进化后,八类视频的宏平均准确率从38.44%升到51.47%。

浙江大学、北京航空航天大学、字节跳动等
让视频智能体自己改代码:四轮进化后准确率从38.44%升至51.47%文章封面
2608.02694 Agent

视频剪完才知道好不好,阿里等把偏好反馈拆回每个编辑片段

长视频编辑智能体要连续做素材选择、剪切、排序、字幕和导出,最终成片出炉后才得到好坏评价。阿里巴巴、中国科学技术大学等机构提出GRPB,把同一任务多版成片的相对排名,重新分配给中间编辑片段,用于训练9B参数的Crayotter。

中国科学技术大学等
视频剪完才知道好不好,阿里等把偏好反馈拆回每个编辑片段文章封面
2608.03979 Agent

让深度研究智能体先看完视频再搜索,200道多跳题做到64%

论文公开页面未披露作者机构。Video-DeepResearch团队研究的任务要求模型先在连续画面里找到人物或物体,再去网页补充外部知识;团队发现,现有智能体常跳过视觉工具直接搜索文字,或凭模型记忆作答。新系统因此分阶段开放工具,强制先完成

让深度研究智能体先看完视频再搜索,200道多跳题做到64%文章封面
2608.03585 Agent

编码智能体让任务多完成39%,公共知识覆盖率却只剩22.3%

上海财经大学与复旦大学研究者的一项开源社区模拟发现,引入编码智能体后,完成任务数增加39%,中位完成时间从45分钟缩短到20分钟;同一批工作留下的公共知识更难被后续开发者利用,标准化检索中的覆盖率只有22.3%,真实人类语料为81.1%。

上海财经大学、复旦大学等
编码智能体让任务多完成39%,公共知识覆盖率却只剩22.3%文章封面
2608.03844 Agent

智能体记忆投毒能把审计检测率压到7.4%以内

带长期记忆的AI智能体会把历史交互写入数据库,后续遇到相似问题再检索。香港科技大学团队提出的MAFIA攻击只通过普通查询和写入接口投放恶意记录,在论文测试中最高取得90.7%的攻击成功率,并把审计检测率压到不超过7.4%。

香港科技大学等
智能体记忆投毒能把审计检测率压到7.4%以内文章封面
2607.29254 大模型

清华等团队发现,给大模型一份工具说明可能削弱拒答信号

北京邮电大学、北京航空航天大学和清华大学研究人员发现,同一条危险请求加入结构化工具说明后,模型内部区分有害与无害输入的能力明显下降。Llama的AUROC从0.927降至0.740,Qwen从0.901降至0.786,Mistral从0.9

北京邮电大学、北京航空航天大学、清华大学等
清华等团队发现,给大模型一份工具说明可能削弱拒答信号文章封面
2607.29320 Agent

蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%

蚂蚁集团团队提出MAGA,把分别擅长手机、桌面和网页操作的GUI智能体蒸馏到同一个Qwen3-VL模型中。8B版本在三套基准上的平均成功率为51.2%,比论文中最强的统一模型基线高2个百分点,接近三个领域教师模型50.9%的平均水平。

蚂蚁集团等
蚂蚁把手机、电脑和网页智能体合成一个,平均成功率51.2%文章封面
2607.28367 Agent

AI智能体被判失败的案例中,15.3%可能判错了

研究人员重新检查了150条被公开基准判定为失败的电脑操作轨迹,发现其中15.3%的“FAIL”结论有问题:10.7%属于评测器漏判,4.7%是任务或环境本身已经损坏。

佐治亚理工学院、北卡罗来纳州立大学、北卡罗来纳大学教堂山分校、马凯特大学等
AI智能体被判失败的案例中,15.3%可能判错了文章封面
2607.28227 Agent

阿里发布Qwen-UI-Agent,手机实机任务成功率92.2%

阿里巴巴MAI-UI团队发布Qwen-UI-Agent技术报告,把手机、电脑、网页和DeepSearch任务放进同一套GUI智能体体系。论文报告的27B版本在MobileWorld-Real实机手机测试中取得92.2%的成功率,在Andro

阿里巴巴MAI-UI团队等
阿里发布Qwen-UI-Agent,手机实机任务成功率92.2%文章封面
2607.28287 Agent

183关全部通关!亚马逊等团队提出Tycho,让AI边玩边写出游戏世界模型

面对一款规则完全陌生的网格益智游戏,大多数智能体的做法是"看一帧、走一步":靠反应式试错摸索规律,每走错一步都要在计分里留下代价。ARC-AGI-3把这类游戏做成了正式基准——64×64的彩色网格、没有文字说明、每一步操作都计入得分。德累斯

德累斯顿工业大学、亚马逊、莱布尼茨科学与技术信息中心等
文章封面
2607.27030 Agent

不用前沿模型也能挖漏洞:HoF-Bench证明小模型组合更省更准

AISLE联合中欧技术研究所和马萨里克大学推出了HoF-Bench,一个基于真实AI发现漏洞的基准测试。基准包含8个代码库的95个CVE(通用漏洞披露),在严格协议下,最便宜的配置只需66美元就找到了70个CVE,而GPT-5.6 luna

AISLE、马萨里克大学等
封面
2607.26784 Agent

浙大&美团等提出SkillRise:让AI智能体在跨任务中自动演化技能

浙江大学、新加坡国立大学、上海交通大学和美团联合提出了SkillRise,一个面向跨任务技能演化的统一强化学习框架。在ALFWorld、WebShop和ScienceWorld三个基准上,SkillRise在Pass@1指标上相比最强基线提

浙江大学、美团、上海交通大学等
封面
↑