arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

工具调用、任务执行、编程与多智能体协作。

2610.11123 Agent

别再来回聊!AI临时做个表单,对话3.4轮降到1.2轮

微软研究院、香港大学等机构提出GenUI-Harness,让AI遇到模糊需求时临时生成一个可操作的界面。用户勾选偏好,AI再据此完成数据库任务。论文的用户研究中,交互从平均3.4轮降至1.2轮;结构化表单把原本散落在聊天里的选择集中到一起。

微软研究院、香港大学等
文章封面
2610.08699 Agent

浙大团队做跨设备个人Agent,手机电脑共用一段对话

浙江大学团队提出nanoMuse,把手机、电脑和网页端组织成同一个个人Agent:多个设备共享会话,每台设备在自己的运行环境里执行任务。记忆保存成用户能读、改、撤回的文件,工具调用先经过规则检查。项目展示了跨设备对话与任务协作的系统结构,用

浙江大学等
文章封面
2610.03715 Agent

AI会搭场景却演不好运动?斯坦福等用200段视频考18个模型

斯坦福大学、约翰斯·霍普金斯大学、麻省理工学院、马克斯·普朗克智能系统研究所等机构提出4DCodeBench,让AI观看视频并编写能重建场景运动的图形代码。18个模型在200个场景中接受检验,榜首模型静态成绩0.91、动态0.67。评测把外

斯坦福大学、约翰斯·霍普金斯大学、麻省理工学院、马克斯·普朗克智能系统研究所等
文章封面
2609.39140 Agent

Agent不再靠文字笔记猜规则,Schema把ARC-AGI-3得分从58.7%拉到99.2%

Impossible Research、加州大学伯克利分校与卡内基梅隆大学提出Schema,让Agent把未知环境规律写成可执行程序,再用历史转移逐步验证和修正。论文在ARC-AGI-3的RHAE指标上把同一基础模型从58.7%提高到99.

Impossible Research、加州大学伯克利分校、卡内基梅隆大学等
文章封面
2609.39903 Agent

电脑Agent开始考“科研实操”:OSWorld-Science盯上真实软件工作流

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP与耶鲁大学等推出OSWorld-Science,把电脑Agent放进统计、生物医学、地理信息和工程仿真等真实科研软件。评测不只看是否点到按钮,而是检查交付文件、数值精度与完整工作流,揭示“

清华大学、加州大学洛杉矶分校、日本理化学研究所AIP、耶鲁大学等
文章封面
2609.40285 Agent

NVIDIA专门教Agent“犯错后翻盘”,1.7B模型ALFWorld平均成功率73.7%

NVIDIA、普林斯顿大学与马里兰大学提出PivotOPD,专门找出Agent轨迹中决定成败的错误转折点,再分别训练“别犯错”和“犯错后如何恢复”。论文中1.7B学生在ALFWorld平均成功率达73.7%,在WebShop达76.6%;这

NVIDIA、普林斯顿大学、马里兰大学等
文章封面
2609.37686 Agent

AI会操作电脑了?一进专业工程软件,多软件任务只成功3.6%

清华大学、智曼公司、北京大学、浙江大学等机构联合建立EngiWorld,用1,301项任务检验Agent能否跨26款专业工程软件完成设计闭环。七个前沿模型中最强者EngiScore仅44.3,多软件任务的尝试成功率只有3.6%,由此暴露真实

清华大学、智曼公司、北京大学、浙江大学等
文章封面
2609.37989 Agent

Google让Agent自己改数据流水线,51个表格任务直接包揽前五

Google Research、南加州大学、Google DeepMind、哈佛大学等机构联合提出TabFM-Auto,让Agent围绕冻结的表格基础模型自动修改数据流水线。它在TabArena的51个数据集上由五种配置包揽总榜前五,最佳方

Google Research、南加州大学、Google DeepMind、哈佛大学等
文章封面
2609.30749 Agent

港大NUS实测大模型跨库代码迁移:顶尖Claude项目级翻译仅33%成功,意图增强破局

香港大学、新加坡国立大学、香港中文大学(深圳)等机构推出ORCA,专门测试大模型能否把数据科学代码从一个软件库迁移到另一个库,同时保持结果正确。论文不仅测短代码片段,还测完整项目。在项目级任务中,受测的Claude-Opus-4.6成功率为

香港大学、新加坡国立大学、香港中文大学(深圳)等
文章封面
2609.30887 Agent

上交阿里通义搞定手机AI智能体:告别一步一步慢速点屏,深层链接直达成功率暴涨268%

上海交通大学与阿里巴巴通义实验室等机构提出GUI-Hopper,让手机AI助手在适合时使用应用的深层链接,直接打开目标页面,而不必每次都从首页逐层点击。团队先从应用中找出可能的入口,再用真机核验链接会落到哪里,并保留普通点屏操作作为兜底。在

上海交通大学、阿里巴巴等
文章封面
2609.28614 大模型

AI搞科研开始钻空子:17个模型74.6%在黑客评审,五轮后越查越漏

圣母大学联合IBM研究院、微软研究院、MIT对17个语言模型做了一次受控审计。在允许钻空子的条件下,74.6%的尝试被确认为奖励黑客,而且评审反馈越详细,模型越会学着逃逸。这给“把科研交给AI”敲响了实打实的警钟。

圣母大学、IBM研究院、微软研究院、MIT等
文章封面
2609.27308 具身智能与机器人

编程Agent开始教机器人,字节Seed把代码解法变训练数据

字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等机构提出EmbodiedSWE,让编程智能体先在仿真中为长时序机器人任务写出可验证解法,再将单个解法扩展成多样训练轨迹。仅用这些仿真示范微调的VLA最终完成了一项真机长时序任务。

字节跳动Seed、耶鲁大学、普林斯顿大学、卡内基梅隆大学等
文章封面
2609.28314 具身智能与机器人

机器人不会再求助,斯坦福把人工示范效率提2.9倍

斯坦福大学、普林斯顿大学提出TANDEM,让任务与运动规划器先做掉熟悉步骤,只在能力缺口处请人遥操。在一项代表性长时序任务中,相同人工介入时间能采集2.9倍示范;每项20条示范微调后,五项任务平均成功率从0%升至60%。

斯坦福大学、普林斯顿大学等
文章封面
2609.20519 Agent

英伟达MIT联手造出SoL-Pi:AI写代码Token直降49%,成本暴砍三分之一

英伟达、麻省理工学院与南洋理工大学等机构联合推出高效率编程智能体框架SoL-Pi,攻克了自主软件工程中的Token与成本激增难题。研究团队构建自动化研究循环,由AI智能体自主探索并提炼出四项底层交互压缩机制,在不损伤任务解决率的前提下将To

英伟达、麻省理工学院、南洋理工大学等
文章封面
2609.25001 大模型

腾讯打造首个AAA游戏AI基准:5000小时数据体检47个大模型

近年来多模态大模型在虚拟环境决策中取得飞速进展,但始终缺少针对商业级AAA游戏的标准化评测体系。腾讯ARC实验室联合大湾区大学、香港中文大学和新加坡国立大学等机构推出了首个GameHorizon评测套件,全面接入21款主流大作。研究团队通过

腾讯ARC实验室、大湾区大学、香港中文大学、新加坡国立大学等
文章封面
↑