arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

作者

Graham Neubig

Natural Language Processing

至 收录 396
2608.12355 2026-08-14 cs.HC cs.AI cs.SE 新提交

Humans are Missing from AI Coding Agent Research

AI编码智能体研究中缺失了人类

Zora Z. Wang, John Yang, Kilian Lieret, Alexa Tartaglini, Valerie Chen, Yuxiang Wei, Zijian Wang, Lingming Zhang, Karthik Narasimhan, Ludwig Schmidt, Graham Neubig, Daniel Fried, Diyi Yang

AI总结 该文指出AI编码智能体研究当前缺失人类维度,主张转向以人为中心的编码智能体,明确了人机交互的四个核心层面并提出相关研究方向。

URL PDF HTML 收藏
2608.10296 2026-08-12 cs.CL 新提交

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

基础的裂痕:看似微小的架构选择会影响长上下文扩展

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

机构 * Ai2 Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。

Comments 29 pages; accepted to COLM 2026

URL PDF HTML 收藏
2603.11245 2026-08-04 cs.AI 版本更新

Mind the Sim2Real Gap in User Simulation for Agentic Tasks

注意用户模拟中的Sim2Real差距以实现代理任务

Xuhui Zhou, Weiwei Sun, Qianou Ma, Yiqing Xie, Jiarui Liu, Weihua Du, Sean Welleck, Yiming Yang, Graham Neubig, Sherry Tongshuang Wu, Maarten Sap

AI总结 研究发现基于LLM的用户模拟器在代理任务中存在Sim2Real差距,表现出过度合作和缺乏真实反馈,需通过人类验证提升模拟真实性。

Comments COLM 2026

URL PDF HTML 收藏
2601.21372 2026-07-21 cs.AI 版本更新

NEMO: Execution-Aware Optimization Modeling via Autonomous Coding Agents

NEMO: 通过自主编码代理实现执行感知的优化建模

Yang Song, Anoushka Vyas, Zirui Wei, Sina Khoshfetrat Pakazad, Henrik Ohlsson, Graham Neubig

机构 * Language Technologies Institute, School of Computer Science, Carnegie Mellon University, Pittsburgh, PA, USA(语言技术研究所,计算机科学学院,卡内基梅隆大学,匹兹堡,PA,美国)

AI总结 提出NEMO系统,利用自主编码代理将决策问题的自然语言描述转化为可执行的数学优化实现,通过执行感知的架构和协调模式实现最先进的性能。

Comments Accepted at ICML 2026

URL PDF HTML 收藏
2503.19877 2026-07-17 cs.CL 版本更新

Scaling Evaluation-time Compute with Reasoning Models as Evaluators

通过推理模型作为评估器来提升评估时的计算能力

Seungone Kim, Ian Wu, Jinu Lee, Xiang Yue, Seongyun Lee, Mingyeong Moon, Carolin Lawrence, Kiril Gashteovski, Julia Hockenmaier, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学) UIUC(伊利诺伊大学) KAIST AI(韩国科学技术院人工智能研究所) NEC Laboratories Europe(日本 NEC 欧洲实验室) Ss.Cyril and Methodius University of Skopje(斯科普里塞尔吉尔和梅蒂乌斯大学)

AI总结 本文探讨了通过增加评估时的计算量来提升语言模型的评估能力,利用推理模型作为评估器,分别评估响应整体和每个步骤,从而提高评估效果。

Comments ACL 2026 Findings

URL PDF HTML 收藏
2603.21489 2026-07-09 cs.CL cs.AI 版本更新

Effective Strategies for Asynchronous Software Engineering Agents

异步软件工程代理的有效策略

Jiayi Geng, Graham Neubig

机构 * Carnegie Mellon University, Language Technologies Institute(卡内基梅隆大学,语言技术研究所)

AI总结 本文提出CAID框架,通过集中任务委派、异步执行和隔离工作区三个核心SWE原语,提升多代理协作效率,在论文复现和Python库开发任务中分别提升26.7%和14.3%的准确性。

URL PDF HTML 收藏
2602.17588 2026-07-09 cs.CL cs.HC 版本更新

Modeling Distinct Human Interaction in Web Agents

建模网络代理中不同的人类交互

Faria Huq, Zora Zhiruo Wang, Zhanqiu Guo, Venu Arvind Arangarajan, Tianyue Ou, Frank Xu, Shuyan Zhou, Graham Neubig, Jeffrey P. Bigham

机构 * Carnegie Mellon University(卡内基梅隆大学) Duke University(杜克大学)

AI总结 本文通过收集400条真实用户网络导航轨迹,识别四种人机交互模式,并训练语言模型预测用户干预时机,将干预预测准确率提升61.4%-63.4%,用户评价的代理有用性提高36.8%。

Comments Preprint

URL PDF HTML 收藏
2607.02032 2026-07-07 cs.AI cs.CL 新提交

PACE: A Proxy for Agentic Capability Evaluation

PACE:智能体能力评估的代理框架

Yueqi Song, Lintang Sutawika, Jiarui Liu, Lindia Tjuatja, Jiayi Geng, Yunze Xiao, Daniel Lee, Aditya Bharat Soni, Vincent Lo, Xiang Yue, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Salesforce AI Research(Salesforce人工智能研究)

AI总结 提出PACE框架,通过从非智能体评测中选取原子实例构建代理基准,以低成本高精度预测智能体基准性能,在14个模型上实现MAE<4%、Spearman>0.80。

URL PDF HTML 收藏
2607.01849 2026-07-03 cs.LG cs.AI cs.SD 新提交

Decomposer: Learning to Decompile Symbolic Music to Programs

Decomposer: 学习将符号音乐反编译为程序

Yewon Kim, Apurva Gandhi, David Chung, Graham Neubig, Chris Donahue

机构 * Carnegie Mellon University(卡内基梅隆大学)

AI总结 提出Decomposer框架,通过两阶段方法(合成数据微调+强化学习优化)将符号音乐反编译为可读、可编辑的程序,在MIDI重建保真度和代码可读性上优于基线。

Comments Project page: https://yewon-kim.com/decomposer

URL PDF HTML 收藏
2606.31154 2026-07-01 cs.LG cs.AI 新提交

PPT-Eval: A Benchmark for Computer-Use Agents on PowerPoint Tasks

PPT-Eval: 面向PowerPoint任务的计算机使用智能体基准

Apurva Gandhi, Vishwas Suryanarayanan, Raja Hasnain Anwar, Firoz Shaik, Shubhang Desai, Thong Q. Nguyen, Muhammad Taqi Raza, Vishal Chowdhary, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) UMass Amherst(马萨诸塞大学阿默斯特分校) Google(谷歌) Snowflake

AI总结 提出PPT-Eval基准,包含120个PowerPoint任务,并设计基于评分标准的评估框架,通过部分评分和自然语言反馈衡量智能体表现,发现现有最强模型仅达45%成功率。

Comments Proceedings of the 43rd International Conference on Machine Learning, Seoul, South Korea. PMLR 306, 2026

URL PDF HTML 收藏
2606.21795 2026-06-23 cs.LG 新提交

Discretizing Reward Models

离散化奖励模型

Vijay Viswanathan, Shiqi Wang, Devamanyu Hazarika, Chirag Nagpal, Tongshuang Wu, Graham Neubig, Yuning Mao

机构 * Carnegie Mellon University(卡内基梅隆大学) Meta Superintelligence Labs(Meta超级智能实验室)

AI总结 针对奖励模型过度敏感导致策略不佳的问题,提出一种基于蒙特卡洛dropout的无训练离散化算法,在保持判别能力的同时降低过度敏感性,减少奖励黑客行为并提升策略效果。

URL PDF HTML 收藏
2606.13322 2026-06-12 cs.CL 新提交

Low-Latency Real-Time Audio Game Commentary System via LLM-Based Parallel Text Generation

基于LLM并行文本生成的低延迟实时音频游戏解说系统

Ryota Kawamatsu, Anum Afzal, Yuki Saito, Shinnosuke Takamichi, Graham Neubig, Katsuhito Sudoh, Hiroya Takamura, Tatsuya Ishigaki

机构 * The University of Tokyo(东京大学) National Institute of Advanced Industrial Science and Technology(产业技术综合研究所) Technical University of Munich(慕尼黑工业大学) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学) Nara Women’s University(奈良女子大学)

AI总结 提出一种并行文本生成与语音播放的低延迟实时游戏解说系统,将平均句间静默从9.6秒降至0.3秒,显著提升解说节奏。

Comments Accepted at IJCAI-ECAI 2026 (Demonstrations Track)

URL PDF HTML 收藏
2510.09801 2026-06-10 cs.AI 版本更新

How can we assess human-agent interactions? Case studies in software agent design

如何评估人机交互?软件代理设计案例研究

Valerie Chen, Rohit Malhotra, Xingyao Wang, Juan Michelini, Xuhui Zhou, Aditya Bharat Soni, Hoang H. Tran, Calvin Smith, Ameet Talwalkar, Graham Neubig

机构 * University of California, Berkeley(加州大学伯克利分校)

AI总结 提出PULSE框架,通过用户反馈和模型预测结合评估人机交互,在15k用户实验中验证其能减少40%置信区间,并揭示基准测试与真实结果的差异。

Comments ICML 2026

URL PDF HTML 收藏
2505.19662 2026-06-09 cs.AI cs.CV 版本更新

FieldWorkArena: Agentic AI Benchmark for Real Field Work Tasks

FieldWorkArena:面向真实作业任务的代理AI基准测试

Jun Takahashi, Atsunori Moteki, Akiyoshi Uchida, Shoichi Masui, Fan Yang, Kanji Uchino, Yueqi Song, Yonatan Bisk, Graham Neubig, Ikuo Kusajima, Yasuto Watanabe, Hiroyuki Ishida, Koki Nakagawa, Shan Jiang

机构 * Fujitsu Limited(富士通株式会社) Fujitsu Research of America(富士通美国研究部) Carnegie Mellon University(卡内基梅隆大学) Master’s Student, The University of Tokyo(东京大学硕士研究生) Agent Research Collective(代理研究集体)

AI总结 本文提出FieldWorkArena,用于评估代理AI在真实制造业和零售环境中的性能,通过现场采集的数据和实地访谈设计任务,验证多模态大语言模型的评估可行性。

Comments 27 pages, 10 figures, 7 tables [ICPR 2026 Accepted] Changes from previous version: added supplemental material

URL PDF HTML 收藏
2601.10925 2026-06-09 cs.CL 版本更新

Massively Multilingual Joint Segmentation and Glossing

大规模多语言联合分割与标注

Michael Ginn, Lindia Tjuatja, Enora Rice, Ali Marashian, Maria Valentini, Jasmine Xu, Graham Neubig, Alexis Palmer

机构 * University of Colorado Boulder(科罗拉多大学博尔德分校) Carnegie Mellon University(卡内基梅隆大学)

AI总结 针对现有神经标注模型缺乏形态边界预测导致可解释性差的问题,提出PolyGloss模型,通过联合分割与标注提升准确性和对齐度,并支持低秩适应快速迁移。

Comments 15 pages, 9 figures, accepted to ACL 2026 Long Papers

URL PDF HTML 收藏
2606.05646 2026-06-05 cs.SE cs.AI

Enhancing Software Engineering Through Closed-Loop Memory Optimization

通过闭环内存优化增强软件工程

Xuehang Guo, Zora Zhiruo Wang, Qingyun Wang, Graham Neubig, Xingyao Wang

机构 * William & Mary(威廉玛丽学院) Carnegie Mellon University(卡内基梅隆大学) OpenHands University(OpenHands大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

AI总结 提出闭环内存优化框架,通过验证下游影响来定义内存效用,作为评估基准和优化信号,显著提升软件工程代理的成功率和效率。

URL PDF HTML 收藏
2605.20668 2026-05-21 cs.CL cs.AI cs.LG

On the limits and opportunities of AI reviewers: Reviewing the reviews of Nature-family papers with 45 expert scientists

人工智能审稿人的局限与机遇:对Nature系列论文审稿的45位专家科学家的审查

Seungone Kim, Dongkeun Yoon, Kiril Gashteovski, Juyoung Suk, Jinheon Baek, Pranjal Aggarwal, Ian Wu, Viktor Zaverkin, Spase Petkoski, Daniel R. Schrider, Ilija Dukovski, Francesco Santini, Biljana Mitreska, Yong Jeong, Kyeongha Kwon, Young Min Sim, Dragana Manasova, Arthur Porto, Biljana Mojsoska, Makoto Takamoto, Marko Shuntov, Ruoqi Liu, Hyunjoo Jenny Lee, Niyazi Ulas Dinç, Yehhyun Jo, Sunkyu Han, Chungwoo Lee, Huishan Li, Esther H. R. Tsai, Ergun Simsek, Khushboo Shafi, Yeonseung Chung, Jihye Park, Aleksandar Shulevski, Henrik Christiansen, Yoosang Son, Elly Knight, Amanda Montoya, Jeongyoun Ahn, Christian Langkammer, Heera Moon, Changwon Yoon, Nikola Stikov, Mooseok Jang, Edward Choi, Junhan Kim, Yeon Sik Jung, Woo Youn Kim, Jae Kyoung Kim, Ishraq Md Anjum, Hyun Uk Kim, Drew Bridges, Carolin Lawrence, Xiang Yue, Alice Oh, Akari Asai, Sean Welleck, Graham Neubig

机构 * Nature(自然)

AI总结 本文通过大规模专家标注研究,探讨了AI审稿人在科学同行评审中的能力与局限,发现AI审稿在准确性、显著性和证据充分性方面表现优异,但存在领域知识有限、上下文管理不足等弱点,表明AI审稿是人类审稿的补充而非替代。

Comments Work in progress

URL PDF HTML 收藏
2605.20506 2026-05-21 cs.LG cs.CL

Reinforcing Human Behavior Simulation via Verbal Feedback

通过言语反馈强化人类行为模拟

Weiwei Sun, Xuhui Zhou, Jiarui Liu, Weihua Du, Haojia Sun, Yiqing Xie, Qianou Ma, Sihao Chen, Mengting Wan, Longqi Yang, Pei Zhou, Sherry Wu, Sean Welleck, Graham Neubig, Yiming Yang, Maarten Sap

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软)

AI总结 本文提出DITTO模型,通过将言语反馈作为强化学习中的首要信号来提升LLM模拟人类行为的能力,并引入SOUL基准测试平台,展示了在多个任务中显著提升性能的成果。

URL PDF HTML 收藏
2605.09063 2026-05-20 cs.CL

Soohak: A Mathematician-Curated Benchmark for Evaluating Research-level Math Capabilities of LLMs

Soohak:一个由数学家精心编订的基准,用于评估大语言模型的研究级数学能力

Guijin Son, Seungone Kim, Catherine Arnett, Hyunwoo Ko, Hyein Lee, Hyeonah Kang, Jiang Longxi, Jin Yun, JungYup Lee, Kyungmin Lee, Sam Yoosuk Kim, Sang Park, Seunghyeok Hong, SeungJae Lee, Seungyeop Yi, Shinae Shin, SunHye Bok, Sunyoung Shin, Yonghoon Ji, Youngtaek Kim, Hanearl Jung, Akari Asai, Graham Neubig, Sean Welleck, Youngjae Yu, Akshelin R, Alexander B. Ivanov, Boboev Muhammadjon, Chae Young Han, Christian Stump, Cooper R. Anderson, Dmitrii Karp, Dohyun Kwon, Dongryung Yi, DoYong Kwon, Duk-Soon Oh, Eunho Choi, Giovanni Resta, Greta Panova, Huiyun Noh, Hyungryul Baik, Hyungsun Bae, Inomov Mashrafdzhon, Jeewon Kim, Jeong-Rae Kim, Ji Eun Lee, Jiaqi Liu, Jieui Kang, Jimin Kim, Jon-Lark Kim, Joonyeong Won, Junseo Yoon, Junwoo Jo, Kibeom Kim, Kiwoon Kwon, Mario Kummer, Max Mercer, Min Hoon Kim, Minjun Kim, Nahyun Lee, Ng Ze-An, Nicolas Libedinsky, Rafał Marcin Łochowski, Raphaël Lachièze-Rey, Robert Auffarth, Ruichen Zhang, Sejin Park, Seonguk Seo, Shin Jaehoon, Sunatullo, Taewoong Eom, Yeachan Park, Yongseok Jang, Youchan Oh, Zhaoyang Wang, Zoltán Kovács

AI总结 本文提出Soohak基准,通过64位数学家自主编写439道问题,评估大语言模型在研究级数学问题上的能力,同时引入拒绝子集以测试模型对不恰当问题的识别能力。

Comments Under review, For questions or model-evaluation requests, contact $guijin.son@snu.ac.kr$

URL PDF HTML 收藏
2605.06639 2026-05-08 cs.LG cs.AI cs.CL cs.MA

Recursive Agent Optimization

递归智能体优化

Apurva Gandhi, Satyaki Chakraborty, Xiangjun Wang, Aviral Kumar, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Amazon AGI Labs(亚马逊人工智能实验室)

AI总结 本文提出递归智能体优化方法,通过递归代理训练实现更高效的推理扩展和泛化能力,提升任务处理效率和泛化性能。

URL PDF HTML 收藏
2511.03690 2026-04-23 cs.SE cs.AI

The OpenHands Software Agent SDK: A Composable and Extensible Foundation for Production Agents

OpenHands软件代理SDK:一种可组合且可扩展的生产代理基础

Xingyao Wang, Simon Rosenberg, Juan Michelini, Calvin Smith, Hoang Tran, Engel Nyst, Rohit Malhotra, Xuhui Zhou, Valerie Chen, Robert Brennan, Graham Neubig

机构 * MLSys 2026

AI总结 本文提出OpenHands SDK,提供灵活的代理实现接口、安全可靠执行及用户交互接口,整合了本地到远程执行、多LLM路由和安全分析,验证了其在生产部署中的有效性。

Comments Accepted at MLSys 2026

URL PDF HTML 收藏
2604.14624 2026-04-17 cs.SE cs.AI

Asking What Matters: Reward-Driven Clarification for Software Engineering Tasks

询问何为关键:面向软件工程任务的奖励驱动澄清

Sanidhya Vijayvargiya, Vijay Viswanathan, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University, Pittsburgh, USA(语言技术研究所,卡内基梅隆大学,匹兹堡,美国)

AI总结 本文研究软件工程任务中有效澄清问题的方法,通过量化影响任务成功的信息类型和用户能提供的信息,提出基于Shapley属性和分布比较的多阶段强化学习奖励机制,训练出CLARITI模块,在未明确问题上表现优于GPT-5,生成更少问题。

Comments 28 pages, 6 figures

URL PDF HTML 收藏
2604.08510 2026-04-10 cs.CL

What do Language Models Learn and When? The Implicit Curriculum Hypothesis

语言模型学习了什么以及何时?隐式课程假说

Emmy Liu, Kaiser Sun, Millicent Li, Isabelle Lee, Lindia Tjuatja, Jen-tse Huang, Graham Neubig

机构 * Language Technologies Institute, Carnegie Mellon University(卡内基梅隆大学语言技术研究所) Department of Computer Science, Data Science and AI Institute, Johns Hopkins University(约翰霍普金斯大学计算机科学系、数据科学与人工智能研究所) Khoury College of Computer Science, Northeastern University(东北大学Khoury计算机科学学院) Department of Computer Science, University of Southern California(南加州大学计算机科学系)

AI总结 研究通过设计简单可组合任务,发现模型技能以可组合顺序出现,且在不同模型间一致,表明预训练过程具有结构性。

URL PDF HTML 收藏
2604.06126 2026-04-08 cs.LG cs.AI

Gym-Anything: Turn any Software into an Agent Environment

Gym-Anything: 将任意软件转化为智能体环境

Pranjal Aggarwal, Graham Neubig, Sean Welleck

机构 * CMU(卡内基梅隆大学)

AI总结 本文提出Gym-Anything框架,通过多智能体任务将任意软件转化为交互式计算机使用环境,生成涵盖医疗、天文、工程等领域的10K+长周期任务,提升现实场景下的智能体研究效率。

URL PDF HTML 收藏
2604.04704 2026-04-07 cs.CL

IDIOLEX: Unified and Continuous Representations for Idiolectal and Stylistic Variation

IDIOLEX:统一且连续的语用与风格变异表示

Anjali Kantharuban, Aarohi Srivastava, Fahim Faisal, Orevaoghene Ahia, Antonios Anastasopoulos, David Chiang, Yulia Tsvetkov, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Notre Dame(圣母大学) George Mason University(乔治梅森大学) University of Washington(华盛顿大学) Archimedes Research Unit(阿基米德研究单元)

AI总结 本文提出IDIOLEX框架,通过结合句子来源信息与语言特征,学习连续的风格和方言表示,用于分析和分类,并用于对齐语言模型的风格。

URL PDF HTML 收藏
2506.13130 2026-04-07 cs.CV cs.AI cs.CL

ZINA: Multimodal Fine-grained Hallucination Detection and Editing

ZINA:多模态细粒度幻觉检测与编辑

Yuiga Wada, Kazuki Matsuda, Komei Sugiura, Graham Neubig

机构 * Keio AI Research Center(庆应义塾大学人工智能研究中心) Keio University(庆应义塾大学) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本文提出ZINA方法,用于多模态大语言模型的细粒度幻觉检测与编辑,通过构建VisionHall数据集验证了其在检测和编辑任务中的优越性。

Comments CVPR 2026 Main Conference

URL PDF HTML 收藏
2603.18886 2026-03-20 cs.AI cs.CL

Reasoning over mathematical objects: on-policy reward modeling and test time aggregation

数学对象推理:在线奖励建模与测试时间聚合

Pranjal Aggarwal, Marjan Ghazvininejad, Seungone Kim, Ilia Kulikov, Jack Lanchantin, Xian Li, Tianjian Li, Bo Liu, Graham Neubig, Anaelia Ovalle, Swarnadeep Saha, Sainbayar Sukhbaatar, Sean Welleck, Jason Weston, Chenxi Whitehouse, Adina Williams, Jing Xu, Ping Yu, Weizhe Yuan, Jingyu Zhang, Wenting Zhao

机构 * FAIR at Meta(Meta旗下的FAIR)

AI总结 本文提出改进数学对象推理的三个贡献:构建数学对象推导的训练数据和基准Principia套件,提供强LLM判官和验证器的训练方案,展示在线训练可提升测试时计算能力。

URL PDF HTML 收藏
2603.17829 2026-03-19 cs.SE cs.AI cs.CL

CodeScout: An Effective Recipe for Reinforcement Learning of Code Search Agents

CodeScout: 一种有效的强化学习代码搜索代理训练方法

Lintang Sutawika, Aditya Bharat Soni, Bharath Sriraam R R, Apurva Gandhi, Taha Yassine, Sanidhya Vijayvargiya, Yuchen Li, Xuhui Zhou, Yilin Zhang, Leander Melroy Maben, Graham Neubig

AI总结 本文提出CodeScout,通过强化学习方法训练仅使用标准Unix终端的代码搜索代理,实验证明其在多个基准测试中优于大型语言模型。

URL PDF HTML 收藏
2603.15798 2026-03-18 cs.AI

CUBE: A Standard for Unifying Agent Benchmarks

CUBE:统一智能体基准的标准化

Alexandre Lacoste, Nicolas Gontier, Oleh Shliazhko, Aman Jaiswal, Kusha Sareen, Shailesh Nanisetty, Joan Cabezas, Manuel Del Verme, Omar G. Younis, Simone Baratta, Matteo Avalle, Imene Kerboua, Xing Han Lù, Elron Bandel, Michal Shmueli-Scheuer, Asaf Yehudai, Leshem Choshen, Jonathan Lebensold, Sean Hughes, Massimo Caccia, Alexandre Drouin, Siva Reddy, Tao Yu, Yu Su, Graham Neubig, Dawn Song

AI总结 本文提出CUBE标准,通过MCP和Gym构建统一协议,实现智能体基准的标准化,减少碎片化,提升研究效率。

Comments Position paper. 10 pages. Reference implementation: https://github.com/The-AI-Alliance/cube-standard

URL PDF HTML 收藏
2603.01203 2026-03-09 cs.AI

How Well Does Agent Development Reflect Real-World Work?

代理开发是否能反映现实世界的工作?

Zora Zhiruo Wang, Sanidhya Vijayvargiya, Aspen Chen, Hanmo Zhang, Venu Arvind Arangarajan, Jett Chen, Valerie Chen, Diyi Yang, Daniel Fried, Graham Neubig

机构 * Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学)

AI总结 本文研究了代理开发与现实工作分布的匹配程度,揭示了代理开发与人类劳动力分布的不匹配,并提出了三个原则以改进基准设计。

URL PDF HTML 收藏