arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15801 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15801 篇

2602.01709 2026-02-04 cs.CL 83%

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01640 2026-02-03 cs.CL 83%

A2Eval: Agentic and Automated Evaluation for Embodied Brain

A2Eval: 基于代理的自动评估用于具身脑

Shuai Zhang, Jiayu Hu, Zijie Chen, Zeyuan Ding, Yi Zhang, Yingji Zhang, Ziyi Zhou, Junwei Liao, Shengjie Zhou, Yong Dai, Zhenzhong Lan, Xiaozhu Ju

机构 * Zhejiang University, China(浙江大学) Westlake University, China(西湖大学) Beijing Innovation Center of Humanoid Robotics, China(北京人形机器人创新中心) University of Manchester, UK(曼彻斯特大学) Southern University of Science(南方科技大学) Xiamen University Malaysia, Malaysia(厦门大学马来西亚分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.CL

AI总结 A2Eval提出首个基于代理的自动评估框架,通过两个协作代理自动化基准编纂和评估,显著提升评估效率并减少成本,同时保持高保真度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01271 2026-02-03 cs.LG 83%

From Intents to Actions: Agentic AI in Autonomous Networks

从意图到动作:自主网络中的代理AI

Burak Demirel, Pablo Soldati, Yu Wang

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.LG

AI总结 本文提出一种代理AI系统,用于自主网络中将高层意图转化为具体控制动作,通过三个专门代理实现意图解析、优化和控制,以满足多样化的网络需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22288 2026-02-02 cs.HC cs.AI eess.AS eess.IV 83%

PersonaCite: VoC-Grounded Interviewable Agentic Synthetic AI Personas for Verifiable User and Design Research

PersonaCite: 基于VoC的可访谈代理合成AI人设用于可验证的用户与设计研究

Mario Truss

机构 * Adobe

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 PersonaCite通过检索增强的交互,将AI人设作为证据受限的研究工具,提升用户与设计研究中的可验证性与透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21403 2026-01-30 cs.AI cs.MA 83%

DataCross: A Unified Benchmark and Agent Framework for Cross-Modal Heterogeneous Data Analysis

DataCross: 一个统一的基准和代理框架,用于跨模态异构数据分析

Ruyi Qi, Zhou Liu, Wentao Zhang

机构 * Peking University(北京大学)

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 DataCross提出一个统一的基准和代理框架,用于跨模态异构数据分析,通过多步骤联合推理提升事实性与鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15153 2026-01-22 cs.AI 83%

How to Build AI Agents by Augmenting LLMs with Codified Human Expert Domain Knowledge? A Software Engineering Framework

如何通过将编码化的人类专家领域知识与大语言模型结合来构建AI代理?一种软件工程框架

Choro Ulan uulu, Mikhail Kulyabin, Iris Fuhrmann, Jan Joosten, Nuno Miguel Martins Pacheco, Filippos Petridis, Rebecca Johnson, Jan Bosch, Helena Holmström Olsson

机构 * Department of Computer Science and Engineering, Chalmers University of Technology(计算机科学与工程系,查尔姆斯理工大学) Department of Mathematics and Computer Science, Eindhoven University of Technology(数学与计算机科学系,埃因霍温理工大学) Department of Computer Science and Media Technology, Malmö University(计算机科学与媒体技术系,马尔默大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一种软件工程框架,通过增强大语言模型与编码化专家知识,构建能自主生成可视化内容的AI代理,实现非专家在专业领域内达到专家水平的成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.10061 2026-01-21 cs.CV cs.AI 83%

DiffusionAgent: Navigating Expert Models for Agentic Image Generation

DiffusionAgent: 专家模型导航用于代理图像生成

Jie Qin, Jie Wu, Weifeng Chen, Yueming Lyu

机构 * Meituan(美团) ByteDance(字节跳动) Nanjing University(南京大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 DiffusionAgent通过统一代理框架实现多领域图像生成,结合树状思维导航和优势数据库提升生成质量与泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09393 2026-01-15 cs.SE cs.DC cs.PF 83%

AI-NativeBench: An Open-Source White-Box Agentic Benchmark Suite for AI-Native Systems

AI-NativeBench: 一个面向 AI-Native 系统的开源白盒代理基准测试套件

Zirui Wang, Guangba Yu, Michael R. Lyu

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 AI-NativeBench 通过白盒代理基准测试揭示 AI-Native 系统中的关键工程现实,指导可靠系统构建。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06663 2026-01-14 cs.AI 83%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01149 2026-01-13 cs.AI 83%

A3: Android Agent Arena for Mobile GUI Agents with Essential-State Procedural Evaluation

A3: 用于移动GUI代理的Android代理竞技场:基于本质状态的程序评估

Yuxiang Chai, Shunye Tang, Han Xiao, Weifeng Lin, Hanhao Li, Jiayu Zhang, Liang Liu, Pengxiang Zhao, Guangyi Liu, Guozhi Wang, Shuai Ren, Rongduo Han, Haining Zhang, Siyuan Huang, Hongsheng Li

机构 * Nankai University(南开大学) vivo AI Lab(vivo 人工智能实验室) SJTU(上海交通大学)

专题命中 Agent评测 :agent(title,abstract);AI agent(abstract);分类 cs.AI

AI总结 A3提出了一种基于本质状态的程序评估系统,通过动态在线应用的100个任务基准和工具包,提升移动GUI代理的评估能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06640 2026-01-13 cs.AI cs.NI 83%

Agentic AI Empowered Intent-Based Networking for 6G

基于代理AI的意图驱动网络用于6G

Genze Jiang, Kezhi Wang, Xiaomin Chen, Yizhou Huang

机构 * Department of Computer Science, Brunel University London, UK(布伦埃尔大学伦敦计算机科学系) Department of Computer Science, University of Reading, UK(阅读大学计算机科学系)

专题命中 Agent评测 :agentic(title);agent(abstract);multi-agent(abstract);分类 cs.AI

AI总结 本文提出基于多代理框架的意图驱动网络方案,通过LLM自主分解意图并生成可行网络配置,提升6G无线网络的自主编排能力。

Comments Submitted for Possible Journal Publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07505 2026-01-09 cs.LG 83%

PEAR: Planner-Executor Agent Robustness Benchmark

PEAR:规划-执行代理鲁棒性基准

Shen Dong, Mingxuan Zhang, Pengfei He, Li Ma, Bhavani Thuraisingham, Hui Liu, Yue Xing

机构 * Michigan State University(密歇根州立大学) Purdue University(普渡大学) University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.LG

AI总结 PEAR基准通过评估规划-执行多智能体系统的鲁棒性,揭示了规划器弱点对任务性能的影响及鲁棒性与性能的权衡。

Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01366 2026-01-06 cs.AI 83%

KGCE: Knowledge-Augmented Dual-Graph Evaluator for Cross-Platform Educational Agent Benchmarking with Multimodal Language Models

KGCE:基于多模态语言模型的跨平台教育代理基准评估知识增强双图评估器

Zixian Liu, Sihao Liu, Yuqi Zhao

机构 * Faculty of the School of Computer Science, Central China Normal University(中央财经大学计算机学院)

专题命中 Agent评测 :agent(title,abstract);autonomous agent(abstract);分类 cs.AI

AI总结 KGCE提出一种基于多模态语言模型的跨平台教育代理基准评估框架,通过知识库增强和双图评估方法提升对特定学校软件任务的执行效率和评估精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01008 2026-01-06 eess.IV cs.AI cs.CV 83%

An Explainable Agentic AI Framework for Uncertainty-Aware and Abstention-Enabled Acute Ischemic Stroke Imaging Decisions

可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策

Md Rashadul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Daffodil International University(达福尔国际大学)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。

Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.25055 2026-01-01 cs.AI cs.HC 83%

Context-aware LLM-based AI Agents for Human-centered Energy Management Systems in Smart Buildings

面向人类中心的基于大语言模型的AI代理用于智能建筑中的能源管理系统

Tianzhi He, Farrokh Jazizadeh

机构 * organization= School of Civil \& Environmental Engineering Construction Management, The University of Texas at San Antonio , addressline= BSE 1.310, One UTSA Circle , city= San Antonio , postcode= 78249 , state= TX , country= U.S. organization= Department of Civil Environmental Engineering, Virginia Polytechnic Institute State University , addressline= 200 Patton Hall, 750 Drillfield , city= Blacksburg , postcode= 24060 , state= VA , country= U.S.

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 本研究提出基于大语言模型的AI代理,用于智能建筑中的人类中心能源管理,通过自然语言交互实现情境感知的能源优化与管理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16250 2025-12-19 cs.AI cs.MA 83%

AMUSE: Audio-Visual Benchmark and Alignment Framework for Agentic Multi-Speaker Understanding

AMUSE:面向代理多说话者理解的音频-视觉基准与对齐框架

Sanjoy Chowdhury, Karren D. Yang, Xudong Liu, Fartash Faghri, Pavan Kumar Anasosalu Vasu, Oncel Tuzel, Dinesh Manocha, Chun-Liang Li, Raviteja Vemulapalli

机构 * University of Maryland, College Park(马里兰大学学院公园分校) Apple(苹果公司)

专题命中 Agent评测 :agentic(title,abstract);planning(abstract);分类 cs.AI

AI总结 AMUSE提出一个面向多说话人理解的音频-视觉基准与对齐框架RAFT,通过代理推理提升多模态模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14860 2025-12-18 cs.CR cs.AI 83%

Penetration Testing of Agentic AI: A Comparative Security Analysis Across Models and Frameworks

代理AI的渗透测试:跨模型和框架的比较安全分析

Viet K. Nguyen, Mohammad I. Husain

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文通过测试五个代理AI模型和两个框架,揭示了代理AI在安全方面的显著差异,发现超过一半的恶意提示成功,提出了新的防御策略和部署建议。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01115 2025-12-17 cs.AI cs.MA econ.TH physics.soc-ph 83%

Exploring Network-Knowledge Graph Duality: A Case Study in Agentic Supply Chain Risk Analysis

探索网络-知识图谱二元性:代理供应链风险分析的案例研究

Evan Heus, Rick Bookstaber, Dhruv Sharma

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出基于LLM的代理框架,利用网络与知识图谱的二元性,通过图遍历和上下文壳技术实现供应链风险分析的实时可解释生成。

Comments Accepted to the 2nd Workshop on LLMs and Generative AI in Finance: International Conference on AI in Finance(ICAIF) 2025;7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12719 2025-12-16 cs.SE 83%

Towards AI Agents Supported Research Problem Formulation

Anrafel Fernandes Pereira, Maria Teresa Baldassarre, Daniel Mendez, Marcos Kalinowski

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.SE

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10501 2025-12-15 cs.AI 83%

Zero-shot 3D Map Generation with LLM Agents: A Dual-Agent Architecture for Procedural Content Generation

无监督3D地图生成与LLM代理:一种双代理架构用于程序化内容生成

Lim Chien Her, Ming Yan, Yunshu Bai, Ruihao Li, Hao Zhang

专题命中 Agent评测 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 本文提出一种双代理架构,利用LLM代理实现无监督3D地图生成,通过迭代推理优化参数配置,提升PCG指令遵循能力。

Comments 12 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09142 2025-12-15 cs.AI 83%

SDialog: A Python Toolkit for End-to-End Agent Building, User Simulation, Dialog Generation, and Evaluation

SDialog:一个用于端到端代理构建、用户模拟、对话生成和评估的Python工具包

Sergio Burdisso, Séverin Baroudi, Yanis Labrak, David Grunert, Pawel Cyrta, Yiyang Chen, Srikanth Madikeri, Esaú Villatoro-Tello, Thomas Schaaf, Ricard Marxer, Petr Motlicek

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 SDialog是一个开源Python工具包,提供端到端的对话代理构建、用户模拟、对话生成和评估功能,结合机理可解释性工具和综合评估方法,帮助研究人员更系统地研究对话系统。

Comments We have an old version of the paper at arXiv:2506.10622, we will update this old version instead (even though the authors and the title have changed since this first old version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06710 2025-12-09 cs.AI 83%

Stochasticity in Agentic Evaluations: Quantifying Inconsistency with Intraclass Correlation

代理评估中的随机性:通过组内相关系数量化不一致性

Zairah Mustahsan, Abel Lim, Megna Anand, Saahil Jain, Bryan McCann

专题命中 Agent评测 :agentic(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出通过组内相关系数量化代理评估中的不一致性,以提高评估可靠性,建议在基准测试中报告ICC和查询内方差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04535 2025-12-08 cs.AI 83%

GTM: Simulating the World of Tools for AI Agents

GTM: 为AI代理模拟工具世界

Zhenzhen Ren, Xinpeng Zhang, Zhenxing Qian, Yan Gao, Yu Shi, Shuxin Zheng, Jiyan He

机构 * Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) School of Computer Science, Fudan University, Shanghai, China(计算机学院,复旦大学,上海,中国)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.AI

AI总结 GTM通过模拟工具提升AI代理训练效率,实现快速且低成本的工具交互模拟。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04367 2025-12-05 cs.AI 83%

AgentBay: A Hybrid Interaction Sandbox for Seamless Human-AI Intervention in Agentic Systems

AgentBay:一种混合交互沙盒,用于无缝的人工智能干预在代理系统中

Yun Piao, Hongbo Min, Hang Su, Leilei Zhang, Lei Wang, Yue Yin, Xiao Wu, Zhejing Xu, Liwei Qu, Hang Li, Xinxin Zeng, Wei Tian, Fei Yu, Xiaowei Li, Jiayi Jiang, Tongxu Liu, Hao Tian, Yufei Que, Xiaobing Tu, Bing Suo, Yuebing Li, Xiangting Chen, Zeen Zhao, Jiaming Tang, Wei Huang, Xuguang Li, Jing Zhao, Jin Li, Jie Shen, Jinkui Ren, Xiantao Zhang

机构 * Alibaba Cloud Computing(阿里云计算)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 AgentBay通过混合交互沙盒实现无缝人机协作,提升代理系统在复杂任务中的成功率与网络适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03955 2025-12-04 cs.AI cs.ET 83%

Benchmark for Planning and Control with Large Language Model Agents: Blocksworld with Model Context Protocol

基于大语言模型代理的规划与控制基准:带有模型上下文协议的积木世界

Niklas Jobs, Luis Miguel Vieira da Silva, Jayanth Somashekaraiah, Maximilian Weigand, David Kube, Felix Gehlhoff

机构 * Institute of Automation Technology, Helmut Schmidt University / University of the Federal Armed Forces Hamburg, Germany(自动化技术研究所,海姆·施密特大学/联邦武装部队大学汉堡,德国) Siemens AG, Nuremberg, Germany(西门子股份公司,纽伦堡,德国)

专题命中 Agent评测 :planning(title,abstract);agent(abstract);分类 cs.AI

AI总结 本文提出一个基于大语言模型的规划与控制基准,通过积木世界问题和模型上下文协议,提供五个复杂度类别以评估不同代理架构的性能。

Comments This work has been submitted to IFAC for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21510 2025-12-02 cs.MA cs.AI 83%

Tool-RoCo: An Agent-as-Tool Self-organization Large Language Model Benchmark in Multi-robot Cooperation

Tool-RoCo: 一种基于机器人协作的大型语言模型自组织评估基准

Ke Zhang, Xiaoning Zhao, Ce Zheng, Jiahong Ning, Dandan Zhu, Wenqi Zhang, Chen Sun, Toshiharu Sugawara

专题命中 Agent评测 :agent(title,abstract);multi-agent(abstract);分类 cs.AI

AI总结 Tool-RoCo提出了一种评估大型语言模型在多机器人协作中自主性和协作能力的基准,通过四种不同自主性范式和三个任务测试工具使用效果。

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21444 2025-11-27 cs.AI physics.ao-ph 83%

EWE: An Agentic Framework for Extreme Weather Analysis

EWE:极端天气分析的代理框架

Zhe Jiang, Jiong Wang, Xiaoyu Yue, Zijie Guo, Wenlong Zhang, Fenghua Ling, Wanli Ouyang, Lei Bai

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) The University of Sydney(悉尼大学)

专题命中 Agent评测 :agentic(title);agent(abstract);planning(abstract);分类 cs.AI

AI总结 EWE是首个用于极端天气分析的智能代理框架,通过知识引导的规划和闭环推理实现自动化诊断,提供首个该领域基准测试,推动科学发现民主化进程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15097 2025-11-26 cs.CR cs.AI 83%

MAIF: Enforcing AI Trust and Provenance with an Artifact-Centric Agentic Paradigm

MAIF:基于 artifacts 的代理范式强化 AI 可信度与溯源

Vineeth Sai Narajala, Manish Bhatt, Idan Habler, Ronald F. Del Rosario, Ads Dawson

机构 * Security Researcher Cisco(安全研究员 希思科) Researcher OWASP/Project Kuiper Security(研究员 OWASP/项目 Kuiper 安全) Adversarial AI Security Research Cisco(对抗性AI安全研究 希思科)

专题命中 Agent评测 :agentic(title);agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 MAIF 通过以 artifacts 为中心的代理范式,解决 AI 的可信度、安全性和问责问题,实现数据的主动信任执行和高效处理。

Comments 7 Pages, 2 Figures, 6 Tables, Repo: https://github.com/vineethsai/maifscratch-1, Added additional Author and fixed Citations

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13646 2025-11-25 cs.SE cs.AI cs.CL cs.LG 83%

Live-SWE-agent: Can Software Engineering Agents Self-Evolve on the Fly?

Live-SWE-agent: 软件工程代理能否在飞行中自我进化?

Chunqiu Steven Xia, Zhe Wang, Yan Yang, Yuxiang Wei, Lingming Zhang

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(title,abstract);分类 cs.AI、cs.CL、cs.LG

AI总结 Live-SWE-agent是一种能够在运行时自主进化其自身框架的软件代理,通过解决现实软件问题实现了77.4%的解决率,优于现有所有软件代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24591 2025-11-25 cs.CL astro-ph.IM 83%

ReplicationBench: Can AI Agents Replicate Astrophysics Research Papers?

ReplicationBench: 人工智能代理能否复制天体物理学研究论文?

Christine Ye, Sihan Yuan, Suchetha Cooray, Steven Dillmann, Ian L. V. Roque, Dalya Baron, Philipp Frank, Sergio Martin-Alvarez, Nolan Koblischke, Frank J Qu, Diyi Yang, Risa Wechsler, Ioana Ciuca

机构 * Stanford University(斯坦福大学) University of Toronto(多伦多大学)

专题命中 Agent评测 :AI agent(title,abstract);agent(abstract);分类 cs.CL

AI总结 ReplicationBench旨在评估人工智能代理复制天体物理学研究论文的能力,通过测试代理在实验设置、推导、数据分析和代码库等任务上的表现,揭示代理在科学研究中的可靠性及挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏