arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15841 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15841 篇

2606.00644 2026-06-05 cs.AI 57%

ForeSci: Evaluating LLM Agents for Forward-Looking AI Research Judgment

ForeSci: 评估LLM智能体在前瞻性AI研究判断中的能力

Qiuyu Tian, Haojie Yin, Yingce Xia, Youyong Kong, Zequn Liu

机构 * Southeast University(东南大学) Beijing Zhongguancun Academy(北京中关村学院) Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出ForeSci基准,通过时间控制的500个任务评估LLM智能体基于历史证据做出前瞻性研究判断的能力,发现证据与决策脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13587 2026-06-05 stat.ML cs.LG eess.SP 57%

Reframing preprocessing selection as model-internal calibration in near-infrared spectroscopy: A large-scale benchmark of operator-adaptive PLS and Ridge models

将预处理选择重新定义为近红外光谱学中的模型内部校准:一种大规模的运算符自适应PLS和岭模型基准测试

Gregory Beurier, Robin Reiter, Camille Noûs, Lauriane Rouan, Denis Cornet

机构 * CIRAD, UMR AGAP Institut(CIRAD,AGAP研究院) UMR AGAP Institut, Univ Montpellier, CIRAD, INRAE, Institut Agro(AGAP研究院,蒙彼利埃大学,CIRAD,INRAE,农业研究院) Laboratoire Cogitamus(Cogitamus实验室)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本文研究了在近红外光谱学中,将预处理选择重新定义为模型内部校准的方法,通过大规模基准测试比较运算符自适应PLS和岭模型的性能和效率。

Comments 17 pages, 8 figures; supplementary material (39 pages, 4 figures) included. Extended preprint version of a companion study prepared as a concise journal article (same results, different framing and scope). Code and artifacts: https://github.com/GBeurier/nirs4all-aom

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.06703 2026-06-05 cs.AI 57%

ST-WebAgentBench: A Benchmark for Evaluating Safety and Trustworthiness in Web Agents

ST-WebAgentBench:用于评估网络代理安全性和可信度的基准测试

Ido Levy, Ben Wiesel, Sami Marreed, Alon Oved, Avi Yaeli, Nir Mashkif, Segev Shlomov

机构 * IBM Research(IBM研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出ST-WebAgentBench基准测试,用于评估网络代理在现实企业场景中的安全性和可信度,通过引入新的评估指标CuP和风险比,揭示了现有代理的安全性缺陷。

Comments The Fourteenth International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23845 2026-06-05 cs.CL 57%

CLFEC: A New Task for Unified Linguistic and Factual Error Correction in paragraph-level Chinese Professional Writing

CLFEC:一种新的任务,用于段落级中文专业写作中的统一语言和事实纠错

Jian Kai, Zidong Zhang, Jiwen Chen, Zhengxiang Wu, Songtao Sun, Fuyang Li, Yang Cao, Qiang Liu

机构 * Huazhong University of Science and Technology(华中科技大学) WPS AI, Kingsoft Office(WPS AI,Kingsoft Office)

专题命中 Agent评测 :agentic(abstract);分类 cs.CL

AI总结 本文提出CLFEC任务,旨在解决段落级中文专业写作中语言和事实错误的联合纠错问题,构建了多领域数据集,并系统研究了基于LLM的纠错方法,揭示了实际挑战并展示了统一纠错的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11973 2026-06-05 cs.LG 57%

Self-Regulating Cars: Automating Traffic Control in Free Flow Road Networks

自调节汽车:自动化自由流道路网络的交通控制

Ankit Bhardwaj, Rohail Asim, Sachin Chauhan, Yasir Zaki, Lakshminarayanan Subramanian

机构 * Department of Computer Science(计算机科学系) New York University(纽约大学) Indian Institute of Technology Delhi(德里印度理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出了一种基于强化学习的自调节汽车方法,通过动态调节车辆速度来优化通行能力和防止拥堵,无需新基础设施,结合经典交通流理论和微观模拟,在高保真度的PTV Vissim模拟器上实现了提高通行能力、减少延误和停车次数的改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05001 2026-06-04 cs.SE 57%

TeleSWEBench: A Commit-Driven Benchmark for Evaluating LLM-Powered Software Engineering in Telecommunications

TeleSWEBench:一个面向电信领域评估基于LLM的软件工程的提交驱动基准

Pranshav Gajjar, Ali Mamaghani, Dinesh Bharadia, Vijay K Shah

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 提出TeleSWEBench,首个面向电信领域的提交驱动基准,通过从srsRAN 5G仓库挖掘真实提交并构建734个可执行测试用例,结合分层LLM评判框架TeleJudge,评估ASE工具在电信软件工程中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04072 2026-06-04 cs.RO cs.DC cs.LG cs.SY eess.SY 57%

CADET: A Modular Platform for Evaluating Distributed Cooperative Autonomy in Connected Autonomous Vehicles

CADET:用于评估网联自动驾驶车辆中分布式协作自主性的模块化平台

Pragya Sharma, Brian Wang, Mani Srivastava

机构 * UCLA Amazon Scholar(亚马逊学者)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 提出CADET模块化平台,通过解耦自动驾驶堆栈并集成网络与工作负载仿真,系统评估分布式协作自主系统在真实部署条件下的安全性与性能。

Journal ref ICRA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00747 2026-06-04 cs.CV cs.AI 57%

SkyShield: Occupancy as a Safety Interface for Low-Altitude UAV Autonomy

SkyShield:占用作为低空无人机自主飞行的安全接口

Jie Gao, Jie Ma, Kaihui Lin, Kai Ye, Miaohui Zhang, Pingyang Dai, Liujuan Cao

机构 * Xiamen University(厦门大学) Jiangxi Academy of Sciences(江西省科学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对低空无人机自主飞行中的三维空间理解问题,提出首个前视单目语义占用基准SkyShield、动态感知度量KAR-mIoU和几何优先基线SkyOcc,将占用作为安全接口。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22240 2026-06-04 cs.AI 57%

Unlocking Proactivity in Task-Oriented Dialogue

解锁任务导向型对话中的主动性

Azure Zhang, Ning Gao, Yuqin Dai, Ruiyuan Wu, Jinpeng Wang, Rena Wei Gao, Bingdong Tan, Shuzheng Gao, Zongjie Li, Chaozheng Wang

机构 * Keeta AI, Meituan(Keeta AI,美团) Independent Researcher(独立研究者) CUHK(香港中文大学) HKUST(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对任务导向型对话中主动性问题,提出认知用户模拟器和模拟器诱导的非对称视角策略优化,通过建模用户潜在关注实现主动对话。

详情

展开后加载摘要…

URL PDF HTML 收藏
1903.07266 2026-06-04 cs.LG cs.DC cs.MA cs.SY eess.SY stat.ML 57%

Distributed stochastic optimization with gradient tracking over strongly-connected networks

在强连通网络上进行分布式随机优化与梯度跟踪

Ran Xin, Anit Kumar Sahu, Usman A. Khan, Soummya Kar

机构 * Department of Electrical and Computer Engineering, Tufts University(Tufts大学电气与计算机工程系) Bosch Center for Artificial Intelligence(博世人工智能中心) Department of Electrical and Computer Engineering, Carnegie Mellon University(卡内基梅隆大学电气与计算机工程系)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文研究了在强连通网络上最小化平滑且强凸局部成本函数之和的分布式随机优化问题,提出了一种新的分布式方法$\mathcal{S}$-$\mathcal{AB}$,通过辅助变量在期望意义上渐近跟踪全局成本的梯度,利用行和列随机权重确保共识和最优性,并在任意强连通图上应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.05971 2026-06-04 eess.SY cs.AI cs.GT cs.SY math.OC 57%

An Integrated Optimization + Learning Approach to Optimal Dynamic Pricing for the Retailer with Multi-type Customers in Smart Grids

在智能电网中面向多类型顾客的零售商最优动态定价集成优化与学习方法

Fanlin Meng, Xiao-Jun Zeng, Yan Zhang, Chris J. Dent, Dunwei Gong

机构 * School of Engineering and Computing Sciences, Durham University(工程与计算科学学院,达勒姆大学) School of Computer Science, The University of Manchester(计算机科学学院,曼彻斯特大学) College of Information System and Management, National University of Defense Technology(信息系统与管理学院,国防科技大学) School of Mathematics, University of Edinburgh(数学学院,爱丁堡大学) School of Information and Control Engineering, China University of Mining and Technology(信息与控制工程学院,中国矿业大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文针对智能电网中零售商服务三种不同类型的顾客问题,提出两级决策框架,结合优化与学习方法实现动态定价优化,通过仿真实验验证模型的有效性。

Comments 38 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1802.08138 2026-06-04 cs.AI cs.GT cs.SY eess.SY 57%

Reliable Intersection Control in Non-cooperative Environments

非合作环境中的可靠交叉口控制

Muhammed O. Sayin, Chung-Wei Lin, Shinichi Shiraishi, Tamer Başar

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Toyota InfoTechnology Center(丰田信息技术中心)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种可靠交叉口控制机制,用于非合作环境中的战略自主和联网车辆。通过分析车辆的战略行为,确定纳什均衡,并识别社会最优均衡以实现公平分配。

Comments Extended version (including proofs of theorems and lemmas) of the paper: M. O. Sayin, C.-W. Lin, S. Shiraishi, and T. Basar, "Reliable intersection control in non-cooperative environments", to appear in the Proceedings of American Control Conference, 2018

详情

展开后加载摘要…

URL PDF HTML 收藏
1508.07933 2026-06-04 math.OC cs.LG cs.SY eess.SY 57%

Coordinate Dual Averaging for Decentralized Online Optimization with Nonseparable Global Objectives

协调双平均法用于具有非分离全局目标的去中心化在线优化

Soomin Lee, Angelia Nedić, Maxim Raginsky

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出两种去中心化变体ODA-C和ODA-PS,用于解决去中心化在线凸优化问题,通过双平均方法实现子线性悔度增长。

Comments 10 pages; accepted for publication in IEEE Transactions on Control of Network Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
1406.1128 2026-06-04 cs.AI cs.SY eess.SY 57%

A self-organizing system for urban traffic control based on predictive interval microscopic model

基于预测区间微观模型的自组织城市交通控制系统

Bartlomiej Placzek

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出一种基于预测区间微观模型的自组织交通信号系统,通过智能体预测控制动作对交通流的影响,优化交通控制性能,尤其在非均匀交通流中表现更优。

Comments 29 pages, 8 figures

Journal ref Engineering Applications of Artificial Intelligence, vol. 34, pp. 75-84, 2014

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03678 2026-06-03 cs.AI 57%

EvoDrive: Pareto Evolution for Safety-Critical Autonomous Driving via Self-Improving LLM Agents

EvoDrive: 通过自我改进的LLM智能体实现安全关键自动驾驶的帕累托进化

Tong Nie, Yuewen Mei, Yihong Tang, Junlin He, Jie Deng, Jian Sun, Wei Ma

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 提出EvoDrive,首个基于LLM的自动化智能体进化框架,通过模拟器接地演员-评论家架构和帕累托存档,在安全关键场景生成中实现对抗性与真实性的多目标优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03135 2026-06-03 cs.AI 57%

Uncertainty-Aware Clarification in LLM Agents with Information Gain

基于信息增益的LLM智能体不确定性感知澄清

Mengyi Deng, Zhiwei Li, Xin Li, Tingyu Zhu, Ying Zhao, Zhijiang Guo, Wei Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 针对用户指令不明确导致LLM智能体工具操作错误的问题,提出一种以信息增益奖励为导向的澄清框架,通过贝叶斯信念更新量化澄清问题的效用,训练智能体生成高信息增益的澄清,在τ-Bench环境中将任务成功率提升3.7%,仅增加0.3个交互步骤。

Journal ref ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03118 2026-06-03 cs.LG cs.CV q-bio.NC 57%

Learning to See via Epiretinal Implant Stimulation in silico with Model-Based Deep Reinforcement Learning

通过基于模型的深度强化学习在硅上学习经由视网膜上植入物刺激的视觉

Jacob Lavoie, Marwan Besrour, William Lemaire, Jean Rouat, Réjean Fontaine, Eric Plourde

机构 * Department of Electrical Engineering and Computer Engineering, Université de Sherbrooke(电气与计算机工程系, Sherbrooke 大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出使用各向同性和各向异性形状,通过深度强化学习在虚拟患者的视网膜上渲染可理解的图像,以提高人工恢复视觉的清晰度。

Comments 18 pages, 6 figures. Published version: Biomed. Phys. Eng. Express 10, 025006 (2024)

Journal ref Biomed. Phys. Eng. Express 10 (2024) 025006

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02822 2026-06-03 cs.CR cs.AI 57%

Which Defense Closes Which Threat? Attributing OWASP-LLM-Top-10 Coverage and Its Brittleness Under Paraphrasing

哪种防御措施应对哪种威胁?归因OWASP-LLM-Top-10覆盖及其在释义下的脆弱性

Alexandre Cristovão Maiorano

机构 * Lumytics

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文通过归因分析,测量了不同防御家族(拒绝过滤、预算控制等)对OWASP-LLM-Top-10威胁的覆盖情况,并揭示了拒绝防御在释义攻击下的脆弱性。

Comments 17 pages, 4 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08747 2026-06-03 cs.AI 57%

Done, But Not Sure: Disentangling World Completion from Self-Termination in Embodied Agents

完成,但不确定:具身智能体中世界完成与自我终止的解耦

Ying Chen, Lihuang Fang, Rui Jiang, Mingxu Wang, Zhifeng Gu, Lei Yi, Jie Chen

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出VIGIL评估框架,通过分离世界状态完成和终端报告正确性,独立衡量智能体的终止承诺能力,并揭示不同模型在相似完成率下终端报告准确性的显著差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02536 2026-06-02 cs.AI 57%

Tracking the Behavioral Trajectories of Adapting Agents

追踪自适应智能体的行为轨迹

Jonah Leshin, Manish Shah, Ian Timmis

机构 * University of Birmingham(伯明翰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种通过文本嵌入空间中的方向定义智能体特质的方法,训练线性模型对技能文件差异进行评分,实现高准确率的行为特质分类与排序。

Comments 5 pages, 1 figure. To appear at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD) at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02016 2026-06-02 cs.LG 57%

Evaluating Real-World Generalizability of Algorithm Selection Models

评估算法选择模型的现实世界泛化能力

Gjorgjina Cenikj, Jakub Kudela, Eva Tuba, Tome Eftimov

机构 * Computer Systems Department, Jožef Stefan Institute(计算机系统部门,约泽夫·斯蒂芬研究所) Brno University of Technology(布拉格技术大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 通过跨基准测试系统评估算法选择模型在合成与现实优化问题上的泛化能力,分析其迁移性能并指出在特定领域应用中的挑战。

Comments 10 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01815 2026-06-02 cs.CL 57%

CRAB-Bench: Evaluating LLM Agents under Complex Task Dependencies and Human-aligned User Simulation

CRAB-Bench:在复杂任务依赖和人类对齐用户模拟下评估LLM智能体

Danqing Wang, Akshay Sivaraman, Lei Li

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 提出CRAB-Bench和RUSE框架,通过约束图生成复杂任务依赖和基于人类行为研究的用户模拟,评估LLM智能体在真实服务场景中的表现,发现最佳模型仅达61%通过率,用户模拟导致性能下降高达57%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01703 2026-06-02 cs.SD cs.AI cs.CV 57%

JenBridge: Adaptive Long-Form Video Soundtracking across Scene Transitions

JenBridge: 跨场景转换的自适应长视频配乐

Jiashuo Yu, Yao Yao, Boyu Chen, Alex Wang

机构 * Jen Music AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出JenBridge框架,通过基于Transformer的生成模型、双文本-视觉条件对齐和LLM代理驱动的自适应过渡机制,实现长视频配乐的高保真生成与场景转换自然连贯。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01363 2026-06-02 cs.LG cs.SY eess.SY 57%

All Models are Wrong, Knowing Where is Useful: On Model Uncertainty in Reinforcement Learning

所有模型都是错的,知道哪里有用:强化学习中的模型不确定性

Bernd Frauenknecht, Devdutt Subhasish, Artur Eisele, Friedrich Solowjow, Sebastian Trimpe

机构 * German Federal Ministry of Research, Technology and Space (BMFTR)(德国联邦研究、技术和空间部) Robotics Institute Germany (RIG)(德国机器人研究所) Institute for Data Science in Mechanical Engineering, RWTH Aachen University(机械工程数据科学研究所,亚琛工业大学) NHR Center NHR4CES at RWTH Aachen University(亚琛工业大学NHR4CES中心)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出通过针对性处理概率模型的不确定性来减轻模型利用的框架,并展示在硬件直接学习和安全探索方面的成功。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01229 2026-06-02 cs.AI 57%

Application of Algorithms in Energy-Efficient Design Platforms for Green Building

算法在绿色建筑节能设计平台中的应用

Na Yu, Fu Wenli, Guo Fei

机构 * First Highway Engineering Co., Ltd.(第一公路工程有限公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种结合BIM、传感器数据和进化多目标优化的算法平台,通过动态能耗仿真降低建筑能耗29.3%,并验证了其可扩展性和技术可行性。

Comments 9 pages, 4 figures.2026 International Conference on Big Data Applications in Education and Engineering (ICBDAEE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00059 2026-06-02 cs.RO cs.LG 57%

Reinforcement Learning for Optimal Experiment Design in Parameter Identification of Mechatronic Systems

机电系统参数辨识中最优实验设计的强化学习方法

Julian Langschwert, Georg Schaefer, Jakob Rehrl, Stefan Huber, Simon Hirlaender

机构 * Josef Ressel Centre for Intelligent and Secure Industrial Automation, Salzburg University of Applied Sciences, Salzburg, Austria(约瑟夫·雷斯尔智能与安全工业自动化中心,萨尔茨堡应用技术大学,萨尔茨堡,奥地利) Paris Lodron University of Salzburg, Salzburg, Austria(萨尔茨堡巴黎洛登伦大学,萨尔茨堡,奥地利)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 提出一种强化学习智能体,通过奖励塑形自主满足安全约束,为Quanser Aero 2测试平台学习最优激励信号,在三个辨识参数上均达到竞争性估计精度,且安全违规率仅0.75%。

Comments Accepted at DEXA AI4IP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00051 2026-06-02 cs.CY cs.AI 57%

Business Utility of Large Language Models as Exploratory Data Analysis Agents

大型语言模型作为探索性数据分析代理的商业实用性

Rafał Łabędzki, Patryk Miziuła, Hubert Rutkowski, Szymon Betlewski, Cezary Depta, Szymon Janowski, Jarosław Kochanowicz, Jan Kanty Milczek

机构 * deepsense.ai SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) Google(谷歌)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00047 2026-06-02 cs.CY cs.AI 57%

Comprehensive AI governance requires addressing non-model gains

全面的人工智能治理需要解决非模型增益问题

Arthur Goemans, Dan Altman, Noemi Dreksler, Jonas Freund, Milan Gandhi, Zhengdong Wang, Sarah Cogan, Sebastien Krier, Demetra Brady, Lewis Ho, Allan Dafoe

机构 * Stanford University(斯坦福大学) UC Berkeley(加州大学伯克利分校) Open Philanthropy(开放哲学基金会)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出非模型增益的概念,包括推理增益、系统增益和资产增益,并论证这些增益会削弱以模型为中心的治理有效性,进而提出超越模型层面的治理方法。

Comments This paper has been accepted to ICML 2026 (Position paper track): https://openreview.net/forum?id=V3O1sHpKxX

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.30000 2026-06-02 cs.AI 57%

Cookie-Bench: Continuous On-screen Key Interaction Evaluation for Web Generation

Cookie-Bench: 面向网页生成的连续屏幕按键交互评估

Haoyue Yang, Zhangxiao Shen, Fan Ding, Hangting Lou, Yifeng Kou, Haoqing Yu, Jingyao Li, Zhengfan Wu, Siqi Bao, Jing Liu, Hua Wu

机构 * Baidu Inc.(百度公司) Beijing, China(中国北京)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出一种无参考、自主驱动且整体推理的网页生成评估框架Cookie-Bench,通过元认知监控分阶段收集证据并评分,与专家评分高度一致。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14771 2026-06-02 cs.AI 57%

OpenHospital: A Thing-in-itself Arena for Evolving and Benchmarking LLM-based Collective Intelligence

OpenHospital: 一个用于进化和基准测试基于LLM的集体智能的物自体竞技场

Peigen Liu, Rui Ding, Yuren Mao, Ziyan Jiang, Yuxiang Ye, Yunjun Gao, Ying Zhang, Renjie Sun, Longbin Lai, Zhengping Qian

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, Zhejiang Gongshang University(浙江工商大学共同富裕统计监测与智能治理实验室) Tongyi Lab, Alibaba Group(阿里集团通义实验室) Alibaba Cloud(阿里云)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 提出OpenHospital交互式竞技场,通过医生代理与患者代理的互动进化集体智能,采用数据在代理自身范式快速提升能力并提供医学熟练度和系统效率的基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏