arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.19653 2026-08-21 cs.LG cs.AI 新提交 73%

DeltaML-Bench: Evaluating Machine Learning Agents on Real-World Research Repositories

DeltaML-Bench:基于真实研究仓库评估机器学习智能体

Josias Moukpe, Priyanka Aryal, Matthew Kenney

机构 * Algorithmic Research Group(算法研究组)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究推出DeltaML-Bench基准,评估发现基于搜索的ARG框架可提升GPT-5在机器学习实验任务中的成功率,且能避免规范博弈,为自主ML智能体部署提供了关键考量

Comments 18 pages, 3 figures, 12 tables. Code and benchmark: https://github.com/AlgorithmicResearchGroup/deltaml-bench-public

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13926 2026-08-17 cs.AI cs.CL cs.DB 新提交 73%

Never the Number: Structural Abstention for AI Systems Whose Answers Are Consumed as Fact

绝非数字:将答案作为事实使用的AI系统的结构弃权

Zhelun, Wu

机构 * Apple Inc.(苹果公司)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM文本转SQL系统返回错误答案且无法区分的问题,提出带生成式外壳的可信内核架构,即结构弃权,在生产案例中验证其可靠性优于两种生成式替代方案。

Comments 26 pages, 5 figures, 5 tables. Technical report. Describes architecture and design principles only; contains no code, schemas, datasets, or performance metrics

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12593 2026-08-14 cs.AI cs.LG 新提交 73%

DiG-bench: Discovery in Games

DiG-bench:游戏中的发现

Ruairidh M. Battleday, Kai Sandbrink, Jimi Cullen-Drohan, Zihan Yan, Timothy Muller, Clare Maguire, Ales Kubicek, Fraser Greenlee-Scott, Sukrit Sumant, Tri Dao, Jürgen Schmidhuber, Michal Valko, Joshua Tenenbaum, Thomas L. Griffiths, Zeb Kurth-Nelson, James C. R. Whittington

专题命中 Agent评测 :AI agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本研究发布DiG-bench基准,含70个需智能体通过交互实验发现规则的游戏,设7个难度级,部分公开部分私有,用于评估智能体在目标未知环境中发现新知识的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11246 2026-08-13 cs.AI cs.LG cs.RO 新提交 73%

Towards the Harness of Embodied Agents

迈向具身智能体的管控

Qi Wang, Tianyi Wang, Chengyang Li, Shikun Ban, Yurun Chen, Yizhong Ge, Jason Qin, Chengtai Li, Wentao Zhu

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 本文提出名为Thea的具身智能体管控系统,通过场景图和退出码评估弥合物理世界与智能体的差距,实现长程任务完成。

Comments Project page: https://eit-hai.github.io/thea

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10716 2026-08-12 cs.SD cs.AI cs.CL 新提交 73%

DuplexWorld: Can voice agents help you get through the day?

DuplexWorld:语音智能体能帮你度过一天吗?

Aryan Vijay Bhosale, Harshit Rajgarhia, Akhil Pothanapalli, Asif Shaik, Abhishek Mukherji, Dinesh Manocha

机构 * Centific Global Solutions Inc.(森蒂菲克全球解决方案公司) University of Maryland(马里兰大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 DuplexWorld针对现有语音智能体评估基准的不足,构建含六大领域的156个场景开展评估,发现现有最优语音智能体在多维度仍有较大改进空间,并分析了相关性能与失败模式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09819 2026-08-11 cs.LG cs.CL 新提交 73%

Macaron-V1: Towards Open Continual Learning with Self-Improvement and Mixture-of-LoRA

Macaron-V1:面向具备自我改进与LoRA混合能力的开放持续学习

Mind Lab, :, Vin Bo, Asher Cai, Jingwei Cao, Song Cao, Vic Cao, Amelia Chen, Andrew Chen, Kaijie Chen, Cleon Cheng, Steven Chiang, Kaixuan Fan, Hera Feng, Huan Feng, Arthur Fu, Jun Gao, Pyke Han, Nolan Ho, Ori Hong, Hailee Hou, Piers Hua, Charles Huang, Miles Jiang, Nora Jiang, Yuyi Jiang, Qiuyu Jin, Fancy Kong, Kuss Koo, Jaron Lee, Andrew Lei, Alexy Li, Dawn Li, Lucian Li, Ray Li, Ricardo Li, Smith Li, Theo Li, Allen Lin, Elliot Lin, Fan Lin, Chen Ling, Kairus Liu, Kieran Liu, Logan Liu, Neo Liu, Xiang Liu, Yuxin Lu, Maeve Luo, Pony Ma, Verity Niu, Cole Qiao, Guian Qiu, Vince Qu, Sentry, Niko Song, Vincent Wang, Bo Wu, Rio Yang, Evelyn Ye, Fiona Ye, Ina Ye, Regis Ye, Josh Ying, Atlas Zeng, Danney Zeng, Salmon Zhan, Anya Zhang, Di Zhang, Mia Zhang, Sueky Zhang, Wei Zhao, Ada Zhou, Adrian Zhou, Yuhua Zhou, Juno Zhu, Murphy Zhuang

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出Macaron-V1开放智能体模型家族,结合MoL架构与递归自我改进机制,经多基准评估验证其有效性,为开放持续学习提供新方案。

Comments 49 pages, technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09153 2026-08-11 cs.AI cs.LG 新提交 73%

TRACE: TRajectory Attribution for Automated Context Engineering

TRACE:用于自动化上下文工程的轨迹归因

Yikai Zhao, Pradeep Kumar Misra, Saurabh Pandey

机构 * Amazon(亚马逊公司)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI、cs.LG

AI总结 TRACE是利用历史智能体轨迹挖掘上下文故障的自动化反馈循环,可在上下文层诊断修复超80%的生产AI智能体故障,归因率72.7%、修复有效性82%。

Comments 21 pages, 5 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08239 2026-08-11 cs.LG cs.CL 新提交 73%

The Replay Gap: Static Evaluation of Model Switching in LLM Agents Scores the Wrong World

重放差距:大语言模型智能体中模型切换的静态评估评估的是错误的世界

Ashritha Gonuguntla

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现大语言模型智能体的模型切换静态评估基于错误假设,通过分支展开实验证明模型交换会导致轨迹分歧,重放评估无法准确预测结果,发布了相关工具与轨迹。

Comments 8 pages, 3 figures. Accepted at the Conference on Language Modeling 2026. Code: https://github.com/AshrithaG/replay-gap Data: https://huggingface.co/datasets/ashritha0907/replay-gap-trajectories

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03689 2026-08-05 cs.AI cs.SE 新提交 73%

LiveEvalBench: Toward Open-World Evaluation for Web Generation

LiveEvalBench:面向网页生成的开放世界评估

Yiyao Wang, Zhen Wen, Yinghao Tang, Yixiao Fu, Lin Yuan, Xiaolau Zhang, Jun Zhou, Wei Chen

专题命中 Agent评测 :workflow(abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 LiveEvalBench是将网页生成评估转为智能体驱动的自适应可扩展过程的自动化框架,经实验验证其与人类专家判断高度一致,可提供前沿模型网页生成能力的细粒度洞察

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00005 2026-08-04 cs.CL cs.AI 新提交 73%

RubricReviewer: From Direct Critique to Objective and Comprehensive Rubric-Driven Peer Review

RubricReviewer:从直接批评到客观全面的基于评分规则的同行评审

Shuyu Guo, Wenxiang Hu, Yuyue Zhao, Yougang Lyu, Xiaohui Yan

机构 * Shandong University(山东大学) Huawei Technologies Co., Ltd.(华为技术有限公司)

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.CL

AI总结 RubricReviewer是一种基于评分规则驱动的框架,通过将评分规则生成为中间步骤,并结合Scout与Aligner模型,生成更全面、具判别性且抗攻击的评审意见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28840 2026-08-03 cs.CL cs.SE 新提交 73%

Benchmarks Are Not Validation: A System-Level View of Financial LLM Applications

基准测试并非验证:金融大语言模型应用的系统级视角

Burak Payzun, İrem Demirtaş, Simona Scala, Elena Ferretti, Seçil Arslan

机构 * Prometeia S.p.A.(普罗米特亚公司)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.CL、cs.SE

AI总结 该研究指出金融大语言模型不能仅靠基准测试验证,提出需从系统全栈进行多层验证,还讨论了LLM-as-a-judge的应用与控制措施,强调要研究系统感知基准等相关方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27231 2026-07-31 cs.AI cs.LG 新提交 73%

KernelGenBench: A Multi-Source and Multi-Chip Benchmark for LLM-based Kernel Generation

KernelGenBench:面向基于大语言模型的内核生成的多源多芯片基准测试

Peiyu Zang, Jian Tao, Jialing Zhang, Yichen Yuan, Wentao Zhang, Guang Liu, Yonghua Lin

机构 * Beijing Normal University(北京师范大学) Beijing Jiaotong University(北京交通大学) Institute of Automation, CAS(中国科学院自动化研究所) Peking University(北京大学) BAAI(北京智源人工智能研究院)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出KernelGenBench基准,评估LLM与智能体生成的Triton内核,发现智能体方法优于纯LLM采样,cuBLAS算子最具挑战,跨平台性能退化严重,自主生成成本远高于简单采样。

Comments 10 pages, 4 figures. Code and data are publicly available at https://github.com/flagos-ai/KernelGenBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17352 2026-07-21 cs.AI cs.LG quant-ph 新提交 73%

Self-Modifying Lean Proof Agents with Verifier-Grounded Benchmark Coevolution

基于验证器的基准协同进化的自修改精益证明智能体

Yuqing Li, Zeguan Wu, Yu Gan, Junyu Liu

机构 * University of Pittsburgh(匹兹堡大学)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 研究设计有效精益证明智能体的挑战,提出自进化精益证明智能体,其工作区可变,与基准协同进化,通过特定更新机制保持分数可比,经实验验证该方法能有效改善精益证明工作流程。

Comments 22 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09711 2026-07-14 cs.LG cs.SE 新提交 73%

EvoClawBench: Can Agents Learn Reusable Skills from Their Own Runs?

EvoClawBench:智能体能否从自身运行中学习可复用技能?

Zhiyuan Peng, Xin Yin, Chenhao Ying, Zhe Cui, Zixiang Ding, Zhenhua Liu, Jiang Wu, Yuan Luo

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Hithink Research(同花顺研究院)

专题命中 Agent评测 :agent(abstract);tool use(abstract);分类 cs.LG、cs.SE

AI总结 研究智能体能否从自身运行学可复用技能,引入EvoClawBench基准测试,涵盖多任务多子问题并支持多运行时。实验对比不同方式,发现直接基线性能依赖运行时,自我创作技能效果各异,表明学习可复用技能有选择性且成本敏感。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09706 2026-07-14 cs.AI cs.GT cs.LG 新提交 73%

YUKTI: From Natural-Language Situations to Robust, Verifiable Decisions An Uncertainty-Typed Proposition IR, Assumption-Robust Pareto Frontiers, and a Regret Certificate

YUKTI:从自然语言情境到稳健、可验证的决策——一种不确定性类型的命题IR、假设稳健帕累托前沿和遗憾证书

Suyash Mishra

专题命中 Agent评测 :agent(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究从自然语言情境生成稳健决策,核心方法是用类型命题图表示,经多求解器及分布帕累托交接耦合,并引入ARPF等。主要贡献是证明rho与决策遗憾关系,增加可追溯性,合成数据基础,通过多种验证方式展示方法有效性。

Comments 19 Pages , 21 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08681 2026-07-13 cs.AI cs.ET cs.LG cs.MA econ.GN q-fin.EC 新提交 73%

SolarChain-Eval: A Physics-Constrained Benchmark for Trustworthy Economic Agents in Decentralized Energy Markets

SolarChain-Eval:去中心化能源市场中可信经济主体的物理约束基准测试

Shilin Ou, Yifan Xu, Luyao Zhang

机构 * Duke Kunshan University(杜克昆山大学)

专题命中 Agent评测 :autonomous agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对去中心化能源市场中智能代理评估需兼顾任务性能与可信度的问题,提出物理约束基准测试SolarChain-Eval,将市场治理建模为马尔可夫决策过程,从多维度评估策略,纳入大语言模型规划器/审计器层,实验揭示效用与安全权衡及相关问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18613 2026-07-13 cs.CL cs.AI 新提交 73%

Are LLMs Ready to Assist Physicians? PhysAssistBench for Interactive Doctor-Patient-EHR Assistance

LLMs 是否已准备好辅助医生?PhysAssistBench:交互式医患-电子病历辅助基准

Tianming Du, Peijie Yu, Sihan Shang, Danli Shi, My Linh Nguyen, Shengbo Gao, Guangyuan Li, Yinghong Yu, Yan Jiang, Qianlong Zhao, Behzad Bozorgtabar, Shaoxiong Ji, Jiazhen Pan, Daniel Rueckert, Jiancheng Yang

机构 * Aalto University(阿尔托大学) Tencent(腾讯) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Hong Kong Polytechnic University(香港理工大学) Aarhus University(奥胡斯大学) Technical University of Munich(慕尼黑工业大学)

专题命中 Agent评测 :tool use(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出PhysAssistBench基准,通过构建交互式患者代理评估LLM在医患-EHR交互中的协调能力,发现当前模型不可靠,瓶颈在于多维度协调而非单一能力。

Comments 34 pages with 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07435 2026-07-09 cs.LG cs.AI 新提交 73%

RLVP: Penalize the Path, Reward the Outcome

RLVP:惩罚路径,奖励结果

Bojie Li, Noah Shi

机构 * Pine AI(松果人工智能公司) University of Washington(华盛顿大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 研究在现实世界中智能体在线学习面临的挑战,提出“惩罚路径,奖励结果”方法,能在几乎零违规情况下实现高任务成功率,并给出有效惩罚的设计规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05638 2026-07-08 cs.SE cs.AI 新提交 73%

EvalLoop: A Methodology for Evaluation-Driven Iterative Improvement of Business AI Systems

EvalLoop:一种用于商业人工智能系统评估驱动迭代改进的方法

Kenneth Benavides, Josh Fleischer, Danti Chen

机构 * Robert Half(罗伯特·哈夫公司)

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 研究针对商业AI系统评估忽视迭代改进价值的问题,提出EvalLoop方法,通过维度指标分组、故障模式分类和结构化迭代工作流程,实现评估驱动的迭代改进,经案例研究验证有效,还能助力模型选择与部署权衡,且被打包为可重用工件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27539 2026-06-29 cs.SI cs.AI cs.LG 新提交 73%

Benchmarking Multi-Modal Graph-based Social Media Popularity Prediction

基于多模态图的社交媒体流行度预测基准测试

Utkarsh Sahu, Zhisheng Qi, Li Zhu, Yizhao Yang, Jun Li, Ryan Rossi, Yu Wang

机构 * University of Oregon(俄勒冈大学) University of Georgia(佐治亚大学) Adobe Research(Adobe研究)

专题命中 Agent评测 :planning(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出统一的多模态图基准MMG-Pop和模型MMG-PopNet,联合建模文本、视觉、时间与社交交互信号,在Bluesky和Reddit数据集上验证了跨平台泛化与多模态贡献。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20474 2026-06-23 cs.LG cs.AI cs.PF 新提交 73%

UltraQuant: 4-bit KV Caching for Context-Heavy Agents

UltraQuant: 面向上下文密集型智能体的4位KV缓存

Inesh Chakrabarti, David Limpus, Aditi Ghai Rana, Bowen Bao, Spandan Tiwari, Thiago Crepaldi, Ashish Sirasao

机构 * Advanced Micro Devices(超威半导体) University of California, Los Angeles(加州大学洛杉矶分校) Purdue University(普渡大学)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对上下文密集型智能体场景,提出UltraQuant方法,通过4位KV缓存压缩、旋转量化和代码本量化,结合AMD GPU优化,在长上下文多轮任务中延迟降低3.47倍,吞吐量提升1.63倍。

Comments 11 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19595 2026-06-19 cs.LG cs.AI 新提交 73%

IHBench: Evaluating Post-Interruption Recovery in Voice Agents with Structured Workflows

IHBench:评估语音代理在结构化工作流中的中断后恢复能力

Ahmad Salimi, Wentao Ma, Yuzhi Tang, Dongming Shen, Mu Li, Alex Smola

机构 * Boson AI

专题命中 Agent评测 :agent(abstract);workflow(abstract);分类 cs.AI、cs.LG

AI总结 提出IHBench基准,评估语音代理在结构化工作流中处理中断后的恢复能力,涵盖任务完成和恢复质量两个维度,实验表明闭源模型比开源模型更鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17474 2026-06-17 cs.CL cs.AI 新提交 73%

AIPatient Arena: EHR-grounded evaluation of large language models in end-to-end clinical consultation workflows

AIPatient Arena:基于电子健康记录的大语言模型在端到端临床咨询工作流中的评估

Jiahui Niu, Huizi Yu, Wenkong Wang, Guangxin Dai, Jingxian He, Xiang Li, Zhiying Liang, Xinxin Lin, Kent CY So, Bryan YP Yan, Yun Kwok Wing, Yanqiu Xing, Xin Ma, Lizhou Fan

机构 * School of Control Science and Engineering, Shandong University(控制科学与工程学院,山东大学) Key Laboratory of Machine Intelligence and System Control, Shandong University(机器智能与系统控制重点实验室,山东大学) Department of Medicine and Therapeutics, The Chinese University of Hong Kong(医学与治疗学系,香港中文大学) Department of Geriatric Medicine, Qilu Hospital of Shandong University(老年医学科,山东大学齐鲁医院) Department of Psychiatry, The Chinese University of Hong Kong(精神病学系,香港中文大学) Li Chiu Kong Family Sleep Assessment Unit, Department of Psychiatry, Faculty of Medicine, The Chinese University of Hong Kong(李秋虹家庭睡眠评估单元,精神病学系,医学院,香港中文大学) Li Ka Shing Institute of Health Sciences, Faculty of Medicine, The Chinese University of Hong Kong(李嘉诚健康科学研究院,医学院,香港中文大学) Gerald Choa Neuroscience Institute, Department of Medicine and Therapeutics, The Chinese University of Hong Kong(Gerald Choa 神经科学研究所,医学与治疗学系,香港中文大学)

专题命中 Agent评测 :planning(abstract);workflow(abstract);分类 cs.AI、cs.CL

AI总结 提出AIPatient Arena框架,通过电子健康记录构建患者知识图谱,在多轮医患交互中评估大语言模型的八项临床能力,发现模型在信息覆盖、诊断推理等方面存在不足,强调过程评估的重要性。

Comments 49 pages, 12 figues, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15306 2026-06-16 cs.LG cs.AI 新提交 73%

LatentGym: A Testbed For Cross-Task Experiential Learning With Controllable Latent Structure

LatentGym: 具有可控潜在结构的跨任务经验学习测试平台

Daksh Mittal, Tommaso Castellani, Thomson Yen, Naimeng Ye, Fangyu Wu, Minghui Chen, Tiffany Cai, Emmanouil Koukoumidis, William Zeng, Hongseok Namkoong

机构 * Columbia University(哥伦比亚大学) Oumi Blog | Code | Models(Oumi博客 | 代码 | 模型)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.LG

AI总结 提出LatentGym测试平台,通过可控潜在变量分离探索与利用,研究LLM代理在跨任务序列中的适应性学习机制。

Comments 61 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11762 2026-06-11 cs.CL cs.AI 新提交 73%

Automated Creativity Evaluation of Language Models Across Open-Ended Tasks

语言模型在开放式任务中的自动化创造力评估

Min Sen Tan, Zachary Kit Chun Choy, Syed Ali Redha Alsagoff, Nadya Yuki Wangsajaya, Mohor Banerjee, Swaagat Bikash Saikia, Alvin Chan

机构 * Raffles Institution(莱佛士书院) College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院) Lee Kong Chian School of Medicine, Nanyang Technological University(南洋理工大学李光前医学院) Centre of AI in Medicine (C-AIM), Nanyang Technological University(南洋理工大学人工智能医学中心)

专题命中 Agent评测 :agent(abstract);multi-agent(abstract);分类 cs.AI、cs.CL

AI总结 提出一种领域无关的自动化框架,通过语义熵和检索式多智能体评估,量化LLM在开放式任务中的发散与收敛创造力,并在问题解决、研究构思和创意写作三个领域验证其有效性。

Comments Accepted to ACL 2026 (Main Conference). 35 pages, 16 figures. Code: https://github.com/tanminsen/creativity-eval

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11070 2026-06-10 cs.CL cs.AI 新提交 73%

T1-Bench: Benchmarking Multi-Scenario Agents in Real-World Domains

T1-Bench:真实世界领域中的多场景智能体基准测试

Genta Indra Winata, Amartya Chakraborty, Yuzhen Lin, Swasthi P Rao, Shikhhar Siingh, Houhan Lu, Nadia Bathaee, Sriharsha Hatwar, Paresh Dashore, Anmol Jain, Kshitij Tayal, Xiuzhu Lin, Anirban Das, Sambit Sahu, Shi-Xiong Zhang

机构 * Capital One(第一资本)

专题命中 Agent评测 :agent(abstract);agentic(abstract);分类 cs.AI、cs.CL

AI总结 提出T1-Bench,一个高保真、全面的基准,用于评估多领域真实客户场景中的智能体系统,通过交织的多轮交互任务提升复杂性和评估严谨性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24010 2026-07-28 cs.LG 新提交 72%

When Should Active RAG Retrieve? A Budget-Aware Evaluation of Utility, Calibration, and Cost

主动检索生成式人工智能何时应进行检索?效用、校准和成本的预算感知评估

Pin Qian, Su Wang, Chong Peng, Junxian You, Lifei Liu, Haoran Yu, Yihang Chen, Xiaochong Jiang

机构 * Carnegie Mellon University(卡内基梅隆大学) University of Glasgow(格拉斯哥大学) Georgia Institute of Technology(佐治亚理工学院)

专题命中 Agent评测 :agentic(abstract,abstract_cn);分类 cs.LG

AI总结 研究主动检索生成式人工智能何时检索,通过将其重述为效用估计进行预算感知评估,并分离出相关三个问题,利用多种方法实现,在多数据集和模型中验证,强调评估应报告多方面指标。

Comments Accepted at the ACM SIGKDD KDD 2026 Workshop on Evaluation and Trustworthiness of Agentic AI; 7 pages, 1 figure, and 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23975 2026-07-28 cs.AI q-bio.QM 新提交 72%

Plato-Bio: verification-first biological novelty screening with temporal rediscovery and structural benchmarks

柏拉图生物:通过时间再发现和结构基准进行验证优先的生物新奇性筛选

Stefan G. Creadore

机构 * Praxa Labs(普拉克斯实验室)

专题命中 Agent评测 :agent(abstract,comments);workflow(abstract);分类 cs.AI

AI总结 研究开发柏拉图生物,扩展开放架构并结合多种功能,修复评估缺陷。通过Python套件等验证其有效性,评估两个用例,如历史再发现任务及蛋白质结构比较,提供可重复软件契约和筛选基准,为生物研究提供支持。

Comments 16 pages, 6 figures, 3 tables. Companion code and data: https://github.com/Eldergenix/Plato-Scientific-Research-Autonomous-Agent. This fork-specific validation study cites, but does not duplicate, arXiv:2510.26887

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11672 2026-06-11 cs.CR cs.AI 新提交 72%

Can Open-Source LLM Agents Replace Static Application Security Testing Tools? An Empirical Assessment

开源LLM代理能否取代静态应用安全测试工具?一项实证评估

Derek Yohn, Luke Flancher, Mirajul Islam, Khaled Slhoub

机构 * College of Engineering and Science, Florida Institute of Technology(工程学院与科学学院,佛罗里达理工学院)

专题命中 Agent评测 :agentic(abstract,comments);agent(abstract);分类 cs.AI

AI总结 评估基于开源LLM的代理在静态应用安全测试中的性能,与SAST工具Bandit对比,发现当前不适合实际应用。

Comments Keywords: Agentic AI, Cybersecurity, Large Language Models, Static Application Security Testing, Model performance evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17142 2026-08-19 eess.SY cs.SY 新提交 71%

A Hybrid Discrete-Event and Agent-Based Simulation Approach to Model Circular Supply Chains in Healthcare: A Case Study of Laparoscopic Scissors

用于建模医疗领域循环供应链的混合离散事件与基于智能体的仿真方法:以腹腔镜剪刀为例

Mohd Shoaib, Antuela Tako, Shahin Rahimifard

专题命中 Agent评测 :agent(title)

AI总结 本文以腹腔镜剪刀供应链为案例,采用混合离散事件与基于智能体的仿真方法,评估医疗领域引入循环医疗器械设计的影响,为医院提供最优库存策略,指出采用循环产品可降低环境影响但需大量前期投资。

详情

展开后加载摘要…

URL PDF HTML 收藏