arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 15756 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 15756 篇

2603.10876 2026-03-12 cs.CL cs.AI cs.DL cs.IR 62%

An Extreme Multi-label Text Classification (XMTC) Library Dataset: What if we took "Use of Practical AI in Digital Libraries" seriously?

极端多标签文本分类(XMTC)库数据集:如果我们认真对待‘在数字图书馆中使用实用人工智能’

Jennifer D'Souza, Sameer Sadruddin, Maximilian Kähler, Andrea Salfinger, Luca Zaccagna, Francesca Incitti, Lauro Snidaro, Osma Suominen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出了一种基于权威术语的多标签文本分类方法,通过发布双语目录记录和可机器操作的GND分类法,提升数字图书馆中人工智能的实用性与透明性。

Comments 9 pages, 5 figures. Accepted to appear in the Proceedings of the Fifteenth Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.08455 2026-03-10 cs.AI cs.LG 62%

The Boiling Frog Threshold: Criticality and Blindness in World Model-Based Anomaly Detection Under Gradual Drift

青蛙沸腾阈值:世界模型基于异常检测中的临界性与盲目性

Zhe Hong

机构 * National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了世界模型在异常检测中的临界阈值,发现检测阈值受噪声底座、检测器和环境动态的三重交互影响,且正弦漂移无法被检测到。

Comments 10 pages, 5 figures, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20152 2026-03-10 cs.CL cs.AI 62%

Goal Alignment in LLM-Based User Simulators for Conversational AI

基于对话AI的LLM用户模拟器中的目标对齐

Shuhaib Mehri, Xiaocheng Yang, Takyoung Kim, Gokhan Tur, Shikib Mehri, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出UGST框架,通过三阶段方法改进用户模拟器的目标对齐能力,并在两个基准测试中取得显著成效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07365 2026-03-10 cs.SD cs.AI cs.CL cs.MM eess.AS 62%

Multi-Domain Audio Question Answering Benchmark Toward Acoustic Content Reasoning

多领域音频问答基准:面向声音内容推理

Chao-Han Huck Yang, Sreyan Ghosh, Qing Wang, Jaeyeon Kim, Hengyi Hong, Sonal Kumar, Guirui Zhong, Zhifeng Kong, S Sakshi, Vaibhavi Lokegaonkar, Oriol Nieto, Ramani Duraiswami, Dinesh Manocha, Gunhee Kim, Jun Du, Rafael Valle, Bryan Catanzaro

机构 * NVIDIA University of Maryland, College Park(马里兰大学 College Park 分校) University of Science and Technology of China(中国科学技术大学) Seoul National University(首尔国立大学) Adobe

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 DCASE 2025挑战赛提出多领域音频问答基准,通过生物声学、时间声音景观和复杂问答子集测试音频-语言模型在多样声音场景中的交互式问答能力,推动音频理解和推理能力发展。

Comments Dataset: https://huggingface.co/datasets/PeacefulData/2025_DCASE_AudioQA_Official DCASE Task-5 challenge: dcase.community/challenge2025/task-audio-question-answering. Accepted to ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06671 2026-03-10 cs.LG cs.AI 62%

ERP-RiskBench: Leakage-Safe Ensemble Learning for Financial Risk

ERP-RiskBench: 用于金融风险的泄漏安全集成学习

Sanjay Mishra

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 ERP-RiskBench通过泄漏安全的集成学习方法,提升ERP系统中金融风险检测的准确性和可解释性。

Comments 12 pages, 11 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05764 2026-03-09 cs.LG cs.AI 62%

TML-Bench: Benchmark for Data Science Agents on Tabular ML Tasks

TML-Bench:用于表格机器学习任务的数据科学代理基准

Mykola Pinchuk

机构 * Independent Researcher(独立研究者)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 TML-Bench评估10个开源LLM在Kaggle竞赛中的表现,揭示不同时间预算下模型性能的差异及稳定性。

Comments 19 pages, 16 tables and figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22266 2026-03-09 cs.LG cs.AI 62%

LLMTM: Benchmarking and Optimizing LLMs for Temporal Motif Analysis in Dynamic Graphs

LLMTM:动态图中基于时间 motif 分析的 LLM 评估与优化

Bing Hao, Minglai Shao, Zengyi Wo, Yunlong Chu, Yuhang Liu, Ruijie Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出 LLMTM 基准测试,评估 LLM 在动态图时间 motif 分析中的性能,并开发结构感知调度器以优化效率与精度的平衡。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05293 2026-03-06 cs.LG cs.CL 62%

Knowledge Divergence and the Value of Debate for Scalable Oversight

知识分歧与辩论在可扩展监督中的价值

Robin Young

机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文通过几何方法分析辩论在可扩展监督中的价值,揭示了辩论与RLAIF之间的联系,并探讨了知识分歧对辩论效果的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01209 2026-03-06 cs.AI cs.LG 62%

Agents Learn Their Runtime: Interpreter Persistence as Training-Time Semantics

智能体学习其运行时:解释器持久性作为训练时语义

Victor May, Aaditya Salgarkar, Yishan Wang, Diganta Misra, Huu Nguyen

机构 * Ontocord Carnegie Mellon University(卡内基梅隆大学) MPI-IS Tübingen(图宾根MPI研究所) Tübingen AI Center(图宾根人工智能中心) ELLIS Institute Tübingen(图宾根ELLIS研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究探讨解释器持久性对智能体学习的影响,发现其影响解决方案达成方式而非能否达成,且训练与运行时对齐可提升效率。

Comments Code: https://github.com/mrcabbage972/agents-learn-runtime

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15163 2026-03-06 cs.CL cs.AI 62%

MCP-SafetyBench: A Benchmark for Safety Evaluation of Large Language Models with Real-World MCP Servers

MCP-SafetyBench:一种用于评估大型语言模型在真实MCP服务器安全性的大规模基准

Xuanjun Zong, Zhiqi Shen, Lei Wang, Yunshi Lan, Chao Yang

机构 * East China Normal University(东华师范大学) Salesforce AI Research(Salesforce人工智能研究) Singapore Management University(新加坡国立大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 MCP-SafetyBench通过真实MCP服务器评估大型语言模型的安全性,揭示了模型在面对MCP攻击时的脆弱性及安全与实用性的权衡问题。

Comments Our benchmark is available at https://github.com/xjzzzzzzzz/MCPSafety

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13900 2026-03-06 cs.CL cs.AI 62%

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00507 2026-03-06 cs.CL cs.AI 62%

Graph2Eval: Automatic Multimodal Task Generation for Agents via Knowledge Graphs

Graph2Eval: 通过知识图谱实现自动多模态任务生成

Yurun Chen, Xavier Hu, Yuhan Liu, Ziqi Wang, Zeyi Liao, Lin Chen, Feng Wei, Yuxi Qian, Bo Zheng, Keting Yin, Shengyu Zhang

机构 * Zhejiang University(浙江大学) Xiameng University(Xmeng大学) The Ohio State University(俄亥俄州立大学) Ant Group(蚂蚁集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Graph2Eval通过知识图谱生成多模态任务,提升智能体任务的语义一致性和可解性,提供新的评估视角。

Comments Accepted at CVPR 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03881 2026-03-05 cs.CR cs.AI cs.CL cs.CY cs.HC 62%

On the Suitability of LLM-Driven Agents for Dark Pattern Audits

关于LLM驱动代理在暗模式审计中的适用性

Chen Sun, Yash Vekaria, Rishab Nithyanand

机构 * University of Iowa(爱荷华大学) University of California, Davis(加州大学戴维斯分校)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文研究了LLM驱动代理在暗模式审计中的适用性,通过分析456个数据经纪人网站,评估了代理在识别和分类暗模式方面的性能及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10550 2026-03-05 cs.LG cs.AI cs.RO 62%

Memory, Benchmark & Robots: A Benchmark for Solving Complex Tasks with Reinforcement Learning

记忆、基准与机器人:一种用于通过强化学习解决复杂任务的基准

Egor Cherepanov, Nikita Kachaev, Alexey K. Kovalev, Aleksandr I. Panov

机构 * AXXX MIRIAI ITMO University(ITMO大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MIKASA基准,旨在通过强化学习解决复杂任务,包含32个记忆密集型任务,用于评估智能体在桌面机器人操作中的记忆能力。

Comments 57 pages, 29 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03484 2026-03-05 cs.LG cs.AI 62%

Optimal trajectory-guided stochastic co-optimization for e-fuel system design and real-time operation

最优轨迹引导的随机共优化用于e-燃料系统设计和实时运行

Jeongdong Kim, Minsu Kim, Jonggeol Na, Junghwan Kim

机构 * Department of Chemical Engineering(化学工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Chemical and Biomolecular Engineering(化学与生物分子工程系) Yonsei University(延世大学) Department of Chemical Engineering and Materials Science(化学工程与材料科学系) Ewha Womans University(成均馆大学) Institute for Multiscale Matter and Systems (IMMS)(多尺度物质与系统研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 MasCOR框架通过轨迹引导的随机共优化,实现e-燃料系统设计与实时运行的高效优化,适用于不同场景下的碳中性生产与成本控制。

Comments 29 pages, 6 figures. Supplementary Information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02983 2026-03-04 cs.CR cs.AI cs.CL 62%

Contextualized Privacy Defense for LLM Agents

上下文化隐私防御用于大语言模型代理

Yule Wen, Yanzhe Zhang, Jianxun Lian, Xiaoyuan Yi, Xing Xie, Diyi Yang

机构 * Tsinghua University(清华大学) Stanford University(斯坦福大学) Microsoft(微软)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出上下文化防御指导(CDI),通过强化学习优化框架,在大语言模型代理执行中主动塑造隐私保护与有用性之间的平衡。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02222 2026-03-04 cs.LG cs.AI 62%

MedCalc-Bench Doesn't Measure What You Think: A Benchmark Audit and the Case for Open-Book Evaluation

MedCalc-Bench 并未衡量你所想的:一项基准审计与开放书考试的案例

Artus Krohn-Grimberghe

机构 * MedCalc

专题命中 Agent评测 :tool-use(abstract);分类 cs.AI、cs.LG

AI总结 MedCalc-Bench的基准审计揭示其主要衡量公式记忆和算术精度,而非临床推理,通过开放书提示显著提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18560 2026-03-04 cs.SE cs.AI 62%

WebDevJudge: Evaluating (M)LLMs as Critiques for Web Development Quality

WebDevJudge: 评估 (M)LLMs 作为 Web 开发质量的批评者

Chunyang Li, Yilun Zheng, Xinting Huang, Tianqing Fang, Jiahao Xu, Lihui Chen, Yangqiu Song, Han Hu

机构 * Tencent AI Lab(腾讯AI实验室) The Hong Kong University of Science and Technology(香港科学与技术大学) Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 WebDevJudge 提出了一种评估 LLM 作为 Web 开发质量批评者的基准,揭示了 LLM 与人类专家之间的显著差距,指出了模型在功能等价性识别、任务可行性验证和偏见缓解方面的根本性限制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02119 2026-03-03 cs.AI cs.GT cs.LG 62%

Pencil Puzzle Bench: A Benchmark for Multi-Step Verifiable Reasoning

笔算谜题基准:多步骤可验证推理的基准

Justin Waugh

机构 * Approximate Labs

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 Pencil Puzzle Bench通过笔算谜题评估大语言模型的多步骤可验证推理能力,揭示推理努力和代理迭代能力的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13888 2026-03-03 cs.CL cs.AI 62%

Reliable Fine-Grained Evaluation of Natural Language Math Proofs

自然语言数学证明的可靠细粒度评估

Wenjie Ma, Andrei Cojocaru, Neel Kolhe, Bradley Louie, Robin Said Sharif, Haihan Zhang, Vincent Zhuang, Matei Zaharia, Sewon Min

机构 * UC Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind) Peking University(北京大学) Allen Institute for AI(人工智能研究院)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出ProofGrader,通过结合强推理模型、丰富上下文和简单集成方法,实现对LLM生成数学证明的细粒度评估,有效提升证明生成任务的可靠性。

Comments 40 pages, 7 figures, 15 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.24288 2026-03-02 cs.AI cs.CL 62%

DARE-bench: Evaluating Modeling and Instruction Fidelity of LLMs in Data Science

DARE-bench: 评估LLMs在数据科学中的建模和指令忠实度

Fan Shu, Yite Wang, Ruofan Wu, Boyi Liu, Zhewei Yao, Yuxiong He, Feng Yan

机构 * University of Houston(德克萨斯大学休斯顿分校) Snowflake AI Research(Snowflake人工智能研究院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.CL

AI总结 DARE-bench通过提供可验证的真实值任务和大规模训练数据,有效评估和提升LLMs在数据科学中的建模和指令忠实度。

Comments Published as a conference paper at ICLR 2026. 10 pages plus appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17582 2026-03-02 q-bio.QM cs.AI cs.LG cs.SY eess.SY q-bio.MN 62%

GenAI-Net: A Generative AI Framework for Automated Biomolecular Network Design

GenAI-Net: 一种用于自动化生物分子网络设计的生成AI框架

Maurice Filo, Nicolò Rossi, Zhou Fang, Mustafa Khammash

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 GenAI-Net是一种生成AI框架,用于自动化设计生物分子网络,通过结合代理和基于模拟的评估,实现从行为规范到可实现机制的转化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22697 2026-02-27 cs.CL cs.AI 62%

Reinforcing Real-world Service Agents: Balancing Utility and Cost in Task-oriented Dialogue

强化现实服务代理:在任务导向对话中平衡效用与成本

Ning Gao, Wei Zhang, Yuqin Dai, Ling Shi, Ziyin Wang, Yujie Wang, Wei He, Jinpeng Wang, Chaozheng Wang

机构 * Ning Gao Wei Zhang Yuqin Dai Ling Shi Ziyin Wang Yujie Wang Wei He Jinpeng Wang Chaozheng Wang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 InteractCS-RL通过多粒度强化学习框架,在任务导向对话中平衡效用与成本,通过用户驱动策略和成本感知优化提升代理性能。

Comments 35 pages, 8 tables, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22523 2026-02-27 cs.AI cs.CL q-bio.NC 62%

Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents

认知模型和AI算法为设计语言代理提供模板

Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths

机构 * Department of Computer Science, Princeton University(普林斯顿大学计算机科学系) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Zuckerman Mind Brain Behavior Institute(祖克曼心智大脑行为研究所) Department of Psychiatry, Columbia University(哥伦比亚大学精神医学系) Neuroscience Institute(神经科学研究所) Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系) Department of Psychology, Princeton University(普林斯顿大学心理学系)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出利用认知模型和AI算法设计语言代理的模板,旨在开发更有效且可解释的语言代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24796 2026-02-27 cs.LO cs.AI cs.FL cs.LG math.CT 62%

LeanCat: A Benchmark Suite for Formal Category Theory in Lean (Part I: 1-Categories)

LeanCat:Lean中的形式范畴论基准测试套件(第一部分:1-范畴)

Rongge Xu, Hui Dai, Yiming Fu, Jiedong Jiang, Tianjiao Nie, Junkai Wang, Holiverse Yang, Zhi-Hao Zhang

机构 * Yau Mathematical Sciences Center, Tsinghua University(清华大学尤洋数学科学中心) Iluvatar CoreX Department of Mathematics, Southern University of Science and Technology(南方科技大学数学系) Westlake Institute for Advanced Study, Westlake University(西湖研究学院) Qiuzhen College, Tsinghua University(清华大学齐臻学院) Department of Physics, The Chinese University of Hong Kong(香港中文大学物理系) Yanqi Lake Beijing Institute of Mathematical Sciences and Applications (BIMSA)(燕琦湖北京应用数学研究所(BIMSA))

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 LeanCat通过100个形式化范畴论任务测试模型的抽象能力,揭示了现有模型在组合泛化上的不足,提出LeanBridge通过迭代优化提升性能至24%。

Comments 22 pages, 9 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01780 2026-02-27 cs.AI cs.CL 62%

LiveMCPBench: Can Agents Navigate an Ocean of MCP Tools?

LiveMCPBench: 代理能否在MCP工具的海洋中导航?

Guozhao Mo, Wenliang Zhong, Jiawei Chen, Qianhao Yuan, Xuanang Chen, Yaojie Lu, Hongyu Lin, Ben He, Xianpei Han, Le Sun

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 LiveMCPBench通过大规模基准测试揭示MCP代理在检索和工具组合上的性能差距,强调检索错误是主要瓶颈,并提供可重复的评估框架和工具套件。

Comments Our code and data will be publicly available at https://icip-cas.github.io/LiveMCPBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10472 2026-02-26 cs.CL cs.AI 62%

FML-bench: Benchmarking Machine Learning Agents for Scientific Research

FML-bench: 用于科学研究的机器学习代理基准测试

Qiran Zou, Hou Hei Lam, Wenhao Zhao, Yiming Tang, Tingting Chen, Samson Yu, Tianyi Zhang, Chang Liu, Xiangyang Ji, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Tsinghua University, Beijing, China(清华大学) University of Minnesota, Minneapolis, MN, USA(明尼苏达大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 FML-bench 是一个用于评估机器学习代理在科学研究中能力的基准测试,包含8个基础任务并引入探索多样性指标,揭示探索策略对性能的影响。

Comments Our benchmark is available at: https://github.com/qrzou/FML-bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03411 2026-02-25 cs.SE cs.CL 62%

SWE-Master: Unleashing the Potential of Software Engineering Agents via Post-Training

SWE-Master:通过训练后技术释放软件工程代理的潜力

Huatong Song, Lisheng Huang, Shuang Sun, Jinhao Jiang, Ran Le, Daixuan Cheng, Guoxin Chen, Yiwen Hu, Zongchao Chen, Yiming Jia, Wayne Xin Zhao, Yang Song, Tao Zhang, Ji-Rong Wen

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.SE

AI总结 SWE-Master通过训练后技术提升软件工程代理能力,实现61.4%的解决率并优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 62%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19698 2026-02-25 cs.LG cs.AI cs.RO 62%

Performance Asymmetry in Model-Based Reinforcement Learning

基于模型的强化学习中的性能不对称性

Jing Yu Lim, Rushi Shah, Zarif Ikram, Samson Yu, Haozhe Ma, Tze-Yun Leong, Dianbo Liu

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) National University of Singapore(新加坡国立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本文提出JEDI世界模型,通过解决基于模型的强化学习中的性能不对称问题,在Human-Optimal任务和Breakout上取得最优成绩,同时提升计算效率。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏