Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents
基准的基准:对话智能体的基准评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。
Comments 15 pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基准的基准:对话智能体的基准评估
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。
Comments 15 pages
基于图支架证据锚定的个性化深度研究查询优化
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。
Comments 13 pages, 4 figures
DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。
OSReward:为跨平台计算机使用奖励模型建立标准化评估
机构 * The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; University of Science and Technology of China(中国科学技术大学) ; National University of Singapore(新加坡国立大学) ; Fudan University(复旦大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究推出OSReward基准评估VLM评判者的可靠性,构建OS-Shepherd开源奖励模型缩小成本差距,为规模化可靠CUA奖励设计提供参考
Comments Work in progress
AgentMeter: 评估基于CLI的本地任务求解智能体的模型-CLI匹配
机构 * Computer Network Information Center, Chinese Academy of Sciences(中国科学院计算机网络信息中心) ; Hangzhou Institute for Advanced Study, Chinese Academy of Sciences(中国科学院杭州高等研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出AgentMeter基准,通过成功锚定、成本感知的AMS指标评估模型与CLI的匹配,发现模型和CLI选择不可解耦,需作为部署单元评估。
Comments 13 pages, 4 figures, 12 tables; includes supplementary material
FinPerMA:一种基于理论、事件驱动的LLM智能体个性化记忆基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究针对LLM智能体个性化记忆的现有基准不足,提出FinPerMA基准,在276个角色的2994个问题上测试7种LLM,发现其记忆配置远未饱和,简单检索优于专用记忆系统且冲击后差距扩大。
当输出分散时,认知修正会随之而来吗?面向机器集体的黑盒耦合诊断方法
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究提出黑盒耦合诊断方法,评估LLM集体输出分散度干预与认知立场修正的关联,发现不同模型的错误前提恢复效应存在显著差异,建议报告立场转变及保留前提率。
Comments Reviewed at Collective Intelligence 2026 (CI 2026) Conference. Revised version incorporating reviewer feedback
CompanionBench:一个基于理论、扎根于真实世界的AI情感陪伴基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 该研究推出基于理论与真实数据的交互式双语AI情感陪伴基准CompanionBench,评估28个智能体发现其能力差异,指出角色扮演智能体表现差、核心能力存弱点,将发布500对中英平行数据及评估代码。
Comments 33 pages, 6 figures, 19 tables, 13 appendices. Bilingual (Chinese/English) interactive benchmark; 28 evaluated agents
大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向
机构 * Hangzhou Normal University(杭州师范大学) ; Zhejiang University(浙江大学) ; China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) ; Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) ; The University of Melbourne(墨尔本大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。
Comments 39 pages, 7 figures, 22 tables
Journal ref Software: Practice and Experience, 2026
EduClaw-Bench:面向教学大型语言模型智能体的长周期基准测试集(含模拟学习者)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究人员推出EduClaw-Bench长周期基准测试集,结合模拟学习者评估LLM智能体辅导效果,发现辅导质量取决于基础模型与智能体适配器的结合,且多数组合无法维持全程良好辅导。
AgentStream:自进化大语言模型智能体在流式任务下的表现如何?
机构 * University of Chinese Academy of Sciences(中国科学院大学) ; Microsoft(微软公司) ; Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) ; Nanjing University(南京大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 本文提出AgentStream框架,评估三种流式场景下三种基础模型的五种自进化LLM智能体方法,发现自进化表现受场景、模型能力等影响,为方法选择提供指导。
Comments Code is available at https://github.com/Jasper-Yan/AgentStream
弃权作为一种动作会同时破坏奖励梯度和KL锚点:错误惩罚强化学习的崩溃规律与修复方案
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 该研究针对错误惩罚强化学习中弃权动作导致的奖励梯度与KL锚点同时失效的问题,提出通过训练强制置信度报告的结构性修复方案,实验验证了机制并提升了语言模型的相关性能。
Setoka:面向异构数据下个性化智能体分层用户理解的基准测试集
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究提出Setoka基准测试集,评估记忆增强型个性化智能体的分层用户理解能力,发现现有系统在需整合异构信息的任务中性能下降,推动相关记忆机制设计。
CLQT:用于LLM投资组合管理代理诊断评估的闭环、成本感知、策略一致性基准
机构 * Illinois Institute of Technology(伊利诺伊理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出CLQT基准,通过闭环交易环境诊断LLM代理的决策过程,而非仅排名收益,评估五个维度的能力。
Comments 56 pages, 15 figures, 15 tables
预算化组合多臂老虎机中基于Shapley值的 meritocratic 公平性框架
机构 * Indian Institute of Technology Ropar(印度理工学院罗帕尔)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出一种新的预算化组合多臂老虎机框架,通过扩展Shapley值到K-Shapley值,解决了全反馈环境下个体臂贡献的计算问题,并提出了K-SVFair-FBF算法,实现了公平性与效率的平衡。
PB²:基于偏好的强化学习中通过基于种群的方法进行偏好空间探索
机构 * Univ. Lille(里尔大学) ; Inria(法国国家信息与自动化技术研究院) ; CNRS(法国国家科学研究中心) ; Centrale Lille(里尔中央理工大学) ; UMR 9189-CRIStAL(9189号研究单元-CRIStAL)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本研究针对基于偏好的强化学习中偏好空间探索不足的问题,提出PB²方法,通过维持多样化智能体种群提升偏好探索能力,在复杂环境及教师误标注场景下性能更优。
ActionParty:生成视频游戏中的多主体动作绑定
机构 * Snap Research(Snap研究院) ; University of Oxford(牛津大学) ; University of Toronto(多伦多大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出ActionParty,一种可控制多主体的生成视频游戏世界模型,通过引入主体状态标记和空间偏置机制,提升动作关联准确性与身份一致性。
Comments ECCV 2026 - Project page: https://action-party.github.io/
Echoverse:用于大规模训练计算机使用智能体的深度演化环境
机构 * Microsoft Research(微软研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码
策略,而非收益:标准型博弈的行为嵌入
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。
相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解
机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Queen’s University Belfast(贝尔法斯特女王大学) ; Middlesex University London(伦敦密德萨斯大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。
谁来评估评估者?用于自我改进的语言模型代理的协同进化评估指标和技能
机构 * Amazon(亚马逊)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 研究自我进化智能体系统中评估指标缺失问题,提出指标可进化,通过“双棘轮”协同进化指标与技能循环,在多任务中保留提升效果,还阐述安全性源于锚定规则与外部审核,为无可靠自动验证器场景提供架构。
Comments Code: https://github.com/amazon-science/Self-Evolving-Agents-Double-Ratchet
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
Comments 21 pages, 7 figures, 7 tables
CogArena:大语言模型认知能力结构的多方法评估
专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.CL
AI总结 研究围绕多方法框架构建CogArena基准评估大语言模型认知能力结构,通过多模型实验,发现范式相关性多为正但组内优势不明显,冻结确认标准及复制均失败,未建立稳定五维分布,提供了结合多种要素的工作流程。
Comments 21 pages, 8 figures. Code and the procedurally generated battery: https://github.com/dengzhe-hou/CogArena
人工智能评估中随机对照试验的原则与指南
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG
AI总结 研究针对人工智能评估随机对照试验缺乏通用标准和共享词汇的问题,借鉴多学科实践综合五条原则,形成33条可操作指南,为其发挥设计工具、评估标准和标准制定蓝图的作用,提供评估标准、共享语言及指南。
Comments 33 pages, ICML 2026 (Workshop on Technical AI Governance Research) and Technical AI Safety Conference
评估强化学习智能体的模糊测试
机构 * College of Intelligence and Computing, Tianjin University(天津大学智能与计算学部)
专题命中 Agent评测 :agent(abstract);分类 cs.LG、cs.SE
AI总结 研究针对强化学习智能体模糊测试评估差异问题,通过在三种环境下统一配置对五种方法及随机测试进行基准测试,从多角度评估,揭示不同方法特点,表明模糊测试能提升智能体鲁棒性等,还给出可操作指导。
具有预算约束的在线公平分配
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究广义分配预算约束下离散公平分配的在线变体,确定有界密度扩展条件并获近似算法,研究资源增强及刻画保证改进,还开发学习增强框架,证明其性质及单独预测边际的不足。
用于海上监视中异构传感器选择的强化学习
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 针对异构海上传感器网络单船跟踪问题,提出信息增益引导的强化学习传感器选择框架,通过近端策略优化智能体选传感器,结合贝叶斯跟踪器估计船只状态,经模拟比较,该策略在单传感器激活下性能接近全传感且避免复杂计算。
Comments 5 pages, 4 figures, submitted to the IEEE MetroSea 2026 Conference: Special Session 13: Object Detection, Tracking, and Sensor Fusion for Maritime Situational Awareness
PeopleSearchBench: 一个多维度基准,用于评估人工智能驱动的人力搜索平台
机构 * LessieAI research team(LessieAI 研究团队)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文提出PeopleSearchBench,一个开源基准,评估四个人力搜索平台在119个真实查询中的表现,采用事实验证方法,提出Criterions-Grounded Verification,评估三个维度:相关性精度、有效覆盖和信息效用,Lessie在所有指标中表现最佳。
Comments 25 pages
线性合约的最优样本复杂度
机构 * Department of Statistics, University of Oxford, United Kingdom(英国牛津大学统计系) ; Department of Computer Science, Aarhus University, Denmark(丹麦奥胡斯大学计算机科学系)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 本文通过经验效用最大化算法,证明仅需 O(ln(1/δ)/ε²) 个样本即可实现最优线性合约的 ε-近似,并匹配下界,从而确立最优样本复杂度。
Loong:通过验证器大规模合成长思维链
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究针对将LLMs推理能力扩展到其他领域的挑战,提出Loong项目这一开源框架,由LoongBench和LoongEnv组成,通过它们形成强化学习的智能体-环境循环,经实验评估及对合成数据的分析,推动推理密集型领域发展。