Persona-Guided LLM Agents for Task-Oriented Dialogue
面向任务型对话的角色引导大语言模型智能体
机构 * University of Kentucky(肯塔基大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究构建无需训练的框架,通过三种情境评估多模型在SGD数据集上的表现,发现适应用户人格存在权衡,Try情境的线索式适应可更可靠实现感知人格的任务型对话。
Comments 8 pages
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
面向任务型对话的角色引导大语言模型智能体
机构 * University of Kentucky(肯塔基大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究构建无需训练的框架,通过三种情境评估多模型在SGD数据集上的表现,发现适应用户人格存在权衡,Try情境的线索式适应可更可靠实现感知人格的任务型对话。
Comments 8 pages
StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试
机构 * ByteDance Seed(字节跳动 Seed) ; Nanjing University(南京大学) ; M-A-P
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。
通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法
机构 * University of California, Berkeley(加州大学伯克利分校) ; Tufts University(塔夫茨大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。
Journal ref Proceedings of the Workshop on Explainable Artificial Intelligence (XAI) at IJCAI-ECAI 2026, Bremen, Germany
面向关键任务基础设施操作中LLM智能体的任务感知工具链配置
机构 * Nanyang Technological University(南洋理工大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究针对LLM智能体的工具链配置问题,提出映射引导的升级算法,在液体冷却任务中提升了准确率并减少token使用,在电网任务中提供低成本替代方案,揭示工具链配置遵循领域依赖的帕累托前沿。
ASI-Bench:人工智能超级智能的黎明
机构 * Tsinghua University(清华大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学) ; Carnegie Mellon University(卡内基梅隆大学) ; University of Michigan(密歇根大学) ; University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Boston University(波士顿大学) ; University of Queensland(昆士兰大学) ; University of Science and Technology of China(中国科学技术大学) ; Flatiron Institute(弗拉蒂伦研究所) ; Microsoft Research(微软研究院) ; AG2 AI(AG2 AI公司)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。
Comments 16 pages, 5 figures, 2 tables
期望自由能作为Bethe拉格朗日量的信息约束
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出受信息约束的Bethe拉格朗日量,可恢复主动推理的期望自由能解,经实验验证其在三个任务上的性能可与EFE和Q-MDP相媲美。
Comments 17 pages, 4 figures, table 2. International Workshop on Active Inference
AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准
机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。
Comments 38 pages, 7 figures, 6 tables
PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统
专题命中 Agent评测 :workflow(abstract);分类 cs.CL
AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。
Comments 10 pages, 4 figures, 3 tables
面向工业异常检测的无分布虚警校准与经机会校正的空间评估
机构 * Tongji University(同济大学)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。
Comments 15 pages, 3 figures, 9 tables
利用记忆:记忆智能体中记忆载体的整体评估
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; University of Washington(华盛顿大学) ; McGill University(麦吉尔大学) ; MBZUAI(穆罕默德·本·扎耶德人工智能大学) ; University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 该研究评估了记忆智能体的多种记忆载体,发现无通用最优载体,不同载体适配不同场景,为自适应智能体记忆系统设计提供了实证指导。
基于大语言模型的并行DEVS状态图生成与验证框架
机构 * Arizona State University(亚利桑那州立大学) ; Intel Corporation(英特尔公司)
专题命中 Agent评测 :agentic(abstract);分类 cs.LG
AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。
Comments 22 pages, 5 figures, 9 tables, 1 algorithm
前沿AI预测存在测量问题:对进展证据的审计
机构 * AIx4All, LLC(AIx4All有限责任公司) ; HCLTech(HCLTech公司) ; Stanley Manne Children’s Research Institute(斯坦利·曼恩儿童研究所) ; Ann & Robert H. Lurie Children’s Hospital of Chicago(安与罗伯特·H·卢里芝加哥儿童医院) ; Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 本文审计前沿AI预测的测量问题,构建含多类元素的冻结记录,发现训练计算量、METR horizon等关键数据缺失,基准更迭存在断点,来源高度集中,提出需明确版本化测量系统的预测主张。
Comments 16 pages, 6 figures, 1 table. Evidence cutoff: 12 August 2026. Ancillary code and data included. Preprint; comments welcome
基于每回合分布的伦理强化学习智能体训练与评估
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 该研究针对强化学习智能体的伦理训练与评估问题,在Craftax基准上对比四种方法,发现ESR准则下的智能体可在每回合维持违规预算,且训练评估需关注每回合分布而非均值。
Comments 11 Pages, Under Review
任务与会话级模型路由:四个基准测试中四种开源路由的通用接口混合评估
机构 * Indiana University(印第安纳大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI
AI总结 该研究提出通用测量协议,在四个基准上混合评估四种开源路由,发现多数路由层级分配恒定,vLLM语义路由随提示变化但无最高成功率,需控制固定层级基线以评估路由。
Comments 34 pages, 25 tables
在语义约束下学习使用不熟悉部件组装新型结构
机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出神经符号架构,在模拟玩具卡车组装领域,借助具身对话与任务演示,通过自然语言传递语义约束提升智能体在线适应的数据效率,解决部署后遇未知语义约束的组装问题。
Comments Accepted to, and to appear in the 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)
测量语言模型智能体的跨任务行为一致性
机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) ; Mantis AI Research(螳螂人工智能研究院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本文提出行为一致性指标(BCM),通过约9000条软件工程任务轨迹发现语言模型智能体的跨任务与任务内一致性是可分化的不同维度,且一致性与成功率无关,BCM可补充结果指标评估智能体。
SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法
机构 * Beihang University(北京航空航天大学) ; Shandong University(山东大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。
Comments 15 pages, 4 figures
SkillEvo:基于多轮交互反馈的自更新进化梯度
机构 * Tencent Cloud Andon(腾讯云Andon) ; Zhejiang University(浙江大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 SkillEvo通过多轮用户模拟生成反馈、独立治理层修复退化,在6类云服务等数据集上,相比两种基线方法显著提升了智能体技能进化效果。
FlowLOB:基于流匹配的高效可控限价订单簿生成模型
机构 * Simudyne(思慕迪恩) ; King’s College London(伦敦国王学院)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本文提出FlowLOB,一种基于流匹配的LOB轨迹生成模型,经HKEX数据训练可泛化至未见过的交易品种,采样效率与可控性优于基准模型,且能零样本泛化。
Comments 8 pages, 3 figures, 2 tables
通过世界模型扩展自动研究智能体
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Amazon(亚马逊公司)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 针对自动研究智能体扩展时的训练瓶颈,提出WMRL方法,结合两种缓解措施提升收敛性,训练加速3-4倍且性能优于更大规模智能体,还可迁移至多类任务。
ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。
Comments Work in Progress
DCM 老虎机:面向多点击的多人信息非对称级联老虎机
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究将DCM老虎机扩展至多人信息非对称多点击场景,针对含非对称性的三种场景提供次线性悔恨保证,改进了单智能体结果,算法在非对称环境中表现良好,凸显反馈结构的关键作用。
Comments Accepted to the Asia Conference on Machine Learning and Computing (ACMLC 2026)
康威99-图的强制结构约简与可验证边界
机构 * Ashoka University(阿育王大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究通过自主AI智能体对康威99-图问题展开系统性可复现研究,完成强制结构约简、可验证边界等贡献,获最佳验证成果69.43%。
Comments This paper is accepted to the first Conference For AI Scientists (CAISc)
DashArena:面向交互式分析仪表板生成的大语言模型基准测试
专题命中 Agent评测 :workflow(abstract);分类 cs.AI
AI总结 研究人员推出首个交互式分析仪表板生成基准DashArena,含轨迹回放与VLM评判,提炼出DashJudge-8B,发现前沿模型仍存多类缺陷,交互评估可捕捉遗漏问题。
RLMOpt:基于递归语言模型的自适应提示优化器
机构 * Autonomize AI ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出基于递归语言模型(RLM)的自适应提示优化器RLMOpt,在四个基准上相比GEPA表现更优,效率更高且提示更小。
迈向AI对齐中的价值理论
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI
AI总结 本研究通过标注94篇AI价值对齐论文,发现多数未明确定义人类价值,转而依赖偏好,且采用合成数据等自动方法可能关闭价值践行路径,旨在明确该领域哲学承诺以丰富相关辩论。
Comments 15 pages, 2 figures
评估协议决定结果:在TwoRoom上独立复现LeWorldModel
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 本研究独立复现LeWorldModel在TwoRoom上的结果,发现评估协议(如目标偏移量)会显著影响性能,还揭示单步预测准确率无法预测长程规划成功、批量归一化层会夸大验证损失等关键结论。
Comments Independent reproduction of arXiv:2603.19312 - https://github.com/joyjeet-singh/tinylab
OpenPM:面向LLM投资组合管理智能体的可审计时点评估框架
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 OpenPM是面向LLM投资组合管理智能体的可审计时点评估框架,构建了分层分配器参考智能体,发现分析师质量比构造器选择更重要,换手率是主要成本驱动因素。
Comments 14 pages, 1 figure
DSLE:《黑暗之魂》Boss 遭遇战的学习环境
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究推出 DSLE 平台,将《黑暗之魂》22 场 Boss 战作为智能体基准,定义 DSLE-5 子集并评估多种智能体,发现多数方法难以击败多数 Boss,仅少数早期 Boss 可被击败。
Comments AAAI Conference on Artificial Intelligence and Interactive Digital Entertainment, 2026
ActBench:协作智能体行为安全的自演进基准
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出自演进行为安全基准ActBench,结合奖励引导束搜索与双证据验证机制,评估协作智能体风险,在24000条轨迹上测试15个LLM和6个开源智能体,发现模型间攻击成功率差异更大。
Comments Benchmark and Code is available https://github.com/zjuicsr/ActBench