Offline Preference-Based Trajectory Evaluation
基于偏好的离线轨迹评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对离线评估中仅使用终端成功率导致统计效率低下的问题,提出基于偏好的轨迹评估方法,通过比较轨迹的时间偏好减少平局,提升区分能力、排名稳定性和数据效率。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
基于偏好的离线轨迹评估
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG
AI总结 针对离线评估中仅使用终端成功率导致统计效率低下的问题,提出基于偏好的轨迹评估方法,通过比较轨迹的时间偏好减少平局,提升区分能力、排名稳定性和数据效率。
DriveJudge: 用视觉-语言模型重新思考自动驾驶评估
机构 * NVIDIA(英伟达)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。
Comments Under Review
模型在预填充阶段记笔记:KV缓存可编辑且可组合
机构 * Pine AI
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。
MyPCBench: 个人智能计算机使用代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 提出MyPCBench基准,在模拟真实桌面环境(含17个Web应用)中测试个人计算机使用代理,发现最佳模型Claude Opus 4.6仅解决55.4%任务,失败集中在多应用和长轨迹任务。
ACCORD: 面向语言智能体的动作条件上下文接地
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。
UXBench: 衡量LLM生成的UX评论的可操作性
机构 * University of Notre Dame(诺丁汉大学) ; University of Pennsylvania(宾夕法尼亚大学) ; University of Rochester(罗切斯特大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Massachusetts Institute of Technology(麻省理工学院) ; Harvard University(哈佛大学) ; LMU Munich(慕尼黑路德维希-马克西米利安大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。
Comments 30 pages
ATLAS: 自动化科学的主动理论学习
机构 * Google DeepMind(谷歌DeepMind) ; Princeton University(普林斯顿大学) ; Columbia University(哥伦比亚大学) ; University College London(伦敦大学学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出ATLAS框架,通过主动学习迭代生成稀疏神经网络假设并设计最优区分实验,在bandit任务中恢复强化学习智能体,相比随机实验采样效率提升5-10倍。
什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化
机构 * Amazon Responsible AI(亚马逊负责任人工智能) ; University of Pennsylvania(宾夕法尼亚大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。
理解并减轻非技术用户使用OpenClaw的风险:一份实用指南与Skill
机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology, Guangzhou, China(计算机科学与工程学院,广州科学与技术研究院,中国广州) ; Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology, Guangzhou, China(科学与教育评估实验室,广州科学与技术研究院,中国广州)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE
AI总结 针对非技术用户,识别OpenClaw的七类核心风险,用通俗语言解释,提供可操作的防御策略,并开发自动化安全配置的Skill,降低使用门槛。
Comments Work in progress
iOSWorld:个人智能手机代理的基准测试
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG
AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。
PACT: 通过特权合成与分支共识学习多样化诊断策略
机构 * Beihang University(北京航空航天大学) ; Baidu(百度) ; ByteDance(字节跳动) ; Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) ; Renmin University of China(中国人民大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 提出PACT框架,通过特权合成对话数据和多分支共识训练,使LLM同时学习多种诊断推理范式,在中文医疗诊断基准上取得最优性能。
Comments 16 pages, 5 figures, 5 tables
开放学习的信息论定义
机构 * Stanford University(斯坦福大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG
AI总结 提出基于比特等价的信息论定义开放环境,证明经典赌博机非开放,设计算法实现开放学习。
对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例
机构 * National Taiwan University(国立台湾大学) ; Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) ; Radboud University(拉德堡德大学) ; Institut Jean Nicod(让·尼科研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。
超越英语基准:巴西葡萄牙语临床大语言模型评估
机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学) ; Toronto Metropolitan University(多伦多都会大学)
专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL
AI总结 提出首个双语临床基准ClinicalBr,基于巴西病例报告构建,评估四个模型发现葡萄牙语-英语性能差距具有任务依赖性,诊断检索英语优势明显,其他任务差距消失。
基础模型智能体的仿真到现实差距:统一MDP视角
机构 * Arizona State University(亚利桑那州立大学)
专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL
AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。
Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track
自进化智能体作为动态图变换:一项综述与新视角
机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) ; Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) ; School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) ; Zhejiang Gongshang University(浙江工商大学)
专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI
AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。
Comments Project: https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git
Quipu:一种受管控的双时态知识图存储系统
专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI
AI总结 研究针对智能体知识图存储的四项默认规则缺陷,提出受管控双时态知识图存储系统Quipu,经Census、DEMM-Bench等基准测试,其在缺陷检测、裁决准确性、管控问题回答等方面表现优于基线。
Comments 15 pages, 2 figures, 4 tables. Subtitle: "Start strict: rethinking knowledge-graph defaults for agent-written knowledge". Source and the benchmark/census/ artifacts behind every reported number are archived at doi:10.5281/zenodo.21878428 (concept DOI, resolves to newest release). Development repository: github.com/scbrown/quipu
面向时间干预下个人语言模型代理的用户条件评估
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Georgia Institute of Technology(佐治亚理工学院) ; Cornell University(康奈尔大学) ; University of Glasgow(格拉斯哥大学)
专题命中 Agent评测 :agent(abstract);分类 cs.LG;agentic(comments)
AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。
Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)
大规模人工智能工具发现:你所需要的只是DNS
机构 * The University of Hong Kong(香港大学)
专题命中 Agent评测 :AI agent(abstract);分类 cs.AI;agent(comments)
AI总结 针对自主人工智能代理时代工具发现难题,提出ToolDNS框架,通过嵌入意图和信任将语义搜索转为轻量级名称解析,引入三项增强。经大规模基准测试验证,其在减少搜索空间和降低延迟方面效果显著,证明可通过利用现有基础设施实现可扩展的AI互操作性。
Comments keywords: AI tool discovery, ToolDNS, Agent, DNS
超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。
Comments 13 pages, 7 figures, 5 tables
AudioWorldSim:用于世界模型的真实双耳音频数据集
机构 * VISGRAF ; IMPA(巴西纯数学与应用数学国家研究所)
专题命中 Agent评测 :agent(abstract);分类 cs.LG
AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。
Comments 7 pages, 3 figures
WA-JEPA:重新思考面向自动驾驶中世界-动作建模的视频JEPA范式
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 该研究针对V-JEPA不适用于自动驾驶规划的问题,提出WA-JEPA模型,采用混合未来掩码预训练与条件流匹配,在NAVSIM和HUGSIM基准上取得优于基线的规划性能。
基于步骤级结果推理与聚合的移动智能体自动轨迹评估
机构 * Jiutian Research(九天研究院) ; China Mobile(中国移动)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。
OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准
机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) ; StrategAI
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。
系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用
机构 * RWTH Aachen University(亚琛工业大学) ; Process Systems Engineering(过程系统工程) ; Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)
专题命中 Agent评测 :planning(abstract);分类 cs.LG
AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。
Comments 33 pages, 10 figures; supplementary information included
记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估
机构 * Southern Methodist University(南卫理公会大学) ; Washington University in St. Louis(圣路易斯华盛顿大学)
专题命中 Agent评测 :agent(abstract);分类 cs.CL
AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。
可验证弃权使AI在供水管网泄漏诊断中具备可问责性
机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) ; Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) ; College of Environment, Shenyang University(沈阳大学环境学院) ; Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) ; College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) ; School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。
Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper
能力而非准确率:技能优化中无参考评判门的诊断方法
机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) ; Shanghai Jiao Tong University(上海交通大学) ; Arizona State University(亚利桑那州立大学) ; Eastern Institute of Technology(东方理工学院)
专题命中 Agent评测 :agent(abstract);分类 cs.AI
AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。
Comments 9 pages, 4 figures, 5 tables
带不确定时变奖励的定向越野问题:面向日常服务机器人的框架与基准
专题命中 Agent评测 :planning(abstract);分类 cs.AI
AI总结 针对日常服务机器人的带不确定时变奖励的定向越野问题,本文提出相关框架与基准,采用三种不同规划器并验证了长时域在线适应规划的有效性。
Comments 11 pages, 6 figures
AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准
专题命中 Agent评测 :agent(abstract);分类 cs.SE
AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。
Comments 9 pages, 2 figures, 5 tables