arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 1239 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1239 篇

2608.21693 2026-08-25 cs.LG 新提交 57%

Benchmarking Composable Compression Techniques in Mixture-of-Experts LLMs

对混合专家大型语言模型中的可组合压缩技术进行基准测试

Afsara Benazir, Chen Chen, Rongxiao Qu, Jiabo Huang, Jingtao Li, Lingjuan Lyu

机构 * University of Virginia(弗吉尼亚大学) Sony AI(索尼人工智能)

专题命中 Agent评测 :workflow(abstract);分类 cs.LG

AI总结 本研究提出MoEXBench基准,系统评估混合专家LLM的可组合压缩技术,发现压缩方法间存在非平凡相互作用,为MoE模型部署提供实用的准确率-内存-延迟比较方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21374 2026-08-25 cs.AI 新提交 57%

LitReview Arena: Evaluating Literature Review Agents with Battle-Style Peer Review Platform

LitReview Arena:基于对战式同行评审平台的文献综述智能体评估

Ruotong Zhao, Zhiyu Chen, Xurui Liu, Haidong Xue, Dong Liang, Jigao Fu, Wu YanBiao, Yuanyi Zhen, Fengli Xu, Yong Li

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究推出对战式文献综述评估平台LitReview Arena,收集约3000条专家判断发现现有最强LLM综述系统仅23.0%胜率,校准后的评估器LitJudge将一致性提升至0.78。

Comments 20 pages, ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 57%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21075 2026-08-24 cs.SD cs.LG 新提交 57%

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

AudioWorldSim:用于世界模型的真实双耳音频数据集

Luis Vitor Zerkowski, Luiz Velho

机构 * VISGRAF IMPA(巴西纯数学与应用数学国家研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20974 2026-08-24 cs.CV cs.AI 新提交 57%

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

WA-JEPA:重新思考面向自动驾驶中世界-动作建模的视频JEPA范式

Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对V-JEPA不适用于自动驾驶规划的问题,提出WA-JEPA模型,采用混合未来掩码预训练与条件流匹配,在NAVSIM和HUGSIM基准上取得优于基线的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 57%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 57%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 57%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19564 2026-08-21 cs.CL 新提交 57%

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents

记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估

Baichuan Li, Junyi Yao, Zihao Zheng

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18836 2026-08-20 cs.AI 新提交 57%

Verifiable abstention makes AI leak diagnosis accountable in water distribution networks

可验证弃权使AI在供水管网泄漏诊断中具备可问责性

Tianwei Mu, Yue Wang, Mingzhe Yuan, Manhong Huang, Wenhong Wang, Xuerui Yin, Qing Luo, Min Xiao, Hui Yang, Jun Li, Dan Xue

机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) College of Environment, Shenyang University(沈阳大学环境学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。

Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18719 2026-08-20 cs.AI 新提交 57%

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

能力而非准确率:技能优化中无参考评判门的诊断方法

Chenle Chen, Yangbo Wei, Chao Yao, Shaoqiang Lu, Junhong Qian, Chen Wu, Lei He

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Arizona State University(亚利桑那州立大学) Eastern Institute of Technology(东方理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18672 2026-08-20 cs.RO cs.AI 新提交 57%

Orienteering Problem with Uncertain Time-Varying Rewards: Framework and Benchmark for Everyday Service Robotics

带不确定时变奖励的定向越野问题:面向日常服务机器人的框架与基准

Masafumi Endo, Kohei Honda, Yuu Jinnai, Ryo Yonetani

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 针对日常服务机器人的带不确定时变奖励的定向越野问题,本文提出相关框架与基准,采用三种不同规划器并验证了长时域在线适应规划的有效性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18588 2026-08-20 cs.SE 新提交 57%

AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin

AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准

Bang Xie, Hao Liu, Zhenyu Shi, Yonghao Zhang, Senjian Zhang, Zhiyuan Peng, Xin Yin, Chenhao Ying, Yuan Luo, Wei Chen, Haiming Jin, Shaocong Long, Xu Liu, Zhe Peng

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18085 2026-08-20 cs.CL 新提交 57%

Persona-Guided LLM Agents for Task-Oriented Dialogue

面向任务型对话的角色引导大语言模型智能体

Maryam Shoaeinaeini, Brent Harrison, A. B. Siddique

机构 * University of Kentucky(肯塔基大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究构建无需训练的框架,通过三种情境评估多模型在SGD数据集上的表现,发现适应用户人格存在权衡,Try情境的线索式适应可更可靠实现感知人格的任务型对话。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17800 2026-08-19 cs.AI 新提交 57%

StartupBench: Benchmarking General-Purpose Agents on Market-Validated End-to-End Workflows

StartupBench:基于市场验证的端到端工作流程的通用智能体基准测试

Liya Zhu, Xin Ma, Tao Liu, Haodong Wang, Ge Zhang, Jingzhe Ding, Qingshui Gu, Yongjie Zhong, Jinxiang Meng, Yuan Gao, Yunqiu Zhou, Hao Zhu, Jifeng He, Yongzhi Liao, Xinyi Zhang, Chaoxin Li, Yi Zhu, Xi Lin, Duju Zeng, Xiang Gao, Wen Zhang, Yunyang Wang, Duo Wang, Huan Zhou, Zuo Wang, Jin Chen, Kaiyuan Zhang, Chuqian Yu, Tianhao Yu, Longxiang Liu, Jianbo Xue, Huimin Che, Jiahao Wang, Yujia Qin, Jiaheng Liu, Shen Yan, Xiaolong Chang, Wenhao Huang

机构 * ByteDance Seed(字节跳动 Seed) Nanjing University(南京大学) M-A-P

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出StartupBench基准测试,基于市场验证的AI初创产品工作流程评估通用智能体,发现当前最强模型仅完成约30%任务,该基准可衡量智能体完成现实用户任务的进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17524 2026-08-19 cs.LG 新提交 57%

Evaluating RL Explainability Methods by How Much They Help Fix Bugs in Agents

通过可解释强化学习(XRL)方法对修复智能体Bug的帮助程度来评估XRL方法

Ram Rachum, Yotam Amitai, Bálint Gyevnár, Reuth Mirsky, Cameron Allen

机构 * University of California, Berkeley(加州大学伯克利分校) Tufts University(塔夫茨大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本文提出EvalXRL基准,通过大型语言模型编码智能体结合XRL方法诊断修复RL智能体故障的效果,实现对多种XRL方法的首次闭环直接对比评估。

Journal ref Proceedings of the Workshop on Explainable Artificial Intelligence (XAI) at IJCAI-ECAI 2026, Bremen, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17433 2026-08-19 cs.AI cs.MA 新提交 57%

Task-Aware Harness Provisioning for LLM Agents in Mission-Critical Infrastructure Operations

面向关键任务基础设施操作中LLM智能体的任务感知工具链配置

Liangtao Lin, Qingang Zhang, Zhaomeng Zhu, Tianwei Zhang, Yonggang Wen

机构 * Nanyang Technological University(南洋理工大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对LLM智能体的工具链配置问题,提出映射引导的升级算法,在液体冷却任务中提升了准确率并减少token使用,在电网任务中提供低成本替代方案,揭示工具链配置遵循领域依赖的帕累托前沿。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17271 2026-08-19 cs.AI 新提交 57%

ASI-Bench: At the Dawn of Artificial Superintelligence

ASI-Bench:人工智能超级智能的黎明

Junwei Zhou, Zhen Sun, Binyu Li, Jiangyu Zhou, Yuexi Pan, Hengyu Wang, Honghe Ren, Xiaohan Jia, Xueyang Zhou, Xiaoyu Cao, Yongchao Chen, Yuanning Feng, Junhao Wu, Cheng Zhang, Sijia Chen, Haoyu Xue, Chengsong You, Huan Wang, Koutian Wu, Peigan Gao, Jiakun Wu, Wenzhe Li, Ergan Shang, Qingyuan Zheng, Jingjing Zhou, Ruixuan Jia, Yan Xu, Hongrui Zhang, Xiao-Han Ma, Zhengxiang Cheng, Yuexing Hao, Liting Mai, Xianglin Ji, Wenjun Zhang, Zhuofan Chen, Yixiao Huang, Chi Wang, Wenyue Hua, Yilun Hao, Yuantao Zhai, Ziyan Zhao, Jingyan Xie

机构 * Tsinghua University(清华大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) Carnegie Mellon University(卡内基梅隆大学) University of Michigan(密歇根大学) University of Illinois Urbana–Champaign(伊利诺伊大学厄巴纳-香槟分校) Boston University(波士顿大学) University of Queensland(昆士兰大学) University of Science and Technology of China(中国科学技术大学) Flatiron Institute(弗拉蒂伦研究所) Microsoft Research(微软研究院) AG2 AI(AG2 AI公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 研究人员推出首个联合评估AI创新探索与自主科学执行能力的基准ASI-Bench,逐步减少人类方法指导测试AI自主科研能力,发现当前AI仍严重依赖人类指导,该基准面向全球开放邀请贡献。

Comments 16 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17167 2026-08-19 cs.IT cs.AI cs.SY eess.SY math.IT stat.ML 新提交 57%

Expected free energy as an information constraint on the Bethe Lagrangian

期望自由能作为Bethe拉格朗日量的信息约束

Wouter M. Kouw

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出受信息约束的Bethe拉格朗日量,可恢复主动推理的期望自由能解,经实验验证其在三个任务上的性能可与EFE和Q-MDP相媲美。

Comments 17 pages, 4 figures, table 2. International Workshop on Active Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16349 2026-08-18 cs.AI 新提交 57%

AeroCopilotBench: A Two-Tier Benchmark for Evaluating LLM Agents as Aviation Copilots in an Interactive Virtual Cockpit Environment

AeroCopilotBench:用于在交互式虚拟驾驶舱环境中评估作为航空副驾驶的大语言模型智能体的双层基准

Yuchen Yuan, Zhenghuang Wu, Yuangan Li, Liang Ma, Ke Li

机构 * School of Aeronautic Science and Engineering, Beihang University(北京航空航天大学航空科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出AeroCopilot操作环境与双层航空智能体评估基准,通过12个模型测试发现静态知识表现难转化为流程执行能力,为航空智能体评估提供可复现基础。

Comments 38 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16276 2026-08-18 cs.HC cs.CL 新提交 57%

PolyDebate: A Game-Orchestrated Multimodal System for Debate Skills Practice and Evaluation

PolyDebate:一种用于辩论技能练习与评估的游戏编排多模态系统

Jianing Yin, Weng Pan Kuan, Xiaoyun Liu, Zhiyuan Wen, Yuxuan Li, Milos Stojmenovic, Jiannong Cao

专题命中 Agent评测 :workflow(abstract);分类 cs.CL

AI总结 PolyDebate是一款游戏化多模态辩论练习评估系统,含Unity 3D游戏与网页版本,经四项研究验证,可结合AI对手、多模态评估与结构化反馈助力学习者提升辩论技能。

Comments 10 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15090 2026-08-18 cs.CV cs.LG 新提交 57%

Distribution-free false-alarm calibration and chance-corrected spatial evaluation for industrial anomaly detection

面向工业异常检测的无分布虚警校准与经机会校正的空间评估

Jie Deng

机构 * Tongji University(同济大学)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 该研究针对工业异常检测现有指标的缺陷,提出结合无分布上限容差阈值与配对减交叉空间检验的方法,在多数据集上验证了其有效性,支持同时报告工作点性能与经机会校正的空间证据。

Comments 15 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15008 2026-08-18 cs.CL 新提交 57%

Harness the Memory: A Holistic Evaluation of Memory Substrates in Memory Agents

利用记忆:记忆智能体中记忆载体的整体评估

Wei-Chieh Huang, Weizhi Zhang, Yuchen Wu, Yankai Chen, Eric Hanchen Jiang, Wooseong Yang, Yiwei Yang, Henry Peng Zou, Hanrong Zhang, Ying Nian Wu, Haolun Wu, Kai-Wei Chang, Philip S. Yu, Xue Liu, Aylin Caliskan

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Washington(华盛顿大学) McGill University(麦吉尔大学) MBZUAI(穆罕默德·本·扎耶德人工智能大学) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 该研究评估了记忆智能体的多种记忆载体,发现无通用最优载体,不同载体适配不同场景,为自适应智能体记忆系统设计提供了实证指导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14956 2026-08-18 cs.LG cs.LO 新提交 57%

LLM-based Framework for Generating and Verifying Parallel DEVS Statecharts

基于大语言模型的并行DEVS状态图生成与验证框架

Vamsi Krishna Vasa, Hessam S. Sarjoughian, Edward J. Yellig

机构 * Arizona State University(亚利桑那州立大学) Intel Corporation(英特尔公司)

专题命中 Agent评测 :agentic(abstract);分类 cs.LG

AI总结 本研究提出智能体式PDEVS-LLM框架,辅助建模人员生成验证PDEVS状态图,经评估该框架可显著提升生成状态图的逻辑一致性。

Comments 22 pages, 5 figures, 9 tables, 1 algorithm

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14903 2026-08-18 cs.AI 新提交 57%

Frontier AI Forecasting Has a Measurement Problem: An Audit of Progress Evidence

前沿AI预测存在测量问题:对进展证据的审计

Fabricio F Costa

机构 * AIx4All, LLC(AIx4All有限责任公司) HCLTech(HCLTech公司) Stanley Manne Children’s Research Institute(斯坦利·曼恩儿童研究所) Ann & Robert H. Lurie Children’s Hospital of Chicago(安与罗伯特·H·卢里芝加哥儿童医院) Northwestern University Feinberg School of Medicine(西北大学费恩伯格医学院)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 本文审计前沿AI预测的测量问题,构建含多类元素的冻结记录,发现训练计算量、METR horizon等关键数据缺失,基准更迭存在断点,来源高度集中,提出需明确版本化测量系统的预测主张。

Comments 16 pages, 6 figures, 1 table. Evidence cutoff: 12 August 2026. Ancillary code and data included. Preprint; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14642 2026-08-18 cs.LG 新提交 57%

Training and Evaluating Ethical Reinforcement Learning Agents on Per-Episode Distributions

基于每回合分布的伦理强化学习智能体训练与评估

Prabhjyot Singh, Majid Ghasemi, Mark Crowley

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 该研究针对强化学习智能体的伦理训练与评估问题,在Craftax基准上对比四种方法,发现ESR准则下的智能体可在每回合维持违规预算,且训练评估需关注每回合分布而非均值。

Comments 11 Pages, Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14641 2026-08-18 cs.AI 新提交 57%

Task- and Session-Level Model Routing: A Common-Interface Hybrid Evaluation of Four Open-Source Routers Across Four Benchmarks

任务与会话级模型路由:四个基准测试中四种开源路由的通用接口混合评估

Kiran N. Kumar, Santhosh K. Saminathan

机构 * Indiana University(印第安纳大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI

AI总结 该研究提出通用测量协议,在四个基准上混合评估四种开源路由,发现多数路由层级分配恒定,vLLM语义路由随提示变化但无最高成功率,需控制固定层级基线以评估路由。

Comments 34 pages, 25 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13684 2026-08-17 cs.AI 新提交 57%

Learning to Assemble Novel Structures with Unfamiliar Parts under Semantic Constraints

在语义约束下学习使用不熟悉部件组装新型结构

Jonghyuk Park, Alex Lascarides, Subramanian Ramamoorthy

机构 * School of Informatics, University of Edinburgh(爱丁堡大学信息学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出神经符号架构,在模拟玩具卡车组装领域,借助具身对话与任务演示,通过自然语言传递语义约束提升智能体在线适应的数据效率,解决部署后遇未知语义约束的组装问题。

Comments Accepted to, and to appear in the 20th Conference on Neurosymbolic Learning and Reasoning (NeSy 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13598 2026-08-17 cs.AI 新提交 57%

Measuring Cross-Task Behavioral Consistency in Language Model Agents

测量语言模型智能体的跨任务行为一致性

Amritesh Banerjee, Pranil Raichura

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Mantis AI Research(螳螂人工智能研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本文提出行为一致性指标(BCM),通过约9000条软件工程任务轨迹发现语言模型智能体的跨任务与任务内一致性是可分化的不同维度,且一致性与成功率无关,BCM可补充结果指标评估智能体。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13173 2026-08-14 cs.AI 新提交 57%

SkillShapley: Boundary-Adaptive Shapley Valuation for Skill Step Attribution in LLM Agents

SkillShapley:面向大语言模型智能体技能步骤归因的边界自适应夏普利值评估方法

Chang Liu, Yuqi Zhang, Yiman Zhong, Boyi Liu, Hengjun Wang, Shuyue Wei

机构 * Beihang University(北京航空航天大学) Shandong University(山东大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 SkillShapley是面向大语言模型智能体技能步骤归因的框架,将技能步骤归因建模为夏普利值估计问题,经SkillsBench实验可高效识别技能步骤价值,为智能体技能构建提供启示。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏