arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2606.17541 2026-06-17 cs.LG cs.AI 新提交 62%

Offline Preference-Based Trajectory Evaluation

基于偏好的离线轨迹评估

Fernando Diaz

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.LG

AI总结 针对离线评估中仅使用终端成功率导致统计效率低下的问题,提出基于偏好的轨迹评估方法,通过比较轨迹的时间偏好减少平局,提升区分能力、排名稳定性和数据效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17362 2026-06-17 cs.CV cs.AI cs.LG cs.RO 新提交 62%

DriveJudge: Rethinking Autonomous Driving Evaluation with Vision-Language Models

DriveJudge: 用视觉-语言模型重新思考自动驾驶评估

Xinglong Sun, Kevin Xie, Jenny Schmalfuss, Despoina Paschalidou, Xiuming Zhang, Sanja Fidler, Kashyap Chitta, Jose M. Alvarez

机构 * NVIDIA(英伟达)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出DriveJudge,结合规则评估与VLM推理,通过选择性调用物理规则函数实现可解释且上下文感知的驾驶评估,在驾驶质量分类和轨迹偏好选择任务上超越现有方法。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17107 2026-06-17 cs.LG cs.AI 新提交 62%

Models Take Notes at Prefill: KV Cache Can Be Editable and Composable

模型在预填充阶段记笔记:KV缓存可编辑且可组合

Bojie Li

机构 * Pine AI

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究发现KV缓存像笔记一样存储结论,支持编辑和组合:编辑单个字段可修正决策(8B模型准确率1.00,仅需~1%计算),组合预编译技能可无缝插入任意上下文(logit余弦相似度0.90-0.999),延迟降低至O(L)。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16748 2026-06-16 cs.LG cs.CL 新提交 62%

MyPCBench: A Benchmark for Personally Intelligent Computer-Use Agents

MyPCBench: 个人智能计算机使用代理的基准测试

Lawrence Keunho Jang, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出MyPCBench基准,在模拟真实桌面环境(含17个Web应用)中测试个人计算机使用代理,发现最佳模型Claude Opus 4.6仅解决55.4%任务,失败集中在多应用和长轨迹任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16432 2026-06-16 cs.CL cs.AI 新提交 62%

ACCORD: Action-Conditioned Contextual Grounding for Language Agents

ACCORD: 面向语言智能体的动作条件上下文接地

Lai Jiang, Cheng Qian, Zhenhailong Wang, Pan Lu, Heng Ji, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对用户指令常因隐含环境假设而欠指定,导致LLM智能体执行失败的问题,提出ACCORD框架,在每次动作前主动探测缺失信息并整合轨迹上下文,无需额外训练,在AppWorld和AlfWorld上显著提升任务完成率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16262 2026-06-16 cs.SE cs.AI 新提交 62%

UXBench: Measuring the Actionability of LLM-Generated UX Critiques

UXBench: 衡量LLM生成的UX评论的可操作性

Wenjie Wang, Yue Huang, Zipeng Ling, Han Bao, Hang hua, Xiaonan Luo, Yu Jiang, Shiyi Du, Yuexing Hao, Xiaomin Li, Yuchen Ma, Dianzhuo Wang, Yanfang Ye, Xiangliang Zhang

机构 * University of Notre Dame(诺丁汉大学) University of Pennsylvania(宾夕法尼亚大学) University of Rochester(罗切斯特大学) Carnegie Mellon University(卡内基梅隆大学) Massachusetts Institute of Technology(麻省理工学院) Harvard University(哈佛大学) LMU Munich(慕尼黑路德维希-马克西米利安大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 提出UXBench基准,通过下游修复代理能否基于评论改进界面来评估LLM作为UX评判者的可操作性,发现不同模型在报告可操作性、修复特征和可靠性上存在显著差异。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12386 2026-06-11 cs.LG cs.AI 新提交 62%

ATLAS: Active Theory Learning for Automated Science

ATLAS: 自动化科学的主动理论学习

Noémi Éltető, Nathaniel D. Daw, Kimberly L. Stachenfeld, Kevin J. Miller

机构 * Google DeepMind(谷歌DeepMind) Princeton University(普林斯顿大学) Columbia University(哥伦比亚大学) University College London(伦敦大学学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出ATLAS框架,通过主动学习迭代生成稀疏神经网络假设并设计最优区分实验,在bandit任务中恢复强化学习智能体,相比随机实验采样效率提升5-10倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11045 2026-06-10 cs.AI cs.LG 新提交 62%

What Fits (Into Few Tokens) Doesn't Overfit: Compression and Generalization in ML Research Agents

什么适合(少量标记)就不会过拟合:ML研究智能体中的压缩与泛化

Martin Andres Bertran, Aaron Roth, Zhiwei Steven Wu

机构 * Amazon Responsible AI(亚马逊负责任人工智能) University of Pennsylvania(宾夕法尼亚大学) Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 研究LLM驱动的科研智能体在输出和输入压缩下能否保持性能,发现短提示和可压缩反馈足以复现高性能模型,支持成功策略位于低复杂度区域的假设。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11007 2026-06-10 cs.CR cs.AI cs.SE 新提交 62%

Understanding and mitigating the risks of OpenClaw for non-technical users: A practical guide with Skill

理解并减轻非技术用户使用OpenClaw的风险:一份实用指南与Skill

Junchang Zheng, Junfeng Tan, Jialiang Lin

机构 * School of Computer Science and Engineering, Guangzhou Institute of Science and Technology, Guangzhou, China(计算机科学与工程学院,广州科学与技术研究院,中国广州) Science and Education Evaluation Lab, Guangzhou Institute of Science and Technology, Guangzhou, China(科学与教育评估实验室,广州科学与技术研究院,中国广州)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 针对非技术用户,识别OpenClaw的七类核心风险,用通俗语言解释,提供可操作的防御策略,并开发自动化安全配置的Skill,降低使用门槛。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09764 2026-06-09 cs.LG cs.CL 新提交 62%

iOSWorld: A Benchmark for Personally Intelligent Phone Agents

iOSWorld:个人智能手机代理的基准测试

Lawrence Keunho Jang, Mareks Woodside, Geronimo Carom, Andrew Keunwoo Jang, Jing Yu Koh, Ruslan Salakhutdinov

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 提出首个基于持久用户身份的交互式原生iOS模拟器基准iOSWorld,包含26个新应用和133个任务,评估代理在单应用、多应用及记忆个性化任务上的表现,最佳配置整体准确率52%,多应用任务仅37%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08938 2026-06-09 cs.CL cs.AI 新提交 62%

PACT: Learning Diverse Diagnostic Strategies via Privileged Synthesis and Branch Consensus

PACT: 通过特权合成与分支共识学习多样化诊断策略

Gen Li, Yuanze Hu, Zhichao Yang, Qingchen Yu, Jianwei Lv, Yue Guo, Yujing Liu, Faguo Wu, Hongwei Zheng, Xiandong Li, Bo Yuan, Yifan Sun, Zhaoxin Fan

机构 * Beihang University(北京航空航天大学) Baidu(百度) ByteDance(字节跳动) Beijing Academy of Blockchain and Edge Computing(北京区块链与边缘计算研究院) Renmin University of China(中国人民大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 提出PACT框架,通过特权合成对话数据和多分支共识训练,使LLM同时学习多种诊断推理范式,在中文医疗诊断基准上取得最优性能。

Comments 16 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08369 2026-06-09 cs.LG cs.AI 新提交 62%

An Information-Theoretic Definition for Open-Ended Learning

开放学习的信息论定义

Wanqiao Xu, Yifan Zhu, Benjamin Van Roy

机构 * Stanford University(斯坦福大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 提出基于比特等价的信息论定义开放环境,证明经典赌博机非开放,设计算法实现开放学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08081 2026-06-09 cs.CL cs.AI 新提交 62%

Aligned but Not Partner-Specific: Distinguishing How Multimodal LLM Agents Succeed in Reference Games Without Human-Like Conventions

对齐但非伙伴特定:区分多模态LLM智能体在参考游戏中如何成功而无需类人惯例

Po-Ya Angela Wang, Chinmaya Mishra, Aslı Özyürek, Paula Rubio-Fernández, Esam Ghaleb

机构 * National Taiwan University(国立台湾大学) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理语言学研究所) Radboud University(拉德堡德大学) Institut Jean Nicod(让·尼科研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 通过约束伪对基线方法,区分多模态LLM智能体在参考游戏中的标签对齐是源于伙伴特定交互还是共享任务词汇,发现智能体通过冗长描述而非压缩表达实现协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07853 2026-06-09 cs.CL cs.AI 新提交 62%

Beyond English benchmarks: clinical llm evaluation in Brazilian Portuguese

超越英语基准:巴西葡萄牙语临床大语言模型评估

Giordano de Pinho Souza, Glaucia Melo, Josefino Cabral Melo Lima, Daniel Schneider

机构 * Federal University of Rio de Janeiro(里约热内卢联邦大学) Toronto Metropolitan University(多伦多都会大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 提出首个双语临床基准ClinicalBr,基于巴西病例报告构建,评估四个模型发现葡萄牙语-英语性能差距具有任务依赖性,诊断检索英语优势明显,其他任务差距消失。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07017 2026-06-08 cs.AI cs.CL cs.ET 新提交 62%

The Sim-to-Real Gap of Foundation Model Agents: A Unified MDP Perspective

基础模型智能体的仿真到现实差距:统一MDP视角

Xiaoou Liu, Tiejin Chen, Weibo Li, Xiyang Hu, Hua Wei

机构 * Arizona State University(亚利桑那州立大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本文提出将基础模型智能体的评估与训练差距形式化为经典仿真到现实问题,围绕MDP四要素(观测、动作、转移、奖励)构建统一框架,并倡导采用域随机化等成熟解决方案。

Comments 7 pages, 2 figures, 2 tables. Accepted by KDD 2026 Blue Sky Ideas Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18104 2026-08-20 cs.AI 新提交 61%

Self-Evolving Agents as Dynamic Graph Transformation: A Survey and New Perspective

自进化智能体作为动态图变换:一项综述与新视角

Yuanyuan Xu, Wenjie Zhang, Yin Chen, Xuemin Lin, Ying Zhang

机构 * School of Computer Science and Engineering, The University of New South Wales(新南威尔士大学计算机科学与工程学院) Faculty of Engineering and Information Technology, University of Technology Sydney(悉尼科技大学工程与信息技术学院) School of Data Science, The Chinese University of Hong Kong-Shenzhen(香港中文大学(深圳)数据科学学院) Zhejiang Gongshang University(浙江工商大学)

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI

AI总结 本综述将自进化智能体建模为动态图变换,梳理相关动态图方法分类,提出动态图学习作为智能体可复用基础设施,探讨图感知评估协议,为自进化智能体设计治理提供结构性视角。

Comments Project: https://github.com/LuckyGirl-XU/Awesome-Agent-Dynamic-Graphs.git

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16813 2026-08-18 cs.AI cs.DB 新提交 61%

Quipu: A Governed Bitemporal Knowledge Graph Store

Quipu:一种受管控的双时态知识图存储系统

Steve Brown

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI

AI总结 研究针对智能体知识图存储的四项默认规则缺陷,提出受管控双时态知识图存储系统Quipu,经Census、DEMM-Bench等基准测试,其在缺陷检测、裁决准确性、管控问题回答等方面表现优于基线。

Comments 15 pages, 2 figures, 4 tables. Subtitle: "Start strict: rethinking knowledge-graph defaults for agent-written knowledge". Source and the benchmark/census/ artifacts behind every reported number are archived at doi:10.5281/zenodo.21878428 (concept DOI, resolves to newest release). Development repository: github.com/scbrown/quipu

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21635 2026-07-27 cs.LG 新提交 61%

Toward User-Conditioned Evaluation of Personal LLM Agents under Temporal Interventions

面向时间干预下个人语言模型代理的用户条件评估

Pin Qian, Su Wang, Yihang Chen, Qiaolin Yu, Xiaoyuan Wang, Zhitong Guo, Zhicheng Wang, Junxian You

机构 * Carnegie Mellon University(卡内基梅隆大学) Georgia Institute of Technology(佐治亚理工学院) Cornell University(康奈尔大学) University of Glasgow(格拉斯哥大学)

专题命中 Agent评测 :agent(abstract);分类 cs.LG;agentic(comments)

AI总结 研究个人语言模型代理在时间干预下的用户条件评估,提出需在不同用户条件状态下重放时间干预并测量故障传播的协议,形式化四个条件,审查发现无满足条件的公开协议,进而提出最小基准设计和候选报告指标。

Comments 9 pages, 2 figures, and 8 tables. Accepted for oral presentation at the ACM SIGKDD KDD 2026 Workshop on Personal Intelligence in the Agentic AI Era (PILA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18242 2026-07-22 cs.AI cs.MA cs.NI 新提交 61%

AI Tool Discovery at Scale: All You Need is DNS

大规模人工智能工具发现:你所需要的只是DNS

Enhao Chen, Yulin Shao

机构 * The University of Hong Kong(香港大学)

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI;agent(comments)

AI总结 针对自主人工智能代理时代工具发现难题,提出ToolDNS框架,通过嵌入意图和信任将语义搜索转为轻量级名称解析,引入三项增强。经大规模基准测试验证,其在减少搜索空间和降低延迟方面效果显著,证明可通过利用现有基础设施实现可扩展的AI互操作性。

Comments keywords: AI tool discovery, ToolDNS, Agent, DNS

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21310 2026-08-24 cs.SE 新提交 57%

Beyond Fault Localization: A Trajectory-Level Study of LLM Agents for Microservice Root Cause Analysis

超越故障定位:面向微服务根本原因分析的大语言模型智能体的轨迹级研究

Qisheng Lu, Aoyang Fang, Junjielong Xu, Jin'ao Shang, Songhan Zhang, Yifan Yang, Xiaochuan Yan, Pinjia He

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究针对微服务根本原因分析,提出轨迹级评估框架,发现智能体答案正确性与诊断质量脱节,构建DiagGuard架构提升了RCA的Acc@1指标,为自动化RCA改进提供指导。

Comments 13 pages, 7 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21075 2026-08-24 cs.SD cs.LG 新提交 57%

AudioWorldSim: Realistic Binaural Audio Datasets For World Models

AudioWorldSim:用于世界模型的真实双耳音频数据集

Luis Vitor Zerkowski, Luiz Velho

机构 * VISGRAF IMPA(巴西纯数学与应用数学国家研究所)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究提出开源平台AudioWorldSim,作为SoundSpaces 2.0的自定义扩展,用于生成真实双耳音频数据集,助力基于音频的机器学习尤其是世界模型研究,相关资源已公开以提升可重复性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20974 2026-08-24 cs.CV cs.AI 新提交 57%

WA-JEPA: Rethinking the Video JEPA Paradigm for World-Action Modeling in Autonomous Driving

WA-JEPA:重新思考面向自动驾驶中世界-动作建模的视频JEPA范式

Xinlin Wang, Yujiao Xiang, Yuheng Zhou, Jingqi Wang, Minqing Huang, Jiajie Huang, Dongxu Wei, Tingguang Zhou, Xiyang Wang, Gong Chen, Zhi Xu, Feiyang Tan, Hangning Zhou, Mu Yang

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 该研究针对V-JEPA不适用于自动驾驶规划的问题,提出WA-JEPA模型,采用混合未来掩码预训练与条件流匹配,在NAVSIM和HUGSIM基准上取得优于基线的规划性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20797 2026-08-24 cs.AI 新提交 57%

Automated Trajectory Evaluation for Mobile Agents via Step-Level Consequence Reasoning and Aggregation

基于步骤级结果推理与聚合的移动智能体自动轨迹评估

Pengshuai Yang, Zijing Gao, Xue Yu, Benhui Zhuang, Bo Yuan, Junlan Feng

机构 * Jiutian Research(九天研究院) China Mobile(中国移动)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究提出CRATE(含安全评估扩展版CRATE-S)这一VLM-as-judge框架,通过步骤级推理解决移动智能体轨迹评估的上下文过载与安全缺失问题,在AndroidWorld、MobileRisk数据集上取得优于现有方法的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20106 2026-08-21 cs.CL 新提交 57%

OenoBench: A Wine-Domain Benchmark for Knowledge-Grounded Evaluation of Large Language Models

OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准

Nikita Khudov

机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) StrategAI

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20024 2026-08-21 cs.LG 新提交 57%

Systematic Evaluation of TabPFN-TS for Zero-Shot Probabilistic Heat Load Forecasting in District Heating Networks

系统评估TabPFN-TS在区域供热网络零样本概率热负荷预测中的应用

Ben Spoek, Karim K. Ben Hicham, Kai Derzsi, Philipp Althaus, Alexander Mitsos, Dirk Müller

机构 * RWTH Aachen University(亚琛工业大学) Process Systems Engineering(过程系统工程) Chair of Energy Efficient Buildings Indoor Climate(节能建筑室内气候主席席位)

专题命中 Agent评测 :planning(abstract);分类 cs.LG

AI总结 本研究系统评估TabPFN-TS用于区域供热网络零样本概率热负荷预测,确定了最优配置,其性能接近Chronos-2且校准更好,相关发现推动了多分辨率残差校正预测器的开发。

Comments 33 pages, 10 figures; supplementary information included

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19564 2026-08-21 cs.CL 新提交 57%

Remember, Verify, or Ask? Cross-Family Evaluation of Memory Commitment in LLM Agents

记住、验证还是询问?大语言模型智能体中记忆承诺的跨家族评估

Baichuan Li, Junyi Yao, Zihao Zheng

机构 * Southern Methodist University(南卫理公会大学) Washington University in St. Louis(圣路易斯华盛顿大学)

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 本研究通过MCB数据集评估LLM智能体的记忆承诺,发现模型验证事实变化更可靠,策略提示可降低错误持久率,少样本提示能提升部分任务准确率,但澄清召回率仍较低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18836 2026-08-20 cs.AI 新提交 57%

Verifiable abstention makes AI leak diagnosis accountable in water distribution networks

可验证弃权使AI在供水管网泄漏诊断中具备可问责性

Tianwei Mu, Yue Wang, Mingzhe Yuan, Manhong Huang, Wenhong Wang, Xuerui Yin, Qing Luo, Min Xiao, Hui Yang, Jun Li, Dan Xue

机构 * School of Municipal Engineering and Environment, Shenyang Jianzhu University(沈阳建筑大学市政工程与环境学院) Guangzhou Institute of Industrial Intelligence(广州工业智能研究院) College of Environment, Shenyang University(沈阳大学环境学院) Shenyang Institute of Automation, Chinese Academy of Sciences(中国科学院沈阳自动化研究所) College of Environmental Science and Engineering, State Environmental Protection Engineering Center for Pollution Treatment and Control in Textile Industry, Donghua University(东华大学环境科学与工程学院(国家环境保护纺织污染防治工程技术中心)) School of Information Science and Engineering, Shenyang University of Technology(沈阳工业大学信息科学与工程学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究针对供水管网泄漏诊断中AI缺乏问责性的问题,提出结合执行器智能体、监督智能体与LLM审计员的可验证弃权决策方法,提升了决策精度与挖掘正确性,为自主水基础设施运营提供可行路径。

Comments 42 pages, 5 main figures, 1 main table, 2 extended data figures, 3 supplementary figures, 15 supplementary tables. Code and data availability described in the paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18719 2026-08-20 cs.AI 新提交 57%

Competence, Not Accuracy: A Diagnostic for Reference-Free Judge Gates in Skill Optimization

能力而非准确率:技能优化中无参考评判门的诊断方法

Chenle Chen, Yangbo Wei, Chao Yao, Shaoqiang Lu, Junhong Qian, Chen Wu, Lei He

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校) Shanghai Jiao Tong University(上海交通大学) Arizona State University(亚利桑那州立大学) Eastern Institute of Technology(东方理工学院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 该研究提出技能优化中无参考评判门的预部署诊断方法,发现评判器能力需超1/k才具可用性,其基准准确率高估关键能力,可预测门控错误。

Comments 9 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18672 2026-08-20 cs.RO cs.AI 新提交 57%

Orienteering Problem with Uncertain Time-Varying Rewards: Framework and Benchmark for Everyday Service Robotics

带不确定时变奖励的定向越野问题:面向日常服务机器人的框架与基准

Masafumi Endo, Kohei Honda, Yuu Jinnai, Ryo Yonetani

专题命中 Agent评测 :planning(abstract);分类 cs.AI

AI总结 针对日常服务机器人的带不确定时变奖励的定向越野问题,本文提出相关框架与基准,采用三种不同规划器并验证了长时域在线适应规划的有效性。

Comments 11 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18588 2026-08-20 cs.SE 新提交 57%

AppEval: A Unified Benchmark for LLM-Based Mobile Application Repair in ArkTS, Swift, and Kotlin

AppEval:面向基于大语言模型的ArkTS、Swift及Kotlin移动应用修复的统一基准

Bang Xie, Hao Liu, Zhenyu Shi, Yonghao Zhang, Senjian Zhang, Zhiyuan Peng, Xin Yin, Chenhao Ying, Yuan Luo, Wei Chen, Haiming Jin, Shaocong Long, Xu Liu, Zhe Peng

专题命中 Agent评测 :agent(abstract);分类 cs.SE

AI总结 本研究提出AppEval基准框架,评估基于大语言模型的移动应用修复智能体在ArkTS、Swift、Kotlin平台的表现,发现其性能因智能体而异,且运行时感知的接受标准对有意义的比较至关重要。

Comments 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏