arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 6955 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 1207 篇

2608.08220 2026-08-11 cs.AI 新提交 65%

Metanormative Theory for RL-Based Moral Agents

基于强化学习的道德智能体的元规范理论

Aleks Knoks, Marija Slavkovik

机构 * University of Luxembourg(卢森堡大学) University of Bergen(卑尔根大学)

专题命中 Agent评测 :agent(abstract,comments);分类 cs.AI;multi-agent(comments)

AI总结 本文针对强化学习(RL)道德智能体设计中哲学文献被边缘化的问题,提炼元规范理论的相关理念审视RL架构,以明确RL智能体道德行为的判定标准,为评估相关RL方法奠定基础。

Comments The 14th International Workshop on Engineering Multi-Agent Systems (EMAS 2026) held May 25-26, 2026 Co-located with AAMAS 2026 Paphos, Cyprus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21107 2026-08-24 cs.AI cs.SE 新提交 62%

Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20622 2026-08-24 cs.AI cs.SE 新提交 62%

Applying Anthropic Primitives at Large Enterprises: Harness Paradigm for Knowledge Work

在大型企业中应用Anthropic原语:知识工作的 harness 范式

George Juraj Salapa

机构 * G.S. s.r.o(G.S.有限责任公司) PwC Austria(普华永道奥地利公司)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 本文针对大型企业知识工作的代码维护痛点,提出基于 harness 范式的架构,通过统一核心、优化机制缩小研究发现与企业采用的治理差距。

Comments 21 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19073 2026-08-20 cs.AI cs.LG stat.ML 新提交 62%

Robust Risk Under Evolving Uncertainty: A Wasserstein Counterpart of the Entropic Value-at-Risk

演化不确定性下的鲁棒风险:熵值风险(Entropic Value-at-Risk)的Wasserstein对应

Deep Kumar Ganguly, Jan Křetínský

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对演化不确定性下的鲁棒风险问题,提出Wasserstein熵值风险,弥补熵值风险无法对冲名义模型认定不可能的灾难的缺陷,经数值验证其变分对偶性,并构造出随信念变化的闭式鲁棒动态规划算子。

Comments Best Paper Award at the 2nd Workshop on Safe AI at UAI (SafeAI@UAI 2026, non-archival), Amsterdam

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18351 2026-08-20 cs.CR cs.AI cs.LG cs.SY eess.SY 新提交 62%

Task-Conditioned Least-Privilege Learning for Executable Terminal and MCP Agents

面向可执行终端与MCP智能体的任务条件最小权限学习

Alexander Tu, Michael Tu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出任务条件最小权限学习框架,通过后训练优化4B参数模型的权限选择,使智能体超额权限错误率大幅降低,安全成功率显著提升,可作为工具使用智能体的额外控制层。

Comments This work has been submitted to the IEEE for possible publication. Copyright may be transferred without notice, after which this version may no longer be accessible

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17373 2026-08-19 cs.LG cs.AI 新提交 62%

Integrating Novelty and Surprise for Experience Prioritization and Exploration in Image-Based Reinforcement Learning

将新颖性与意外性结合用于基于图像的强化学习中的经验优先级排序与探索

Hoda Yamani, Henry Williams, Bruce A. MacDonald

机构 * University of Auckland(奥克兰大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出NSPER及扩展的NSPER+R,将新颖性与意外性结合,在DeepMind Control Suite任务上提升了基于图像的强化学习的训练效率与收敛速度。

Comments 9 pages, 4 figures. Published in International Journal of Computer and Systems Engineering, 2026. Code: https://github.com/UoA-CARES/NSPER

Journal ref International Journal of Computer and Systems Engineering, Vol. 20, No. 4, pp. 439-447, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14677 2026-08-18 eess.SP cs.AI cs.LG 新提交 62%

Offline Ambient-Controlled Latent Diffusion: Architecture, Telemetry, and On-Device Evaluation

离线环境光控制潜在扩散:架构、遥测与设备端评估

Lech Kalinowski, Artur Morys-Magiera, Piotr Miłkowski

专题命中 Agent评测 :workflow(abstract);分类 cs.AI、cs.LG

AI总结 该研究开发了一款设备端Android潜在扩散图像生成应用,以环境光传感器驱动而非文本提示,通过绑定传感器读数等实现离线审计,验证了环境光依赖的保留及设备端运行的延迟表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14620 2026-08-18 cs.LG cs.AI 新提交 62%

Explaining Reinforcement Learning Decisions in Self-adaptive Systems

解释自适应系统中强化学习的决策

Jasmina Gajcin, Juan C. Rosero, Ivana Dusparic

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对强化学习策略透明度不足的问题,本文提出EARL库用于生成反事实解释,并在CitiBikes模拟中验证了其在实际自适应系统中的适用性。

Comments Accepted in the 20th Colombian Computing Congress. 13 pages, 2 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14109 2026-08-17 cs.AI cs.LG cs.MA 新提交 62%

A Graph-Based Reinforcement Learning Framework for Structured Drift Diagnosis and Recovery in Autonomous LLM Agents

面向自主大语言模型智能体中结构化漂移诊断与恢复的基于图的强化学习框架

Ismail El Hamraoui, Sagar Jose, Nicolas Bureau, Robert Plana

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究针对自主LLM智能体的运行时行为漂移问题,提出基于图的强化学习即插即用恢复框架,经AppWorld基准验证,该框架可利用漂移信息做出正确恢复决策且输出符合要求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11381 2026-08-13 cs.AI cs.LG 新提交 62%

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

从数字到判断:专业大语言模型智能体与欧洲上市房地产的强化学习研究

Pardis Taghavi, Santosh Bhavani

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究以欧洲上市房地产分析为对象,提出Larix框架将分析维度映射为专业LLM智能体,结合GRPO微调Qwen3.5-9B,实现数值任务与判断任务的性能提升且可迁移至新企业与监管体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 62%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10475 2026-08-12 cs.AI cs.CL cs.GT 新提交 62%

Evaluating Rational Contracting in Natural Language

评估自然语言中的理性缔约

Bhavyesh Sajja, Max Kleiman-Weiner, Roger Zimmermann, Tan Zhi-Xuan

专题命中 Agent评测 :AI agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对自然语言缔约的评估缺口,构建理性框架并开发ContractSim评估套件,发现当前LLM智能体在高不确定性下缔约及执行协议存在不足,为相关智能体设计指明改进方向。

Comments 9 pages, 5 figures, 2 tables (Appendix: 34 pages, 6 figures, 9 tables)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08968 2026-08-11 cs.SE cs.AI 新提交 62%

GALA: Graph-Augmented LLM Agents for Root Cause Analysis and Incident Response in Microservices

GALA:用于微服务根本原因分析和事件响应的图增强大语言模型智能体

Yifang Tian, Yaming Liu, Zichun Chong, Zihang Huang, Yiran Li, Hans-Arno Jacobsen

专题命中 Agent评测 :agentic(abstract);分类 cs.AI、cs.SE

AI总结 针对微服务RCA的现有方法存在局限,提出图增强LLM智能体框架GALA+,结合STRIX与SURE-Score,在基准测试中性能优于最佳LLM基线,获SRE专家认可。

Comments Proceedings of the 41st IEEE/ACM International Conference on Automated Software Engineering (ASE '26), October 12--16, 2026, Munich, Germany

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08814 2026-08-11 cs.CV cs.AI cs.LG 新提交 62%

360CityArena: A Realistic Virtual Urban Navigation Benchmark for Embodied Agents

360CityArena:面向具身智能体的真实虚拟城市导航基准

Kenta Watanabe, Atsuyuki Miyai, Mizuki Takenawa, Kiyoharu Aizawa, Toshihiko Yamasaki

机构 * The University of Tokyo(东京大学)

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.LG

AI总结 研究人员提出基于东京秋叶原重建的360CityArena城市导航基准,评估具身智能体城市探索能力,发现最强模型Gemini 2.5 Flash表现远低于人类,为相关研究提供了挑战性测试平台。

Comments ECCV2026. Project Page: https://360mm-team.github.io/360CityArena/

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08180 2026-08-11 cs.CL cs.AI 新提交 62%

A Grounded and Decomposed Framework for Relation-Level Hallucination Evaluation in Abstractive Summarization

用于抽象摘要中关系级幻觉评估的基于基础与分解的框架

Praveen Kumar Katwe, Rakesh Chandra Balabantaray, Kali Prasad Vittala, Naman Kabadi

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出一种用于抽象摘要关系级幻觉评估的基于基础与分解的框架,引入关系幻觉指数(RHI)及其归一化公式,经多模型评估验证其可生成稳定且具区分性的幻觉测量结果,推进了自动化关系级保真度评估。

Comments 6 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08160 2026-08-11 cs.CL cs.AI 新提交 62%

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

大语言模型智能体能坚持剧本吗?交互式叙事中长期一致性的基准测试

Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对LLM智能体在交互式叙事中难以维持长期一致性的问题,构建了NCP-Bench基准测试,发现现有顶尖LLM的承诺保持率较低,存在显著的逻辑冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07533 2026-08-11 cs.AI cs.SE 新提交 62%

MetaSpace: Metamorphic Testing for Spatial Cognition in Embodied Agents

MetaSpace:面向具身智能体空间认知的变形测试

Gengyang Xu, Dongwei Xiao, Yiteng Peng, Shuai Wang

机构 * Hong Kong University of Science and Technology(香港科技大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.SE

AI总结 MetaSpace是评估具身智能体空间认知的框架,基于变形测试原则生成测试用例,在三个场景中检测到SOTA MLLM驱动智能体的90422个空间认知错误,其SC分数远低于人类基准。

Comments 30 pages, 17 figures. Published in Proceedings of the ACM on Programming Languages (OOPSLA1)

Journal ref Proceedings of the ACM on Programming Languages, 10, OOPSLA1 (April 2026), 343-372

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07529 2026-08-11 cs.CL cs.AI 新提交 62%

WuYuEval: A Multi-Level Benchmark for Large Language Models in Solid Waste Management

WuYuEval:面向固体废物管理的大语言模型多级基准测试

Yi Zhang, Hongyang Wang, Zheng Hao Leong, Zihao Wu, Kaijun Lin, Zhixing Pan, Qixun Huangfu, Wei Ren, Wenyan Wu, Fangyun Wang, Wenting Yu, Hengyu Lin, Muling Yang, Zongguo Wen

专题命中 Agent评测 :planning(abstract);分类 cs.AI、cs.CL

AI总结 WuYuEval是面向固体废物管理的多级基准测试,含基础与专家模块,评估33个LLM的SWM能力,发现其在专业任务表现差,为开发专用基础模型提供依据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08118 2026-08-11 cs.AI cs.LG cs.SC math.CO 新提交 62%

Neurosymbolic Discovery of Algebraic Graph Constructions

代数图构造的神经符号发现

David Seka, Stefan Szeider

机构 * TU Wien(维也纳技术大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对仅提供原始图数据无法揭示其结构性质的问题,提出基于通用大语言模型与SageMath的神经符号智能体,可自动发现代数图构造,在100个高度对称图基准上全部成功,还找到Bernhart-Kainen可散度猜想的最小反例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06420 2026-08-10 cs.LG cs.AI 新提交 62%

Risk-Aware Decision Policies for Agents Under Noisy Perception

感知噪声下智能体的风险感知决策策略

David Szczecina

机构 * University of Waterloo(滑铁卢大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 针对感知噪声下智能体决策问题,该研究构建人工生命捕食者-猎物觅食模型,发现不确定性感知策略可提升智能体存活率,揭示了行为随不确定性的状态转变,为含噪声标签的鲁棒学习提供类比。

Comments 8 pages, 6 figures. Submitted to the 2026 Conference on Artificial Life (ALIFE2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06352 2026-08-07 cs.LG cs.CL 新提交 62%

CalibForge: Adversarial Solver Calibration for Scaling Learnable Terminal Tasks

CalibForge:用于扩展可学习终端任务的对抗性求解器校准

Fanzhe Meng, Guoxin Chen, Jiale Zhao, Shuang Sun, Zhiyu Lin, Wayne Xin Zhao, Ruihua Song, Ji-Rong Wen, Kai Jia

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 本文提出CalibForge系统,通过对抗性求解器校准合成5431个终端任务,训练的模型在多个基准测试中取得显著性能提升,验证了求解器相关可学习性的实用价值。

Comments Dataset: https://huggingface.co/datasets/AweAI-Team/CalibForge. Repository: https://github.com/AweAI-Team/CalibForge

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06329 2026-08-07 cs.CL cs.AI 新提交 62%

Benchmarking the Benchmarks: Evaluating Benchmarks for Conversational Agents

基准的基准:对话智能体的基准评估

Noam Koren, Roy Bar-Haim, Abigail Goldsteen

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 该研究针对对话智能体基准质量评估不足的问题,提出基于LLM评判员的无参考评估框架,可区分基准质量等级,适用于合成与人工整理的基准,验证了其有效性与实用性。

Comments 15 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05876 2026-08-07 cs.AI cs.CL 新提交 62%

Personalized Deep Research Query Refinement with Graph-Scaffolded Evidence Grounding

基于图支架证据锚定的个性化深度研究查询优化

Soojin Yoon, Dongha Lee

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究提出G-STEER方法,通过图支架证据锚定优化用户请求为个性化研究规范,在提升深度研究智能体报告个性化的同时,大幅减少向用户提问的数量。

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05695 2026-08-07 cs.AI cs.CL cs.CR 新提交 62%

DreamGuard: Efficient Runtime Guardrail for LLM Agents via Risk-Aware World Model

DreamGuard:基于风险感知世界模型的LLM智能体高效运行时护栏

Wenhao Lin, Chenyu Yu, Xingwei Lin, Sicong Cao, Xiang Chen, Lei Xue, Le Yu, Letian Sha, Chunming Wu

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 针对LLM智能体运行时护栏的长视野风险盲点问题,提出基于风险感知世界模型的主动式护栏DreamGuard,经实验验证其安全-效用权衡更优且延迟低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04095 2026-08-06 cs.AI cs.CL 新提交 62%

FinPerMA: A Theory-Informed, Event-Grounded Personalized-Memory Benchmark for LLM Agents

FinPerMA:一种基于理论、事件驱动的LLM智能体个性化记忆基准

Ben Wang, Kang Zhou, Lifan Guo, Feng Chen, Chi Zhang

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究针对LLM智能体个性化记忆的现有基准不足,提出FinPerMA基准,在276个角色的2994个问题上测试7种LLM,发现其记忆配置远未饱和,简单检索优于专用记忆系统且冲击后差距扩大。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03206 2026-08-05 cs.CY cs.AI cs.CL 新提交 62%

EduClaw-Bench: A Long-Horizon Benchmark for Pedagogical LLM Agents with Simulated Learners

EduClaw-Bench:面向教学大型语言模型智能体的长周期基准测试集(含模拟学习者)

Unggi Lee, Sookbun Lee, Yeil Jeong, Eunjoo Lee, Minchul Shin, Hoilym Kwon

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 研究人员推出EduClaw-Bench长周期基准测试集,结合模拟学习者评估LLM智能体辅导效果,发现辅导质量取决于基础模型与智能体适配器的结合,且多数组合无法维持全程良好辅导。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00301 2026-08-04 cs.LG cs.CL 新提交 62%

Abstention as an Action Can Kill Both the Reward Gradient and the KL Anchor: Collapse Law and Repair for Error-Penalized Reinforcement Learning

弃权作为一种动作会同时破坏奖励梯度和KL锚点:错误惩罚强化学习的崩溃规律与修复方案

Xujun Che, Yuchen Yuan, Weida Zhao, Chenyang Yu

专题命中 Agent评测 :agent(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对错误惩罚强化学习中弃权动作导致的奖励梯度与KL锚点同时失效的问题,提出通过训练强制置信度报告的结构性修复方案,实验验证了机制并提升了语言模型的相关性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28074 2026-07-31 cs.AI cs.LG 新提交 62%

Echoverse: Deep, Evolving Environments for Training Computer-Use Agents at Scale

Echoverse:用于大规模训练计算机使用智能体的深度演化环境

Yash Pandya, Sahil Gupta, Sarthak Harne, Archana Yadav, Kavyansh Chourasia, Hussein Mozannar, Vibhav Vineet, Sara Abdali, Corby Rosset, Yash Lara, Ahmed Awadallah, Ece Kamar, Akshay Nambi

机构 * Microsoft Research(微软研究院)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 Echoverse是用于大规模训练计算机使用智能体的深度演化环境,其协同演化循环可提升智能体性能,经12个环境训练后9B模型准确率大幅提升,还发布了基准环境与代码

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27536 2026-07-31 cs.GT cs.AI cs.LG cs.MA 新提交 62%

Strategy, Not Payoffs: A Behavioural Embedding of Normal-Form Games

策略,而非收益:标准型博弈的行为嵌入

Joshua Caiata, Sreepriya Pulyassary, Xiang Li, Kate Larson

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出轻量双特征行为嵌入,可预测大型语言模型在不同标准型博弈间微调后的策略能力变化,证明策略能力迁移由决策行为结构而非收益几何决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.27384 2026-07-31 cs.CL cs.AI 新提交 62%

Same Facts, Different Diagnosis: Measuring and Mitigating Narrative Anchoring in Clinical Language Models

相同事实,不同诊断:临床语言模型中叙事锚定的测量与缓解

Prabhjot Singh, Pritam Deka, Vijay Chennareddy

机构 * University of Texas at Austin(德克萨斯大学奥斯汀分校) Queen’s University Belfast(贝尔法斯特女王大学) Middlesex University London(伦敦密德萨斯大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.CL

AI总结 本研究针对临床语言模型的叙事锚定偏差,构建含1000个USMLE案例的基准,提出NarrativeShield三智能体流水线,可大幅降低叙事锚定差距并减少不稳定决策,同时发布数据集供相关研究使用。

详情

展开后加载摘要…

URL PDF HTML 收藏