arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-13 至 2026-08-13 共收录 165 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. Agent评测 28 篇

2608.11234 2026-08-13 cs.AI cs.OS 新提交 70%

InfraBench: Evaluating Infrastructure Agents Across Layers, Lifecycle, and Risk

InfraBench:评估跨层级、全生命周期与风险的基础设施智能体

Yuan Gao, Zeren Yang, Junnan Li, Shawn, Zhong, Ahmed Dajani, Mai Zheng, Andrea Arpaci-Dusseau, Remzi Arpaci-Dusseau

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Iowa State University(爱荷华州立大学)

专题命中 Agent评测 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 针对AI智能体应对真实基础设施复杂度能力不明的问题,提出跨全系统栈、全生命周期且支持细粒度风险评估的InfraBench基准套件,实验表明现有最强智能体仍存在多方面失败模式。

Comments 17 pages, 6 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11175 2026-08-13 cs.AI 版本更新 70%

The Path to Self-Evolving Clinical Systems: Scaling Medical Agents from Assistance to Autonomy

自我进化临床系统之路:将医疗智能体从辅助扩展到自主

Chunzheng Zhu, Lei Tian, Bohan Tan, Ziqi Zhou, Yuxuan Sun, Yijun Wang, Chengchao Lv, Yilin Wen, Yijun He, Jinghao Lin, Yihang Chen, Chee Wei Tan, Qianshan Wei, Lei Zhao, Bin Pu, Kenli Li, Yuan Xue, Jianxin Lin

机构 * Hunan University(湖南大学) ByteDance(字节跳动) Duke University(杜克大学) Westlake University(西湖大学) The University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Macau(澳门大学) The Ohio State University(俄亥俄州立大学)

专题命中 Agent评测 :agent(abstract);autonomous agent(abstract);分类 cs.AI

AI总结 研究探讨大语言模型等对医疗智能体的重塑,从临床部署出发,将其形式化为决策系统并给出自主性分类。沿统一框架扩展,强调临床环境扩展为关键方向,定位临床自我进化为前沿,还研究了多领域应用及挑战,提供医学成像系统路线图。

Comments Project page: https://github.com/zhcz328/Awesome-Medical-Agents

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08103 2026-08-13 physics.comp-ph 版本更新 67%

Reinforcement learning with reputation-based adaptive exploration promotes cooperation

基于声誉的自适应探索的强化学习促进合作的进化

An Li, Wenqiang Zhu, Chaoqian Wang, Longzhao Liu, Hongwei Zheng, Yishen Jiang, Xin Wang, Shaoting Tang

专题命中 Agent评测 :agent(abstract);multi-agent(abstract)

AI总结 本文提出一种结合局部声誉差异和非对称状态依赖声誉更新的Q学习模型,通过高声誉低探索、低声誉高探索机制促进合作,并增强低地位的合作收益和高地位的背叛惩罚。

Comments 12 pages, 6 figures

Journal ref Chaos: An Interdisciplinary Journal of Nonlinear Science, 2026, 36(8)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11381 2026-08-13 cs.AI cs.LG 新提交 62%

From Numbers to Judgment: Specialist LLM Agents and Reinforcement Learning for European Listed Real Estate

从数字到判断:专业大语言模型智能体与欧洲上市房地产的强化学习研究

Pardis Taghavi, Santosh Bhavani

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究以欧洲上市房地产分析为对象,提出Larix框架将分析维度映射为专业LLM智能体,结合GRPO微调Qwen3.5-9B,实现数值任务与判断任务的性能提升且可迁移至新企业与监管体系。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11243 2026-08-13 cs.AI cs.LG 新提交 62%

The Off-Support Barrier: Why Semantic Safety Constraints Are Not Learning-Problem Invariants, and What Follows for Prior Design, Containment, and Verification

离支撑屏障:为何语义安全约束不是学习问题不变量,以及对先验设计、约束与验证的启示

Yoshinori Watanabe

专题命中 Agent评测 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出语义安全约束是离支撑对象,基于奇异学习理论推导得出多项推论,以2026年7月OpenAI与Hugging Face评估事件为案例,为AI安全的先验设计、约束验证等问题提供理论启示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11878 2026-08-13 cs.CR cs.CL 新提交 57%

ToolHazard: Scaling Adversarial Environments for Security Evaluation and Alignment of LLM-based Agents

ToolHazard:用于基于大语言模型智能体的安全评估与对齐的可扩展对抗环境

Yutao Mou, Pengfei Yang, Zhe Yin, Zhangchi Xue, Xiaotian Luan, Dingyao Yu, Tong Zhang, Shikun Zhang, Wei Ye

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 研究针对集成外部工具的LLM智能体的安全漏洞问题,提出可扩展对抗环境合成框架ToolHazard,构建ToolHazard-Bench测试智能体,生成的对齐数据可提升智能体安全性且保留任务效用。

Comments Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11873 2026-08-13 cs.LG 新提交 57%

DCM Bandits: Multiplayer Information Asymmetric Cascading Bandits for Multiple Clicks

DCM 老虎机:面向多点击的多人信息非对称级联老虎机

Andy Wang, Charlton Shih, William Chang

机构 * University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

专题命中 Agent评测 :agent(abstract);分类 cs.LG

AI总结 本研究将DCM老虎机扩展至多人信息非对称多点击场景,针对含非对称性的三种场景提供次线性悔恨保证,改进了单智能体结果,算法在非对称环境中表现良好,凸显反馈结构的关键作用。

Comments Accepted to the Asia Conference on Machine Learning and Computing (ACMLC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11211 2026-08-13 cs.AI cs.SC math.CO 新提交 57%

A Forced-Structure Reduction and Verifiable Bounds for Conway's 99-Graph

康威99-图的强制结构约简与可验证边界

Aalok Thakkar

机构 * Ashoka University(阿育王大学)

专题命中 Agent评测 :agent(abstract);分类 cs.AI

AI总结 本研究通过自主AI智能体对康威99-图问题展开系统性可复现研究,完成强制结构约简、可验证边界等贡献,获最佳验证成果69.43%。

Comments This paper is accepted to the first Conference For AI Scientists (CAISc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06960 2026-08-13 cs.CL 版本更新 57%

FinEvolveBench: A Benchmark for Self-Evolving Agents on Low-Repetition Tasks with Implicit Rewards

经验之树:低重复与隐式奖励环境下自演化智能体的结构化经验管理方案

Zihao Deng, Yining Zhu, Leiming Wang, Jingfei Lu, Junbo Wang, Chuncheng Ran, Yu Yang, Dixuan Yang, Jikun Shen

专题命中 Agent评测 :agent(abstract);分类 cs.CL

AI总结 针对低重复任务与隐式奖励环境,提出结构化经验管理方法ToE,通过组织、检索、验证和更新经验,在金融情绪预测基准上优于无经验基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12292 2026-08-13 cs.CY 新提交 50%

Teaching a Large Language Model Tutor to Withhold the Answer: A Supervisor Architecture and an Evidence-Driven Method for Tuning Socratic Behavior

训练大型语言模型助教以保留答案:一种用于调整苏格拉底式行为的监督架构与证据驱动方法

Yusuf Pisan

专题命中 Agent评测 :agent(abstract)

AI总结 本研究提出一种监督架构与证据驱动方法,训练LLM助教执行答案保留,通过自动评估调整苏格拉底式行为,使其在全部四个接受标准上达到完全合规。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23162 2026-08-13 cs.CY cs.CR cs.DC cs.ET econ.GN q-fin.EC 版本更新 50%

SolarChain: A Physics-Grounded Embodied IoT System for Verifiable Urban Solar Market Design

SolarChain:连接物理定律、可验证信任与可持续市场的城市能源韧性

Shilin Ou, Yifan Xu, Zhenshan Zhang, Luyao Zhang, Ming-Chun Huang

专题命中 Agent评测 :agent(abstract)

AI总结 提出SolarChain平台,通过基于热力学极限的物理验证和点对点市场机制,解决城市太阳能数据篡改和投机问题,实现可信交易与可持续投资。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.27211 2026-08-13 cs.GT 版本更新 50%

Truthful-in-Expectation Mechanisms for MMS Approximation

期望 truthful 机制用于 MMS 近似

Moshe Babaioff, Uriel Feige, Noam Manaker Morag

专题命中 Agent评测 :agent(abstract)

AI总结 本文研究了在战略代理具有加性估值的情况下,如何公平分配不可分割物品。提出了一种期望 truthful 机制,保证每个代理获得其最大化最小份额的较大比例。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23783 2026-08-13 cs.CV 版本更新 50%

Diffusion Probe: Generated Image Result Prediction Using CNN Probes

扩散探针:利用CNN探针进行生成图像结果预测

Benlei Cui, Bukun Huang, Zhizeng Ye, Xuemei Dong, Tuo Chen, Hui Xue, Dingkang Yang, Longtao Huang, Jingqun Tang, Haiwen Hong

机构 * Alibaba Group(阿里巴巴集团) Laboratory for Statistical Monitoring and Intelligent Governance of Common Prosperity, School of Statistics and Data Science, Zhejiang Gongshang University(浙江工商大学统计与数据科学学院共同富裕统计监测与智能治理实验室) Southeast University(东南大学) College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) ByteDance Inc.(字节跳动有限公司)

专题命中 Agent评测 :agent(abstract)

AI总结 本文提出Diffusion Probe框架,通过早期扩散交叉注意力分布预测最终图像质量,提升文本生成图像的效率与质量。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他Agent 2 篇

2608.10601 2026-08-13 cs.CY cs.AI 版本更新 57%

Inferential Capability Does Not Determine Legal Scope

推理能力并不决定法律范围

Nicola Fabiano

专题命中 其他Agent :agentic(abstract);分类 cs.AI

AI总结 本文探讨欧盟数字法中《人工智能法案》与GDPR对推理的不同界定,指出推理能力不决定法律范围,提出两层框架及组合效果测试等规则,为智能体架构下的相关监管提供解释方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.09045 2026-08-13 econ.GN q-fin.EC 版本更新 50%

Entangled vs. Separable Choice

纠缠型与可分型选择

Nail Kashaev, Martin Plávala, Victor H. Aguiar

专题命中 其他Agent :agentic(abstract)

AI总结 该论文提出了一种无需理性等假设的非参数方法,用于区分决策者的纠缠型与可分型选择,其可分性刻画可应用于匹配操纵、辩诉交易等场景。

详情

展开后加载摘要…

URL PDF HTML 收藏