arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-31 至 2026-08-31 共收录 11 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 11 篇

2608.27675 2026-08-31 cs.AI 新提交 87%

Agents for Everyone: A Workshop Framework for Building Agentic AI Capabilities in a Distributed Curation Community

面向所有人的智能体:分布式整理社区中构建智能体AI能力的研讨会框架

Seth Carbon, Sierra Moxon, Kimberly Van Auken, Pascale Gaudet, Christopher J. Mungall

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);tool use(abstract);workflow(abstract)

AI总结 该研究针对智能体AI应用于生物数据库整理的障碍,构建了基于JupyterHub与Claude Code的云环境及含四个模块的研讨会,证明其可提升分布式社区的智能体AI整理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27992 2026-08-31 cs.AI cs.MA 新提交 85%

GOD: Govern, Observe, and Direct - A Real-Time Control Room for Agent Societies

GOD:管控、观测与指挥——智能体群体的实时控制室

Yige Luo, Ran Guan

机构 * Laboratories, Huawei(华为2012实验室)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 研究针对生成式智能体系统难检查的问题,提出GOD实时控制室,整合多类工具与技术,经15次运行评估验证其干预有效性,可助力智能体群体的管控与观测。

Comments 9 pages, 5 figures. Accepted to the EMNLP 2026 System Demonstrations Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28497 2026-08-31 cs.SE cs.AI 新提交 84%

On the Maintenance and Co-evolution of Agent Plugins: An Empirical Study of Claude Code Plugin Marketplaces

智能体插件的维护与协同演化:Claude Code插件市场的实证研究

Ahmed Hereiz, Yingzhe Lyu, Hao Li, Bram Adams, Ahmed E. Hassan

专题命中 软件智能体 :agent(title,abstract);tool use(abstract);分类 cs.AI、cs.SE

AI总结 本研究通过对Claude Code插件市场的实证分析,揭示智能体插件的维护与协同演化规律,发现其功能驱动开发特征及新型组件耦合依赖关系。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27549 2026-08-31 cs.CV 新提交 82%

Code as Worlds: Agentic Discovery of Executable World Representations for Physical Reasoning

代码即世界:用于物理推理的可执行世界表征的智能体式发现

Hanyang Wang, Yimo Cai, Weiliang Chen, Jiawei Chi, Haowen Sun, Qiyu Dai, Yi-Hsin Hung, Xingzhuo Guo, Jinshan Ren, Runmao Yao, Ziwei Liu, Mingsheng Long, Yueqi Duan, Jun Gao, Jiangran Lyu, Fangfu Liu, Jialong Wu

机构 * MirroS

专题命中 软件智能体 :agentic(title,abstract);agent(abstract)

AI总结 本研究提出Code-as-World范式,通过智能体式发现循环构建可执行世界表征,将其用于为视觉-语言模型训练提供物理监督,在QuantiPhy数据集上取得最优性能且超越领先专有模型

Comments Project Page: this https URL (https://mirros-lab.github.io/code-as-world)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27902 2026-08-31 cs.CL cs.AI 新提交 81%

LandingAgent: A Reference-Annotated Dataset and Agentic Generation Framework for Landing Pages

LandingAgent:用于落地页的参考标注数据集与智能体生成框架

Injun Baek, HyeongSeok Lee, Yearim Kim, Junhoo Lee, Nojun Kwak

机构 * Seoul National University(首尔大学) Samsung Electronics(三星电子)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.CL

AI总结 针对落地页生成中通用模板与无依据主张的问题,本文提出智能体框架LandingAgent,结合参考标注数据集LandingBench,实验验证其在目标适配性、呈现质量等方面优于直接生成方法。

Comments 30 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25202 2026-08-31 cs.SE cs.AI 版本更新 79%

SpecMine: A Large-Scale Corpus of Spec-Driven Development Artifacts

SPECMINE:一个大规模的规范驱动开发制品语料库

Shyam Agarwal, Bogdan Vasilescu

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);workflow(abstract);分类 cs.AI、cs.SE

AI总结 SPECMINE是一个大规模语料库,通过两次普查收集公共GitHub仓库中的规范驱动开发制品,含大量文件、PR及引用数据,助力研究AI智能体时代软件的规范过程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27790 2026-08-31 cs.AI cs.DB 新提交 74%

Credo: Reusable Declarative Primitives for Agentic Workflows

Credo:面向智能体工作流的可复用声明式原语

Duo Lu, Andrew Crotty, Uğur Çetintemel

机构 * Brown University(布朗大学) Northwestern University(西北大学)

专题命中 软件智能体 :agentic(title);分类 cs.AI

AI总结 Credo可恢复智能体工作流harness的结构化声明式描述,标记元数据并带来源编目,编译器可绑定其原语生成新任务harness,避免从头搜索,还提出了数据库界可开展的相关研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28433 2026-08-31 cs.AI cs.LO cs.MA 新提交 70%

Prove2Me: An Open Collaborative Platform for Scaling Math Formalization

Prove2Me:用于规模化数学形式化的开源协作平台

Shuze Chen, Kunal Marwaha, Xiaoyang Lu, Henry Yuen, Tianyi Peng

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Prove2Me是支持人类与AI智能体协作的开源数学形式化平台,可降低大规模数学形式化的门槛,实现众包式规模化形式化验证。

Comments this https URL (https://prove2.me)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28400 2026-08-31 cs.CR cs.SE 新提交 57%

When Verified Source Becomes Attack Input: Defending Smart Contracts Against LLM-Based Vulnerability Scanning

当已验证源码成为攻击输入:防御智能合约免受基于大语言模型(LLM)的漏洞扫描

Mingyuan Huang, Zimo Ji, Yifan Mo, Shuai Wang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出DeLLMGuard框架,通过分离源码与运行时执行并验证相关信息,在保留公开源码披露和授权审计的同时,降低LLM智能体对智能合约漏洞扫描的准确性,防御恶意扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28230 2026-08-31 cs.SE 新提交 57%

Adaptive Strategy Generation for Boundary Value Exploration Beyond Numeric Inputs

超越数值输入的边界值探索自适应策略生成

Sabinakhon Akbarova, Felix Dobslaw, Robert Feldt

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出基于LLM的ABEX框架,以自适应策略生成替代手动设计变异算子,在含多类型输入的20个函数的黑盒测试中,其边界探索与故障揭示性能优于现有QD基线。

Comments 29 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22967 2026-08-31 cs.LG 版本更新 57%

Learned Relay Representations for Forward-Thinking Discrete Diffusion Models

学习的中继表示用于前向思考的离散扩散模型

Benjamin Rozonoyer, Jacopo Minniti, Dhruvesh Patel, Neil Band, Avishek Joey Bose, Tim G. J. Rudner, Andrew McCallum

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) University of Toronto(多伦多大学) Stanford University(斯坦福大学) Imperial College London(伦敦帝国学院) Mila Vijil

专题命中 软件智能体 :planning(abstract);分类 cs.LG

AI总结 提出Learned Relay Representations (Relay)方法,通过可微通道传递潜在信息,使掩码扩散模型在去噪步骤间前向思考,减少推理延迟并提升性能。

Comments 16 pages, 3 figures. Equal contribution: Benjamin Rozonoyer, Jacopo Minniti, and Dhruvesh Patel. Code: this https URL (https://github.com/jacopo-minniti/relay)

详情

展开后加载摘要…

URL PDF HTML 收藏