arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-08-13 至 2026-08-13 共收录 17 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 17 篇

2408.06849 2026-08-13 cs.AI cs.CL 版本更新 88%

Causal Agent based on Large Language Model

基于大语言模型的因果智能体

Kairong Han, Kun Kuang, Ziyu Zhao, Junjian Ye, Fei Wu

专题命中 软件智能体 :agent(title,summary_cn);分类 cs.AI、cs.CL

AI总结 该研究针对LLM难以处理因果问题的挑战,提出Causal Agent框架,构建CausalTQA基准,实验显示其在多层级因果问题及真实数据集上性能优于SOTA。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12311 2026-08-13 cs.SE 新提交 87%

The Role Specialization Model (RSM): Coordinating LLM-Based Tools in Agentic Software Development - An Exploratory Case Study

角色专业化模型(RSM):在智能体软件开发中协调基于大语言模型(LLM)的工具——一项探索性案例研究

Carlos Alberto Fernández-y-Fernández, Jorge R. Aguilar-Cisneros

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);autonomous agent(abstract);workflow(abstract)

AI总结 本研究通过探索性案例研究提出角色专业化模型(RSM),协调Antigravity、Gemini CLI等三种LLM工具开发Python气候可视化应用,发现明确角色协调可优化开发质量但需配套策略与人工验证。

Comments 28 pages, 4 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11274 2026-08-13 cs.CR cs.AI 新提交 85%

Agent Safety Should Be a Runtime Contract

智能体安全应成为运行时契约

Albus W. Ng, Yi Han, Jusheng Zhang, Wenhao Wang

专题命中 软件智能体 :agent(title,abstract);autonomous agent(abstract);agentic(abstract);分类 cs.AI

AI总结 该研究指出将AI安全仅在训练阶段植入的范式不足,提出智能体安全应是兼具预防与证据层面的运行时契约,通过四类公开证据支撑该立场并给出研究议程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11386 2026-08-13 cs.SE 新提交 83%

The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior

关键在于接口:评估工具架构如何影响编码智能体行为

Xiangzhe Xu, Hamidreza Saghir, Qianhui Wu, Marc-Alexandre Côté, Tong Wang, Kiran Lakkaraju, Kexin Pei, Xiangyu Zhang

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.SE

AI总结 该研究通过编码智能体的对照实验,发现工具架构会显著影响智能体行为,不同工具架构在一致性、文件访问量、步骤数等方面表现出不同效果,其中Python CodeAct风格接口性能优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11241 2026-08-13 cs.AI cs.IR 新提交 83%

RecSys Factory: Bounding LLM Agent Autonomy to Decision Points in the Industrial Recommender Lifecycle

RecSys Factory:限制LLM智能体在工业推荐生命周期内的自主决策点

Dongyang Ao, Kaixiang Fang, Shijie Xu

机构 * Tencent(腾讯) FiT(腾讯FiT)

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);分类 cs.AI

AI总结 RecSys Factory 是限制 LLM 智能体自主到决策点的平台,解决工业推荐系统运营的三角困境,在腾讯三业务线部署 78 天,CLI 调度成功率达 78.6%。

Comments 21 pages, 6 figures, 9 tables. Reports a 78-day deployment across three heterogeneous industrial recommender business lines (1,624 CLI-tool dispatches). Companion paper: AutoResearch (P3b), which instantiates the same substrate for autonomous research

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11338 2026-08-13 cs.CL cs.LG 新提交 81%

Better, Faster, Stronger: Programmatic Skill Learning Best Reduces Agent Cost

更好、更快、更强:程序化技能学习最能降低智能体成本

Zixi Huang, Xiheng Wang, Andrew Wang, William Jurayj, Bernal Jiménez Gutiérrez, Daniel Khashabi, Nicholas Andrews

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL、cs.LG

AI总结 该研究提出程序化技能学习的SpeedRunner编码智能体,通过分析轨迹重构技能,在三个具身环境中实现最优学习与成本降低,且对分布偏移和环境随机性能保持鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12123 2026-08-13 cs.DC cs.AI cs.OS 新提交 79%

Ready Cohorts: Bounding GPU Opportunity and Avoiding Host Round Trips in LLM-Agent Control

就绪队列:在LLM智能体控制中限定GPU机会并避免主机往返

Josef Liyanjun Chen

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 该研究针对LLM智能体控制,提出就绪队列边界的形式化方法,通过实验验证设备驻留路由决策路径可提升效率,为GPU智能体控制确立了两个可测量门限。

Comments 14 pages, 4 figures. Includes formal proofs, trace provenance, and a reproducibility appendix. Code and artifacts: https://github.com/josefchen/ready-cohorts ; processed evidence: https://huggingface.co/datasets/josefchen/ready-

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11282 2026-08-13 eess.IV cs.AI cs.LG 新提交 62%

Physics-Informed Implicit Neural Representations for Improved Myocardial Perfusion MRI Quantification

用于改进心肌灌注MRI定量的物理信息隐式神经表示

Christos Tsepas, Chang Yan, Maximilian Fuetterer, Sebastian Kozerke, Cian M Scannell

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 该研究将物理信息神经网络(PINN)框架扩展加入时空隐式神经表示(INRs),在真实模拟CMR数据集上提升了心肌灌注参数估计的鲁棒性与准确性。

Comments Accepted at the STACOM workshop at MICCAI, Strasbourg 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11232 2026-08-13 cs.CL cs.AI 新提交 62%

Backtrader-Bench: Benchmarking LLM Agents on Algorithmic Trading with Self-Generated MCQs

Backtrader-Bench:基于自生成多项选择题的算法交易大语言模型智能体基准测试

Ruoxi Zhao, Maziar Raissi

机构 * University of California, Riverside(加利福尼亚大学河滨分校)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.CL

AI总结 Backtrader-Bench是用于算法交易LLM智能体的基准框架,通过自生成MCQ解决评估难题,实验显示带工具智能体准确率显著高于无工具模型,还可生成强化学习训练语料以构建专用量化交易智能体。

Comments Accepted to the FinLLM Workshop at IJCAI 2026. Code and data: https://github.com/rzhao999/Backtrader-Bench

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10986 2026-08-13 cs.CL cs.LG 交叉投稿 62%

What Iterated Self-Feeding Probes of Language Models Measure, and a test that separates the construction from the model

语言模型迭代自馈探测的测量对象,以及一种区分构造与模型的测试方法

Nicolás Vera Zúñiga

专题命中 软件智能体 :agentic(abstract);分类 cs.CL、cs.LG

AI总结 本研究探究语言模型迭代自馈探测的测量对象,提出区分探测构造与模型的测试方法,揭示两类测量量的差异,复现验证工具并纠正错误判断。

Comments 16 pages, 4 figures. Code, per-run results, and the findings ledger: https://github.com/nicoveraz/token-lattice-ca (archived: https://doi.org/10.5281/zenodo.21880472)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20667 2026-08-13 cs.SE cs.AI 版本更新 62%

REVERE: Reflective Evolving Research Engineer

REVERE:面向科学工作流的反思性进化研究工程师

Balaji Dinesh Gangireddi, Aniketh Garikaparthi, Manasi Patwardhan, Arman Cohan

机构 * TCS Research(TCS研究) Yale University(耶鲁大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 REVERE通过全局训练上下文学习和反思优化框架,提升科研编码任务性能,实现4.50%、3.51%和4.89%的提升。

Comments Published as a conference paper at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.03818 2026-08-13 cs.LG cs.AI cs.PL 版本更新 62%

Program Semantic Inequivalence Game with Large Language Models

基于大语言模型的程序语义不等价博弈

Antonio Valerio Miceli-Barone, Vaishak Belle, Ali Payani

机构 * University of Edinburgh(爱丁堡大学) Cisco Systems(思科系统)

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出基于语义不等价博弈(SInQ)的方法,通过生成器与评估器智能体半对抗训练合成代码推理数据,在跨语言漏洞检测等基准上显著提升LLMs的代码语义理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11727 2026-08-13 cs.AI 新提交 57%

Harness-IF: Evaluating Instruction Following Across Instruction Surfaces in Coding Agents

Harness-IF:评估编码智能体在不同指令层面的指令遵循能力

Zining Huang, Haoran Que, Hong Zeng, Ge Zhang, Zuo Wang, Jin Chen, Haodong Wang, Zhongfei Hou, Changxin Pu, Shen Yan, Wenhao Huang

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本研究推出Harness-IF评估框架,引入AP-Acc指标区分编码智能体的指令合规与巧合,发现12个前沿模型在对抗先验规则上表现更差,且合并优先级不随提示深度变化。

Comments 26 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11460 2026-08-13 cs.CL 新提交 57%

Principal Trait Analysis: Towards Deriving "Skills" in Human-AI Collaboration

主特质分析:面向人机协作中“技能”的推导

Hunter McNichols, Kai Du, Andrew Lan

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本研究提出主特质分析算法,从人机协作编码数据中推导有效交互特质,该特质可解释协作者行为并预测任务结果,但特质是否为技能仍需验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11225 2026-08-13 cs.AI 新提交 57%

Identity from the Outside: A Conceptual Framework and Research Program for AI Personality Clones

来自外部的身份:AI人格克隆的概念框架与研究计划

Luc E. Brunet

机构 * R&D Mediation(调解研发部)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 该研究针对AI人格克隆问题,提出含六项分解的身份概念框架,定义不可区分性,通过类比阐明线性性,区分代理类型,提出实验计划,主张以环境保真度为长期标准,核心为条件猜想。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12195 2026-08-13 cs.HC 新提交 50%

IF:CARGO: LLM-Based Semantic Compilation for Al-Native Rule Programming Games

IF:CARGO:面向AI原生规则编程游戏的基于大语言模型的语义编译

Ting-Chen Hsu, Lianye Zhang, Jiangxu Lin, Zhaoyi Yu, Fei Qin, Zihao Chen

专题命中 软件智能体 :agent(abstract)

AI总结 本研究通过实验性益智游戏IF:CARGO,将大语言模型用作语义编译器而非游戏代理,开展24人混合方法游戏测试,提出AI原生游戏需约束自然语言输入、保留玩家创作权并确保确定性执行的模式。

Comments Accepted to 2026 AAAI Conference on Artificial Intelligence and Digital Interactive Entertainment (AIIDE)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11932 2026-08-13 math.OC 新提交 50%

Joint Identifiability and Conditioning in Finite-Horizon Continuous-Time Inverse LQR with Unknown Dynamics

未知动力学下有限时域连续时间逆LQR的联合可识别性与条件约束

Meiling Yu, Yuan-Hua Ni, Lei Jiang

专题命中 软件智能体 :agent(abstract)

AI总结 本文针对未知动力学的有限时域连续时间逆LQR问题,利用时变最优增益的内生激励建立联合可识别性条件,开发感知条件的采样数据重构方法,通过数值实验验证了理论与条件指数的诊断价值。

详情

展开后加载摘要…

URL PDF HTML 收藏