arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3244 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3244 篇

2506.20062 2025-09-23 cs.HC cs.AI 72%

Beyond Autocomplete: Designing CopilotLens Towards Transparent and Explainable AI Coding Agents

Runlong Ye, Zeling Zhang, Boushra Almazroua, Michael Liut

机构 * Computer Science, University of Toronto(计算机科学,多伦多大学) University of Toronto(多伦多大学) King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI;planning(comments)

Comments accepted at The First Workshop on the Application of LLM Explainability to Reasoning and Planning (XLLM-Reason-Plan) @ COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18397 2026-05-19 cs.DC 71%

Duet instrumentation: An Agentic Approach to Improving Sensitivity in Cloud Service Benchmarking

双人乐器:一种改进云服务基准测试灵敏度的代理方法

Sebastian Koch, Nils Japke, David Bermbach

专题命中 软件智能体 :agentic(title)

AI总结 本文提出了一种名为duet instrumentation的新基准测试方法,利用大型语言模型的代码理解能力,通过分析两个连续应用版本之间的代码变更,提高云服务基准测试的灵敏度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20067 2026-04-23 q-fin.TR 71%

Testing replication for an agent-based model of market fragmentation and latency arbitrage

对代理基于市场碎片化和延迟套利模型的复制性检验

Ethan Ratliff-Crain, Colin M. Van Oort, Matthew T. K. Koehler, Brian F. Tivnan

专题命中 软件智能体 :agent(title)

AI总结 本文通过复制Wah和Wellman 2016年的延迟套利模型,发现原论文中缺失的实现细节和有限的定量报告阻碍了准确复制。通过增加模拟次数生成置信区间,弥补了分布信息的不足,并指出模型复杂性与对齐难度成正比。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09607 2026-04-14 cs.DC 71%

LLM-assisted Agentic Edge Intelligence Framework

基于大语言模型的代理边缘智能框架

Chinmaya Kumar Dehury, Siddharth Singh Kushwaha, Qiyang Zhang, Alaa Saleh, Praveen Kumar Donta

专题命中 软件智能体 :agentic(title)

AI总结 本文提出LEI框架,利用云托管的大语言模型协调设备端逻辑的生成与更新,通过生成轻量级程序并部署以适应变化条件,提升边缘计算的灵活性与资源效率。

Comments 35 pages, 22 Figures, Journal version

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22433 2026-03-13 cs.CV 71%

SkeletonAgent: An Agentic Interaction Framework for Skeleton-based Action Recognition

SkeletonAgent: 一种基于骨架的动作识别代理交互框架

Hongda Liu, Yunfan Liu, Changlu Wang, Yunlong Wang, Zhenan Sun

机构 * NLPR, Institute of Automation, Chinese Academy of Sciences(神经信息处理研究室,自动化研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 软件智能体 :agentic(title)

AI总结 SkeletonAgent通过Questioner和Selector两个代理连接识别模型与LLM,提升基于骨架的动作识别性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24240 2025-09-30 cs.CR 71%

Takedown: How It's Done in Modern Coding Agent Exploits

Eunkyu Lee, Donghyeon Kim, Wonyoung Kim, Insu Yun

专题命中 软件智能体 :agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01673 2025-09-29 econ.TH 71%

Strategic Analysis of Fair Rank-Minimizing Mechanisms with Agent Refusal Option

Yasunori Okumura

专题命中 软件智能体 :agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13860 2024-10-18 cs.CV cs.RO 71%

VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding

Runsen Xu, Zhiwei Huang, Tai Wang, Yilun Chen, Jiangmiao Pang, Dahua Lin

专题命中 软件智能体 :agent(title)

Comments CoRL 2024 Camera Ready. 25 pages. A novel zero-shot 3D visual grounding framework based solely on 2D images

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.01703 2024-08-06 cs.HC 71%

WaitGPT: Monitoring and Steering Conversational LLM Agent in Data Analysis with On-the-Fly Code Visualization

Liwenhan Xie, Chengbo Zheng, Haijun Xia, Huamin Qu, Chen Zhu-Tian

专题命中 软件智能体 :agent(title)

Comments Accepted in the 37th Annual ACM Symposium on User Interface Software and Technology (UIST'24)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04647 2023-11-09 astro-ph.EP astro-ph.IM 71%

Modelling the Light Curves of Transiting Exomoons: a Zero-order Photodynamic Agent Added to the Transit and Light Curve Modeller

Sz. Kálmán, Sz. Csizmadia, A. E. Simon, K. W. F. Lam, A. Deline, J. -V. Harre, Gy. M. Szabó

专题命中 软件智能体 :agent(title)

Comments 6 pages, 3 figures; Accepter for publication in MNRAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2112.12063 2021-12-24 physics.soc-ph cs.SI stat.AP 71%

Investigating Opinion Dynamics Models in Agent-Based Simulation of Energy Eco-Feedback Programs

Mohammad Zarei, Mojtaba Maghrebi

专题命中 软件智能体 :agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2003.12303 2021-11-11 cs.DL 71%

A Text-Embedding-based Approach to Measure Patent-to-Patent Technological Similarity -- Workflow, Code, and Applications

Daniel Hain, Roman Jurowetzki, Tobias Buchmann, Patrick Wolf

专题命中 软件智能体 :workflow(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2111.03899 2021-11-09 eess.SY cs.SY 71%

Planning for net zero by 2050, what HVAC system interventions will today's code minimum commercial buildings require?

Patrick Pease, Jayati Chhabra, Zahra Zolfaghari

专题命中 软件智能体 :planning(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2102.00844 2021-02-02 cs.MA 71%

Agent Based Virus Model using NetLogo: Infection Propagation, Precaution, Recovery, Multi-site Mobility and (Un)Lockdown

Dibakar Das

专题命中 软件智能体 :agent(title)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21101 2026-08-24 cs.CR cs.AI 新提交 70%

ClawSentry: A Progressive Multi-Tier Security Monitor for Safeguarding Autonomous LLM Agents

ClawSentry:一种用于保护自主大语言模型智能体的渐进式多层安全监控器

Kai Wang, Zeming Wei, BiaoJie Zeng, Chang Jin, An Wang, Xiaokun Luan, Zhixiao Lin, Jingjing Qu, Xia Hu, Xingcheng Xu

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 ClawSentry是一种开源、与框架无关的智能体运行时安全监控网关,通过渐进式多层机制防护自主LLM智能体,可大幅降低攻击成功率,同时保持较高的任务安全率。

Comments 35 pages, 14 figures. Code: this https URL (https://github.com/Elroyper/ClawSentry)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19784 2026-08-21 cs.SE 新提交 70%

PRAXIS: Graph-Grounded Tacit Knowledge for Domain Code Generation

PRAXIS:面向领域代码生成的基于图的默会知识

Xue Jiang, Tianyu Zhang, Lingwei Wu, Ziyu Wang, Ge Li, Yuan Sui, Hao Zhu, Wenpin Jiao, Zhi Jin, Yihong Dong

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 PRAXIS框架通过模拟人类开发工作流提取代码依赖图上的默会知识,提升智能体领域代码生成性能,优于现有方法且可适配多种智能体框架与大语言模型

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16302 2026-08-18 cs.SE 新提交 70%

Comparing the Quality of Code Generated by Vibe Coding Tools

比较 vibe 编码工具生成代码的质量

Gustavo da Mota, Kiev Gama

专题命中 软件智能体 :agent(abstract_cn);AI agent(abstract);分类 cs.SE

AI总结 本研究对比 Lovable、v0、Replit 三种 vibe 编码工具生成代码的结构质量,发现三者存在不同质量特征,选择工具需考量结构层面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10934 2026-08-12 cs.SE 新提交 70%

Understanding the Architecture of Coding Agents: An Exploratory Study Using a Research Prototype

理解编码智能体的架构:一项使用研究原型的探索性研究

Marco Tulio Valente

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本研究通过推出编码智能体Ark及基准ArkBench,探索了编码智能体的架构,用gpt-5.4-mini测试Ark解决10项任务中的8项,还对比了其与先进编码智能体的架构,为相关研究提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09268 2026-08-11 cs.HC cs.AI 新提交 70%

Can Coding Agents Solve Repository-Level Issues with Rendered Code? An Exploratory Study of Visual Representations

编码智能体能通过渲染代码解决仓库级问题吗?一项关于视觉表示的探索性研究

Weijie Liang, Yuanfeng Song, Xing Chen, Caleb Chen Cao, Sirui Han, Yike Guo

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 本研究探索将渲染代码作为编码智能体的操作上下文,基于 SWE-bench Verified 实验发现其可降低提示 token 成本但受模型架构限制,仅在原始代码读取为瓶颈时有用,是可行但有条件的压缩机制。

Comments 8 pages of main content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.09253 2026-08-11 cs.AI 新提交 70%

SkillSentry: Reliable Skill Execution for LLM Agents via Runtime Assurance

SkillSentry:基于运行时保障的大语言模型智能体可靠技能执行方案

You Lu, Xinyu Huang, Bihuan Chen, Xin Peng

专题命中 软件智能体 :agent(abstract);tool use(abstract);分类 cs.AI

AI总结 SkillSentry是基于DSL的技能运行时保障框架,通过初始化、监控引导与迭代优化提升LLM智能体技能执行可靠性,在15项技能上平均提升任务成功率24.1%且降低变异性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08950 2026-08-11 cs.SE 新提交 70%

Independent Patch Verification for Coding Agents with a Bidirectional Reconstruct-and-Verify Framework

基于双向重构-验证框架的代码智能体独立补丁验证

Chenglin Li, Yisen Xu, Zehao Wang, Shin Hwei Tan, Tse-Hsun, Chen

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本研究针对代码智能体生成补丁后缺乏独立验证的问题,提出无需训练的RETRACE双向重构-验证框架,在SWE-bench Verified等基准上显著提升了代码补丁的正确性。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08570 2026-08-11 cs.AI 新提交 70%

FailForge: Distilling Procedural Competence from Persistent Failures into Code Agents

FailForge:从持续失败中提取过程能力到代码智能体

Dongyi Lv, Fushun E, Aichen Cai, Liang Huang, Ya Zhang, Qiuyu Ding, Canhui Wu, Zhi Wang, Yuesong Zhang, Jiaqi Wang, Nan Duan

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 FailForge 框架将代码智能体的失败案例转化为训练信号,以边际成本恢复超26%失败实例,使 Qwen3.5-4B 在 SWE-bench Verified 上的解决率提升6.6个百分点,增益集中于最难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25637 2026-08-10 cs.DL cs.AI cs.SI 版本更新 70%

F(AI)2R: Who Did What, and Who Checked? Verifiable AI Provenance as an Executable Skill

F(AI)2R:谁做了什么,谁进行了检查?可验证的人工智能溯源作为一项可执行技能

Florian Krebs

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 研究将F(AI)2R实验的溯源模型扩展为aiprov,涵盖任何含人工智能工件。方法被打包为可执行技能,由人工智能代理操作,能解析操作员身份,把关图一致性并发布论文版本,以自身为例展示溯源记录。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29658 2026-08-03 cs.SE 新提交 70%

Reusing Past Repairs Through Hierarchical Trajectory Abstraction for Coding Agents

通过分层轨迹抽象复用编码智能体的过往修复工作

Yisen Xu, Jiayuan Zhou, Ruiqi Pan, Tse-Hsun Chen

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 本研究提出STAIR框架,通过分层轨迹抽象复用编码智能体过往修复经验,在SWE-bench Verified上显著提升修复智能体的Pass@1指标,且计划可跨智能体泛化。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28947 2026-08-03 cs.LG 新提交 70%

Overcoming the Weakest-Link Effect in LLM-Driven Program Optimization via Heterogeneous Edit Recombination

通过异构编辑重组克服大语言模型驱动的程序优化中的最弱链效应

Jingwen Fu, Zhen Liu, Yuhan Liu, He Zhang, Nanning Zheng

专题命中 软件智能体 :planning(abstract);agentic(abstract);分类 cs.LG

AI总结 本研究针对LLM程序优化的最弱链效应,提出HERO异构编辑重组优化器,可生成多样非重叠原子编辑并结合评估器分数组合改进,在多领域实现更高分数、更快收敛与更少token消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10046 2026-08-03 cs.SE 版本更新 70%

Automated Table Reproduction via Code Generation

Artisan: 自动化代理评估

Doehyun Baek, Michael Pradel

专题命中 软件智能体 :agent(abstract,abstract_cn);分类 cs.SE

AI总结 Artisan通过自动化LLM代理生成重现脚本,提升软件工程研究结果的可重复性,生成44/60个有效脚本并发现20个新错误。

Comments Accepted at ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11270 2026-07-31 cs.SE 版本更新 70%

Evaluating LLM Agents on Automated Software Analysis Tasks

评估LLM代理在自动化软件分析任务中的性能

Islem Bouzenia, Cristian Cadar, Michael Pradel

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.SE

AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26155 2026-07-30 cs.AI 新提交 70%

ClinLens: Towards Long-Horizon Coding Agents for Longitudinal Multimodal Clinical Data Science

ClinLens:面向纵向多模态临床数据科学的长周期编码智能体

Yuan Zhu, Ethan B. Liu, Frank Nie, Jindong Han

机构 * Shandong University(山东大学)

专题命中 软件智能体 :agent(abstract);workflow(abstract);分类 cs.AI

AI总结 该研究推出CLINLENS基准,包含200项基于5种MIMIC资源的临床可执行任务,实验显示现有编码智能体与生物医学系统在正确临床分析上存在显著差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22798 2026-07-28 cs.SE cs.CV 新提交 70%

StateAct: Program State, before Pixels, for Long-Horizon Computer-Use Agents

StateAct:在像素之前的程序状态,用于长期计算机使用代理

Yan Yang, Xiangru Jian, Ziyang Luo, Zirui Zhao, Yutong Dai, Ziji Shi, Hanshu Yan, Jun Hao Liew, Silvio Savarese, Junnan Li

专题命中 软件智能体 :agent(abstract);multi-agent(abstract);分类 cs.SE

AI总结 研究针对计算机使用代理,提出基于程序状态的StateAct多代理框架,主要代理用代码处理状态,GUI子代理辅助,支持验证,在OSWorld 2.0上提升了Claude Opus 4.8的成功率,且成本降低,实现从感知到推理的瓶颈转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18310 2026-07-22 physics.soc-ph cs.AI 新提交 70%

Distribution-First Population Simulation: Collapse, Calibration, and Recall in Non-WEIRD LLM Persona Modeling

分布优先的总体模拟:非怪异大语言模型角色建模中的崩溃、校准和召回

Gurkan Ozkan

机构 * Istanbul Technical University(伊斯坦布尔技术大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.AI

AI总结 研究非怪异LLM角色建模中独立代理范式的问题,提出分布优先校正方法,通过言语化采样等进行实验,发现原范式有崩溃等问题,校正方法能测量内部不一致性及校准条件。

Comments 8 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏