arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

2026-09-01 至 2026-09-01 共收录 36 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 36 篇

2608.30572 2026-09-01 cs.SE 新提交 87%

Practical Implementation Report on Introducing Spec-Driven Development Using AI Agents in Software Development PBL

在软件开发PBL中引入基于AI智能体的规格驱动开发的实践实施报告

Hidetake Tanaka, Hiroshi Igaki, Kazumasa Shimari, Kiyoshi Honda, Naoki Fukuyasu

专题命中 软件智能体 :AI agent(title,abstract);agent(abstract);planning(abstract);workflow(abstract)

AI总结 本研究在大三本科生SDPBL课程中实践引入基于AI智能体的SDD,定义四阶段工作流程,发现AI提升实施吞吐量但需教师验证代码理解以维持教育效果。

Comments Accepted for publication in the 38th International Conference on Software Engineering Education and Training (CSEE&T 2026): 18 pages, 1 table, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29310 2026-09-01 cs.SE cs.AI cs.CL 新提交 87%

Super Library Agent: Joint Generation and Maintenance of Multiple Applications Beyond the Single Codebase

超级库智能体:超越单一代码库的多应用联合生成与维护

Daegyu Sung, Yukyeong Lee, Geon Park, Yumin Choi, Sung Ju Hwang

专题命中 软件智能体 :agent(title,abstract);workflow(abstract);agentic(abstract);分类 cs.AI、cs.CL、cs.SE

AI总结 针对关联应用组合维护的冗余与结构退化问题,提出超级库智能体方法,通过候选引导提取等技术,在WebGen-Bench等基准上减少冗余并避免结构退化。

Comments Findings of the Association for Computational Linguistics: EMNLP 2026. Project page: this https URL (https://sbigstar0310.github.io/super-library-agent/)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30701 2026-09-01 cs.SE 新提交 85%

A Phased Workflow for Operating LLM-Based Coding Agents

操作基于大语言模型(LLM)的编码智能体的分阶段工作流

Ante Kapetanovic, Tomislav Duricic, Andro Mercep, Emanuel Lacic

专题命中 软件智能体 :workflow(title,abstract);agent(abstract);planning(abstract);分类 cs.SE

AI总结 该研究提出Infobip团队开发的四阶段编码智能体操作工作流,通过前置人力审查、分阶段上下文管理应对故障,同时指出工作流有效性指标缺失等两个未解决问题。

Comments 2 pages, industry paper, to appear in proceedings of the 35th ACM International Conference on Information and Knowledge Management (CIKM '26), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30910 2026-09-01 cs.LG cs.CL 新提交 84%

S3C-LLM: Skill-Code Guided Agentic Language Models for Spectrum-to-Structure Elucidation

S3C-LLM:用于谱图到结构解析的技能-代码引导型智能体语言模型

Xuanle Zhao, Xinyuan Cai, Xiang Cheng, Bo Xu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 软件智能体 :agentic(title,abstract);workflow(abstract);分类 cs.CL、cs.LG

AI总结 S3C-LLM是一种技能-代码引导型智能体LLM,通过检索光谱学技能、执行分析代码整合证据与约束来解析分子结构,性能优于同类模型且训练语料更少。

Comments Accepted by EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29204 2026-09-01 cs.SE cs.AI 新提交 84%

AgentLogs: A Dataset for Opening the Black Box of GitHub's Cloud Agent

AgentLogs:用于揭开GitHub云智能体黑箱的数据集

Jonan Richards, Kosei Horikawa, Youmei Fan, Yutaro Kashiwa, Mairieli Wessel

专题命中 软件智能体 :agent(title,abstract);agentic(abstract);分类 cs.AI、cs.SE

AI总结 该研究推出AgentLogs数据集,包含GitHub上35810个热门仓库的智能体任务、会话及6400余万条日志,可用于研究智能体行为、协作等,填补了智能体贡献过程数据的空白。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30803 2026-09-01 cs.LO cs.SE 新提交 83%

Schwarz: Solver-Aware Agentic Program Verification

Schwarz:感知求解器的智能体程序验证工具

Jingyu Ke (Shanghai Jiao Tong University), Ling-I Wu (Shanghai Jiao Tong University), Guoqiang Li (Shanghai Jiao Tong University)

专题命中 软件智能体 :agentic(title,abstract);agent(abstract);分类 cs.SE

AI总结 本文提出感知求解器的智能体程序验证工具Schwarz,通过本地化修复任务等方法,在两类基准任务上分别实现95.2%、91.5%的解决率,验证了其有效性与可扩展性。

Comments 12 pages, 4 figures, 4 tables; preprint prepared in IEEE conference format

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24820 2026-09-01 cs.CL 版本更新 81%

SHERLOC: Structured Diagnostic Localization for Code Repair Agents

SHERLOC: 代码修复智能体的结构化诊断定位

Hovhannes Tamoyan, Sean Narenthiran, Erik Arakelyan, Mira Mezini, Boris Ginsburg

机构 * NVIDIA(英伟达) Santa Clara, CA 95051, USA(美国加利福尼亚州圣克拉拉) TU Darmstadt(达姆施塔特工业大学) National Research Center for Applied Cybersecurity ATHENE(国家应用网络安全研究中心 ATHENE)

专题命中 软件智能体 :agent(abstract);tool use(abstract);agentic(abstract);multi-agent(abstract)

AI总结 提出SHERLOC框架,通过推理LLM与紧凑仓库工具及自恢复机制,实现无需微调的结构化诊断定位,在SWE-Bench上达到最优定位精度,并提升修复率、降低令牌消耗。

Comments Accepted to EMNLP 2026 Main Conference. Code: this https URL (https://github.com/NVIDIA-NeMo/Skills/tree/main/recipes/sherloc)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01359 2026-09-01 cs.CR cs.AI 版本更新 81%

Breaking the Code: Security Assessment of AI Code Agents Through Systematic Jailbreaking Attacks

破解代码:通过系统性越狱攻击对AI代码代理进行安全评估

Shoumik Saha, Jifan Chen, Sam Mayers, Sanjay Krishna Gouda, Zijian Wang, Varun Kumar

机构 * University of Maryland – College Park(马里兰大学-College Park) AWS AI Labs(AWS人工智能实验室) Meta Superintelligence Labs(Meta超智能实验室)

专题命中 软件智能体 :agent(abstract,abstract_cn);tool use(abstract);planning(abstract);分类 cs.AI

AI总结 提出JAWS-Bench基准测试,通过三级工作区评估代码LLM代理的越狱风险,发现代理化使攻击成功率提升1.6倍,并揭示可执行攻击代码的高比例。

Comments 22 pages, 18 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29675 2026-09-01 cs.SE cs.AI 新提交 81%

Cost-Effective Repository Exploration for Agentic Issue Localization

面向智能体问题定位的高性价比代码仓库探索

Mohammad Nour Al Awad, Sergey Ivanov

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI、cs.SE

AI总结 本研究在IssueLoc-Bench上评估5种探索器模型,发现低成本探索器可保留较高定位质量并大幅降低耗时与token用量,支持将仓库探索作为编码智能体的模块化独立阶段。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08311 2026-09-01 cs.SE cs.AI 版本更新 81%

Ouroboros: A Self-Developing Frontier Coding Agent with Reviewed Core Evolution

Ouroboros:一种具有经审核的核心演化机制的自发展前沿编码智能体

Anton Razzhigaev, Andrei Gritsaev, Andrei Kaznacheev, Nikita Dragunov, Roman Yampolskiy, Andrei Kuznetsov

机构 * Lomonosov Moscow State University(莫斯科罗蒙诺索夫国立大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究所) Artificial Intelligence Research Institute(人工智能研究所)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 本研究提出具有经审核核心演化机制的编码智能体Ouroboros,其在三个基准测试中均创最优结果,Hope部署为长期活体演化实验,同时需应对自发展带来的操作安全问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21894 2026-09-01 cs.SE cs.AI 版本更新 81%

Skills for the future software profession: beyond agentic AI!

未来软件职业的技能:超越智能体AI!

Abhik Roychoudhury, Sungmin Kang, Baishakhi Ray

机构 * National University of Singapore(新加坡国立大学) Columbia University(哥伦比亚大学)

专题命中 软件智能体 :agentic(title,abstract);分类 cs.AI、cs.SE

AI总结 本文通过2026年在纽约和新加坡举行的两场圆桌会议,总结未来软件工程师所需的核心技能,强调验证与确认在智能体处理实现时的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29442 2026-09-01 cs.SE cs.AI cs.HC 版本更新 81%

How Coding Agents Fail Their Users: A Large-Scale Analysis of Developer-Agent Misalignment in 20,574 Real-World Sessions

编码助手如何辜负用户:基于20,574个真实会话的开发人员与智能体不一致的大规模分析

Ningzhi Tang, Chaoran Chen, Gelei Xu, Yiyu Shi, Yu Huang, Collin McMillan, Tao Dong, Toby Jia-Jun Li

机构 * University of Notre Dame(诺丁汉大学) Vanderbilt University(范德比大学) Google(谷歌)

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI、cs.SE

AI总结 通过对20,574个编码助手会话的分析,识别出七种常见的不一致形式,发现大多数不一致导致信任成本而非系统损坏,且多数仍需用户显式纠正。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30686 2026-09-01 cs.CR cs.CL 新提交 79%

Beyond the Payload: How User Invocation Shapes Coding Agent Vulnerability to Repository Poisoning

超越有效载荷:用户调用如何塑造编码代理对仓库中毒的漏洞

Fukang Zhu, Binbin Zhao, Ruixiao Lin, Ping He, Tianyu Du, Shouling Ji

专题命中 软件智能体 :agent(title,abstract);分类 cs.CL

AI总结 该研究推出首个针对编码代理仓库中毒漏洞的基准CIPR,发现漏洞高度依赖用户提示级配置,任务类型可使攻击成功率产生4.5倍差异,测试执行任务为隐蔽攻击面,不明确或嘈杂提示会间接改变风险。

Comments 30 pages,7 figures, Accepted to EMNLP 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28990 2026-09-01 cs.AI q-bio.MN 新提交 79%

Agentic AI uncovers conserved cross-tissue protein co-abundance programs inaccessible to single-dataset analysis

智能体AI揭示跨组织保守蛋白质共丰度程序,这类程序是单数据集分析无法获取的

Runyu Guan, Dehao Wu, Qiqi Xie, Yang Li, Haohan Wang

机构 * School of Information Sciences, University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校信息科学学院) Department of Ecology and Evolutionary Biology, University of Michigan(密歇根大学生态与进化生物学系)

专题命中 软件智能体 :agentic(title);agent(abstract);分类 cs.AI

AI总结 该研究提出LLM智能体框架,分析41种人体组织与体液的820种成对组合,识别出大量跨组织保守蛋白质共丰度簇,为疾病机制与治疗探索提供资源。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2202.06853 2026-09-01 stat.AP cs.AI 交叉投稿 79%

Agent-Based Model Framework for the North Carolina Modeling Infectious Diseases Program (NC MInD ABM) Overview, Design Concepts, and Details Protocol

北卡罗来纳州传染病建模项目(NC MInD ABM)的基于智能体的模型框架:概述、设计概念与细节协议

Kasey Jones, Emily Hadley, Caroline Kery, Alexander Preiss, Marie C.D. Stoner, Sarah Rhea

专题命中 软件智能体 :agent(title,abstract);分类 cs.AI

AI总结 本研究开发了用于模拟北卡罗来纳州医疗机构患者移动的ABM,发布了其标准化ODD协议,该模型可与疾病子模型配合用于评估干预成效、资源压力及医院容量预测。

Comments 23 pages. arXiv admin note: text overlap with arXiv:2106.04461 (https://arxiv.org/abs/2106.04461)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29889 2026-09-01 cs.CL 新提交 77%

VibeJam: A User Study Platform for Web Development with Agents

VibeJam:用于智能体辅助Web开发的用户研究平台

Nishant Balepur, Connor Baumler, Valerie Chen, Eunsol Choi, Rachel Rudinger, Jordan Boyd-Graber

机构 * University of Maryland(马里兰大学) New York University(纽约大学) Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);agentic(abstract);分类 cs.CL

AI总结 研究推出开源浏览器平台VibeJam,支持用户与Aider智能体协作开发网站,试点显示其获资深程序员认可且初级学生用其生成的网站质量更优,可推动编码智能体相关研究。

Comments EMNLP 2026 (Demo)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.29016 2026-09-01 cs.CV cs.SE 新提交 77%

Towards Fully Automated Medical Imaging Code Generation via Validation-based Context Engineering

基于验证的上下文工程实现全自动医学影像代码生成

Zixiao Zhao, Jing Sun, Zhe Hou, Cheng-Hao Cai, Qian Liu, Mengze Li, Zijian Zhang, Jin Song Dong

机构 * University of Auckland(奥克兰大学) Griffith University(格里菲斯大学) Suzhou Industrial Park Monash Research Institute of Science and Technology(苏州工业园区莫纳什科技研究院) Beijing Institute of Technology(北京理工大学) National University of Singapore(新加坡国立大学)

专题命中 软件智能体 :agent(abstract);planning(abstract);multi-agent(abstract);分类 cs.SE

AI总结 本文提出AutoMedImg多智能体框架,通过规划与编码阶段的多阶段验证及自动上下文工程,实现零人工干预的全自动医学影像代码生成,在六个数据集上分割任务Dice最高0.90、分类准确率99%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08311 2026-09-01 cs.SE cs.AI 版本更新 73%

Understanding Automated Program Repair Agents Through the Lens of Traceability: An Empirical Study

通过可追溯性视角理解自动化程序修复智能体:一项实证研究

Ira Ceka, Hailie Mitchell, Saurabh Pujar, Luca Buratti, Shyam Ramji, Junfeng Yang, Gail Kaiser, Baishakhi Ray

机构 * Columbia University(哥伦比亚大学) IBM Research(IBM研究院)

专题命中 软件智能体 :agent(abstract);planning(abstract);分类 cs.AI、cs.SE

AI总结 本文通过追踪五个最先进的自动化程序修复智能体在500个真实世界修复任务中的决策流程,揭示了它们在逻辑密集型错误修复、测试生成和回归测试选择方面的关键局限性,并提出了改进方向。

Comments Accepted for publication (ISSTA '26). Camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28972 2026-09-01 cs.SE 新提交 70%

Legacy System Modernization with Coding Agents: A Case Study

基于编码智能体的遗留系统现代化:一项案例研究

Iago da Silva Rodrigues Alves, Cristiano Politowski, João Eduardo Montandon

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.SE

AI总结 本研究通过工业案例评估Claude Code智能体迁移企业ERP系统功能的效果,发现其平均等价率70%,低级功能表现优于高级功能,同时探讨了该方法的适用场景及局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28433 2026-09-01 cs.AI cs.LO cs.MA 版本更新 70%

Prove2Me: An Open Collaborative Platform for Scaling Math Formalization

Prove2Me:用于规模化数学形式化的开源协作平台

Shuze Chen, Kunal Marwaha, Xiaoyang Lu, Henry Yuen, Tianyi Peng

机构 * Columbia University(哥伦比亚大学) University of Chicago(芝加哥大学) Purdue University(普渡大学)

专题命中 软件智能体 :agent(abstract);AI agent(abstract);分类 cs.AI

AI总结 Prove2Me是支持人类与AI智能体协作的开源数学形式化平台,可降低大规模数学形式化的门槛,实现众包式规模化形式化验证。

Comments this https URL (https://prove2.me)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15932 2026-09-01 cs.CL 版本更新 70%

Beyond NL2Code: A Structured Survey of Multimodal Code Intelligence

超越NL2Code:多模态代码智能的结构化综述

Xuanle Zhao, Qiushi Sun, Jingyu Xiao, Xuexin Liu, Haoyue Yang, Qiaosheng Chen, Xianzhen Luo, Jing Huang, Yufeng Zhong, Lei Chen, Shuai Fu, Zhenlin Wei, Jinhe Bi, Lei Jiang, Haibo Qiu, Siqi Yang, Peng Shi, Jian Hu, Zhixiong Zeng

机构 * Meituan(美团) The University of Hong Kong(香港大学) The Chinese University of Hong Kong(香港中文大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Nanjing University(南京大学) Harbin Institute of Technology(哈尔滨工业大学) Australian Institute for Machine Learning, Adelaide University(阿德莱德大学澳大利亚机器学习研究所) Ludwig Maximilian University of Munich(慕尼黑大学) University of Science and Technology of China(中国科学技术大学) Queen Mary University of London(伦敦玛丽女王大学)

专题命中 软件智能体 :agent(abstract);agentic(abstract);分类 cs.CL

AI总结 本文系统综述多模态代码智能,将任务按代码角色分类,覆盖GUI、科学可视化、结构化图形及前沿任务,并提出四个基于验证的未来方向。

Comments Accepted by TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13856 2026-09-01 eess.IV cs.CV stat.AP 版本更新 67%

From crown candidates to neighborhood screening: integrating optical GeoAI and spatial modeling for urban-canopy assessment in Davis, California

从树冠候选到邻域筛选:整合光学地理人工智能与空间建模用于加利福尼亚州戴维斯市的城市树冠评估

Mohammadreza Narimani, Shreyan Mitra, Parastoo Farajpoor

机构 * University of California, Davis(加利福尼亚大学戴维斯分校) California High School(加利福尼亚高中)

专题命中 软件智能体 :planning(abstract);workflow(abstract)

AI总结 本研究整合光学GeoAI与空间建模,利用2022年影像在戴维斯市生成树冠筛选层,绘制了该市9.37%的树冠,验证了其与热环境的关联,为城市规划提供支持。

Comments 17 pages, 10 figures + 5 supplementary figures, 7 tables. Revised preprint (expanded canopy infill; IoU 0.719). Preprint submitted to Taylor & Francis. Code: this https URL (https://github.com/MohammadrezaNarimaniUCDavis/Davis_Urban_Canopy_GeoAI) Data: this https URL (https://doi.org/10.5281/zenodo.21925526)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13681 2026-09-01 cs.SE cs.AI cs.ET cs.LG 交叉投稿 67%

Fine-Tuning Qwen3-27B for C-to-Rust Code Translation: A Three-Stage Curriculum of Pretraining, Debugging-Aware SFT, and Task-Specific SFT

微调Qwen3-27B实现C到Rust代码翻译:预训练、调试感知监督微调与任务特定监督微调的三阶段课程

Pu Zhao, Changdi Yang, Yixiao Chen, Yi Gao, Yifan Cao, Haochen Zeng, Yanzhi Wang

机构 * Northeastern University(东北大学) EmbodyX Inc(EmbodyX公司) Aibao LLC(Aibao有限责任公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI、cs.LG、cs.SE

AI总结 本研究针对C到Rust代码翻译任务,对Qwen3-27B采用三阶段微调课程,结合SACTOR框架评估后,其性能优于基线模型及其他LLM。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28795 2026-09-01 cs.SE cs.AI 新提交 62%

The reach of a verification tool decides its value: A controlled study of verification surface, artifact quality, and cost in AI coding agents

验证工具的覆盖范围决定其价值:AI编码智能体中验证面、产物质量与成本的对照研究

Achint Mehta

专题命中 软件智能体 :agent(abstract);分类 cs.AI、cs.SE

AI总结 该研究通过构建仅工具列表为受控变量的极简编码智能体,开展对照实验,发现验证工具的覆盖范围需匹配应用实际故障方式才能提升产物质量,且不同验证工具的成本效益存在差异。

Comments 27 pages, 13 figures, 10 tables. Submitted to IEEE Access. Data and code: this https URL (https://doi.org/10.5281/zenodo.21961590)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16956 2026-09-01 cs.SE cs.LG 版本更新 62%

SpIDER: Spatially Informed Dense Embedding Retrieval for Software Issue Localization

SpIDER:面向软件问题定位的时空感知密集嵌入检索

Shravan Chaudhari, Rahul Thomas Jacob, Jiajun Cao, Shihab Rashid, Mononito Goswami, Christian Bock

机构 * Department of Computer Science, Johns Hopkins University(约翰霍普金斯大学计算机科学系) AWS(亚马逊公司) AWS AI Labs(亚马逊人工智能实验室)

专题命中 软件智能体 :agentic(abstract);分类 cs.LG、cs.SE

AI总结 SpIDER通过结合LLM推理和图结构探索信息,提升代码库中相关代码单元的密集检索性能,实验显示在多个编程语言和基准测试中性能提升达13%。

Comments EMNLP 2026 camera-ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.31009 2026-09-01 cs.LG 新提交 57%

Language-Informed Flow Matching for Trend-Guided Structure-Based 3D Molecular Generation

用于趋势引导的基于结构的3D分子生成的语言知情流匹配

Tianyu Gao, Zhikai Su, Jiashu Li, Wenjun Gao, Zichuan Ying, Zhe Zhao, Fei Zhang, Ye Wei

机构 * City University of Hong Kong(香港城市大学) The University of Hong Kong(香港大学) Stanford University(斯坦福大学)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 该研究提出基于流匹配的语言知情跨模态框架LiFT,通过“感知-演化-组装”智能体和自条件解耦路由器实现趋势引导的3D分子生成,在Cross-Docked2020数据集上验证了其分布匹配、药物化学指标及结构有效性的优势。

Comments Accepted at Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.30300 2026-09-01 cs.SE 新提交 57%

Update from Hell: Can Coding Agents Survive Hidden Breakage in Dependency Upgrades?

来自地狱的更新:编码智能体能否在依赖升级的隐藏损坏中存活?

Zijian Luo, Runzhi He, Pengfei Gao, Yu Kang, Zeqi Lin, Minghua Ma, Qingwei Lin, Saravan Rajmohan, Yongqiang Tian

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文推出含203项真实依赖升级任务的DEPBENCH基准,评估主流编码智能体后发现其仅解决51.2%任务,凸显当前智能体能力与软件维护需求的差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28814 2026-09-01 cs.CV cs.AI 新提交 57%

FigMirror: Ground It, Code It, Plot It

FigMirror:定位它、编码它、绘制它

Xiaohan Zhao, Jiacheng Liu, Yaxin Luo, Zhiqiang Shen

机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出FigMirror智能体框架,通过定位测量结合PlotTwin-Bench基准,实现科学图表风格迁移至新数据,性能优于现有方法,论文图表多由其生成。

Comments Code and data available at this https URL (https://github.com/VILA-Lab/FigMirror)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28646 2026-09-01 cs.AI 新提交 57%

BiasMix-Finance: Post-Generation KYC Guardrails for LLM Portfolio Advice

BiasMix-Finance:面向LLM投资组合建议的生成后KYC护栏

Gaurav Kukreja, Parul Kukreja, Mohammed Abraar, Raj Dandekar, Rajat Dandekar, Sreedath Panat

机构 * Vizuara(维祖拉公司)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出BiasMix-Finance生成后KYC护栏流水线,含JSON模式约束、数值上限验证及凸二次规划投影,可将LLM投资组合建议违规率降至0%,并发布相关基准与代码。

Comments 18 pages, 9 figures, 8 tables. Accepted to the ICLR 2026 Financial AI (FinAI) Workshop. Code and data: this https URL (https://github.com/gauravkukreja06/biasmix-finance)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09156 2026-09-01 cs.LG 版本更新 57%

Activation Steering Transfer to Agents: One Gain Ratio Does Not Identify Potency and Efficacy

存在但重新缩放:加法激活引导的聊天到智能体的转移

Lucas Pinto

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。

Comments v3 qualifies the two-sided sign claim to the primary dose grid: the sole positive cell loses CI-exclusion under the registered alpha*-trim. Also discloses the comparison set behind the overlapping-gain pair. 42 pages, 7 figures, 9 tables. Includes an errata section correcting v1's public record. Code: this http URL (http://github.com/digdoug/steering-dose-reparametrization)

详情

展开后加载摘要…

URL PDF HTML 收藏