arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

AI Agent

智能体、工具调用、规划、工作流、多智能体和自主任务执行。

共收录 3270 信号源:cs.AI, cs.CL, cs.LG, cs.SE

1. 软件智能体 3270 篇

2604.23027 2026-04-28 cs.AI 57%

A Systematic Approach for Large Language Models Debugging

大语言模型调试的系统方法

Basel Shbita, Anna Lisa Gentile, Bing Zhang, Sungeun An, Shailja Thakur, Shubhi Asthana, Yi Zhou, Saptha Surendran, Farhan Ahmed, Rohan Kulkarni, Yuya Jeremy Ong, Chad DeLuca, Hima Patel

机构 * IBM Research(IBM研究院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.20452 2026-04-23 cs.IR cs.CL 57%

HaS: Accelerating RAG through Homology-Aware Speculative Retrieval

HaS:通过同源感知的推测检索加速RAG

Peng Peng, Weiwei Lin, Wentai Wu, Xinyang Wang, Yongheng Liu

机构 * South China University of Technology(华南理工大学) Pengcheng Laboratory(鹏城实验室) Jinan University(暨南大学) Beijing Forestry University(北京林业大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 HaS通过同源感知的推测检索框架,在受限范围内进行低延迟推测检索以获取候选文档,并验证其是否包含所需知识,从而提升RAG的效率。

Comments Accepted by ICDE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19965 2026-04-23 cs.SE 57%

Insights into Security-Related AI-Generated Pull Requests

对与安全相关的AI生成拉取请求的洞察

Md Fazle Rabbi, Asif K. Turzo, Arifa I. Champa, Minhaz F. Zibran

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文分析了33,000多个AI生成的拉取请求,发现675个与安全相关的提交,揭示了AI生成的拉取请求中常见的安全漏洞及审查结果,发现提交质量对接受度影响有限,扩展了拒绝分类。

Comments accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22598 2026-04-23 cs.CL 57%

RExBench: Can coding agents autonomously implement AI research extensions?

RExBench:代码代理能否自主实现AI研究扩展?

Nicholas Edwards, Yukyung Lee, Yujun Audrey Mao, Yulu Qin, Sebastian Schuster, Najoung Kim

机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) Boston University(波士顿大学)

专题命中 软件智能体 :agent(abstract);分类 cs.CL

AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15220 2026-04-21 cs.CL 57%

Privacy Collapse: Benign Fine-Tuning Can Break Contextual Privacy in Language Models

隐私崩溃:良性微调可能在语言模型中破坏上下文隐私

Anmol Goel, Cornelius Emde, Sangdoo Yun, Seong Joon Oh, Martin Gubri

机构 * Parameter Lab(参数实验室) TU Darmstadt(图腾达姆斯塔特大学) University of Oxford(牛津大学) NAVER AI Lab(NAVER AI实验室) University of Tübingen(图宾根大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07591 2026-04-21 cs.CL 57%

Creating ConLangs to Probe the Metalinguistic Grammatical Knowledge of LLMs

创建ConLangs以探测LLMs的元语言语法知识

Chihiro Taguchi, Richard Sproat

机构 * University of Notre Dame(诺特达美大学) Sakana AI(萨卡纳人工智能) Notre Dame, IN, USA(印第安纳州诺特达美) Tokyo, Japan(日本东京)

专题命中 软件智能体 :agentic(abstract);分类 cs.CL

AI总结 本文提出IASC系统,通过LLMs生成构造语言,探讨LLMs对语言和语言学概念的理解能力,实验显示不同LLM和语言规范在形态语法能力上有显著差异。

Comments 53 pages, 18 tables, 3 figures. Accepted at ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17092 2026-04-21 cs.SE 57%

AI Observability for Developer Productivity Tools: Bridging Cost Awareness and Code Quality

AI可观性用于开发者生产力工具:弥合成本意识与代码质量

Happy Bhati, Twinkll Sisodia

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文提出一种统一的AI可观性方法,通过实时跟踪token、配置模型定价库、响应验证和成本分析,构建单一仪表板,提升开发者生产力工具的成本与代码质量理解。

Comments 5 pages, 2 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16736 2026-04-21 cs.AI 57%

When Agents Go Quiet: Output Generation Capacity and Format-Cost Separation for LLM Document Synthesis

当代理变得沉默:LLM文档合成中的输出生成能力与格式-成本分离

Justice Owusu Agyemang, Michael Agyare, Miriam Kobbinah, Nathaniel Agbugblah, Prosper Addo

机构 * Sperix Labs(Sperix实验室) VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科诺斯大学) GCTU, Ghana(加纳格茨大学) NCA, Ghana(加纳国家计算机学院)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出OGC衡量输出生成能力,证明格式-成本分离定理,并提出自适应策略选择框架,通过实验验证理论,减少生成token并消除输出停滞问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16336 2026-04-21 cs.HC cs.AI cs.MA 57%

Distributed Human Identity: AI-Enabled Multi-Existence Through Cognitive Replication and Robotic Embodiments

分布式人类身份:通过认知复制和机器人躯体实现的AI赋能多存在

A S M Touhidul Islam, John Tookey

机构 * Faculty of Design and Creative Technologies, Auckland University of Technology(设计与创意技术学院,奥克兰技术大学)

专题命中 软件智能体 :agentic(abstract);分类 cs.AI

AI总结 本文提出多存在身份框架,通过认知、行为和情感属性的复制,实现AI赋能的多场景存在,突破传统物理躯体限制,提升身份一致性与文化相关性,探讨其在专业、教育、医疗等领域的应用与伦理挑战。

Comments 30 pages, 1 figure, 4 tables. cs.AI under Computer Science category

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24647 2026-04-21 cs.LG stat.ML 57%

Can LLMs Beat Classical Hyperparameter Optimization Algorithms? A Study on autoresearch

LLMs能否超越经典超参数优化算法?对autoresearch的研究

Fabio Ferreira, Lucca Wobbe, Arjun Krishnakumar, Frank Hutter, Arber Zela

机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) University of Freiburg(弗赖堡大学) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) Prior Labs(Prior实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文通过autoresearch平台比较经典HPO算法与LLM方法在优化小型语言模型超参数时的表现,发现经典方法在避免内存故障方面更优,而LLM在代码编辑能力上有所提升,但未完全超越经典方法,提出Centaur混合方法结合经典算法和LLM优势,取得最佳效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15020 2026-04-20 cs.SE cs.HC 57%

Applying SHAPR in AI-Assisted Research Software Development: Lessons Learnt from Building a Share Trading System

在AI辅助研究软件开发中应用SHAPR:从构建股票交易系统中获得的经验

Ka Ching Chan

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 本文通过构建模块化股票交易系统案例,展示了SHAPR框架在AI辅助软件开发中的应用,强调持续文档更新、合同稳定编码、源码层提升连贯性等核心方法与贡献。

Comments 6 pages, 2 figures, conference paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02263 2026-04-20 cs.CV cs.AI 57%

Social-JEPA: Emergent Geometric Isomorphism

Social-JEPA:涌现的几何同构

Haoran Zhang, Youjin Wang, Yi Duan, Rong Fu, Dianyu Zhao, Sicheng Fan, Shuaishuai Cao, Wentao Guo, Xiao Zhou

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 Social-JEPA通过让不同视角的独立代理学习环境模型,发现其潜在空间近似线性同构,从而实现跨代理的透明转换与高效迁移学习。

Comments This preprint is withdrawn due to significant errors in the emergent geometric isomorphism results that necessitate full rewriting, coupled with unresolved author disagreement on authorship. A corrected and revised manuscript will be released separately

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.14709 2026-04-17 cs.AI 57%

HWE-Bench: Benchmarking LLM Agents on Real-World Hardware Bug Repair Tasks

HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试

Fan Cui, Hongyuan Hou, Zizhang Luo, Chenyun Yin, Yun Liang

机构 * Peking University(北京大学)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13955 2026-04-16 cs.CR cs.CY cs.SE 57%

Towards Personalizing Secure Programming Education with LLM-Injected Vulnerabilities

面向个性化安全编程教育的LLM注入漏洞方法

Matthew Frazier, Kostadin Damevski

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文提出利用LLM在学生代码中注入特定CWE漏洞,生成个性化教学材料,通过实验发现学生认为此类示例更相关清晰,但定量结果未显示显著差异,需进一步研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.12086 2026-04-15 cs.LG 57%

Robust Optimization for Mitigating Reward Hacking with Correlated Proxies

鲁棒优化用于通过相关代理缓解奖励黑客问题

Zixuan Liu, Xiaolin Sun, Zizhan Zheng

机构 * Department of Computer Science(计算机科学系)

专题命中 软件智能体 :agent(abstract);分类 cs.LG

AI总结 本文提出通过鲁棒策略优化方法应对奖励黑客问题,基于r相关性代理奖励空间,改进代理优化并提升鲁棒性与透明度。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11836 2026-04-15 cs.CY cs.SE 57%

Design and Deployment of a Course-Aware AI Tutor in an Introductory Programming Course

面向入门编程课程的课程感知AI助教的设计与部署

Iris Groher, Patrick Heissenberger, Michael Vierhauser

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文设计了一款面向入门编程课程的AI助教,通过检索增强的课程对齐指导帮助学生提升问题解决能力,研究发现学生主要利用助教进行概念理解、实现指导和调试。

Comments accepted for publication at CSEDU 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27494 2026-04-14 cs.CV cs.AI 57%

Learning to Focus and Precise Cropping: A Reinforcement Learning Framework with Information Gaps and Grounding Loss for MLLMs

学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型

Xuanpu Zhao, Zhentao Tan, Dianmo Sheng, Tianxiang Chen, Yao Liu, Yue Wu, Tao Gong, Qi Chu, Nenghai Yu

机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10493 2026-04-14 cs.SE 57%

SWE-Shepherd: Advancing PRMs for Reinforcing Code Agents

SWE-Shepherd:推进基于强化学习的代码代理的PRMs

Mahir Labib Dihan, Md Ashrafur Rahman Khan

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。

Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20567 2026-04-14 cs.CL 57%

KCS: Diversify Multi-hop Question Generation with Knowledge Composition Sampling

KCS: 通过知识组合采样多样化多跳问题生成

Yangfan Wang, Jie Liu, Chen Tang, Lian Yan, Jingchi Jiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)

专题命中 软件智能体 :planning(abstract);分类 cs.CL

AI总结 本文提出KCS框架,通过采样不同知识组合提升多跳问题生成的多样性,改进知识组合选择的准确率,并在HotpotQA和2WikiMultihopQA数据集上提升数据增强效果。

Comments Accept by EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05529 2026-04-13 cs.AI 57%

ActivityEditor: Learning to Synthesize Physically Valid Human Mobility

ActivityEditor: 学习合成物理有效的行人移动

Chenjie Yang, Yutian Jiang, Anqi Liang, Wei Qi, Chenyu Wu, Junbo Zhang

机构 * Southwest Jiaotong University(西南交通大学) HKUST (Guangzhou)(香港科技大学(广州)) Shanghai Jiao Tong University(上海交通大学) Tsinghua University(清华大学) JD Technology(京东科技)

专题命中 软件智能体 :agent(abstract);分类 cs.AI

AI总结 本文提出ActivityEditor,一种双LLM代理框架,用于零样本跨区域轨迹生成。通过意图生成代理和编辑代理协同工作,结合强化学习和物理约束,实现高保真轨迹生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06861 2026-04-09 cs.SE 57%

REAgent: Requirement-Driven LLM Agents for Software Issue Resolution

REAgent:基于需求的LLM代理用于软件问题解决

Shiqi Kuang, Zhao Tian, Kaiwei Lin, Chaofan Tao, Shaowei Wang, Haoli Bai, Lifeng Shang, Junjie Chen

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文提出REAgent框架,通过引入问题导向的需求作为结构化任务规范,提升补丁生成准确性,实验表明其在问题解决率上平均提升17.40%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.04045 2026-04-07 cs.SE 57%

SmartPatchLinker: An Open-Source Tool to Linked Changes Detection for Code Review

SmartPatchLinker:一种开源工具,用于代码审查中的变更检测链接

Islem Khemissi, Moataz Chouchen, Dong Wang, Raula Gaikovina Kula

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 SmartPatchLinker是一款基于浏览器的开源工具,用于在代码审查界面中发现相关变更,通过轻量级Chrome扩展和Gerrit集成,帮助审查人员高效识别语义关联的代码变更,提升代码审查效率。

Comments FSE26 Tool Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03851 2026-04-07 cs.SE 57%

Beyond Crash-to-Patch: Patch Evolution for Linux Kernel Repair

超越崩溃到补丁:Linux内核修复的补丁演变

Luyao Bai, Kenan Alghythee, Hang Zhang, Xiaoguang Wang

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文研究Linux内核修复的补丁演变过程,提出PatchAdvisor框架,通过整合检索与诊断顾问,提升修复质量与审查一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03610 2026-04-07 cs.SE 57%

DebugHarness: Emulating Human Dynamic Debugging for Autonomous Program Repair

DebugHarness: 模拟人类动态调试以实现自主程序修复

Maolin Sun, Yibiao Yang, Xuanlin Liu, Yuming Zhou, Baowen Xu

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03438 2026-04-07 cs.SE 57%

Android Instrumentation Testing in Continuous Integration: Practices, Patterns, and Performance

Android持续集成中的仪器测试:实践、模式与性能

Hamid Parsazadeh, Taher A. Ghaleb, Safwat Hassan

专题命中 软件智能体 :workflow(abstract);分类 cs.SE

AI总结 研究Android持续集成中仪器测试的实践、模式及性能,发现仅10.6%的仓库使用仪器测试,常用社区组件或自定义脚本设置模拟器,不同设置方式在可靠性、效率和成本上有差异。

Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03196 2026-04-06 cs.SE 57%

From Industry Claims to Empirical Reality: An Empirical Study of Code Review Agents in Pull Requests

从行业声明到实证现实:代码审查代理在拉取请求中的实证研究

Kowshik Chowdhury, Dipayan Banik, K M Ferdous, Shazibul Islam Shamim

专题命中 软件智能体 :agentic(abstract);分类 cs.SE

AI总结 本文通过分析代码审查代理(CRAs)在拉取请求中的表现,探讨其对合并成功率的影响,发现CRAs生成的反馈质量与PR废弃率密切相关,需人类监督以提高代码审查效果。

Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.02174 2026-04-03 cs.AI 57%

Quantifying Self-Preservation Bias in Large Language Models

量化大型语言模型中的自我保护偏差

Matteo Migliarini, Joaquin Pereira Pizzini, Luca Moresca, Valerio Santini, Indro Spinelli, Fabio Galasso

机构 * Sapienza University(罗马大学) ItalAI

专题命中 软件智能体 :AI agent(abstract);分类 cs.AI

AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01442 2026-04-03 cs.SE 57%

Fuzzing with Agents? Generators Are All You Need

代理 fuzzing?生成器就是一切

Vasudev Vikram, Rohan Padhye

专题命中 软件智能体 :agent(abstract);分类 cs.SE

AI总结 本文探讨利用AI代理自动生成针对特定目标的输入生成器,发现生成器在分支覆盖率上优于人工编写者,且无需覆盖引导和突变策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01052 2026-04-02 cs.CR cs.AI 57%

VibeGuard: A Security Gate Framework for AI-Generated Code

VibeGuard:面向AI生成代码的安全闸门框架

Ying Xie

机构 * Kennesaw State University(肯尼索州立大学)

专题命中 软件智能体 :workflow(abstract);分类 cs.AI

AI总结 本文提出VibeGuard,针对AI生成代码中的五个盲点提供预发布安全检查,通过实验验证其在八个合成项目中的高召回率和精度,为依赖AI生成代码的团队提供多层次防御策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.28233 2026-03-31 cs.CV cs.AI 57%

TwinMixing: A Shuffle-Aware Feature Interaction Model for Multi-Task Segmentation

TwinMixing:一种面向多任务分割的洗牌感知特征交互模型

Minh-Khoi Do, Huy Che, Dinh-Duy Phan, Duc-Khai Lam, Duc-Lung Vu

机构 * University of Information Technology(信息技术大学) Vietnam National University(越南国立大学)

专题命中 软件智能体 :planning(abstract);分类 cs.AI

AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。

Journal ref Results in Engineering 30 (2026) 109982

详情

展开后加载摘要…

URL PDF HTML 收藏