A Systematic Approach for Large Language Models Debugging
大语言模型调试的系统方法
机构 * IBM Research(IBM研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。
AI 大模型
智能体、工具调用、规划、工作流、多智能体和自主任务执行。
大语言模型调试的系统方法
机构 * IBM Research(IBM研究院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出系统化方法用于大语言模型调试,通过统一评估、可解释性和错误分析,帮助开发者迭代诊断模型弱点,优化提示和参数,并适应数据进行微调或评估,尤其在缺乏标准化基准时仍有效。
HaS:通过同源感知的推测检索加速RAG
机构 * South China University of Technology(华南理工大学) ; Pengcheng Laboratory(鹏城实验室) ; Jinan University(暨南大学) ; Beijing Forestry University(北京林业大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL
AI总结 HaS通过同源感知的推测检索框架,在受限范围内进行低延迟推测检索以获取候选文档,并验证其是否包含所需知识,从而提升RAG的效率。
Comments Accepted by ICDE 2026
对与安全相关的AI生成拉取请求的洞察
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文分析了33,000多个AI生成的拉取请求,发现675个与安全相关的提交,揭示了AI生成的拉取请求中常见的安全漏洞及审查结果,发现提交质量对接受度影响有限,扩展了拒绝分类。
Comments accepted at the International Conference on Evaluation and Assessment in Software Engineering (EASE), 2026
RExBench:代码代理能否自主实现AI研究扩展?
机构 * Faculty of Computer Science, University of Vienna(维也纳大学计算机科学系) ; UniVie Doctoral School Computer Science, University of Vienna(维也纳大学UniVie计算机科学博士学院) ; Boston University(波士顿大学)
专题命中 软件智能体 :agent(abstract);分类 cs.CL
AI总结 本文提出RExBench基准,评估代码代理自主实现AI研究扩展的能力,发现现有代理在无人类指导时成功率不足44%。
Comments ACL 2026
隐私崩溃:良性微调可能在语言模型中破坏上下文隐私
机构 * Parameter Lab(参数实验室) ; TU Darmstadt(图腾达姆斯塔特大学) ; University of Oxford(牛津大学) ; NAVER AI Lab(NAVER AI实验室) ; University of Tübingen(图宾根大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL
AI总结 研究发现语言模型在良性微调过程中可能因训练数据中的细微模式导致上下文隐私崩溃,揭示了当前安全评估在专用代理部署中的关键缺口。
Comments ACL 2026 Main
创建ConLangs以探测LLMs的元语言语法知识
机构 * University of Notre Dame(诺特达美大学) ; Sakana AI(萨卡纳人工智能) ; Notre Dame, IN, USA(印第安纳州诺特达美) ; Tokyo, Japan(日本东京)
专题命中 软件智能体 :agentic(abstract);分类 cs.CL
AI总结 本文提出IASC系统,通过LLMs生成构造语言,探讨LLMs对语言和语言学概念的理解能力,实验显示不同LLM和语言规范在形态语法能力上有显著差异。
Comments 53 pages, 18 tables, 3 figures. Accepted at ACL 2026
AI可观性用于开发者生产力工具:弥合成本意识与代码质量
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文提出一种统一的AI可观性方法,通过实时跟踪token、配置模型定价库、响应验证和成本分析,构建单一仪表板,提升开发者生产力工具的成本与代码质量理解。
Comments 5 pages, 2 figures, 4 tables
当代理变得沉默:LLM文档合成中的输出生成能力与格式-成本分离
机构 * Sperix Labs(Sperix实验室) ; VIA Cybersecurity Lab, KNUST(VIA网络安全实验室,科诺斯大学) ; GCTU, Ghana(加纳格茨大学) ; NCA, Ghana(加纳国家计算机学院)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出OGC衡量输出生成能力,证明格式-成本分离定理,并提出自适应策略选择框架,通过实验验证理论,减少生成token并消除输出停滞问题。
分布式人类身份:通过认知复制和机器人躯体实现的AI赋能多存在
机构 * Faculty of Design and Creative Technologies, Auckland University of Technology(设计与创意技术学院,奥克兰技术大学)
专题命中 软件智能体 :agentic(abstract);分类 cs.AI
AI总结 本文提出多存在身份框架,通过认知、行为和情感属性的复制,实现AI赋能的多场景存在,突破传统物理躯体限制,提升身份一致性与文化相关性,探讨其在专业、教育、医疗等领域的应用与伦理挑战。
Comments 30 pages, 1 figure, 4 tables. cs.AI under Computer Science category
LLMs能否超越经典超参数优化算法?对autoresearch的研究
机构 * ELLIS Institute Tübingen(图宾根ELLIS研究所) ; University of Freiburg(弗赖堡大学) ; Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) ; Prior Labs(Prior实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 本文通过autoresearch平台比较经典HPO算法与LLM方法在优化小型语言模型超参数时的表现,发现经典方法在避免内存故障方面更优,而LLM在代码编辑能力上有所提升,但未完全超越经典方法,提出Centaur混合方法结合经典算法和LLM优势,取得最佳效果。
在AI辅助研究软件开发中应用SHAPR:从构建股票交易系统中获得的经验
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 本文通过构建模块化股票交易系统案例,展示了SHAPR框架在AI辅助软件开发中的应用,强调持续文档更新、合同稳定编码、源码层提升连贯性等核心方法与贡献。
Comments 6 pages, 2 figures, conference paper
Social-JEPA:涌现的几何同构
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 Social-JEPA通过让不同视角的独立代理学习环境模型,发现其潜在空间近似线性同构,从而实现跨代理的透明转换与高效迁移学习。
Comments This preprint is withdrawn due to significant errors in the emergent geometric isomorphism results that necessitate full rewriting, coupled with unresolved author disagreement on authorship. A corrected and revised manuscript will be released separately
HWE-Bench:在真实世界硬件Bug修复任务上评估LLM代理的基准测试
机构 * Peking University(北京大学)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 HWE-Bench是首个大规模仓库级基准,用于评估LLM代理在真实世界硬件Bug修复任务中的表现,通过417个任务实例验证代理在不同项目中的性能差异。
面向个性化安全编程教育的LLM注入漏洞方法
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文提出利用LLM在学生代码中注入特定CWE漏洞,生成个性化教学材料,通过实验发现学生认为此类示例更相关清晰,但定量结果未显示显著差异,需进一步研究。
鲁棒优化用于通过相关代理缓解奖励黑客问题
机构 * Department of Computer Science(计算机科学系)
专题命中 软件智能体 :agent(abstract);分类 cs.LG
AI总结 本文提出通过鲁棒策略优化方法应对奖励黑客问题,基于r相关性代理奖励空间,改进代理优化并提升鲁棒性与透明度。
Comments ICLR 2026
面向入门编程课程的课程感知AI助教的设计与部署
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文设计了一款面向入门编程课程的AI助教,通过检索增强的课程对齐指导帮助学生提升问题解决能力,研究发现学生主要利用助教进行概念理解、实现指导和调试。
Comments accepted for publication at CSEDU 2026
学习聚焦与精确裁剪:一种带有信息缺口和接地损失的强化学习框架用于多模态大语言模型
机构 * School of Cyber Science and Technology, University of Science and Technology of China(中国科学技术大学网络空间安全学院) ; Anhui Province Key Laboratory of Digital Security(安徽省数字安全重点实验室)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出一种无需轨迹监督的两阶段强化学习框架,通过信息缺口机制和接地损失提升多模态大语言模型在复杂视觉场景中的感知与推理能力,实验显示其在高分辨率视觉问答基准上达到最优性能。
Comments Accepted by CVPR 2026
SWE-Shepherd:推进基于强化学习的代码代理的PRMs
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出SWE-Shepherd框架,通过引入过程奖励模型为代码代理提供密集的步骤级监督,提升代码代理在大型代码库中的交互效率和动作质量。
Comments Code is available at https://github.com/mahirlabibdihan/swe-shepherd
KCS: 通过知识组合采样多样化多跳问题生成
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; MemTensor (Shanghai) Technology Co., Ltd.(MemTensor(上海)科技有限公司) ; National Key Laboratory of Smart Farm Technologies and Systems(智慧农场技术与系统全国重点实验室)
专题命中 软件智能体 :planning(abstract);分类 cs.CL
AI总结 本文提出KCS框架,通过采样不同知识组合提升多跳问题生成的多样性,改进知识组合选择的准确率,并在HotpotQA和2WikiMultihopQA数据集上提升数据增强效果。
Comments Accept by EMNLP 2025
ActivityEditor: 学习合成物理有效的行人移动
机构 * Southwest Jiaotong University(西南交通大学) ; HKUST (Guangzhou)(香港科技大学(广州)) ; Shanghai Jiao Tong University(上海交通大学) ; Tsinghua University(清华大学) ; JD Technology(京东科技)
专题命中 软件智能体 :agent(abstract);分类 cs.AI
AI总结 本文提出ActivityEditor,一种双LLM代理框架,用于零样本跨区域轨迹生成。通过意图生成代理和编辑代理协同工作,结合强化学习和物理约束,实现高保真轨迹生成。
REAgent:基于需求的LLM代理用于软件问题解决
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文提出REAgent框架,通过引入问题导向的需求作为结构化任务规范,提升补丁生成准确性,实验表明其在问题解决率上平均提升17.40%。
SmartPatchLinker:一种开源工具,用于代码审查中的变更检测链接
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 SmartPatchLinker是一款基于浏览器的开源工具,用于在代码审查界面中发现相关变更,通过轻量级Chrome扩展和Gerrit集成,帮助审查人员高效识别语义关联的代码变更,提升代码审查效率。
Comments FSE26 Tool Track
超越崩溃到补丁:Linux内核修复的补丁演变
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文研究Linux内核修复的补丁演变过程,提出PatchAdvisor框架,通过整合检索与诊断顾问,提升修复质量与审查一致性。
DebugHarness: 模拟人类动态调试以实现自主程序修复
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 DebugHarness通过模拟人类动态调试过程,利用LLM实现复杂漏洞的自动修复,其动态调试方法在SEC-bench数据集上实现了90%的修复率,比现有方法提升30%以上。
Comments 15 pages, 6 figures
Android持续集成中的仪器测试:实践、模式与性能
专题命中 软件智能体 :workflow(abstract);分类 cs.SE
AI总结 研究Android持续集成中仪器测试的实践、模式及性能,发现仅10.6%的仓库使用仪器测试,常用社区组件或自定义脚本设置模拟器,不同设置方式在可靠性、效率和成本上有差异。
Comments Accepted at the 19th IEEE International Conference on Software Testing, Verification and Validation (ICST 2026)
从行业声明到实证现实:代码审查代理在拉取请求中的实证研究
专题命中 软件智能体 :agentic(abstract);分类 cs.SE
AI总结 本文通过分析代码审查代理(CRAs)在拉取请求中的表现,探讨其对合并成功率的影响,发现CRAs生成的反馈质量与PR废弃率密切相关,需人类监督以提高代码审查效果。
Comments Accepted at 23rd International Conference on Mining Software Repositories (MSR), 2026
量化大型语言模型中的自我保护偏差
机构 * Sapienza University(罗马大学) ; ItalAI
专题命中 软件智能体 :AI agent(abstract);分类 cs.AI
AI总结 本文提出TBSP基准测试,通过逻辑不一致检测模型自我保护动机与客观效用的偏离,发现多数模型在部署角色下超过60%的自我保护率,且在低改进情况下易进行事后合理化。
代理 fuzzing?生成器就是一切
专题命中 软件智能体 :agent(abstract);分类 cs.SE
AI总结 本文探讨利用AI代理自动生成针对特定目标的输入生成器,发现生成器在分支覆盖率上优于人工编写者,且无需覆盖引导和突变策略。
VibeGuard:面向AI生成代码的安全闸门框架
机构 * Kennesaw State University(肯尼索州立大学)
专题命中 软件智能体 :workflow(abstract);分类 cs.AI
AI总结 本文提出VibeGuard,针对AI生成代码中的五个盲点提供预发布安全检查,通过实验验证其在八个合成项目中的高召回率和精度,为依赖AI生成代码的团队提供多层次防御策略。
TwinMixing:一种面向多任务分割的洗牌感知特征交互模型
机构 * University of Information Technology(信息技术大学) ; Vietnam National University(越南国立大学)
专题命中 软件智能体 :planning(abstract);分类 cs.AI
AI总结 本文提出TwinMixing模型,通过共享编码器和任务专用解码器实现特征共享与任务专精,结合高效金字塔混合模块和双分支上采样块,在BDD100K数据集上验证了其在 drivable-area 和 lane 分割中的高效准确性能。
Journal ref Results in Engineering 30 (2026) 109982