Update from Hell: Can Coding Agents Survive Hidden Breakage in Dependency Upgrades?
来自地狱的更新:编码智能体能否在依赖升级的隐藏损坏中存活?
专题命中 仓库级理解 :coding agent(title,abstract);分类 cs.SE
AI总结 本文推出含203项真实依赖升级任务的DEPBENCH基准,评估主流编码智能体后发现其仅解决51.2%任务,凸显当前智能体能力与软件维护需求的差距。
AI 大模型
代码生成、软件工程智能体、程序修复、测试生成和开发者工具。
来自地狱的更新:编码智能体能否在依赖升级的隐藏损坏中存活?
专题命中 仓库级理解 :coding agent(title,abstract);分类 cs.SE
AI总结 本文推出含203项真实依赖升级任务的DEPBENCH基准,评估主流编码智能体后发现其仅解决51.2%任务,凸显当前智能体能力与软件维护需求的差距。
超级库智能体:超越单一代码库的多应用联合生成与维护
专题命中 仓库级理解 :coding agent(abstract);分类 cs.SE、cs.CL、cs.AI
AI总结 针对关联应用组合维护的冗余与结构退化问题,提出超级库智能体方法,通过候选引导提取等技术,在WebGen-Bench等基准上减少冗余并避免结构退化。
Comments Findings of the Association for Computational Linguistics: EMNLP 2026. Project page: https://sbigstar0310.github.io/super-library-agent/
面向自主云 MLOps 的前置式全栈工程
专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG
AI总结 本研究提出带证据门控的多智能体框架,结合图工程等技术,在 Google Cloud Platform 实现自主云 MLOps 全栈工程,可阻止无效生命周期转换,保障任务达成验证部署或可审计失败。
Comments Nill
基于相减的肿瘤分割与以病灶为中心的pCR预测:MAMA-MIA挑战赛方案
机构 * Fraunhofer Institute for Digital Medicine MEVIS(弗劳恩霍夫数字医学梅维斯研究所)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG
AI总结 FME团队针对MAMA-MIA挑战赛,提出基于相减输入的nnU-Net集成肿瘤分割方法与基于病灶裁剪块的3D视频分类器集成pCR预测方法,两项任务均获第二名,为跨站点肿瘤分割及pCR预测提供了参考
面向LLM深度压缩的局部感知冗余剪枝
机构 * University of Southern California(美国南加州大学) ; Neural Superintelligence Lab, MODULABS(MODULABS神经超级智能实验室) ; Seoul National University(首尔国立大学) ; Inha University(釜山大学)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI、cs.LG
AI总结 提出LoRP,一种基于表示局部性的无训练单次深度剪枝框架,通过引入表示局部性分数(RLS)来识别和剪除冗余层,在多种LLM上提升了困惑度和下游任务准确率。
Comments EMNLP 2026 Main Accepted
开源自动驾驶系统分析及结合强化学习测试与大语言模型的多学科硬件在环研究范式
专题命中 仓库级理解 :repository(abstract);分类 cs.SE
AI总结 本文针对开源自动驾驶系统实验记录分散问题,提出Apollo-on-Hongqi EV环境下的实车实验框架,结合大语言模型与强化学习测试,为相关研究提供可审查的实验基础。
Comments 33 pages, 7 figures, 7 tables
Git 提交签名的数月研究
专题命中 仓库级理解 :repository(abstract);分类 cs.SE
AI总结 本研究对22名计算机科学专业学生开展三个月Git提交签名使用研究,发现其存在配置阻碍、难发现异常提交、对签名保障存误解等问题,指出仅简化签名不足以保障安全使用,还需配套工具与教育支持。
Comments A shortened version of this paper appears in the Proceedings of the 2026 ACM SIGSAC Conference on Computer and Communications Security (ACM CCS 2026)
BiasMix-Finance:面向LLM投资组合建议的生成后KYC护栏
机构 * Vizuara(维祖拉公司)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI
AI总结 本文提出BiasMix-Finance生成后KYC护栏流水线,含JSON模式约束、数值上限验证及凸二次规划投影,可将LLM投资组合建议违规率降至0%,并发布相关基准与代码。
Comments 18 pages, 9 figures, 8 tables. Accepted to the ICLR 2026 Financial AI (FinAI) Workshop. Code and data: https://github.com/gauravkukreja06/biasmix-finance
CrossAudit:面向智能体科学的原生Git跨供应商审计循环
机构 * University of Cambridge(剑桥大学) ; University of Wisconsin–Madison(威斯康星大学麦迪逊分校)
专题命中 仓库级理解 :repository(abstract);分类 cs.AI
AI总结 CrossAudit是面向智能体科学的原生Git跨供应商审计协议,通过不同供应商智能体按人类规则审计工作,试验显示不同供应商对规则解读有差异,其自身审计记录为核心证据。
Comments 19 pages, 4 figures, 3 tables, 22 references. Reference implementation, audit ledger, and experiment artefacts: https://github.com/dongzhaohe321418-lab/crossaudit
带有快速写入路由与慢速整合的双层智能体记忆
机构 * Zhejiang University(浙江大学) ; Xiaohongshu(小红书) ; University of North Texas(北得克萨斯大学)
专题命中 仓库级理解 :repository(abstract);分类 cs.CL
AI总结 该研究针对LLM智能体动态环境下的记忆管理问题,提出双层智能体记忆框架,通过成本感知路由与周期性整合实现高效记忆处理,在保留高检索性能的同时减少冗余。
存在但重新缩放:加法激活引导的聊天到智能体的转移
专题命中 仓库级理解 :repository(abstract);分类 cs.LG
AI总结 研究加法激活引导从聊天到智能体的转移,通过匹配信息设计进行研究,发现转移真实但重新缩放,确定了加法特定机制,定位了重新缩放位置,指出智能体部署对引导拒绝绕过影响不可预测。
Comments v3 qualifies the two-sided sign claim to the primary dose grid: the sole positive cell loses CI-exclusion under the registered alpha*-trim. Also discloses the comparison set behind the overlapping-gain pair. 42 pages, 7 figures, 9 tables. Includes an errata section correcting v1's public record. Code: github.com/digdoug/steering-dose-reparametrization
无约束协方差下的立方根高斯近似
专题命中 仓库级理解 :repository(abstract)
AI总结 该研究针对无约束协方差下高维矩形的高斯近似问题,通过两阶段插值与无秩矩阵加权高斯曲面界的方法,否定了Chernozhukov等人关于多项式维度下$n^{-1/4}$速率接近最优的推测,得出新的近似误差界为$n^{-1/3}$。
Comments 52 pages, 1 table
环形磁铁的稳定悬浮:基于磁力-距离定律的低成本3D打印实验
专题命中 仓库级理解 :repository(abstract)
AI总结 该研究开发了一种低成本3D打印环形磁铁稳定悬浮实验装置,用于探究磁力与间距的定量关系,其结果与等效电流环模型吻合良好,相关设计文件已公开以支持可重复性。