arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

代码大模型 / AI 编程

代码生成、软件工程智能体、程序修复、测试生成和开发者工具。

2026-08-24 至 2026-08-24 共收录 4 信号源:cs.SE, cs.CL, cs.AI, cs.LG, cs.PL

1. 代码评测 4 篇

2608.21107 2026-08-24 cs.AI cs.SE 新提交 62%

Large Language Models at the Intersection of Software Engineering and Software Security:An Evidence-Centered Structured Survey and Research Agenda

大型语言模型在软件工程与软件安全交叉领域:一项以证据为中心的结构化调查与研究议程

Wei Lin, Tao Zhou, Zhaofei Xie, Changgui Hong

机构 * Nanjing Liancheng Intelligent Technology Group(南京连城智能科技集团)

专题命中 代码评测 :repository(abstract);分类 cs.SE、cs.AI

AI总结 本研究调查了LLMs在软件工程与软件安全交叉领域的进展,提出保证框架,识别有效性威胁与最低报告协议,制定研究议程,主张以任务适配证据而非单一基准评判模型能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20614 2026-08-24 cs.AI 新提交 57%

Evaluating Skills, Not Just Agents: Agentic Continuous Evaluation of Skills

评估技能,而非仅评估智能体:智能体驱动的技能持续评估

Christopher Kevin, Narendran Raghavan, Jean-Francois Puget, Roshni Malani, Meghana Puvvadi, Moshe Abramovitch, Mohit Gupta, Rama Akkiraju, Subodh Prabhu, Yogesh Dangi, Wei Luo, Seong Hee Lee

机构 * NVIDIA(英伟达)

专题命中 代码评测 :repository(abstract);分类 cs.AI

AI总结 该研究提出ACES框架,通过配对实际 trials等方式评估技能附加价值,实验表明其能发现扫描式审核无法观测的信号,开源实现已在NVIDIA SkillEvaluator中提供。

Comments 15 pages. Extended preprint incorporating versions accepted at Agent Skills '26 (ACM CAIS 2026) and the KDD 2026 Workshop on Enterprise AI Agents: From Prototypes to Production (oral presentation). Open-source implementation: this https URL (https://github.com/NVIDIA/SkillEvaluator)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20406 2026-08-24 cs.LG stat.AP 新提交 57%

Machine Learning and ARIMA Model Averaging for Adaptive Public Health Forecasting: Comparative Evaluation and an Ontario COVID-19 Case Study

机器学习与ARIMA模型平均法用于自适应公共卫生预测:比较评估及安大略省COVID-19案例研究

Yushu Zou, Ye Li, Johra Moosa, Martin Grunnill, Samir N. Patel, Venkata R. Duvvuri

机构 * Public Health Ontario(安大略省公共卫生局) Dalla Lana School of Public Health, University of Toronto(多伦多大学达拉·拉纳公共卫生学院) University of Toronto(多伦多大学) York University(约克大学)

专题命中 代码评测 :repository(abstract);分类 cs.LG

AI总结 本研究评估ARIMA、随机森林、XGBoost模型,提出MLAMA集成方法,基于安大略省COVID-19数据验证其预测性能更优,支持按操作条件选择预测模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08164 2026-08-24 cs.CV 版本更新 50%

Continual Test-Time Adaptation in Computer Vision: Methods, Benchmarks, and Future Directions

计算机视觉中的持续测试时间适应:方法、基准和未来方向

Sarthak Kumar Maharana, Shambhavi Mishra, Yunbei Zhang, Shuaicheng Niu, Taki Hasan Rafi, Jihun Hamm, Marco Pedersoli, Jose Dolz, Yunhui Guo

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) LIVIA ETS Montreal, ILLS International Laboratory on Learning Systems (ILLS)(蒙特利尔LIVIA ETS,学习系统国际实验室(ILLS)) Tulane University(路易斯安那州立大学) Nanyang Technological University(南洋理工大学) Hanyang University(翰阳大学)

专题命中 代码评测 :repository(abstract)

AI总结 本文针对计算机视觉中训练与测试数据分布不同的问题,定义CTTA问题,分析持续域转移模式,提出分层分类法将现有方法分为三类,回顾代表性方法并展示实验结果,讨论局限性与新兴方向,为持续测试时间适应研究提供路线图。

Comments TMLR 2026 (July edition)

详情

展开后加载摘要…

URL PDF HTML 收藏