Validation Evidence in LLM Repair Agents: How Much of What Passes Actually Tests the Bug?
LLM修复智能体中的验证证据:通过的测试究竟在多大程度上能检验缺陷?
专题命中 其他LLM :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究以BSG-VA方法分析LLM修复智能体的验证证据,发现近半数阳性测试无缺陷区分信息,缺陷对比反馈可减少证据不足的部署,其效果幅度仍需进一步验证。