Regression Accumulation in Multi-Turn LLM Programming Conversations
多轮LLM编程对话中的回归累积
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
多轮LLM编程对话中的回归累积
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
如其所是:将LLM搜索评估与历史用户偏好对齐
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。
校准仪器:LLM驱动的合成人群的可控性
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。
从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。
QVal:廉价评估长周期LLM智能体的密集监督信号
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出QVal,一种无需训练的基准测试,通过Q值对齐直接评估密集监督信号质量,避免下游训练开销。在21种方法、4个环境上的实验表明,简单提示基线优于现有方法。
Comments 10 pages, 5 figures in main text; 48 pages, 6 figures with appendix
MultModLM:基于大语言模型的硬件原理图生成的多模态基准
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)
AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。
GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。
Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/
运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 通过分析SWE-bench上的代理轨迹和端到端修复尝试,发现代码执行在LLM程序修复中普遍使用但效益不均,限制执行可节省成本且不影响修复成功率。
Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 23 pages
自适应健康仪表盘的连续行为合成:一种集成显式偏好、空间重组和注意力分配信号的LLM中介架构
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种利用大语言模型作为行为合成引擎的架构,通过集成显式反馈、空间重组和注意力信号,实现从稀疏异构用户信号中即时生成自适应仪表盘布局。
Comments 33 pages, Accepted EICS2026 Patras, Greece
SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。
Comments Accepted by DAC 2026
软件文档的自动摘要:一种基于LLM的多智能体方法
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出基于大语言模型的多智能体系统Metagente,采用师生架构协作生成软件文档摘要,在真实数据集上优于基线方法,提升需求分析和技术文档的摘要效果。
Comments Paper has been accepted for publication with the Automated Software Engineering journal
LLM-as-a-Judge:用于Top-K推荐中可靠且可解释的离线评估
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 针对离线评估中反馈偏差和缺乏解释的问题,提出基于LLM的语义代理和推理评分框架,提升评估可靠性与可解释性。
Comments Accepted by KDD 2026
基于大语言模型的暗物质约束库自动化
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 提出一个LLM流水线,从arXiv论文中提取暗物质约束曲线并生成拉取请求,在基准测试中达到90.5%的耦合类型分类准确率和0.33 dex的中位残差。
生成式推荐器会加深信息茧房吗?基于LLM用户模拟器的闭环仿真
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出闭环仿真框架RecLoop,利用LLM用户代理比较生成式与传统推荐器,发现生成式推荐器在暴露层面不易形成信息茧房,但反馈循环仍会导致编码空间集中,且茧房严重程度取决于分词策略和模型规模。
面向软件工具发现的LLM加速快速综述——以日志异常检测为例
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出一种结合LLM筛选和编码代理的流水线,用于快速识别和运行软件工具,在日志异常检测案例中实现高效综述。
Comments 52nd Euromicro Conference on Software Engineering and Advanced Applications (SEAA) 2026
以人为中心的基准测试大型语言模型(LLM)育儿建议方法
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文以育儿专家的多维度评分为标准,采用LLM作为评判者,评估15个LLM在100个育儿场景中英、中文的表现,发现聚合分数掩盖弱点、模型隐性影响育儿风格等,为相关应用提供见解。
Comments 15 pages. Submitted for review
技能使用:智能体框架中的大语言模型(LLM)真的能使用技能吗?
机构 * East China Normal University(华东师范大学) ; Hong Kong University of Science and Technology(香港科技大学) ; Fudan University(复旦大学) ; Tencent Hunyuan(腾讯混元)
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究推出Skill-Use基准,评估智能体在渐进式披露下的技能使用,发现8个LLM在两个框架下的SU分数仅0.613,技能使用是依赖框架的能力。
反转大语言模型中的箭头
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 本研究首次系统探究大语言模型的反向关系方向性,用含5457个实例的基准评估5种开源模型,发现其反向关系分类存在不对称性,关系描述与实体表示会影响性能。
Comments The preprint is under review in a venue
ANCHOR-RE:用于接地生物医学关系抽取的智能体神经符号框架
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 该研究提出ANCHOR-RE框架,将本体引导推理等集成到LLM推理中,在多个BioRE基准及2026年生物医学文章数据集上,该框架性能优于直接LLM提示及部分现有方法,是实用的无训练生物医学文献挖掘方法。
Comments Submitted to Journal of Biomedical Informatics (under review)
CrossLex:面向大语言模型跨司法辖区法律推理的、基于法律来源的基准测试集
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.CL
AI总结 本文提出基于中、加州、德三国法律来源的CrossLex基准测试集,定义三项任务并提出联合评估指标,发现大语言模型在跨司法辖区法律推理上存在不足,旨在推动相关研究。
非对称通信:大语言模型与语言游戏
专题命中 评测与基准 :language model(title,abstract);large language model(title);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 本文通过提出非对称通信框架,纠正了AI讨论对大语言模型的错误属性投射,将相关现象重新归类为接收方一侧的现象,为AI治理提供了启示,明确对齐是制度约束工程,责任归人类机构。
超越认知:认知分裂症与作为技术符号机器的大语言模型
机构 * Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究大语言模型输出致“认知症”现象,挑战其解释框架。借鉴相关哲学,将大语言模型视为技术符号机器,指出“认知症”是“认知分裂症”后果,强调相关单元是整个实践,为新设计方案奠定基础。
印度评估:一个在印度语言和文化背景下评估大语言模型的开放基准框架
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 Inspect India Evals是在印度语言文化背景下评估大语言模型的开放框架,基于Inspect AI平台构建,含六个基准。测试五个模型,Sarvam-M 24B和Gemma 2 27B表现最佳,各模型在多语言安全测试中表现一致,DPI安全得分有差异,框架公开可扩展。
Comments 19 pages, 9 figures, 7 tables
引导语言模型更具同理心:通过人机协作生成具有文化敏感性的心理健康建议
机构 * Ahsanullah University of Science and Technology(阿山努拉科技大学) ; Bangladesh University of Business and Technology(孟加拉国商业与技术大学) ; The University of New South Wales(新南威尔士大学) ; Jashore University of Science and Technology(贾绍尔科技大学) ; American International University - Bangladesh(孟加拉国美国国际大学)
专题命中 评测与基准 :language model(title,abstract);LLM(title);large language model(abstract);prompting(abstract)
AI总结 研究探索大语言模型在低资源语言中生成同理心心理健康建议的能力,提出角色扮演反思性思维链咨询框架和基于Grok 4的评估框架,通过人机协作及特定策略,提升心理健康建议质量,使其更符合专业咨询。
大型语言模型个性化能力的基准测试
机构 * Adobe Media & Data Science Research(Adobe媒体与数据科学研究)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究大型语言模型个性化能力,将贝叶斯说服框架应用于生成式智能体并实例化到销售场景,发布SDR-Bench语料库,发现个性化存在平台期,通过现场部署验证框架,还公开了SDR-Arena和SDR-Bench以支持相关可重复研究。
ClickGuard:利用信息性度量和大语言模型检测和揭露标题党新闻
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 本文利用信息性度量和大语言模型开发了名为ClickGuard的浏览器扩展,采用混合机器学习架构,结合Transformer嵌入、语言特征和“诱饵性”分数,基于XGBoost建模,能在用户访问前后预警标题党文章,给出可能性分数并解释,还提供文章剧透。
LKValues:使大语言模型与斯里兰卡社会价值观保持一致
机构 * TJUNLP Lab, School of Computer Science and Technology, Tianjin University(天津大学计算机科学与技术学院TJUNLP实验室) ; School of Mathematical and Computational Sciences, Massey University(梅西大学数学与计算科学学院) ; Department of Computer Science & Engineering, University of Moratuwa(莫拉图瓦大学计算机科学与工程系) ; Johns Hopkins University(约翰霍普金斯大学) ; School of Computing, University of Colombo(科伦坡大学计算机学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
AI总结 研究针对大语言模型价值对齐存在西方文化偏见问题,以斯里兰卡为例,提出LKValues资源套件,通过调查得出社会价值观,构建语料库和评估基准,经实验发现其能改善模型表现,为低资源国家价值对齐提供可复制流程。
Comments 37 pages, 10 figures, and 15 tables. Includes appendices. Datasets are available at the project repository
SLAPBench:用于四指SLAP指纹验证的多模态大语言模型基准测试
机构 * University of Wisconsin–Green Bay(威斯康星大学格林湾分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.AI
AI总结 研究四指SLAP指纹验证,介绍SLAPBench基准,评估多个MLLM在不同提示下的表现,发现提示控制崩溃,模型能力控制歧视,建立了特定于SLAP的MLLM基线,揭示了模型在指纹验证中的能力差距和公平性问题。
Comments 19 pages, 6 figures, 2 tables. Includes appendix with supporting figures and per-subgroup fairness detail. Code and data: https://github.com/bibeshpyakurel/SLAPBench
用于从多语言提示生成代码的大语言模型:一个精心策划的基准测试和对代码质量的研究
机构 * University of Catania(卡塔尼亚大学) ; North Carolina State University(北卡罗来纳州立大学) ; University of Sannio(萨尼奥大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI总结 研究多语言提示对代码生成的影响,通过460个Python和Java编码任务,将英文提示翻译成多种语言并评估生成代码,发现英文提示非最佳,提示语言影响因编程语言和大语言模型而异,提供多语言基准测试及见解。