SONAR: Task-Aware Code Summary Evaluation for LLM Consumers Without References
SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SONAR:面向LLM使用者的任务感知型代码摘要评估框架(无需参考摘要)
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 该研究提出无需参考摘要的SONAR框架,从四个维度评估代码摘要,发现正确性、抽象性对LLM性能影响显著,简洁性、流畅性影响微弱,还明确了不同LLM在各维度的优劣。
评估MFU作为GPU功耗代理用于LLM训练的能效感知仿真
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本研究测试MFU能否作为LLM训练的GPU功耗预测器,通过近3000次单设备训练基准测试,发现计算密集型 workload 下基于MFU的线性模型适用,特定参数拟合可大幅降低误差。
Comments Accepted at MASCOTS 2026
CodeAssay:带有审计基准真值的多指标大语言模型代码生成基准
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出CodeAssay基准,涵盖185个Python任务,结合多类测试与度量,经审计后发现模型正确性标签有9.0%变化,且验证了多类LLM代码生成的评估特性。
位置偏差破坏基于大语言模型的列表式重排序中的偏好一致性
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 本研究揭示基于LLM的列表式重排序存在位置偏差,引入多维度评估框架验证其会破坏偏好一致性,且均衡位置曝光无法修复该问题。
Comments Accepted at RecSys 2026
多智能体LLM辩论中偏向性共识的涌现
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 该研究针对多智能体LLM辩论中集体偏向性共识的涌现问题,提出物理启发的社会动力学分析框架,经实验验证其相变规律,发现智能体异质性可抑制该现象,且见解可推广至投资等现实决策任务。
Comments Accepted at the 43rd International Conference on Machine Learning (ICML 2026). 23 pages, 12 figures
人人遵从,无人认同:LLM智能体群体中的多元无知
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 该研究证实LLM智能体群体中会出现多元无知,构建了多场景基准评估8种模型,发现遵从率高且级联成功率低,提示模型选择会影响模拟结果,LLM模拟或高估社会规范稳定性。
顺应阻力:偏好优化的大型语言模型(LLM)咨询师可在动机访谈中权衡目标坚持性与关系调谐
专题命中 评测与基准 :LLM(title,title_cn);preference optimization(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 该研究基于动机访谈准则构建双轴评估框架,通过偏好优化训练LLM咨询师,发现惩罚对抗会降低目标坚持性,惩罚妥协无显著效果,仅提示控制可提升关系调谐且无目标坚持性代价。
利用感知能力:针对多模态大语言模型智能体的隐蔽并发音频提示注入攻击
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 该研究针对多模态LLM智能体提出隐蔽并发音频提示注入攻击,构建首个相关基准并评估多款智能体,还提出CADV防御机制,经实验验证攻击有效且防御可靠。
Comments 19 pages, 8 figures, The code is publicly available at https://github.com/Limax666/AudioAgentSecurity
评估LLM代理在自动化软件分析任务中的性能
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文通过AnalysisBench评估四种LLM架构在自动化软件分析任务中的表现,发现AnalysisAgent在手动验证的成功率高达94%,而现有代理存在阶段混用、错误定位差等问题,且整程序分析和符号执行是最具挑战性的任务。
基于LLM的视觉解释评估框架:用于评估面部皮肤病分类模型的可解释性
机构 * AI and Business Analytics, Ewha Womans University(人工智能与商业分析,成均馆大学)
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出基于LLM的视觉解释评估框架,通过渐进式提示工程评估Grad-CAM在面部皮肤病诊断模型中的解释质量,聚焦病变定位和可信度。
命名之前先理解!通过代码摘要增强基于大语言模型的方法名预测
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究针对方法名预测中现有评估不能反映语义质量、基于LLM的方法与人命名过程不同的问题,通过实证研究比较多种评估器及策略,提出结合摘要和细化的SMNP方法,实验证明该方法在方法名预测上有效且鲁棒。
通过变形测试和关联规则挖掘对大语言模型生成代码进行横切安全分析
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究针对LLM生成代码的安全漏洞,提出结合变形测试与关联规则挖掘的框架,定义九个MRs并应用于3700个代码片段,揭示共同违反结构与横切模式,还进行提示级风险分析,发现不安全代码生成具结构化和提示依赖性,推动相关验证与干预。
Comments This work has already been accepted by IEEE 27th International Conference on Information Reuse and Integration for Data Science
TerraRepair:一种用于基础设施即代码修复的工具接地大语言模型代理
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究探讨工具接地能否改进基于LLM的Terraform修复及何时升级问题。提出TerraRepair工具接地LLM代理,通过检索上下文等操作进行修复。实验表明其能显著提高扫描器验证修复率,凸显工具接地改进修复效果,同时指出特定部署上下文是自主修复的主要限制。
Comments The paper has been peer reviewed and accepted for publication in the proceedings of the 20th International Symposium on Empirical Software Engineering and Measurement (ESEM 2026)
AutoQResearch:基于LLM的闭环策略搜索用于自适应变分量子优化
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 本文提出AutoQResearch,通过LLM引导的闭环实验框架,实现变分量子优化中求解器的自适应配置,通过阶段确认和低成本评估避免过拟合,展示在最大独立集和车辆路径问题上的有效性。
Comments Accepted at the 2026 IEEE International Conference on Quantum Computing and Engineering (QCE 2026), Quantum-GenAI Co-Design & Co-Discovery (QGDD) Technical Papers Track. QCE26 Technical Paper 238
ARGUS:防御大语言模型智能体免受上下文感知提示注入攻击
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究针对LLM智能体的上下文感知提示注入攻击,提出AgentLure基准测试及ARGUS因果溯源审计器,通过构建溯源图等验证行动因果依据,在AgentLure上降低攻击成功率,提升安全-效用权衡表现。
Comments 14 pages
针对基于大语言模型的网络流量分类器的可控性感知对抗样本
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究基于大语言模型的网络流量分类器的对抗鲁棒性,提出可控性感知黑盒迁移框架,按通信语义划分特征组限制扰动,生成对抗样本并迁移到多个目标,发现LLM迁移漏洞及相关特性,验证跨架构迁移层次和交叉代理有效性。
Comments 13 pages, 5 figures
在来自不受信任第三方渠道的对抗性提示下衡量移动大语言模型代理的安全性
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract)
AI总结 研究移动LLM代理在对抗性环境下的安全风险,设计评估一系列案例研究,涵盖多种攻击类型并涉及多个先进移动代理,通过大量试验揭示系统漏洞,映射攻击到相关框架发现新途径,证明其在现实中可被利用。
多轮LLM编程对话中的回归累积
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 研究多轮LLM编程对话中代码建议破坏先前需求的回归累积问题,通过构建542个任务链评估六种模型,发现40%-73%的任务出现回归,并验证了Verification Gate策略的有效性。
认知防火墙:一种主动、零信任、多门控的LLM安全框架
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出认知防火墙框架,通过意图、零信任上下文、一致性和输出风险四个门控进行对话级安全评估,有效降低单轮、多轮、基于权威和人工制作的越狱攻击成功率。
如其所是:将LLM搜索评估与历史用户偏好对齐
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出行为锚定的LLM评判器,通过查询-相关性-印象卡引入历史用户交互证据,在音乐搜索评估中提升与用户偏好的斯皮尔曼秩相关约5%,并在多语言数据集上提高15%的相关性。
校准仪器:LLM驱动的合成人群的可控性
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出SIVE实验,通过七项预注册标准评估LLM驱动合成人群对已知效价刺激的响应可控性,发现弱阳性消息被识别为阴性,经重新设计后恢复预期排序,并揭示噪声特性与微观动力学。
从灰烬中崛起:基于LLM的深度学习框架缺陷静态分析
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出首个基于LLM的静态分析技术Phoenix,通过结构化语义桥接中间表示建模跨语言张量流,结合多智能体工作流检测深度学习框架缺陷,已在PyTorch中发现31个新bug。
QVal:廉价评估长周期LLM智能体的密集监督信号
机构 * Tübingen AI Center, University of Tübingen(图宾根大学图宾根人工智能中心) ; Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会)
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出QVal,一种无需训练的基准测试,通过Q值对齐直接评估密集监督信号质量,避免下游训练开销。在21种方法、4个环境上的实验表明,简单提示基线优于现有方法。
Comments 10 pages, 5 figures in main text; 48 pages, 6 figures with appendix
TacEvo:通过LLM驱动的质量多样性搜索实现机器人触觉感知的自演化架构发现
机构 * Department of Bioengineering, Imperial-X Initiative, Imperial College London(生物工程系、Imperial-X计划、伦敦帝国学院)
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出TacEvo框架,利用LLM生成代码级变异和交叉,结合MAP-Elites质量多样性循环,自动发现高效触觉感知网络架构,在力回归和光栅分类任务上显著提升性能。
重新思考基于LLM的推荐系统中的公平性:一项综述
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 本文系统综述了基于大语言模型的推荐系统中的公平性问题,从偏见机制和公平目标两个维度组织现有研究,并探讨了评估与缓解策略,旨在为未来研究提供结构化基础。
MultModLM:基于大语言模型的硬件原理图生成的多模态基准
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract)
AI总结 提出MultModLM基准,评估LLM从RTL描述生成硬件原理图的能力,通过多阶段评估框架发现模型生成原理图功能正确性有限,且LLM评估者与人类评分一致性极低。
GenWorld:用于可扩展LLM智能体研究的经验性城市模拟基础设施
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 提出GenWorld,一种结合合成城市、结构化接口和离线编译LLM决策信号为查找策略的经验性城市模拟基础设施,实现可扩展的LLM智能体研究。
Comments 27 pages, 24 figures. Code: https://github.com/Perseus1993/genworld. Project page: https://genworld1993.netlify.app/
运行还是不运行:分析基于LLM的程序修复中代码执行的成本效益
专题命中 评测与基准 :LLM(title,title_cn)
AI总结 通过分析SWE-bench上的代理轨迹和端到端修复尝试,发现代码执行在LLM程序修复中普遍使用但效益不均,限制执行可节省成本且不影响修复成功率。
Comments Accepted to the ACM SIGSOFT International Symposium on Software Testing and Analysis (ISSTA 2026). 23 pages
自适应健康仪表盘的连续行为合成:一种集成显式偏好、空间重组和注意力分配信号的LLM中介架构
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出一种利用大语言模型作为行为合成引擎的架构,通过集成显式反馈、空间重组和注意力信号,实现从稀疏异构用户信号中即时生成自适应仪表盘布局。
Comments 33 pages, Accepted EICS2026 Patras, Greece
SafeGen: 面向功能安全的LLM驱动断言生成与故障关键性评估
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract)
AI总结 提出SafeGen框架,利用大语言模型和超知识图谱从设计文档提取规范并生成功能安全断言,结合门级到RTL故障映射与形式验证实现故障关键性语义分级,在FOC系统中验证了优于传统方法。
Comments Accepted by DAC 2026