Comparing Developer and LLM Biases in Code Evaluation
比较开发者与LLM在代码评估中的偏见
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 本文提出TRACE框架,评估LLM在代码评估中的偏见,发现LLM在与开发者偏好对齐方面表现不佳,揭示了人类与模型在代码质量标准上的系统性差异。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
比较开发者与LLM在代码评估中的偏见
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 本文提出TRACE框架,评估LLM在代码评估中的偏见,发现LLM在与开发者偏好对齐方面表现不佳,揭示了人类与模型在代码质量标准上的系统性差异。
推理模型优于LLM-判官,但存在偏见
机构 * Institute of Science Tokyo(东京科学研究院) ; Harbin Institute of Technology(哈尔滨工业大学) ; The University of Osaka(大阪大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 本文系统比较了推理模型在判断任务中的表现,发现其在准确性、指令遵循和抗攻击能力上优于非推理LLM,但存在显著偏见,提出PlanJudge策略以缓解偏见问题。
Comments Accepted by ACL 2026 Workshop EvalEval
LLM pipelines 中隐藏的测量误差扭曲了注释、评估和基准测试
机构 * Center for Social Media, AI, and Politics(社交媒体、人工智能与政治中心)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 本文分析了LLM评估流程中隐藏的测量误差来源,通过设计研究减少总评估误差,并展示改进后的精度和基准测试效果。
SAGE:可扩展的自动鲁棒性增强用于LLM知识评估
机构 * University of Science and Technology of China(中国科学技术大学) ; Alibaba Group(阿里巴巴集团) ; National University of Singapore(新加坡国立大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 SAGE通过细调小型模型构建大规模鲁棒性增强的知识评估基准,成本显著低于人工标注的HellaSwag-Pro,且细调模型可泛化至MMLU。
Comments Under Review
LLM-X:一种可扩展的面向协商的交换机制用于个人LLM代理间的通信
机构 * University of Waterloo(滑铁卢大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出LLM-X,一种可扩展的面向协商的交换机制,支持个人代理间的结构化通信。该机制引入了消息总线和路由子层,支持LLM间的协调,并保证了模式有效性和政策执行。贡献包括LLM-X的架构、类型化消息协议以及首次大规模LLM多代理协商的实证评估。
Comments 8 pages, 7 figures, accepted at AGENT 2026 Workshop, co-located with ICSE 2026
gwBenchmarks: 对高精度引力波天文学中LLM代理的应力测试
机构 * Kavli Institute for Theoretical Physics, University of California Santa Barbara, Kohn Hall, Lagoon Rd, Santa Barbara, CA 93106(加州大学圣芭芭拉分校凯弗利理论物理研究所) ; Center for Gravitational Physics, University of Texas at Austin, Austin, TX 78712, USA(德克萨斯大学奥斯汀分校引力物理中心) ; Department of Physics, Princeton University, Princeton, NJ 08540, USA(普林斯顿大学物理系)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文研究了最先进的LLM编码代理能否完成端到端的科学建模任务,通过八个任务测试其精度和物理系统推理能力,发现代理在复杂任务上表现不佳,无法达到领域要求。
Comments 26 pages, 4 figures
技能漂移是合同违约:为LLM代理技能库的主动维护
机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院 Gallagher 学院) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出通过提取可执行环境合同来检测LLM代理技能库中的技能漂移,通过区分噪声监控与精准维护信号,提升检测精度和修复效果,同时发布了一个技能退化基准数据集。
LITMUS:在真实操作系统环境中评估LLM代理行为越狱的基准测试
机构 * Nanjing University of Aeronautics and Astronautics(南京航空航天大学) ; Zhejiang University(浙江大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 LITMUS通过语义-物理双重验证机制和操作系统级状态回滚,解决现有基准测试在物理层危害评估和测试隔离上的不足,揭示LLM代理在行为安全方面的缺陷和漏洞。
通过低秩分解实现LLM评估中的最佳模型识别
机构 * Department of Computer Science, Technion – Israel Institute of Technology(计算机科学系,技术离子理工学院) ; Department of Electrical and Computer Engineering, Technion – Israel Institute of Technology(电气与计算机工程系,技术离子理工学院)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出结合多臂老虎机与低成本预测评分的框架,通过低秩分解减少方差,构建有效的置信区间,实现实验结果的准确识别与计算成本的降低。
KernelBenchX: 一个全面的评估LLM生成GPU内核的基准测试
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG
AI总结 本文提出KernelBenchX基准测试,通过176个任务的分类评估,揭示LLM生成GPU内核在正确性和硬件效率上的表现,发现任务结构比方法设计更重要,迭代优化提升正确性但不改善性能,正确性不等于效率,量化问题仍未解决。
Comments minor textual revision; no changes to technical content or results
ER-Reason:用于急诊科大型语言模型临床推理的基准数据集
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of California, San Francisco(加州大学旧金山分校) ; Duke University(杜克大学) ; University of Alberta(阿尔伯塔大学) ; Beth Israel Deaconess Medical Center(贝斯以色列德aconess医疗中心) ; UC Berkeley and UCSF(伯克利大学和旧金山分校)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 ER-Reason基准数据集通过真实患者病例评估LLM在急诊流程中逐步推理能力,包含25174份脱敏临床记录,采用Script Concordance Test风格问题测试模型在积累临床证据时的诊断信念更新。
检测、定位与解释:基于LLM增强的交互式分层日志异常分析
机构 * Worcester Polytechnic Institute, USA(沃斯特理工学院,美国) ; University of Nevada, Las Vegas, USA(内华达大学拉斯维加斯分校,美国)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出Krone系统,通过分层日志抽象和 orchestration 框架,结合LLM推理实现日志异常的精准检测、定位与解释,提供交互式可视化工具支持软件工程师和系统运维人员进行可解释的分层日志分析。
SAGE:基于本体的层级LLM文学评价
机构 * Mercy University, Math & Computer Science Department(梅里大学数学与计算机科学系) ; IBM T.J. Watson Research Center(IBM 托马斯·贾维斯·沃森研究中心)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 SAGE通过本体引导的解释性维度对文学质量进行分层评估,利用结构化大语言模型评估和多轮迭代反思,实现98.8%的评分收敛和94%的评分者一致性,揭示了文学质量的层次结构和影响因素。
Comments 19 pages, 4 figures
JudgeSense: 一个用于评估LLM作为裁判系统提示敏感性的基准
机构 * Florida International University(佛罗里达国际大学) ; CrowdStrike ; University of Maryland Baltimore County(马里兰大学巴尔的摩县分校)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文提出JudgeSense基准,用于评估LLM作为裁判系统在提示重述下的稳定性,分析不同任务和架构的决策稳定性,并发现一致性不依赖模型规模。
Comments 20 pages, 2 figures, 1 table. Code: https://github.com/rohithreddybc/judgeSense. Dataset (JudgeSense Benchmark): https://huggingface.co/datasets/Rohithreddybc/judgesense-benchmark
NeuroAgent:用于多模态神经影像分析和研究的LLM代理
机构 * Stevens Neuroimaging and Informatics Institute, Keck School of Medicine, University of Southern California(史蒂文斯神经影像与信息学研究所,凯克医学院,南加州大学) ; Viterbi School of Engineering, University of Southern California(维特比工程学院,南加州大学) ; Alfred E. Mann Department of Biomedical Engineering, Viterbi School of Engineering, University of Southern California(阿尔弗雷德·E·曼生物医学工程部门,维特比工程学院,南加州大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 NeuroAgent通过LLM驱动的代理框架自动化多模态神经影像预处理与分析,支持自然语言查询,提升神经影像研究的自动化与可重复性。
超越准确性:将政策不变性作为LLM安全裁判的可靠性测试
机构 * Nanjing University(南京大学) ; Singapore Management University(新加坡国立管理学院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出政策不变性作为LLM安全裁判可靠性测试,通过三个可测试原则揭示现有裁判在面对规范性变化和结构性重写时的失效模式,并提出政策不变性分数和裁判卡报告协议以评估裁判可靠性。
Comments 9 pages
LoopTrap: 对 LLM agent 的终止污染攻击
机构 * The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室) ; Zhejiang University(浙江大学) ; School of Cyber Science and Engineering(网络安全与工程学院) ; Southeast University(东南大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文研究了LLM agent迭代执行循环中的终止污染风险,提出10种攻击策略并通过实验证明不同agent的行为特征影响攻击效果,设计了自动化框架LoopTrap以提升红队攻击效率。
利用优化深度学习和LLM驱动智能AI对膝骨关节炎严重程度进行分级
机构 * Jamia Hamdard(贾迈亚哈姆达德大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出结合深度学习CNN与TensorFlow Lite平台的自动诊断方法,用于膝骨关节炎严重程度分级,通过迁移学习和优化模型实现94.48%的测试准确率,并利用Gemini-2.0-flash生成解释性结果,提升AI辅助筛查的可及性。
Comments 6 pages, 11 figures, Accepted and presented at the 2nd International Conference on Emerging Computational Intelligence (ICECI 2026), IEEE. Published in conference proceedings. To appear in IEEE Xplore
SkillRet:一种大规模技能检索基准,用于LLM代理
机构 * ThakiCloud
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出SkillRet基准,用于评估LLM代理中的技能检索。该基准包含17810个公开技能,提供63259个训练样本和4997个评估查询,通过任务特定微调显著提升了检索性能。
通过验证驱动的LLM工作流生成统计图表
机构 * University of Ljubljana Faculty of Computer and Information Science(卢布尔雅那大学计算机与信息科学系)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.LG
AI总结 本文提出一种结构化的LLM工作流,通过验证输出来生成多样且易读的统计图表,解决可视化特有的失败模式,如可读性和语义不匹配。
Sentra-Guard:一种实时多语言对抗对抗性LLM提示的防御系统
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Sentra-Guard通过混合架构和分类器-检索器融合模块,实时检测并缓解针对大语言模型的劫持和提示注入攻击,实现多语言鲁棒性与高检测率。
Comments 11 pages, 5 figures. Preprint version under review in the area of Artificial Intelligence (cs.AI)
TADI:通过异构钻井现场数据的代理LLM编排实现工具增强的钻井智能
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 TADI通过代理LLM编排整合钻井数据,实现证据驱动的分析智能,展示了领域专用工具设计对分析质量的关键作用。
保真度、多样性与隐私:面向临床数据增强的多维LLM评估
机构 * Universidad Politécnica de Madrid(马德里理工大学) ; University Hospital Rey Juan Carlos(雷伊·卡洛斯大学医院) ; University Hospital Jimenez Diaz Foundation(吉梅尼兹·迪亚兹基金会大学医院) ; General Hospital of Villalba(维拉尔巴综合医院) ; University Hospital Infanta Elena(伊菲塔·埃莱娜大学医院) ; Universidad Catolica del Maule(马乌尔天主教大学) ; Madrid Autonomous University(马德里自治大学) ; CIBERSAM, ISCIII
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出多维LLM评估框架,用于生成符合ICD-10编码的合成心理健康评估报告,评估保真度、多样性及隐私安全,提升临床NLP训练数据质量。
Comments 9 pages, 1 figure, 1 table
基于意图匹配的政策引导LLM路由用于仪器实验室
机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学 爱丁堡 英国)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出基于意图匹配的政策引导LLM路由系统,通过Routiium和EduRouter实现对实验室辅助系统的管理和控制,提升学习挑战度和任务完成率。
Comments IEEE EduCon
提升议程设定研究:28个欧洲议会的ParlaCAP数据集及可扩展的多语言LLM分类方法
机构 * Jožef Stefan Institute(焦兹夫·斯蒂芬研究所) ; Faculty of Computer and Information Science(计算机与信息科学系) ; University of Ljubljana(卢布尔雅那大学) ; Institute of Contemporary History(当代历史研究所) ; Faculty of Political Science(政治科学系) ; University of Zagreb(扎格列布大学)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文介绍ParlaCAP数据集,用于分析欧洲议会议程设定,并提出一种低成本的领域特定政策主题分类方法,通过多语言ParlaMint语料库构建分类器,展示其在目标领域内的有效性。
Comments 17 pages, 7 figures, 7 tables. Presented in the PoliticalNLP 2026 workshop, co-located with LREC 2026 conference
LLM代理能否模拟多轮人类行为?基于真实在线客户行为数据的证据
机构 * Northeastern University(东北大学) ; Amazon.com, Inc.(亚马逊公司)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 本文通过购物案例研究,首次对先进LLM在模拟人类行为方面的准确性进行大规模定量评估,发现基于提示的LLM仅能生成11.86%的人类行为,通过微调提升至17.26%和33.86%的F1分数,建立首个严谨的基准。
RESTestBench:一个评估LLM生成REST API测试用例有效性的基准
机构 * CASABLANCA hotelsoftware GmbH(CASABLANCA酒店软件公司) ; University of Innsbruck(因斯布鲁克大学) ; Technical University of Munich(慕尼黑技术大学) ; Diffblue Ltd(Diffblue有限公司)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 RESTestBench通过精确和模糊的自然语言需求评估LLM生成的REST测试用例有效性,引入基于需求的变异测试指标,评估两种生成方法在不同LLM中的表现。
Comments Accepted for EASE 2026
再见视角API:NLP、CSS和LLM评估中的测量基础设施教训
机构 * Weizenbaum Institute(韦izenbaum研究所) ; TU Berlin(柏林技术大学) ; University of Oxford(牛津大学) ; KU Leuven(根特大学) ; Pleias(Pleias公司) ; Freie Universität Berlin(柏林自由大学) ; University of Bremen(不莱梅大学) ; ifib research(ifib研究) ; TU Munich(慕尼黑技术大学) ; Munich Center for Machine Learning(慕尼黑机器学习中心) ; HTW Berlin(柏林应用技术大学) ; University of Hamburg(汉堡大学)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL
AI总结 视角API的关闭使NLP、CSS和LLM评估领域失去自动化毒性测量的基准,本文探讨其依赖问题及对研究的影响,呼吁建立独立、可验证的测量基础设施。
Comments 13 pages, 1 figure, 1 table
ValueAlpha:基于LLM投资理据的同意门压力测试
机构 * Blossom AI Labs(Blossom AI实验室) ; Blossom AI
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出ValueAlpha协议,通过控制市场状态资本分配原型,评估LLM投资理据的可发表性与有效性,发现低秩系统和单判官排名的依赖性及术语惩罚问题。
Comments 9 pages, Submitted to IEEE Computational Intelligence in Financial Engineering and Economics (CIFEr) 2026, Tokyo, Japan
多维评估可持续城市旅行的LLM-as-Judge与人机协同
机构 * Technical University of Munich(慕尼黑技术大学) ; Polytechnic University of Bari(巴里理工学院)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出多维评估可持续城市旅行推荐的框架,通过LLM-as-Judge和人类协同校准,解决传统指标忽略利益相关者目标的问题,揭示模型偏差与维度差异。