LLM Ethics Benchmark: A Three-Dimensional Assessment System for Evaluating Moral Reasoning in Large Language Models
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments Accepted by AAAI2025
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments 56 pages
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title,abstract)
专题命中 评测与基准 :LLM(title,abstract);large language model(title,abstract);language model(title,abstract)
Comments Accepted to IEEE/ACM International Conference on Software Engineering 2023 (ICSE 2023)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(title);分类 cs.CL、cs.AI、cs.LG
Comments EACL 2023 (20 pages)
LLM的变色龙本质:量化搜索增强语言模型中的多轮立场不稳定性
机构 * University of Southern California(美国南加州大学)
专题命中 评测与基准 :LLM(title_cn,summary_cn);language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI
AI总结 提出变色龙基准数据集和两个度量指标,揭示搜索增强LLM在多轮对话中因知识多样性不足而严重依赖查询框架,导致立场频繁摇摆。
Comments 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop: MTI-LLM @ NeurIPS 2025
评估大型语言模型在国际海运危险货物规则合规性上的性能
机构 * NCB Hazcheck Limited(NCB Hazcheck有限公司) ; Durham University(杜伦大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI
AI总结 本研究构建首个IMDG规则合规性基准DGEval,评估13个LLM的性能,发现其在积载等安全关键领域表现弱,仅可辅助结构化查询,需人工监督。
Comments 28 pages, 2 figures
OenoBench:用于大型语言模型知识基础评估的葡萄酒领域基准
机构 * DipWSET(葡萄酒与烈酒教育基金会文凭) ; StrategAI
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL
AI总结 本研究推出葡萄酒领域基准OenoBench,构建含3266道题的语料库,评估16种LLM配置,发现不同模型准确率差异及推理模式提升等规律并发布相关资源。
大语言模型通过了历史考试却遗漏了《历史》:波兰高中毕业考试Matura基准测试
机构 * Adam Mickiewicz University(亚当·密茨凯维奇大学) ; IDEAS Research Institute(IDEAS研究院) ; AMU Center for Artificial Intelligence(亚当·密茨凯维奇大学人工智能中心) ; Poznań University of Medical Sciences(波兹南医科大学) ; Maria Curie-Skłodowska University(玛丽·居里-斯克洛多夫斯卡大学) ; WSB Merito University(WSB梅里托大学)
专题命中 评测与基准 :LLM(summary_cn,abstract);language model(title,abstract);large language model(title);分类 cs.CL
AI总结 该研究针对波兰Matura历史考试评估8款LLM,发现其总分远超人类考生,但存在波兰历史得分惩罚、源内容混淆等缺陷,推出了首个基于波兰国家课程的LLM历史基准。
DS@GT ARC参与Touché任务:用于检索增强辩论的大型语言模型
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);prompting(abstract)
AI总结 DS@GT ARC参与Touché 2025检索增强辩论任务,采用三家提供商的六个主流LLMs通过检索增强提示流水线,发现多LLM评估者一致性无法可靠追踪官方评估目标,在质准则上差距最大。
Comments 12 pages, 4 figures. Accepted for publication in the CLEF 2026 Best of Labs proceedings
大语言模型能否恢复编译器遗漏的语义优化机会?
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 本文探究大语言模型能否恢复编译器遗漏的语义优化机会,推出含多类案例的可执行基准SeGaBench,实验显示最强模型生成的工件可实现较高正确率与加速比,证实LLM可作为编译器的补充语义提议者。
Comments 9 pages, 3 figures
大语言模型对夺旗赛的颠覆性影响及公平竞赛之路
机构 * WMG, University of Warwick(华威大学制造工程学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract);分类 cs.AI
AI总结 研究大语言模型对夺旗赛的影响,通过混合方法绘制人机能力边界,发现社区对AI参赛分歧源于竞赛目的不明。为此提出含分层分组、抗LLM挑战设计等的保障框架及决策工具,其适用于网络安全中以结果证能力的场景。
Comments 20 pages, 3 figures, 1 table
SAKE:大型语言模型的软件架构知识评估基准
机构 * University of Southern Denmark(丹麦南方大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出SAKE基准,包含2154道专家策划的多选题,评估LLM在八个架构类别和四种上下文长度下的架构知识,揭示专业实践中的能力差距。
Comments 25 pages
大型语言模型能否可靠地编码定性人道主义数据?一项针对人类专家裁决的基准研究
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG
AI总结 本研究通过对比46个大型语言模型与人类专家在150份高保真合成人道主义转录本上的编码表现,发现多个LLM在结构化提示和推理配置下能达到与经验丰富人类编码员相当的可靠性,但聚合可靠性指标不足以指导部署,模型在识别间接表达的需求、类别外需求及保护相关问题方面存在差异。
Comments 34 pages, 4 tables, 3 Annexes
测量大型语言模型中的行为可移植性
机构 * Knowledge Lab University of Chicago(芝加哥大学知识实验室) ; Data Science Institute Department of Sociology University of Chicago(芝加哥大学数据科学研究所社会学系)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出一个形式化框架,通过拟合可解释行为模型并评估其在目标环境中的预测性能,量化LLM在不同支付等价决策环境中的行为可移植性,实验发现显著且系统的可移植性损失。
SegTME-UNI2: 一种基于基础模型的可泛化多类细胞分割框架及LLM驱动的组织微环境表征在组织病理学中的应用
机构 * Department of Data Science and Artificial Intelligence, School of Computing and Artificial Intelligence, Faculty of Engineering and Technology, Sunway University(双威大学工程与技术学院计算与人工智能学院数据科学与人工智能系) ; Faculty of Dentistry, Universiti Malaya(马来亚大学牙科学院)
专题命中 评测与基准 :LLM(title,title_cn);foundation model(title,abstract);分类 cs.AI
AI总结 提出SegTME-UNI2框架,结合UNI2-H病理基础模型与双头UperNet解码器实现六类语义分割和核实例分割,通过三阶段伪标签课程学习解决标注不足问题,并利用LLM生成临床可解释的TME报告。
权威、真实性与引文偏差:研究大语言模型认知易感性的大规模多领域基准
机构 * University of California, Berkeley(加州大学伯克利分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.LG
AI总结 提出AuthorityBench基准,通过2x2因子设计隔离引文权威信号对LLM认知行为的影响,发现引文存在(无论真假)均提高幻觉率,真声明搭配假引文时幻觉率上升3-22个百分点。
Comments 10 pages, 5 figures. Accepted to AI4GOOD and EIML at ICML 2026
ChiKhaPo: 一个用于评估大型语言模型词汇理解与生成能力的大规模多语言基准
机构 * Toyota Technological Institute at Chicago(芝加哥丰田技术研究所) ; Johns Hopkins University, Center for Language and Speech Processing(约翰霍普金斯大学语言与语音处理中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.CL
AI总结 针对现有基准语言覆盖不足且侧重高阶任务的问题,提出ChiKhaPo基准,包含8个子任务,覆盖2700+种语言,评估LLM的词汇理解与生成能力,发现6个SOTA模型表现不佳。
大型语言模型作为探索性数据分析代理的商业实用性
机构 * deepsense.ai ; SGH Warsaw School of Economics(SGH沃兹尼亚克经济学院) ; Bydgoszcz University of Science and Technology(比得戈茨茨理工大学) ; Google(谷歌)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 通过基于代理的供应链模拟基准,评估LLM作为EDA代理在商业环境中的平均性能与可重复性,提出风险调整指标Business utility,发现多数配置不可靠,GPT-5.4表现最佳。
拒绝-顺从权衡:大型语言模型的大规模安全行为审计
机构 * Department of Computer and Data Sciences(计算机与数据科学系)
专题命中 评测与基准 :LLM(summary_cn,abstract);large language model(title);language model(title);post-training(abstract)
AI总结 本研究通过调整组合方法隔离模型敏感性与数据集毒性混淆,审计了21个开源权重LLM在四个安全基准上的拒绝与顺从失败模式,发现模型采用不同校准策略、人口保护不平等以及拒绝与顺从倾向在模型家族内稳定。
大型语言模型在密码分析和侧信道漏洞方面的基准测试
机构 * Macquarie University(麦考瑞大学) ; University of New South Wales(新南威尔士大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本研究通过零样本和少样本设置及思维链提示,评估大型语言模型在多种加密算法生成的密文上的解密成功率,揭示其在侧信道场景中的能力与局限,并讨论欠泛化相关攻击的风险。
Comments EMNLP'25 Findings
当英语重写地方知识:大语言模型中的全球叙事主导
机构 * University of Toronto(多伦多大学) ; BUET(巴特利特大学) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本研究通过构建孟加拉语文化数据集CulturalNB,评估大语言模型在低资源文化背景下的跨语言知识一致性,发现英语提问会系统性地增加全球替代和制度框架,减少地方视角覆盖,表明文化失败不仅是知识缺失,更是根基和叙事优先级问题。
Comments Submitted to ARR
基于大语言模型的论证质量评估:一种成对Bradley-Terry方法
机构 * Centrum Wiskunde & Informatica, The Netherlands(荷兰代尔夫特理工大学) ; Vrije Universiteit Amsterdam, The Netherlands(荷兰阿姆斯特丹自由大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本研究利用12种开源大语言模型,通过成对比较和Bradley-Terry模型评估论证质量,发现Llama-70B与人类专家判断具有中等一致性(Cohen's κ=0.493),其他模型表现各异但互补。
大型语言模型中的个性、角色与表达风格:一种互动主义分析
机构 * Okayama Prefectural University(冈山县立大学) ; AI & Humans Lab(人工智能与人类实验室) ; C4A Research Institute(C4A研究所)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);prompting(abstract)
AI总结 本研究从互动主义视角,通过因子设计实验分析个性特质、对话角色和表达风格如何共同影响大型语言模型生成对话中感知的大五人格特质表达。
Comments 26 pages
AlphaForgeBench:用大型语言模型对端到端交易策略设计进行基准测试
机构 * Nanyang Technological University(南洋理工大学) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; Hong Kong Polytechnic University(香港理工大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(summary_cn,abstract_cn);分类 cs.AI
AI总结 提出AlphaForgeBench框架,将LLM从随机交易代理重新定义为量化研究员,通过生成可执行alpha因子和基于因子的交易策略,消除执行不稳定,实现可复现的金融推理评估。