CORE: Comprehensive Ontological Relation Evaluation for Large Language Models
CORE:面向大语言模型的全面本体关系评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
CORE:面向大语言模型的全面本体关系评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。
在悬崖边转向还是偏离?重新思考推断时间干预中的特异性和鲁棒性
机构 * University of Maryland College Park(马里兰大学学院市)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出模型转向中特异性和鲁棒性的评估框架,揭示转向方法在提升效率的同时可能牺牲安全性。
Comments EACL 2026 Main, Long Paper
CreditAudit: 2维度用于LLM评估与选择
机构 * Northwestern Polytechnical University Institute of Artificial Intelligence (TeleAI), China Telecom(西北工业大学人工智能研究所(TeleAI),中国电信) ; Dalian Maritime University Institute of Artificial Intelligence (TeleAI), China Telecom(大连海事大学人工智能研究所(TeleAI),中国电信) ; Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) ; Guangxi Normal University Institute of Artificial Intelligence (TeleAI), China Telecom(广西师范大学人工智能研究所(TeleAI),中国电信)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CreditAudit 通过 2D 信用评级框架,提供基于稳定性风险的 LLM 部署评估方法,支持更精确的模型选择与分层部署。
Comments Second update
关于通过调查问题评估LLM可信度的研究
机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。
Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures
FoundationalASSIST: 一个用于基础知识追踪和LLM教学基础的教育数据集
机构 * Worcester Polytechnic Institute(沃斯特理工大学) ; The ASSISTments Foundation(ASSISTments基金会) ; University of Central Florida(中央佛罗里达大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY、cs.LG
AI总结 FoundationalASSIST 是首个为研究LLM在教育中的应用而设计的英文教育数据集,提供完整问题文本、学生实际回答和对齐标准,用于评估LLM在知识追踪和教学基础方面的性能。
用户模拟中需要基于社会的个性框架
机构 * Salesforce Research(Salesforce研究院)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文提出SCOPE框架,通过社会心理学协议构建更高质量的个性,提升大语言模型在社会模拟中的表现。
通过LLM修订支持利益相关者需求表达:一项实证评估
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文通过实证研究展示LLM在辅助利益相关者表达需求方面的有效性,证明其能提升需求表达的完整性、清晰度和一致性。
Comments This paper has been accepted at the research track of the 32nd International Working Conference on Requirements Engineering: Foundation for Software Quality (REFSQ 2026)
评估大型语言模型在法律应用中的表现:挑战、方法与未来方向
机构 * Tsinghua University(清华大学) ; The University of Hong Kong(香港大学) ; University of Waterloo(多伦多大学) ; Shanghai Jiaotong University(上海交通大学) ; Peking University(北京大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 本文探讨了大型语言模型在法律应用中的评估挑战与方法,分析了现有评估框架的局限性,并提出了未来研究方向。
可控且受保护的内容生成的生成式AI代理
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本文提出了一种多代理框架,通过整合可控内容生成和来源保护,解决生成式AI在可控性和内容保护方面的挑战。
Comments Accepted GenProCC NeurIPS 2025, Paper # 33
Journal ref GenProCC NeurIPS 2025, Paper # 33
MMDeepResearch-Bench: 一个多模态深度研究代理的基准
机构 * OSU(俄亥俄州立大学) ; Amazon(亚马逊公司) ; UMich(密歇根大学) ; UCL(伦敦大学学院) ; CUHK(香港中文大学) ; UCR(加州大学尔湾分校) ; CWRU(克里夫兰医学中心) ; HKU(香港大学)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 MMDeepResearch-Bench提出一个多模态深度研究代理的基准,强调报告式合成与引用证据的结合,揭示多模态完整性对深度研究代理的重要性。
从守护者到魔鬼?由LLM防御引发的意外风险交互
专题命中 安全评测 :safety(abstract);jailbreak(abstract)
AI总结 本文提出CrossRiskEval框架,系统研究LLM防御在安全、公平性与隐私间的相互影响,揭示防御措施对其他风险的非随机交互机制。
LIME-LLM:通过流畅的反事实而非破碎文本来探测模型
机构 * University of North Texas(北卡罗来纳州立大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LIME-LLM通过假设驱动的可控扰动提升NLP模型的可解释性,实现更准确的局部解释效果。
FIRE 2025 科学高跟踪概述:从科学论文中生成研究亮点
机构 * Jadavpur University(贾梵pur大学) ; Indian Association for the Cultivation of Science(印度科学培养协会) ; Techno India University(技术印度大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 FIRE 2025 科学高跟踪旨在通过预训练语言模型等方法,从科学论文摘要中自动生成简洁的亮点,以提升文献阅读效率和学术资源检索质量。
Comments 7 pages, 2 tables
PMOA-TTS:引入PubMed开放获取文本时间序列语料库
机构 * Machine Learning Department, School of Computer Science(计算机科学系机器学习部门) ; Heinz College of Information Systems and Public Policy(信息系统与公共政策学院) ; National Library of Medicine(国家医学图书馆)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 PMOA-TTS通过大规模语言模型管道构建,为时间序列分析提供结构化文本时间线,支持时间推理、生存建模和事件预测研究。
实例对齐的描述用于可解释的视频异常检测
机构 * SungKyunKwan University(顺 Kyun 峰大学)
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。
深度价值基准:衡量模型是泛化深度价值还是浅层偏好
机构 * University of Michigan Ann Arbor(密歇根大学安娜堡分校) ; New York University Shanghai(纽约大学上海)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY
AI总结 深度价值基准通过测试模型泛化深度价值还是浅层偏好,评估AI对齐的核心能力。
Comments NeurIPS 2025 (Spotlight)
关于3D大视觉-语言模型的对抗鲁棒性
机构 * Singapore University of Technology and Design (SUTD)(新加坡科技设计大学)
专题命中 安全评测 :alignment(abstract);safety(abstract)
AI总结 本文研究了3D大视觉-语言模型的对抗鲁棒性,提出两种攻击策略评估其鲁棒性,发现其在无目标攻击下较脆弱,但在有目标攻击中更稳健。
Comments Under Review
MLB:面向临床应用的大型语言模型评估场景驱动基准
机构 * Ant Group(蚂蚁集团) ; Zhejiang University(浙江大学) ; Health Information Center of Zhejiang Province(浙江省健康信息中心) ; Peking University(北京大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 MLB基准通过场景驱动的评估方法,评估大型语言模型在临床应用中的表现,揭示模型在结构化任务与患者交互场景间的性能差异。
Comments 11 pages, 4 figures, 5 tables
大规模多模态基准的判断模型
机构 * Department of Electrical and Computer Engineering, Viterbi School of Engineering, University of Southern California(电气与计算机工程系,维特比工程学院,南加州大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出了一种多模态判断模型,用于评估多种任务,通过聚合多模态判断并生成诊断反馈,展示了其在多模态AI研究中的应用潜力。
基于英国航路空域的概率数字孪生:用于训练和评估空管AI代理
专题命中 安全评测 :safety(abstract);trustworthy(abstract)
AI总结 本文提出基于英国航路空域的概率数字孪生,用于训练和评估空管AI代理,通过结合历史与实时数据及概率模型,提供高保真虚拟环境以支持AI代理的开发与评估。
开放世界知识辅助的单细胞基础模型与鲁棒跨模态细胞-语言预训练
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OKR-CELL通过开放世界知识和鲁棒跨模态预训练,提升单细胞基础模型在细胞-语言跨模态任务中的表现。
Comments 41 pages
LORE:一种大规模生成模型用于搜索相关性
机构 * Alibaba Group(阿里巴巴集团)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 LORE提出了一种基于大规模生成模型的搜索相关性框架,通过两阶段训练和分层部署策略提升搜索效果,为垂直领域提供方法参考。
OAEI-LLM-T:用于理解大规模语言模型幻觉的本体匹配TBox基准数据集
机构 * Australian National University(澳大利亚国立大学) ; Monash University(墨尔本大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 OAEI-LLM-T是一个用于研究大规模语言模型在本体匹配中幻觉问题的TBox基准数据集,通过分类幻觉类型并提供评估工具,促进对LLM在OM任务中表现的深入理解。
Comments 14 pages, 4 figures, 4 tables, 2 prompt templates
Aletheia: 通过正则化逆混淆矩阵量化推理模型中的认知信念
机构 * Zhejiang University(浙江大学)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 Aletheia通过正则化逆混淆矩阵量化推理模型中的认知信念,探索AI科学诚信的测量方法。
Comments 6 pages, 2 figures
病变聚焦对基于AI的黑色素瘤分类性能的影响
机构 * Department of Computer Science University of Illinois Urbana-Champaign(计算机科学系伊利诺伊大学厄巴纳-香槟分校)
专题命中 安全评测 :alignment(abstract);trustworthy(abstract)
AI总结 本研究探讨了病变聚焦对AI黑色素瘤分类性能的影响,通过分析模型对病变区域的关注程度,揭示了可解释AI在医疗诊断中的应用潜力。
语言模型代理受攻击:客户服务中心中逐利行为的跨模型基准测试
专题命中 安全评测 :prompt injection(abstract);trustworthy(abstract)
AI总结 本文提出了一项跨领域基准测试,评估客户服务中心中LLM代理在面对利润驱动攻击时的鲁棒性,揭示了攻击的领域和技术依赖性,并提供了可复现的评估工具。
代理大语言模型:综述
机构 * Leiden University Leiden Netherlands ; Leiden University \& AI Lab, Pegasystems Leiden Netherlands ; Leiden University ; Leiden University \& AI Lab, Pegasystems
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文综述了代理大语言模型的研究现状,探讨了其在医疗诊断、物流和金融分析等领域的应用,并提出通过推理、行动和交互提升大语言模型能力的未来研究方向。
Comments Website: https://askeplaat.github.io/agentic-llm-survey-site/
Journal ref JAIR volume 84, article 29, December 2025
道德是情境性的:从人类数据中学习可解释的道德情境,结合概率聚类和大语言模型
机构 * Institute of Intelligent Systems and Robotics(智能系统与机器人研究所) ; Sorbonne University(索邦大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 COMETH通过结合概率聚类和大语言模型,从人类数据中学习可解释的道德情境,提升道德判断的准确性与可解释性。
Comments 11 pages, 5 figures, +24 pages of Appendix
持续学习中虚假遗忘的实时检测与定量分析
机构 * Shenzhen Sunline Tech Co., Ltd.(深圳Sunline科技有限公司)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出浅层与深层对齐框架,通过定量指标和实时检测方法解决持续学习中的虚假遗忘问题,提升模型鲁棒性。
通过科学家对齐的工作流探测大语言模型的科学通用智能
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出基于实用探究模型的科学通用智能定义,通过四个科学家对齐任务构建SGI-Bench,揭示大语言模型在科学推理中的不足,并引入测试时强化学习提升创新性。