CORE: Comprehensive Ontological Relation Evaluation for Large Language Models
CORE:面向大语言模型的全面本体关系评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
CORE:面向大语言模型的全面本体关系评估
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 CORE提出一个全面评估大语言模型语义关系区分能力的数据集和基准测试,揭示其在无关性推理上的显著缺陷。
在悬崖边转向还是偏离?重新思考推断时间干预中的特异性和鲁棒性
机构 * University of Maryland College Park(马里兰大学学院市)
专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出模型转向中特异性和鲁棒性的评估框架,揭示转向方法在提升效率的同时可能牺牲安全性。
Comments EACL 2026 Main, Long Paper
对抗鲁棒性与可解释性漂移的实证分析:在网络安全分类器中的应用
机构 * Palo Alto Networks(帕洛阿尔托网络公司) ; Quicken Inc(Quicken公司)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文通过实证研究分析了网络安全分类器中对抗鲁棒性与可解释性漂移的问题,提出鲁棒性指数指标,并展示了对抗训练对提升鲁棒性的效果。
Comments Accepted for publication in 18th ACM International Conference on Agents and Artificial Intelligence (ICAART 2026), Marbella, Spain
面向大语言模型多智能体强化学习的数据导向可解释性
机构 * goodstartlabs(Good Start Labs)
专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Meta-Autointerp方法,利用SAEs和LLM总结器分析多智能体强化学习行为,发现细粒度行为及奖励黑客,验证SAE特征的有效性并提升智能体性能。
Comments authors 1, 2 and 3 contributed equally
量化测试集污染对生成评估的影响
机构 * University of Oxford(牛津大学) ; ServiceNow Research(ServiceNow研究院) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.LG
AI总结 本研究通过语言模型生命周期量化测试集污染对生成评估的影响,发现污染可降低模型损失,进一步训练和采样温度调节影响记忆效果。
通过优化可解释提升机改善信用卡欺诈检测
机构 * ReDi School(ReDi学院)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 本文通过优化可解释提升机算法,提升信用卡欺诈检测的准确性和可解释性,实验结果显示其在ROC-AUC指标上优于多种传统方法。
Comments 22 pages, 5 figures, 5 tables
利用LLM估算考试题目难度:在巴西ENEM语料库上的基准测试
专题命中 安全评测 :safety(abstract);分类 cs.CY
AI总结 本文研究了LLM在估算考试题目难度上的表现,发现其在单模态问题上表现中等,但对多模态问题和人口统计数据提示的适应性有限,建议采用评估后再生成的流程进行负责任的评估设计。
Comments 42 pages, 19 figures. Appendix included
Confundo: 学习生成稳健的毒药以应对实际RAG系统
机构 * The University of Hong Kong(香港大学) ; Nanjing University(南京大学) ; City University of Hong Kong(香港城市大学)
专题命中 安全评测 :trustworthy(abstract);分类 cs.LG
AI总结 Confundo是一种学习生成毒药的框架,通过微调大型语言模型以提高RAG系统的鲁棒性和隐蔽性,有效应对实际系统中的安全威胁。
FMBench: 自适应大语言模型输出格式化
机构 * Fudan University(复旦大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 FMBench通过结合监督微调和强化学习微调,提升大语言模型在Markdown格式化任务中的语义和结构准确性。
迈向材料科学的代理智能
机构 * DIRO & Institut Courtois, Université de Montréal(蒙特利尔大学DIRO与Courtois研究所) ; Mila – Quebec AI Institute(魁北克AI研究所) ; University of Waterloo(滑铁卢大学) ; Université de Sherbrooke(Sherbrooke大学) ; University of California, San Diego(加州大学圣地亚哥分校) ; The University of Tokyo, Institute of Industrial Science(东京大学工业科学研究所) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; Singapore Management University(新加坡管理学院) ; The Hong Kong University of Science and Technology, Guangzhou(香港科学与技术大学(广州)) ; Alibaba DAMO Academy(阿里巴巴达摩院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; CIFAR AI Chair(CIFAR人工智能主席)
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文提出以流程为中心的代理系统框架,通过整合人工智能与材料科学,推动材料发现的自主化与智能化。
Comments 81 pages
柏拉图的形:通过原型表示向 LLMs 提供后门防御即服务
专题命中 安全评测 :alignment(abstract)
AI总结 PROTOPURIFY通过原型表示实现LLMs的后门防御即服务,有效降低后门攻击成功率并保持模型性能。
基于统计的软件故障预测指标阈值设置方法:在固件项目中的工业经验
专题命中 安全评测 :safety(abstract)
AI总结 本文提出基于统计的软件故障预测指标阈值设置方法,通过实证研究验证了其在工业环境中的有效性,为故障预测提供可解释的解决方案。
机器学习从业者在欧盟监管要求下的数据质量观点:一项欧洲在线调查
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文通过欧洲在线调查,探讨了欧盟监管下机器学习从业者对数据质量的认知与实践,揭示了当前数据质量实践与监管要求之间的差距,并提出改进数据质量工具和协作的建议。
策略证明排名聚合的不可能性
专题命中 安全评测 :trustworthy(abstract)
AI总结 本文证明了在至少四个选项的情况下,不存在同时满足一致性和策略证明性的排名聚合方法。
Comments Published as full paper at AAMAS 2026
FloorplanVLM:一种用于平面图向量化的视觉-语言模型
机构 * Beike(贝克)
专题命中 安全评测 :alignment(abstract)
AI总结 FloorplanVLM通过像素到序列的范式,实现复杂平面图向量化的高精度与高鲁棒性,其统一框架和渐进训练策略在工程级向量化任务中表现出色。
DreamHome-Pano: 基于设计意识和无冲突的全景室内生成
机构 * Beike(贝克)
专题命中 安全评测 :alignment(abstract)
AI总结 DreamHome-Pano通过引入Prompt-LLM和无冲突控制架构,实现了高保真的全景室内生成,平衡了美学质量和结构一致性。
人类价值观的计算框架
机构 * Artificial Intelligence Research Institute (IIIA-CSIC)(人工智能研究 institute (IIIA-CSIC))
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI、cs.CY
AI总结 本文提出一个基于社会科学的正式框架,用于系统研究如何通过人类价值观设计伦理人工智能。
Journal ref Proceedings of the 23rd International Conference on Autonomous Agents and Multiagent Systems (AAMAS 2024), pp. 1531-1539
Jackpot: 为极端演员-策略不匹配强化学习的最优预算拒绝采样
机构 * Carnegie Mellon University(卡内基梅隆大学)
专题命中 AI治理与伦理 :alignment(abstract);分类 cs.AI
AI总结 Jackpot通过最优预算拒绝采样方法,有效减少rollout模型与策略之间的分布差异,提升大语言模型强化学习的训练稳定性与效率。
Comments ICLR 2026
揭示多目标对齐中的跨目标干扰
机构 * University of Notre Dame(诺丁汉大学)
专题命中 其他安全 :alignment(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出CTWA方法,通过保持目标奖励与训练信号的正协方差来缓解多目标对齐中的跨目标干扰问题,并分析了干扰与模型几何属性的关系。
通过可扩展的交互监督引导大语言模型
专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG
AI总结 本文提出可扩展的交互监督框架,通过递归决策树提升人类对AI任务的引导能力,实现非专家生成高质量产品需求文档,并通过强化学习优化
概率聚合与定向嵌入优化用于大语言模型中的集体道德推理
机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) ; School of Social Sciences and Technology, Technical University of Munich(社会科学与技术学院,慕尼黑技术大学)
专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI
AI总结 本文提出了一种概率聚合与定向嵌入优化方法,通过融合多个大语言模型的道德判断,提升集体道德推理的一致性和准确性。
Comments Accepted to ACL 2025 (Findings)
利用LLM代理识别恶意软件二进制中的攻击战术与技术
专题命中 其他安全 :alignment(abstract)
AI总结 TTPDetect通过结合密集检索与LLM神经检索,利用LLM代理识别恶意软件二进制中的TTPs,实现高精度和召回率。