arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-06 至 2026-01-06 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2408.09881 2026-01-06 cs.AI physics.ao-ph physics.plasm-ph 70%

Uncertainty Quantification of Surrogate Models using Conformal Prediction

利用符合预测对代理模型的不确定性量化

Vignesh Gopakumar, Ander Gray, Joel Oskarsson, Lorenzo Zanisi, Daniel Giles, Matt J. Kusner, Stanislas Pamela, Marc Peter Deisenroth

机构 * Centre for Artificial Intelligence Department of Computer Science University College London(人工智能中心 计算机科学系 伦敦大学学院) Heudiasyc Laboratory Université de Technologie de Compiègne(Heudiasyc实验室 技术大学Compiègne) Department of Computer and Information Science Linköping University(计算机与信息科学系 链接普大学) Computing Division UK Atomic Energy Authority(计算部门 英国原子能局)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种基于符合预测的框架,用于对代理模型的不确定性进行统计保证的量化,适用于高维空间-时间问题,且计算成本低,能有效验证预训练模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01008 2026-01-06 eess.IV cs.AI cs.CV 70%

An Explainable Agentic AI Framework for Uncertainty-Aware and Abstention-Enabled Acute Ischemic Stroke Imaging Decisions

可解释的代理AI框架:用于不确定性和可 abstention 的急性缺血性中风影像决策

Md Rashadul Islam

机构 * Department of Computer Science and Engineering(计算机科学与工程系) Daffodil International University(达福尔国际大学)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出了一种可解释的代理AI框架,用于在急性缺血性中风影像学中实现不确定性意识和选择性退避,以提高临床决策的安全性和透明性。

Comments Preprint. Conceptual and exploratory framework focusing on uncertainty-aware and abstention-enabled decision support for acute ischemic stroke imaging

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03860 2026-01-06 cs.CL cs.AI cs.LG 67%

Hallucination to Truth: A Review of Fact-Checking and Factuality Evaluation in Large Language Models

幻觉与事实:大型语言模型中事实核查与事实性评估的综述

Subhey Sadi Rahman, Md. Adnanul Islam, Md. Mahbub Alam, Musarrat Zeba, Md. Abdur Rahman, Sadia Sultana Chowa, Mohaimenul Azam Khan Raiaan, Sami Azam

机构 * Department of Computer Science and Engineering, United International University, Dhaka 1212, Bangladesh(乌姆特国际大学计算机科学与工程系) Department of Computer Science and Engineering, Daffodil International University, Dhaka-1341, Bangladesh(达芙尼国际大学计算机科学与工程系) Faculty of Science and Technology, Charles Darwin University, Casuarina, NT 0909, Australia(查尔斯·达尔文大学科学与技术学院)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文综述了大型语言模型中事实核查与事实性评估的关键挑战及方法,强调了提升事实准确性的重要性。

Journal ref Artif. Intell. Rev. (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02314 2026-01-06 cs.AI 57%

Project Ariadne: A Structural Causal Framework for Auditing Faithfulness in LLM Agents

Project Ariadne: 一种用于审计大语言模型代理忠实性的结构因果框架

Sourena Khanzadeh

机构 * Sourena Khanzadeh(独立研究者)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 Project Ariadne提出一种结构因果框架,通过因果干预评估大语言模型代理推理的忠实性,揭示代理推理与决策之间的因果脱节问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01378 2026-01-06 cs.AI 57%

Empowering Small Language Models with Factual Hallucination-Aware Reasoning for Financial Classification

赋能小型语言模型以实现金融分类的事实幻觉感知推理

Han Yuan, Yilin Wu, Li Zhang, Zheng Ma

机构 * Decision Science Center of Excellence(决策科学中心卓越机构) American Express(美国运通)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出AAAI流程,通过缓解事实幻觉提升小型语言模型在金融分类中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏