arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-09 至 2026-02-09 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 5 篇

2505.23506 2026-02-09 cs.LG stat.ML 70%

Position: Epistemic uncertainty estimation methods are fundamentally incomplete

位置:epistemic不确定性估计方法本质上是不完整的

Sebastián Jiménez, Mira Jürgens, Willem Waegeman

机构 * Department of Data Analysis and Mathematical Modeling, Ghent University, Ghent, Belgium(数据分析与数学建模系,根特大学,根特,比利时)

专题命中 幻觉与事实性 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文指出epistemic不确定性估计方法存在固有缺陷,导致不确定性量化不准确且难以解释,需在高风险决策中谨慎使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06103 2026-02-09 cs.LG 70%

Toward Faithful and Complete Answer Construction from a Single Document

从单个文档构建忠实且完整的答案

Zhaoyang Chen, Cody Fleming

机构 * Department of Mechanical Engineering(机械工程系) Iowa State University(爱荷华州立大学)

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 EVE通过结构化框架提升文档基础推理的完整性和准确性,同时解决单次生成中覆盖与准确性的权衡问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06920 2026-02-09 cs.CL cs.AI 62%

Halluverse-M^3: A multitask multilingual benchmark for hallucination in LLMs

Halluverse-M^3: 一个多任务多语言的幻觉基准测试用于LLMs中的幻觉

Samir Abdaljalil, Parichit Sharma, Erchin Serpedin, Hasan Kurban

机构 * Texas A&M University(德克萨斯农工大学) University of Maryland, Baltimore(马里兰大学巴尔的摩分校) Hamad Bin Khalifa University(哈马德·本·卡尔法大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 Halluverse-M^3是一个多语言多任务基准测试,用于评估大型语言模型中的幻觉检测性能,涵盖四种语言和两种生成任务,揭示了不同任务和语言下的幻觉检测挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06570 2026-02-09 cs.CL 57%

Baichuan-M3: Modeling Clinical Inquiry for Reliable Medical Decision-Making

Baichuan-M3:用于可靠医疗决策的临床查询建模

M3 Team, Chengfeng Dou, Fan Yang, Fei Li, Jiyuan Jia, Qiang Ju, Shuai Wang, Tianpeng Li, Xiangrong Zeng, Yijie Zhou, Hongda Zhang, Jinyang Tai, Linzhuang Sun, Peidong Guo, Yichuan Mo, Xiaochuan Wang, Hengfu Cui, Zhishou Zhang

机构 * Baichuan-M3 Team(Baichuan-M3团队)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 Baichuan-M3通过建模临床查询流程,实现了医疗决策支持的可靠性和准确性,优于现有模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.26829 2026-02-09 cs.LG cs.CR 57%

Layer of Truth: Probing Belief Shifts under Continual Pre-Training Poisoning

真相层:在持续预训练中毒下的信念转变探究

Svetlana Churina, Niranjan Chebrolu, Kokil Jaidka

机构 * Centre for Trusted Internet \& Community, National University of Singapore, Singapore

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究揭示了持续预训练中虚假信息如何取代模型内部事实表示,通过实验发现中毒对模型信念的影响及可逆性,强调了对事实完整性进行监控的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏