arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-09 至 2026-01-09 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2601.04277 2026-01-09 cs.LG 79%

Unlocking the Pre-Trained Model as a Dual-Alignment Calibrator for Post-Trained LLMs

解封预训练模型作为后训练LLMs的双对齐校准器

Beier Luo, Cheng Wang, Hongxin Wei, Sharon Li, Xuefeng Du

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) School of Computing, National University of Singapore(计算学院,新加坡国立大学) Department of Computer Sciences, University of Wisconsin-Madison(计算机科学系,威斯康星大学麦迪逊分校) College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Dual-Align方法,通过双对齐策略校正后训练LLMs的置信度漂移和过程漂移,提升校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04486 2026-01-09 cs.CR cs.AI cs.HC 74%

Decision-Aware Trust Signal Alignment for SOC Alert Triage

面向SOC警报分拣的决策感知信任信号对齐

Israt Jahan Chowdhury, Md Abu Yousuf Tanvir

机构 * Ontario Tech University(安大略技术大学)

专题命中 幻觉与事实性 :alignment(title);分类 cs.AI

AI总结 本文提出了一种决策感知的信任信号对齐方法,用于提升SOC警报分拣的决策支持效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04435 2026-01-09 cs.CL cs.AI cs.CY 67%

Accommodation and Epistemic Vigilance: A Pragmatic Account of Why LLMs Fail to Challenge Harmful Beliefs

适应与认知警觉:一种实用视角下为何LLMs未能挑战有害信念

Myra Cheng, Robert D. Hawkins, Dan Jurafsky

机构 * Department of Computer Science, Stanford University(计算机科学系,斯坦福大学) Department of Linguistics, Stanford University(语言学系,斯坦福大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过语用学视角揭示LLMs在挑战有害信念时的失败原因,并提出简单干预提升安全性的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04728 2026-01-09 cs.LG cs.AI 62%

Excess Description Length of Learning Generalizable Predictors

学习可泛化的预测器的超额描述长度

Elizabeth Donoway, Hailey Joren, Fabien Roger, Jan Leike

机构 * ucb(加州大学伯克利分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出EDL框架,用于量化微调提取的预测结构并评估模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04742 2026-01-09 cs.CL 57%

Tool-MAD: A Multi-Agent Debate Framework for Fact Verification with Diverse Tool Augmentation and Adaptive Retrieval

Tool-MAD: 一种用于事实验证的多智能体辩论框架,具有多样化工具增强和自适应检索

Seyeon Jeong, Yeonjun Choi, JongWook Kim, Beakcheol Jang

机构 * Graduate School of Information, Yonsei University(Yonsei大学信息研究生院) Department of Computer Science, Sangmyung University(Sangmyung大学计算机科学系)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 Tool-MAD通过多智能体辩论框架结合多样化工具增强和自适应检索,提升事实验证的准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11529 2026-01-09 cs.CL 57%

Hallucination Detection via Internal States and Structured Reasoning Consistency in Large Language Models

通过内部状态和结构化推理一致性检测大语言模型中的幻觉

Yusheng Song, Lirong Qiu, Xi Zhang, Zhihao Tang

机构 * Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 通过内部状态和结构化推理一致性检测大语言模型中的幻觉,提出统一框架解决检测困境,提升事实和逻辑任务的检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24307 2026-01-09 cs.HC 50%

Exploring Similarity between Neural and LLM Trajectories in Language Processing

探索神经与大语言模型在语言处理中的相似性

Xin Xiao, Kaiwen Wei, Jiang Zhong, Xuekai Wei, Mingliang Zhou

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本研究通过比较LLMs与人类大脑在语言处理中的轨迹相似性,揭示了语义整合机制和实时处理动态的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏