arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-30 至 2026-01-30 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 6 篇

2506.09277 2026-01-30 cs.CL 79%

NeuroFaith: Evaluating LLM Self-Explanation Faithfulness via Internal Representation Alignment

NeuroFaith:通过内部表示对齐评估LLM自解释的忠实性

Milan Bhan, Jean-Noel Vittaut, Nicolas Chesneau, Sarath Chandar, Marie-Jeanne Lesot

机构 * Sorbonne Université, CNRS, LIP6(索邦大学、国家科学研究中心、LIP6实验室) Mila - Quebec AI Institute, Université de Montréal(魁北克人工智能研究院、蒙特利尔大学)

专题命中 幻觉与事实性 :alignment(title);trustworthy(abstract);分类 cs.CL

AI总结 NeuroFaith通过内部表示对齐评估LLM自解释的忠实性,提出了一种灵活的框架和线性探针以提高模型的解释可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04418 2026-01-30 cs.LG cs.CL 62%

The Illusion of Certainty: Uncertainty Quantification for LLMs Fails under Ambiguity

确定性的幻觉:在歧义下LLM的不确定性量化失效

Tim Tomov, Dominik Fuchsgruber, Tom Wollschläger, Stephan Günnemann

机构 * School of Computation, Information Technology \& Munich Data Science Institute - Technical University of Munich

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究揭示了在歧义环境下LLM的不确定性量化方法存在缺陷,提出了MAQA*和AmbigQA*数据集以评估模型在歧义数据上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21113 2026-01-30 cs.AI cs.MA 57%

Planner-Auditor Twin: Agentic Discharge Planning with FHIR-Based LLM Planning, Guideline Recall, Optional Caching and Self-Improvement

计划-审核双胞胎:基于FHIR的LLM计划、指南回忆、可选缓存和自我改进的代理出院计划

Kaiyuan Wu, Aditya Nagori, Rishikesan Kamaleswaran

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI

AI总结 基于FHIR的LLM计划与审核框架,通过自我改进和缓存优化,提升临床出院计划的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17865 2026-01-30 cs.CL 57%

D-Models and E-Models: Diversity-Stability Trade-offs in the Sampling Behavior of Large Language Models

D模型和E模型:大语言模型采样行为中的多样性-稳定性权衡

Jia Gu, Liang Pang, Huawei Shen, Xueqi Cheng

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences(人工智能安全国家重点实验室,计算技术研究所,中国科学院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型中D模型与E模型在采样行为上的多样性-稳定性权衡,为任务应用中的模型选择提供了指导。

Comments 12 pages, 10 figures. Accepted by WWW'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22099 2026-01-30 physics.soc-ph 50%

Towards Universal Urban Patterns-of-Life Simulation

迈向通用的城市生活方式模拟

Sandro M. Reia, Henrique F. de Arruda, Shiyang Ruan, Taylor Anderson, Hamdi Kavak, Dieter Pfoser

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出了一种可扩展且通用的城市生活方式模拟框架,通过模拟日常活动生成模式,并验证了其在不同城市中的有效性,适用于城市系统中的多种场景分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21126 2026-01-30 cs.MA cs.RO 50%

AI-Augmented Density-Driven Optimal Control (D2OC) for Decentralized Environmental Mapping

AI增强的密度驱动最优控制(D2OC)用于去中心化环境映射

Kooktae Lee, Julian Martinez

机构 * Department of Mechanical Engineering, New Mexico Institute of Mining and Technology(机械工程系,新墨西哥矿业与技术研究院)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 本文提出AI增强的密度驱动最优控制方法,用于在传感和通信受限条件下实现多智能体环境映射,通过自适应机制提升密度估计精度和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏