arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 13 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 13 篇

2602.02034 2026-02-03 cs.AI 70%

Constrained Process Maps for Multi-Agent Generative AI Workflows

多代理生成AI工作流的约束过程图

Ananya Joshi, Michael Rudow

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 70%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00085 2026-02-03 cs.LG cs.AI cs.CL 67%

CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models

CARE-RFT:基于置信度的强化微调用于大语言模型中的可靠推理

Shuozhe Li, Jincheng Cao, Bodun Hu, Aryan Mokhtari, Leqi Liu, Amy Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CARE-RFT通过引入置信度锚定的正则化方法,在保持大语言模型推理能力的同时提升其可信度和校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01956 2026-02-03 cs.LG cs.AI 62%

Efficient Epistemic Uncertainty Estimation for Large Language Models via Knowledge Distillation

通过知识蒸馏实现大型语言模型的高效信念不确定性估计

Seonghyeon Park, Jewon Yeom, Jaewon Sok, Jeongjae Park, Heejun Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Rural Systems Engineering, Seoul National University(首尔国立大学农村系统工程系) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学科技研究院电子工程与计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过知识蒸馏高效估计大型语言模型的信念不确定性,减少估计误差并提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15386 2026-02-03 cs.CL cs.AI 62%

RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection

RePPL:通过语义传播和语言生成中的不确定性重新校准困惑度以检测可解释问答幻觉

Yiming Huang, Junyan Zhang, Zihao Wang, Biquan Bie, Yunzhong Qiu, Xuming Hu, Yi R. Fung, Xinlei He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 RePPL通过校准语义传播和语言生成中的不确定性,提升问答幻觉检测性能,生成token级不确定性评分作为解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00977 2026-02-03 cs.CL cs.LG 62%

Trust in One Round: Confidence Estimation for Large Language Models via Structural Signals

单轮信任:通过结构信号提升大语言模型的置信度估计

Pengyue Yang, Jiawen Wen, Haolin Jin, Linghan Huang, Huaming Chen, Ling Chen

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(技术大学悉尼)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过分析模型最终层隐藏状态轨迹中的多尺度结构信号,提出结构置信度方法,实现单次通过的高效、稳健置信度估计,适用于高社会影响和资源受限的LLM应用。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00279 2026-02-03 cs.CL cs.LG 62%

Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering

在大型语言模型长格式问答中评估不确定性校准的基准测试

Philip Müller, Nicholas Popovič, Michael Färber, Peter Steinbach

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01522 2026-02-03 cs.LG cs.CV 57%

When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning

何时秩-1足够?基于几何的初始化方法用于参数高效微调

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01078 2026-02-03 cs.AI 57%

AutoHealth: An Uncertainty-Aware Multi-Agent System for Autonomous Health Data Modeling

AutoHealth:一种面向自主健康数据建模的不确定性感知多智能体系统

Tong Xia, Weibin Li, Gang Liu, Yong Li

机构 * Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心电子工程系) Tsinghua University, China(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 AutoHealth通过多智能体系统自主建模健康数据,提升预测性能和不确定性估计,有效解决健康数据建模中的泛化和可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00850 2026-02-03 cs.CY 57%

PS$^2$: Parameterized Control for Fine-Grained Student Proficiency Simulation

PS$^2$: 基于参数化控制的细粒度学生能力模拟

Ruochen Liu, Zhiyuan Wen, Hao Yan, Jun Yin, Senzhang Wang, Jiannong Cao

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 PS$^2$提出一种基于参数化控制的细粒度学生能力模拟方法,通过混合比率在强弱模型间插值得到更精确的能力模拟,提升学生行为相似性和题目难度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19145 2026-02-03 stat.ME cs.LG stat.AP 57%

Do Large Language Models (Really) Need Statistical Foundations?

大型语言模型(真的需要统计基础吗?

Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文探讨大型语言模型是否需要统计学基础,指出其统计本质和黑箱特性使统计方法成为必要,并强调统计学界在LLMs研究中的重要性。

Comments Accepted at The Annals of Applied Statistics; Added discussions on more topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10844 2026-02-03 cs.HC 50%

Be Friendly, Not Friends: How LLM Sycophancy Shapes User Trust

友好而非朋友:LLM谄媚如何塑造用户信任

Yuan Sun, Ting Wang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究探讨LLM谄媚如何影响用户信任,通过实验发现适应性对话态度影响用户对LLM真实性和信任度的感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01264 2026-02-03 cs.HC 50%

Shades of Uncertainty: How AI Uncertainty Visualizations Affect Trust in Alzheimer's Predictions

不确定性之影:AI不确定性可视化如何影响阿尔茨海默病预测的可信度

Jonatan Reyes, Mina Massoumi, Anil Ufuk Batmaz, Marta Kersten-Oertel

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本研究探讨了AI不确定性可视化对阿尔茨海默病预测可信度的影响,发现连续编码提升可靠性,而二元编码增强即时信心,揭示了高不确定性下专业背景的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏