arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-10 至 2026-02-10 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 7 篇

2602.07179 2026-02-10 cs.HC cs.AI cs.CL cs.CY cs.IT math.IT 67%

An Information-Theoretic Framework for Comparing Voice and Text Explainability

一种信息论框架用于比较语音和文本的可解释性

Mona Rajhans, Vishal Khawarey

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文提出了一种信息论框架,用于比较语音和文本在AI系统可解释性中的效果,发现类比基于的交付在理解效率与信任校准之间取得最佳平衡。

Comments Accepted for publication at the 10th ACM International Conference on Intelligent Systems, Metaheuristics & Swarm Intelligence (ISMSI 2026), April 24-26, Cebu City, Phillipines

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08272 2026-02-10 cs.LG cs.AI 62%

When Do Multi-Agent Systems Outperform? Analysing the Learning Efficiency of Agentic Systems

多智能体系统何时表现更优?分析智能体系统的学习效率

Junwei Su, Chuan Wu

机构 * Department of Computer Science, University of Hong Kong(计算机科学系,香港大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文研究多智能体强化学习在大语言模型中的学习效率,通过理论分析揭示任务分解与对齐对样本复杂性的影响,明确MARL在特定任务下的优势条件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10602 2026-02-10 cs.CV cs.AI cs.CL 62%

TruthPrInt: Mitigating Large Vision-Language Models Object Hallucination Via Latent Truthful-Guided Pre-Intervention

TruthPrInt: 通过潜在真实引导预干预缓解大视觉-语言模型对象幻觉

Jinhao Duan, Fei Kong, Hao Cheng, James Diffenderfer, Bhavya Kailkhura, Lichao Sun, Xiaofeng Zhu, Xiaoshuang Shi, Kaidi Xu

机构 * Drexel University(德雷塞尔大学) University of Electronic Science and Technology of China(电子科技大学) Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) LLNL(劳伦斯利弗莫尔国家实验室) Lehigh University(莱斯大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 TruthPrInt通过学习真相方向并引导解码过程,有效缓解大视觉-语言模型中的对象幻觉问题。

Comments 15 pages, 9 figures, the first two authors contributed equally, Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07164 2026-02-10 cs.CL cs.AI 62%

Your Language Model Secretly Contains Personality Subnetworks

你的语言模型秘密包含个性子网络

Ruimeng Ye, Zihan Wang, Zinan Ling, Yang Xiao, Manling Li, Xiaolong Ma, Bo Hui

机构 * University of Tulsa(图兰大学) Northwestern University(西北大学) University of Arizona(亚利桑那大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究发现大型语言模型内部已嵌入身份子网络,无需外部知识即可实现身份切换和行为调整。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08693 2026-02-10 cs.LG 57%

Reasoning aligns language models to human cognition

推理使语言模型对齐人类认知

Gonçalo Guiomar, Elia Torre, Pehuen Moure, Victoria Shavina, Mario Giulianelli, Shih-Chii Liu, Valerio Mante

机构 * ETH AI Center, Zürich, Switzerland ETH Zürich, Switzerland Institute for Neuroinformatics, University of Zürich \& ETH Zürich, Switzerland University College London, London, United Kingdom

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本研究通过主动概率推理任务揭示语言模型与人类在不确定性决策中的差异,发现延长推理能显著提升推理性能,但对信息获取影响有限。

Comments 38 pages, 4 main figures, multiple appendix figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07674 2026-02-10 cs.LG 57%

ElliCE: Efficient and Provably Robust Algorithmic Recourse via the Rashomon Sets

ElliCE: 通过Rashomon集实现高效且可证明稳健的算法补救

Bohdan Turbal, Iryna Voitsitska, Lesia Semenova

机构 * Princeton University(普林斯顿大学) Ukrainian Catholic University(乌克兰天主教大学) Rutgers University(罗格斯大学) Taras Shevchenko National University of Kyiv(塔拉斯·谢甫琴科基斯林国立大学) Microsoft Research NYC(微软研究院纽约)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 ElliCE通过椭球近似Rashomon集,提供高效且可证明稳健的算法补救方法,提升反事实解释的鲁棒性和灵活性。

Journal ref The Thirty-ninth Annual Conference on Neural Information Processing Systems 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21083 2026-02-10 cs.AI 57%

OpenSec: Measuring Incident Response Agent Calibration Under Adversarial Evidence

OpenSec: 在对抗性证据下评估事件响应代理的校准

Jarrod Barnes

机构 * Jarrod Barnes

专题命中 幻觉与事实性 :prompt injection(abstract);分类 cs.AI

AI总结 OpenSec通过双控制强化学习环境评估事件响应代理在对抗性证据下的校准能力,发现前沿模型存在过度触发问题,校准差距体现在克制而非检测。

Comments 7 pages, 3 figures, 3 tables. Code: https://github.com/jbarnes850/opensec-env. Dataset: https://huggingface.co/datasets/Jarrodbarnes/opensec-seeds

详情

展开后加载摘要…

URL PDF HTML 收藏