arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-09 至 2025-12-09 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2512.06406 2025-12-09 cs.AI cs.LG 62%

UncertaintyZoo: A Unified Toolkit for Quantifying Predictive Uncertainty in Deep Learning Systems

UncertaintyZoo: 一个统一的工具包,用于量化深度学习系统中的预测不确定性

Xianzong Wu, Xiaohong Li, Lili Quan, Qiang Hu

机构 * Tianjin University(天津大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 UncertaintyZoo是一个统一的工具包,整合了29种不确定性量化方法,用于量化深度学习系统中的预测不确定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02324 2025-12-09 cs.CL cs.AI 62%

Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning

通过CASAL减少幻觉:对比激活引导用于近似学习

Wannan, Yang, Xinchi Qiu, Lei Yu, Yuchen Zhang, Aobo Yang, Narine Kokhlikyan, Nicola Cancedda, Diego Garcia-Olano

机构 * Meta Superintelligence Labs(Meta超级智能实验室) New York University(纽约大学)

专题命中 幻觉与事实性 :DPO(abstract);分类 cs.CL、cs.AI

AI总结 CASAL通过对比激活引导减少LLM幻觉,提升模型可解释性和实用性,适用于多种模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07334 2025-12-09 cs.AI 57%

Hallucination as a Computational Boundary: A Hierarchy of Inevitability and the Oracle Escape

幻觉作为计算边界:不可避免性层级与 oracle 逃逸

Wang Xi, Quan Shi, Zenghui Ding, Jianqing Gao, Xianjun Yang

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出计算类对齐原则,通过构建计算必要性层级和逃逸路线,为大型语言模型的幻觉问题提供理论框架和解决方案。

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22019 2025-12-09 cs.CV 50%

Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models

类内概率嵌入用于视觉-语言模型中的不确定性估计

Zhenxiang Lin, Maryam Haghighat, Will Browne, Dimity Miller

机构 * Queensland University of Technology(昆士兰理工大学)

专题命中 幻觉与事实性 :safety(abstract)

AI总结 本研究提出一种无需训练的后处理方法,通过类内概率嵌入提升视觉-语言模型的不确定性估计,有效检测错误预测。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏