arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-19 至 2026-01-19 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 4 篇

2601.10986 2026-01-19 cs.CL 79%

ZPD Detector: Data Selection via Capability-Difficulty Alignment for Large Language Models

ZPD检测器:基于能力-难度对齐的数据选择用于大语言模型

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Shijian Li

机构 * State Key Laboratory of Brain–Machine Intelligence(脑机智能国家重点实验室) College of Computer Science and Technology, Zhejiang University(计算机科学与技术学院,浙江大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL

AI总结 ZPD检测器通过能力-难度对齐动态选择高价值样本,提升大语言模型的数据利用效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10803 2026-01-19 cs.CR cs.AI cs.CV 79%

Beyond Known Fakes: Generalized Detection of AI-Generated Images via Post-hoc Distribution Alignment

超越已知伪造:通过事后分布对齐实现AI生成图像的通用检测

Li Wang, Wenyu Chen, Xiangtao Meng, Zheng Li, Shanqing Guo

机构 * School of Cyber Science and Technology, Shandong University(网络安全科学与技术学院,山东大学) State Key Laboratory of Cryptography and Digital Economy Security, Shandong University(密码与数字经济安全国家重点实验室,山东大学) Shandong Key Laboratory of Artificial Intelligence Security, Shandong University(人工智能安全山东省重点实验室,山东大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.AI

AI总结 本文提出PDA框架,通过事后分布对齐实现对未知生成器AI图像的通用检测,实验显示其在16种生成模型上的检测准确率达96.69%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01439 2026-01-19 cs.AI cs.RO 57%

Probabilistic Mission Design for Neuro-Symbolic Unmanned Aircraft Systems

基于概率的方法用于神经符号无人机系统任务设计

Simon Kohaut, Benedict Flade, Daniel Ochs, Devendra Singh Dhami, Julian Eggert, Kristian Kersting

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出概率任务设计(ProMis)方法,结合神经符号技术,用于在法律框架内导航无人驾驶航空器,通过混合概率逻辑程序和机器学习模型提升任务规划的可靠性和适应性。

Comments arXiv admin note: text overlap with arXiv:2406.03454

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14022 2026-01-19 cs.LG 57%

BLIPs: Bayesian Learned Interatomic Potentials

BLIPs: 基于贝叶斯学习的原子间势能

Dario Coscia, Pim de Haan, Max Welling

机构 * mathLab, SISSA University of Amsterdam(mathLab、SISSA大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 BLIPs是一种基于贝叶斯学习的原子间势能方法,通过变分dropout实现可扩展的不确定性估计,提升模拟化学任务中的预测精度和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏