arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-16 至 2026-02-16 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 幻觉与事实性 2 篇

2602.13087 2026-02-16 cs.LG cs.AI 62%

EXCODER: EXplainable Classification Of DiscretE time series Representations

EXCODER: 可解释的时间序列离散表示分类

Yannik Hahn, Antonin Königsfeld, Hasan Tercan, Tobias Meisen

机构 * Institute for Technologies and Management of Digital Transformation (TMDT) University of Wuppertal(数字转型技术与管理研究所(TMDT)乌珀塔尔大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 EXCODER通过将时间序列转换为离散潜在表示,提升分类的可解释性,并提出SSA度量标准验证XAI方法的有效性。

Comments Accepted at PAKDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06014 2026-02-16 cs.CV cs.LG 57%

Post-hoc Probabilistic Vision-Language Models

事后概率视觉-语言模型

Anton Baumann, Rui Li, Marcus Klasson, Santeri Mentu, Shyamgopal Karthik, Zeynep Akata, Arno Solin, Martin Trapp

专题命中 幻觉与事实性 :safety(abstract);分类 cs.LG

AI总结 本文提出一种无需额外训练的VLMs事后不确定性估计方法,通过贝叶斯后验近似和余弦相似度不确定性量化,提升主动学习效率和预测可靠性。

Comments Published at ICLR 2026. Project page: https://aaltoml.github.io/BayesVLM/

详情

展开后加载摘要…

URL PDF HTML 收藏