arXivDaily arXiv每日学术速递 周一至周五更新

期刊&会议

International Conference on Machine Learning · 会议 · Machine Learning

2026-07-10 至 2026-07-10 共收录 3
2605.12726 2026-07-10 cs.LG 版本更新

Before the Last Token: Diagnosing Final-Token Safety Probe Failures

在最后的标记之前:诊断最终标记安全探针失败

Shravan Doda

机构 * SafeSwitch HarmBench SorryBench

AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。

Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02998 2026-07-10 cs.LG stat.ME stat.ML 版本更新

Multi-Distribution Robust Conformal Prediction

多分布鲁棒共形预测

Yuqi Yang, Ying Jin

机构 * Mathematics Department, The Hong Kong University of Science(香港科学与技术大学数学系) Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) Data Science, University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学数据科学)

AI总结 研究在多源分布下构建一致有效的共形预测集问题,提出最大\(p\)聚合方案,证明其最优性并给出学习一致性分数算法,实验表明该方法能在多分布上提供有效覆盖率且减小集合大小。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12857 2026-07-10 cs.CY cs.AI 版本更新

Adaptive Generation of Bias-Eliciting Questions for LLMs

为大语言模型自适应生成偏差引发问题

Robin Staab, Jasper Dekoninck, Maximilian Baader, Martin Vechev

机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)

AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏