Overthinking: Amplifying Reasoning Weights to Extract Learned Secrets
过度思考:放大推理权重以提取学习到的秘密
AI总结 研究针对语言模型黑盒审计可能遗漏隐藏信息的问题,提出“过度思考”方法,通过特定模型构建及新策略放大推理,经实验证明该方法能更频繁揭示隐藏信息,不同秘密浮现方式有别。
Comments Accepted at ICML 2026. 9 pages, 6 figures
期刊&会议
International Conference on Machine Learning · 会议 · Machine Learning
过度思考:放大推理权重以提取学习到的秘密
AI总结 研究针对语言模型黑盒审计可能遗漏隐藏信息的问题,提出“过度思考”方法,通过特定模型构建及新策略放大推理,经实验证明该方法能更频繁揭示隐藏信息,不同秘密浮现方式有别。
Comments Accepted at ICML 2026. 9 pages, 6 figures
对比顺序学习:序数回归的通用框架
AI总结 该研究提出对比顺序学习框架ConOrd,整合对比学习与顺序学习优势,通过引入基于秩差的对比顺序损失解决相关局限,在面部年龄估计等序数回归任务实验中达最优性能且泛化性好。
Comments Accepted to ICML 2026
随机序学习:一种使用噪声数据进行秩估计的方法
AI总结 研究标签噪声下的秩估计问题,提出随机序学习(SOL)框架,通过判别损失和随机序损失两个互补目标捕捉不确定性并学习嵌入空间,实验证明该框架能在多种标签噪声下实现可靠秩估计。
Comments Accepted to ICML 2026
当思考有害时:视觉语言模型推理链中的认知信号
AI总结 研究视觉语言模型推理链中的认知信号,通过在相同对抗样本上运行四个模型,发现不同模型的答案熵行为模式有差异,思考链熵在部分情况下优于答案熵,还发现结构化弃权及其实用弃权门可提升准确率。
Comments 7 pages, 2 figures, 5 tables. Oral paper at the 2nd Workshop on Epistemic Intelligence in Machine Learning (EIML@ICML 2026), Seoul, South Korea
重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署
AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。
Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing
通过记忆回溯和拓扑归因实现时间图网络的可解释性
AI总结 研究如何增强时间图网络(TGNs)的可解释性,通过拓扑归因树和记忆回溯树对其预测进行归因,应用LRP并设计优化目标,在九个时间图数据集实验中表现出色,提供可靠解释且优于基线。
Comments ICML 2026 Spotlight
基础模型智能体中的部署时记忆
机构 * Lei (Rachel) Chen ; Guilin Zhang ; Kai Zhao ; Dalmo Cirne ; Andy Olsen ; Zeke Miller ; Xu Chu ; Alet Blanken ; Amine Anoun ; Jerry Ting
AI总结 研究基础模型智能体在部署时记忆的设计选择如何影响个性化效用、提取风险和删除保真度,提出遗忘残差分数并揭示压缩与删除的权衡。
Comments 4 pages, ICML MemFM 2026 Workshop
在最后的标记之前:诊断最终标记安全探针失败
机构 * SafeSwitch ; HarmBench ; SorryBench
AI总结 研究最终标记安全探针在预填充阶段的失败模式,发现安全证据分布在早期用户标记中,传统探针无法捕捉,提出基于PCA-HMM的轨迹模型提升诊断能力。
Comments 8 pages, 2 figures, 7 tables. Accepted at the ICML 2026 Mechanistic Interpretability Workshop and the ICML 2026 Failure Modes in Agentic AI Workshop
多分布鲁棒共形预测
机构 * Mathematics Department, The Hong Kong University of Science(香港科学与技术大学数学系) ; Department of Statistics and Data Science, University of Pennsylvania(宾夕法尼亚大学统计与数据科学系) ; Data Science, University of Pennsylvania, Philadelphia, PA, USA(宾夕法尼亚大学数据科学)
AI总结 研究在多源分布下构建一致有效的共形预测集问题,提出最大\(p\)聚合方案,证明其最优性并给出学习一致性分数算法,实验表明该方法能在多分布上提供有效覆盖率且减小集合大小。
Comments ICML 2026
为大语言模型自适应生成偏差引发问题
机构 * ETH Zurich, Switzerland(苏黎世联邦理工学院)
AI总结 针对大语言模型固有偏差问题,引入反事实框架,通过迭代问题变异生成开放式问题评估偏差,构建CAB基准,评估发现模型在某些场景有持续偏差,凸显公平性研究需求。
Comments ICML 2026