Why Does RLAIF Work At All?
为什么RLAIF真的有效?
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。
高校专区
为什么RLAIF真的有效?
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
AI总结 本文提出潜在价值假设,解释RLAIF通过激活预训练编码的价值方向实现自我改进,并统一了相关实证发现。
无需自回归即可获取大语言模型的数值预测分布
机构 * Department of Applied Mathematics and Theoretical Physics(应用数学与理论物理系) ; University of Cambridge(剑桥大学)
AI总结 本研究探讨如何在不使用自回归生成的情况下,通过内部表示直接获取LLM对数值预测分布的统计特征,揭示了LLM在数值任务中编码不确定性的可能性。
Comments First two authors contributed equally. Published as a conference paper at ICLR2026
世界各语言元音频率分布:宏观与微观信息论模型
机构 * Department of Computer Science and Technology University of Cambridge, UK(计算机科学与技术系剑桥大学)
AI总结 本研究通过宏观和微观信息论模型揭示了世界各语言元音频率分布的规律,揭示了语音库存量与元音频率之间的补偿效应,并利用最大熵模型预测语言特定的元音概率。
基于指南的证据积累用于高风险代理验证
机构 * Tsinghua University(清华大学) ; University of Cambridge(剑桥大学) ; Thomson Reuters Foundational Research(汤姆森路透基础研究)
AI总结 GLEAN通过基于指南的证据积累框架,提升高风险代理决策的验证可靠性,实验显示其在AUROC和Brier分数减少方面均优于基线方法。
无需答案:从仅问题的线性探针预测LLM答案准确性
机构 * Universidad Internacional de Valencia(瓦伦西亚国际大学) ; University of Cambridge(剑桥大学) ; Independent Researcher(独立研究者)
AI总结 研究通过线性探针预测LLM答案准确性,发现模型在中间层预测能力饱和,但对数学推理问题泛化能力下降,揭示了LLM内部机制。
Comments Accepted (poster) to Principled Design for Trustworthy AI at ICLR 2026
不公平的设备:超越个人传感中AI准确性的局限
机构 * CYENS Centre of Excellence(CYENS卓越中心) ; Nokia Bell Labs(诺基亚贝尔实验室) ; University of Cambridge(剑桥大学) ; Google Research(谷歌研究) ; Aristotle University of Thessaloniki(亚里士多德大学) ; University of Glasgow(格拉斯哥大学)
AI总结 本文探讨了个人设备中AI模型的偏见问题,提出以人类为中心的评估方法,并提供无偏AI的设计和应用指南。
Comments ACM Journal on Responsible Computing (2026)
具有习惯形成和理性约束的神经需求估计
机构 * University of Cambridge(剑桥大学)
AI总结 本文提出了一种基于习惯形成和理性约束的神经需求估计方法,通过最小化KL散度来估计预算份额,并在实证应用中展示了其在提高预测准确性与福利分析中的有效性。
对齐税是什么
机构 * Department of Computer Science and Technology University of Cambridge(计算机科学与技术系剑桥大学)
AI总结 本文提出了一种几何理论,用于刻画表示空间中的对齐税,通过分析安全与能力子空间的关系,推导了安全-能力取舍的前沿,并探讨了能力保持在安全目标冲突中的作用。
CREPE:通过复制交换控制扩散模型
机构 * University of Cambridge(剑桥大学) ; Technical University of Denmark(丹麦技术大学) ; University of Oxford(牛津大学) ; Cornell University(康奈尔大学) ; University of British Columbia(不列颠哥伦比亚大学) ; Xaira Therapeutics(Xaira制药公司)
AI总结 CREPE通过复制交换算法在推理过程中控制扩散模型,实现样本生成的高多样性与在线优化,适用于多种任务并优于传统SMC方法。
Comments Accepted to ICLR 2026