Text2Grad: Reinforcement Learning from Natural Language Feedback
Text2Grad:从自然语言反馈中强化学习
AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。
Comments The code for our method is available at https://github.com/microsoft/Text2Grad
Journal ref ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
Text2Grad:从自然语言反馈中强化学习
AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。
Comments The code for our method is available at https://github.com/microsoft/Text2Grad
Journal ref ICLR 2026
宣传AI:大型语言模型中语义分歧的分析
机构 * Singapore Management University(新加坡国立管理学院)
AI总结 本文提出RAVEN方法,用于检测大型语言模型中因概念提示引发的语义分歧,通过结合语义熵与跨模型分歧,揭示模型在特定主题上的异常响应,以提高对宣传影响的防范能力。
Comments Accepted at ICLR 2026, 22 pages, 1 figure
往返之间:关于扩散模型中噪声与图像逆向之间的关系
机构 * Warsaw University of Technology(华沙技术大学) ; IDEAS Research Institute(IDEAS研究机构) ; University of Warsaw(华沙大学) ; Institute of Mathematics, Polish Academy of Sciences(波兰科学院数学研究所) ; IDEAS NCBR
AI总结 本文研究了扩散模型中噪声与图像逆向之间的关系,通过替换DDIM逆向步骤为正向扩散过程,解相关潜在编码并提升编辑与插值质量。
Comments ICLR 2026
贝叶斯自适应蒙特卡洛树搜索用于离线模型驱动强化学习
机构 * The University of Hong Kong(香港大学) ; Tsinghua University(清华大学) ; Carnegie Mellon University(卡内基梅隆大学)
AI总结 本文提出贝叶斯自适应蒙特卡洛树搜索算法,用于提升离线模型驱动强化学习的性能,显著优于现有方法。
Comments This paper is accepted in ICLR 2026
伪非线性数据增强:一种约束能量最小化视角
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; National Institute of Informatics(日本信息处理研究所) ; SOKENDAI
AI总结 本文提出了一种基于约束能量最小化视角的伪非线性数据增强方法,通过构建几何感知的潜在空间,实现了高效的数据增强与细粒度可控性。
Comments Accepted at the 14th International Conference on Learning Representations (ICLR 2026)
基于水印的AI生成内容归属
AI总结 本文提出基于水印的AI生成内容归属方法,通过为每个用户分配唯一水印并嵌入生成内容中,实现对生成内容来源的准确追溯。
Comments Accepted by ICLR 2026
一个高效的、可证明最优的0-1损失线性分类问题算法
机构 * Xi He School of Computer Science Peking University(何西 北京大学计算机科学学院) ; Max A. Little School of Computational Neuroscience University of Birmingham(马克斯·A·利特 布里斯托大学计算神经科学学院)
AI总结 本文提出了一种高效的、可证明最优的0-1损失线性分类算法ICE,能够在O(N^{D+1})时间内精确求解该问题,并将其推广到多项式超曲面分类问题。
Comments Published in ICLR 2026, The Fourteenth International Conference on Learning Representations. 19 pages, 6 figures
通过扩散模型的秩1 Fisher避免灾难性遗忘
机构 * College of Computing(计算学院) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 本文提出基于扩散模型的秩1 EWC 方法,通过改进 Fisher 估计减少持续学习中的灾难性遗忘,提升图像生成任务的 FID 指标。
Comments 19 pages, 14 figures
Journal ref ICLR 2026