When Style Breaks Safety: Defending LLMs Against Superficial Style Alignment
当风格破坏安全性:防御大语言模型对抗浅层风格对齐
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。
Comments Accepted by ICLR 2026
期刊&会议
International Conference on Learning Representations · 会议 · Machine Learning
当风格破坏安全性:防御大语言模型对抗浅层风格对齐
机构 * Massachusetts Institute of Technology(麻省理工学院)
AI总结 本研究探讨了风格对齐对大语言模型安全性的影响,提出 SafeStyle 防御策略有效缓解了浅层风格对齐带来的风险。
Comments Accepted by ICLR 2026
InftyThink: 突破大型语言模型长上下文推理的长度限制
机构 * Zhejiang University(浙江大学) ; Meituan Group(美团集团) ; Peking University(北京大学)
AI总结 InftyThink通过迭代推理与中间摘要机制,突破大型语言模型长上下文推理的长度限制,提升推理深度与效率。
Comments ICLR 2026: https://openreview.net/forum?id=T1h5em349L Project Page: https://zju-real.github.io/InftyThink Code: https://github.com/ZJU-REAL/InftyThink
VOILA:对多模态大语言模型的感知理解与类比推理能力评估
机构 * Arizona State University(亚利桑那州立大学) ; University of Maryland, Baltimore County(马里兰大学巴尔的摩县分校)
AI总结 VOILA通过类比映射方法评估多模态大语言模型的感知理解和抽象推理能力,发现其在图像间关系理解上存在不足,但通过多步提示策略可提升性能。
Comments Accepted at ICLR 2025. Code and data: https://github.com/nlylmz/Voila
MathFimer: 通过填空中间任务扩展推理步骤以增强数学推理
AI总结 MathFimer通过填空中间任务扩展推理步骤,提升大语言模型的数学推理能力,无需依赖强大外部模型或昂贵计算资源。
Comments ICLR 2026: https://openreview.net/forum?id=14i2wzPPfn
面向问题的视角与锚点验证用于代码优化
机构 * Zhejiang University(浙江大学) ; Stony Brook University(石溪大学) ; AntGroup(蚂蚁集团)
AI总结 本文提出面向问题的视角与锚点验证框架,用于提升代码优化的正确性和效率,减少优化过程中的性能损耗。
Comments ICLR 2026