OLA: Output Language Alignment in Code-Switched LLM Interactions
OLA:代码切换交互中的输出语言对齐
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL
AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
OLA:代码切换交互中的输出语言对齐
专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL
AI总结 OLA研究了代码切换交互中LLM输出语言对齐问题,发现现有模型存在隐含语言期望识别偏差,通过Code-Switching Aware DPO方法显著提升对齐效果。
TRYLOCK:通过分层偏好和表征工程实现对LLM劫持的纵深防御
机构 * AI/ML Security Researcher(人工智能与机器学习安全研究员)
专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)
AI总结 TRYLOCK通过分层偏好和表征工程实现对LLM劫持的纵深防御,结合DPO、RepE、自适应侧车和输入规范化,有效降低攻击成功率并提升安全性与易用性的平衡。
Comments 14 pages, 4 figures. Code and datasets at https://github.com/scthornton/trylock
AMIR-GRPO:将隐式偏好信号引入GRPO
机构 * Department of Natural Language Processing, MBZUAI(自然语言处理系,MBZUAI)
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 AMIR-GRPO通过隐式对比正则化器提升GRPO性能,增强低奖励轨迹抑制,减少长度偏差,实现更密集的监督约束。
屏蔽的推荐强化学习:无需降级的推荐系统解释生成
专题命中 偏好对齐 :RLHF(abstract);分类 cs.LG
AI总结 Shielded RecRL通过双塔架构和复合奖励信号,在不降低推荐准确性的情况下,提升推荐系统个性化解释的质量和用户交互效果。
理解文本到图像强化学习中的奖励黑客行为
机构 * Department of Computer Science, University of California, Los Angeles(计算机科学系,加州大学洛杉矶分校)
专题命中 偏好对齐 :alignment(abstract)
AI总结 本文提出了一种轻量的伪影奖励模型,用于缓解文本到图像强化学习中的奖励黑客问题,通过提高图像真实性和减少低质量生成。