Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment
可微社会选择中的开放问题:学习机制、决策与对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可微社会选择中的开放问题:学习机制、决策与对齐
专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG
AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。
基于扩散模型的人体网格恢复中的群体偏好对齐
机构 * Nanyang Technological University(南洋理工大学) ; HKUST(GZ)(香港科技大学(广州)) ; SenseTime Research(商汤科技研究院) ; A*STAR(新加坡科技研究局)
专题命中 偏好对齐 :alignment(title,abstract)
AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。
Comments Accepted to CVPR 2026
IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法
机构 * UC Davis(加州大学戴维斯分校) ; Virginia Tech(弗吉尼亚理工大学) ; Salesforce(Salesforce公司) ; Meta AI
专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG
AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。
Ada-RS: 选择性思维的自适应拒绝采样
机构 * PayPal AI
专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG
AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。
MergeMix:一种用于视觉和多模态理解的统一增强范式
机构 * Westlake University(西拉克大学) ; Zhejiang University(浙江大学) ; College of Computer Science and Technology(计算机科学与技术学院)
专题命中 偏好对齐 :alignment(abstract)
AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。
Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/