arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-24 至 2026-02-24 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2602.03003 2026-02-24 cs.AI cs.LG 81%

Open Problems in Differentiable Social Choice: Learning Mechanisms, Decisions, and Alignment

可微社会选择中的开放问题:学习机制、决策与对齐

Zhiyu An, Wan Du

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了可微社会选择中的18个开放问题,研究如何将投票规则、机制和聚合过程作为可学习模型进行优化,揭示了经典公理在机器学习中的新应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19180 2026-02-24 cs.CV 78%

VLM-Guided Group Preference Alignment for Diffusion-based Human Mesh Recovery

基于扩散模型的人体网格恢复中的群体偏好对齐

Wenhao Shen, Hao Wang, Wanqi Yin, Fayao Liu, Xulei Yang, Chao Liang, Zhongang Cai, Guosheng Lin

机构 * Nanyang Technological University(南洋理工大学) HKUST(GZ)(香港科技大学(广州)) SenseTime Research(商汤科技研究院) A*STAR(新加坡科技研究局)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 本文提出了一种基于群体偏好的扩散模型微调框架,通过双内存增强的批评代理生成质量评分,提升人体网格恢复的物理合理性和图像一致性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19416 2026-02-24 cs.AI cs.LG 73%

IR$^3$: Contrastive Inverse Reinforcement Learning for Interpretable Detection and Mitigation of Reward Hacking

IR$^3$:基于可解释性强化学习的对抗性检测与缓解方法

Mohammad Beigi, Ming Jin, Junshan Zhang, Jiaxin Zhang, Qifan Wang, Lifu Huang

机构 * UC Davis(加州大学戴维斯分校) Virginia Tech(弗吉尼亚理工大学) Salesforce(Salesforce公司) Meta AI

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI、cs.LG

AI总结 IR3通过对比逆强化学习重建隐含奖励并修正模型,有效识别和缓解奖励黑客问题,提升模型对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19519 2026-02-24 cs.AI cs.LG 62%

Ada-RS: Adaptive Rejection Sampling for Selective Thinking

Ada-RS: 选择性思维的自适应拒绝采样

Yirou Ge, Yixi Li, Alec Chiu, Shivani Shekhar, Zijie Pan, Avinash Thangali, Yun-Shiuan Chuang, Chaitanya Kulkarni, Uma Kona, Linsey Pang, Prakhar Mehrotra

机构 * PayPal AI

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 Ada-RS通过自适应拒绝采样提升LLMs在延迟敏感场景下的推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23479 2026-02-24 cs.CV 50%

MergeMix: A Unified Augmentation Paradigm for Visual and Multi-Modal Understanding

MergeMix:一种用于视觉和多模态理解的统一增强范式

Xin Jin, Siyuan Li, Siyong Jian, Kai Yu, Huan Wang

机构 * Westlake University(西拉克大学) Zhejiang University(浙江大学) College of Computer Science and Technology(计算机科学与技术学院)

专题命中 偏好对齐 :alignment(abstract)

AI总结 MergeMix通过高效的令牌合并Mixup增强方法,平衡了SFT和RL的优劣,提升多模态大语言模型的分类准确率和对齐能力。

Comments ICLR 2026, Web link: https://jinxins.github.io/MergeMix_Web/

详情

展开后加载摘要…

URL PDF HTML 收藏