arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2504.20106 2026-02-05 cs.LG cs.AI 90%

Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

基于偏好向量的自适应有益有害对齐

Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu, Saransh Agrawal, Shih-Cheng Huang, Chieh-Yen Lin, Shang-Tse Chen, Kuan-Hao Huang, Shao-Hua Sun

机构 * National Taiwan University(国立台湾大学) Texas A&M University(德克萨斯A&M大学) Appier AI Research(Appier人工智能研究院) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(title);RLHF(abstract);DPO(abstract)

AI总结 本文提出偏好向量框架,通过模块化方法实现细粒度的用户可控偏好调整,提升大语言模型的有益性和无害性平衡。

Comments Accepted at The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04224 2026-02-05 cs.LG cs.AI cs.CL cs.CR math.OC 80%

RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning

RAPO:面向通用安全推理的风险感知优化

Zeming Wei, Qiaosheng Zhang, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RAPO 提出了一种风险感知优化框架,通过提升安全推理的泛化能力,增强大型推理模型在复杂攻击下的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04649 2026-02-05 cs.CL 70%

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

结果准确性不够:对奖励模型推理过程的对齐

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 70%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03876 2026-02-05 cs.LG cs.AI 62%

GOPO: Policy Optimization using Ranked Rewards

GOPO:基于排名奖励的策略优化

Kyuseong Choi, Dwaipayan Saha, Woojeong Kim, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech, Cornell University, NY, United States(康奈尔科技、康奈尔大学,纽约,美国) Columbia University, NY, United States(哥伦比亚大学,纽约,美国)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过使用奖励排名而非绝对值,提高了不可验证任务中策略优化的性能和效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13131 2026-02-05 cs.CL cs.LG stat.ML 62%

Improving Detection of Watermarked Language Models

提升水印语言模型的检测能力

Dara Bahri, John Wieting

机构 * Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文通过结合水印与非水印检测器提升大型语言模型的检测能力。

Comments Published at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04493 2026-02-05 cs.CL cs.HC 57%

PersoDPO: Scalable Preference Optimization for Instruction-Adherent, Persona-Grounded Dialogue via Multi-LLM Evaluation

PersoDPO: 通过多LLM评估实现可扩展的偏好优化

Saleh Afzoon, MohammadHossein Ahmadi, Usman Naseem, Amin Beheshti

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 PersoDPO通过多LLM评估实现可扩展的偏好优化,提升对话系统的人格导向和上下文连贯性。

Comments Accepted at WISE 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18321 2026-02-05 cs.MM cs.CL cs.CV 57%

Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning

融合细粒度音频视觉证据以实现鲁棒的多模态情绪推理

Zhixian Zhao, Wenjie Tian, Lei Xie

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SABER-LLM通过构建大规模情绪推理数据集和结构化证据分解范式,实现鲁棒的多模态情绪推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04526 2026-02-05 econ.TH 50%

Choice via AI

通过代理人工智能的选择

Christopher Kops, Elias Tsakas

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文通过代理人工智能模型研究选择行为,提出双重单调性与幂等性属性以确保推荐的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏