arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2512.22631 2025-12-30 cs.CL 87%

Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs

评估GRPO和DPO在LLM中的忠实链式推理能力

Hadi Mohammadi, Tamas Kozak, Anastasia Giachanou

机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14925 2025-12-30 cs.LG 70%

A Survey of Reinforcement Learning from Human Feedback

从人类反馈强化学习的综述

Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) MCML Munich(慕尼黑马克斯·普朗克研究所) DFKI(德国人工智能研究中心)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。

Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23693 2025-12-30 cs.CL 57%

Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans

基于文本片段的细粒度人类反馈微调语言模型

Sky CH-Wang, Justin Svegliato, Helen Appel, Jason Eisner

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于文本片段的细粒度人类反馈方法,通过反馈驱动的改进链提升语言模型微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23132 2025-12-30 cs.CR cs.LG cs.MA 57%

Multi-Agent Framework for Threat Mitigation and Resilience in AI-Based Systems

多智能体框架用于AI系统中的威胁缓解与韧性

Armstrong Foundjem, Lionel Nganyewou Tidjon, Leuson Da Silva, Foutse Khomh

机构 * Department of Computer and Software Engineering, Polytechnique Montreal(计算机与软件工程系,蒙特利尔理工学院)

专题命中 偏好对齐 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出多智能体框架,用于识别和缓解AI系统中的威胁,通过构建威胁图分析漏洞和攻击模式,提升系统韧性。

Comments 56 pages, 18 Figures, 22 Tables, TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22398 2025-12-30 cs.AI 57%

Lightweight Inference-Time Personalization for Frozen Knowledge Graph Embeddings

轻量级推理时个性化方法用于冻结的知识图谱嵌入

Ozan Oguztuzun, Cerag Oguztuzun

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 GatedBias通过轻量级推理时个性化方法,实现对冻结知识图谱嵌入的个体用户适应,提升对齐度并保持群体性能,同时验证因果响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏