arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-22 至 2026-01-22 共收录 2 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 2 篇

2502.18099 2026-01-22 cs.LG 79%

Stackelberg Self-Annotation: A Robust Approach to Data-Efficient LLM Alignment

Stackelberg 自注释:一种鲁棒的数据高效 LLM 对齐方法

Xu Chu, Zhixin Zhang, Tianyu Jia, Yujie Jin

机构 * Key Laboratory of High Confidence Software Technologies, Ministry of Education(高可信软件技术重点实验室,教育部) Center on Frontiers of Computing Studies, Peking University(计算前沿研究中心,北京大学) School of Computer Science, Peking University(计算机学院,北京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出Stackelberg自标注方法,通过少量人工标注和迭代自我标注,实现高效LLM对齐,减少对昂贵人工标注的依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05553 2026-01-22 cs.CL cs.CY 62%

Do Political Opinions Transfer Between Western Languages? An Analysis of Unaligned and Aligned Multilingual LLMs

政治观点在西方语言之间是否转移?对未对齐和对齐的多语言大语言模型的分析

Franziska Weeber, Tanise Ceron, Sebastian Padó

机构 * University of Stuttgart(斯图加特大学) Bocconi University(博科尼大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 研究探讨多语言大语言模型在五种西方语言中政治观点的转移情况,发现对齐前模型观点差异小,对齐后观点在各语言间均匀转移。

Comments EACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏