arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-27 至 2026-02-27 共收录 6 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 6 篇

2602.22554 2026-02-27 cs.LG 89%

Multilingual Safety Alignment Via Sparse Weight Editing

多语言安全对齐 via 稀疏权重编辑

Jiaming Liang, Zhaoxin Wang, Handing Wang

机构 * School of Artificial Intelligence, Xidian University(人工智能学院,西安电子科技大学)

专题命中 偏好对齐 :alignment(title,abstract);safety(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 本文提出基于稀疏权重编辑的多语言安全对齐方法,通过稀疏神经元映射降低低资源语言攻击成功率,同时保持通用推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22718 2026-02-27 cs.AI cs.DC 79%

RLHFless: Serverless Computing for Efficient RLHF

RLHFless:用于高效RLHF的无服务器计算

Rui Wei, Hanfei Yu, Shubham Jain, Yogarajan Sivakumar, Devesh Tiwari, Jian Li, Seung-Jong Park, Hao Wang

机构 * Stevens Institute of Technology Northeastern University Stony Brook University Missouri University of Science \& Technology

专题命中 偏好对齐 :RLHF(title,abstract);分类 cs.AI

AI总结 RLHFless通过无服务器计算环境实现高效同步RLHF训练,预计算共享前缀并采用成本感知的演员扩展策略,提升训练速度并降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12522 2026-02-27 cs.CL cs.AI 73%

Evaluating the Diversity and Quality of LLM Generated Content

评估大型语言模型生成内容的多样性和质量

Alexander Shypula, Shuo Li, Botong Zhang, Vishakh Padmakumar, Kayo Yin, Osbert Bastani

机构 * University of Pennsylvania(宾夕法尼亚大学) New York University(纽约大学) UC Berkeley(伯克利大学)

专题命中 偏好对齐 :RLHF(abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出有效语义多样性测量框架,发现偏好微调模型在质量阈值下具有更高多样性,且小模型在固定预算内更高效生成独特内容。

Comments Published at COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.16661 2026-02-27 cs.CL cs.AI cs.LG cs.LO 67%

RLSF: Fine-tuning LLMs via Symbolic Feedback

通过符号反馈进行LLM微调:RLSF

Piyush Jha, Prithwish Jana, Pranavkrishna Suresh, Arnav Arora, Vijay Ganesh

机构 * Georgia Institute of Technology, USA(佐治亚理工学院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RLSF通过符号反馈微调LLM,利用符号推理工具提供精细反馈,提升领域特定任务的性能,使小模型超越大模型。

Journal ref ECAI 2025, Frontiers in Artificial Intelligence and Applications, Vol. 413, pp. 1687-1694, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02088 2026-02-27 cs.CV cs.AI 57%

Dual-IPO: Dual-Iterative Preference Optimization for Text-to-Video Generation

Dual-IPO: 双迭代偏好优化用于文本到视频生成

Xiaomeng Yang, Mengping Yang, Jia Gong, Luozheng Qin, Zhiyu Tan, Hao Li

机构 * Fudan University(复旦大学) Shanghai Academy of AI for Science(上海人工智能科学研究院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 Dual-IPO通过迭代优化奖励模型和视频生成模型,提升文本到视频生成的质量和人类偏好对齐,无需手动标注即可提高合成效果。

Comments To appear in ICLR 2026, GitHub Code: https://github.com/SAIS-FUXI/IPO

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16434 2026-02-27 cs.RO 50%

From Prompts to Printable Models: Support-Effective 3D Generation via Offset Direct Preference Optimization

从提示到可打印模型:通过偏移直接偏好优化实现支持有效的3D生成

Chenming Wu, Xiaofan Li, Chengkai Dai

机构 * Axiswise Ltd.(Axiswise有限公司) Centre for Perceptual and Interactive Intelligence(感知与交互智能中心)

专题命中 偏好对齐 :DPO(abstract)

AI总结 SEG通过偏移直接偏好优化实现支持有效的3D生成,显著减少支撑材料使用并提升打印可制造性。

Comments Accepted by IEEE Robotics and Automation Letters 2026, preprint version by authors

详情

展开后加载摘要…

URL PDF HTML 收藏