arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-08-25 至 2025-08-25 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2508.15805 2025-08-25 cs.CL cs.AI cs.LG 67%

ALAS: Autonomous Learning Agent for Self-Updating Language Models

Dhruv Atreja

机构 * Dhruv Atreja(独立研究者)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10652 2025-08-25 cs.CL cs.AI cs.CY 67%

Can Large Language Models Simulate Human Responses? A Case Study of Stated Preference Experiments in the Context of Heating-related Choices

Han Wang, Jacek Pawlak, Aruna Sivakumar

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15790 2025-08-25 cs.CL cs.AI 62%

KG-o1: Enhancing Multi-hop Question Answering in Large Language Models via Knowledge Graph Integration

Nan Wang, Yongqi Fan, yansha zhu, ZongYu Wang, Xuezhi Cao, Xinyan He, Haiyun Jiang, Tong Ruan, Jingping Liu

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01819 2025-08-25 cs.LG cs.AI math.OC 62%

Score as Action: Fine-Tuning Diffusion Generative Models by Continuous-time Reinforcement Learning

Hanyang Zhao, Haoxian Chen, Ji Zhang, David D. Yao, Wenpin Tang

机构 * StonyBrook(石溪大学)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

Comments arXiv admin note: text overlap with arXiv:2409.08400

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03789 2025-08-25 cs.CV 50%

HPSv3: Towards Wide-Spectrum Human Preference Score

Yuhang Ma, Yunhao Shui, Xiaoshi Wu, Keqiang Sun, Hongsheng Li

机构 * Mizzen AI CUHK MMLab(香港大学MMLab) King’s College London(伦敦国王学院) Shanghai Jiaotong University(上海交通大学) Shanghai AI Laboratory(上海人工智能实验室) CPII, InnoHK(创新香港科技促进会)

专题命中 偏好对齐 :alignment(abstract)

Comments ICCV2025

详情

展开后加载摘要…

URL PDF HTML 收藏