arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-01 至 2026-01-01 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2512.24263 2026-01-01 cs.AI 85%

Constrained Language Model Policy Optimization via Risk-aware Stepwise Alignment

通过风险感知的逐步对齐实现约束语言模型策略优化

Lijun Zhang, Lin Li, Wei Wei, Yajie Qi, Huizhong Song, Jun Wang, Yaodong Yang, Jiye Liang

机构 * Key Laboratory of Computational Intelligence and Chinese Information Processing of Ministry of Education, School of Computer and Information Technology, Shanxi University(教育部计算智能与中文信息处理重点实验室,计算机与信息技术学院,山西大学) University College London(伦敦大学学院) Institute for AI, Peking University(北京大学人工智能研究院)

专题命中 安全训练 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.AI

AI总结 本文提出风险感知的逐步对齐方法,通过嵌套风险度量提升语言模型策略优化的安全性与鲁棒性,有效抑制高影响有害行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23717 2026-01-01 cs.CL cs.AI 73%

HarmTransform: Transforming Explicit Harmful Queries into Stealthy via Multi-Agent Debate

HarmTransform: 通过多智能体辩论将显性有害查询转化为隐蔽形式

Shenzhe Zhu

机构 * University of Toronto(多伦多大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 HarmTransform通过多智能体辩论框架,系统地将有害查询转化为隐蔽形式,以提升大型语言模型的安全对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23738 2026-01-01 cs.PL cs.AI cs.FL cs.LO 57%

Enforcing Temporal Constraints for LLM Agents

为LLM代理强制执行时间约束

Adharsh Kamath, Sishen Zhang, Calvin Xu, Shubham Ugare, Gagandeep Singh, Sasa Misailovic

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Illinois at Urbana-Champaign, USA(伊利诺伊大学厄巴纳-香槟分校,美国) Meta

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Agent-C通过运行时保证确保LLM代理遵守时间安全属性,提高任务实用性并实现完美安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22386 2026-01-01 cs.IR 50%

OxygenREC: An Instruction-Following Generative Framework for E-commerce Recommendation

OxygenREC: 一种用于电商推荐的指令遵循生成框架

Xuegang Hao, Ming Zhang, Alex Li, Xiangyu Qian, Zhi Ma, Yanlong Zang, Shijie Yang, Zhongxuan Han, Xiaolong Ma, Jinguang Liu, Zhen Li, Zhida Jiang, Shusheng Wang, Ning Tang, Yanchen Qiao, Chenxiang Yang, Chen Sun, Jincheng Yuan, Chunhua Peng, Heng Hu, Peijun Yang, Baopeng Yuan, Caiyun Qiu, Zhaolong Xing, Haofei Yuan, Haipeng Zhang, Yuzhang Guo, Weijie Ding, Jiahua Gao, Hao Huang, Zhen Chen, Tongxuan Liu, Pinghua Gong

专题命中 安全训练 :alignment(abstract)

AI总结 OxygenREC通过快慢思考架构和语义对齐机制,实现低延迟多场景的深度推荐推理。

Comments 37 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏