arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-17 至 2026-02-17 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 8 篇

2602.13234 2026-02-17 cs.AI 85%

Stay in Character, Stay Safe: Dual-Cycle Adversarial Self-Evolution for Safety Role-Playing Agents

保持角色,保持安全:双循环对抗自进化用于安全角色扮演代理

Mingyang Liao, Yichen Wan, shuchen wu, Chenxi Miao, Xin Shen, Weikang Li, Yang Li, Deguo Xia, Jizhou Huang

机构 * Baidu Inc.(百度公司) The University of Queensland(昆士兰大学) Peking University(北京大学)

专题命中 安全训练 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出双循环对抗自进化框架,通过角色扮演防御机制提升安全性和角色忠实度,实验表明在多个大语言模型上有效提升角色扮演的稳定性与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14252 2026-02-17 cs.AI cs.LG cs.RO 81%

GRAIL: Goal Recognition Alignment through Imitation Learning

GRAIL:通过模仿学习进行目标识别对齐

Osher Elhadad, Felipe Meneguzzi, Reuth Mirsky

机构 * Department of Computer Science, Bar Ilan University(巴伊兰大学计算机科学系) Department of Computer Science, Aberdeen University(阿伯丁大学计算机科学系) Department of Computer Science, Tufts University(塔夫茨大学计算机科学系)

专题命中 安全训练 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 GRAIL通过模仿学习和逆强化学习,从演示轨迹中学习目标导向策略,提高目标识别的准确性和鲁棒性。

Comments Accepted for publication at AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13451 2026-02-17 cs.GT 78%

Personalization Aids Pluralistic Alignment Under Competition

个性化有助于竞争中的多元对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Mirah Shi

专题命中 安全训练 :alignment(title,abstract)

AI总结 本文研究了竞争中AI提供者通过个性化策略实现用户多元对齐的可能性,并探讨了不同对齐条件下的均衡结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.08796 2026-02-17 cs.LG cs.AI 73%

Robust Multi-Objective Controlled Decoding of Large Language Models

鲁棒多目标控制解码大型语言模型

Seongho Son, William Bankes, Sangwoong Yoon, Shyam Sundhar Ramesh, Xiaohang Tang, Ilija Bogunovic

机构 * University College London(伦敦大学学院) Ulsan National Institute of Science and Technology(釜山国立科学技术研究所) University of Basel(巴塞尔大学) University College London AI Centre(伦敦大学学院人工智能中心)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出RMOD算法,通过最大化最坏情况奖励实现鲁棒多目标解码,有效提升大型语言模型在多个人类目标上的对齐性能。

Comments Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13860 2026-02-17 cs.CL 70%

Tutoring Large Language Models to be Domain-adaptive, Precise, and Safe

指导大语言模型成为领域自适应、精确和安全的

Somnath Banerjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院克哈格浦分校)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本研究通过领域适应、伦理严谨性和文化对齐,指导大语言模型实现精确性、安全性和全球包容性。

Comments Accepted to the PhD Symposium at Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14338 2026-02-17 cs.LG cs.AI 62%

Train Less, Learn More: Adaptive Efficient Rollout Optimization for Group-Based Reinforcement Learning

少训练,多学习:基于群体的强化学习中的自适应高效回滚优化

Zhi Zhang, Zhen Han, Costas Mavromatis, Qi Zhu, Yunyi Zhang, Sheng Guan, Dingmin Wang, Xiong Zhou, Shuai Wang, Soji Adeshina, Vassilis Ioannidis, Huzefa Rangwala

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Amazon Web Services(亚马逊网络服务)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 AERO通过自适应回滚策略和选择性拒绝提升群体强化学习的计算效率,减少48%的训练计算并缩短45%的训练时间,同时保持或提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04856 2026-02-17 cs.CL 57%

CoT is Not the Chain of Truth: An Empirical Internal Analysis of Reasoning LLMs for Fake News Generation

CoT并非真理链:对用于虚假新闻生成的推理LLM的实证内部分析

Zhao Tong, Chunlin Gong, Yiping Zhang, Haichao Shi, Qiang Liu, Xingcheng Xu, Shu Wu, Xiao-Yu Zhang

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究揭示推理LLM在生成虚假新闻时,即使拒绝有害请求,其内部推理仍可能传播不安全内容,通过分析框架和指标揭示潜在风险并挑战安全假设。

Comments 28 pages, 35 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13227 2026-02-17 cs.NI cs.AI 57%

An Agentic AI Control Plane for 6G Network Slice Orchestration, Monitoring, and Trading

面向6G网络切片编排、监控与交易的代理式AI控制平面

Eranga Bandara, Ross Gore, Sachin Shetty, Ravi Mukkamala, Tharaka Hewa, Abdul Rahman, Xueping Liang, Safdar H. Bouk, Amin Hass, Peter Foytik, Ng Wee Keong, Kasun De Zoysa

机构 * Florida International University, USA(佛罗里达国际大学) Center for Wireless Communications, University of Oulu, Finland(无线通信中心,奥卢大学) Accenture Technology Labs, Arlington, VA, USA(埃森哲技术实验室) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出面向6G网络切片编排、监控与交易的代理式AI控制平面,通过市场感知编排和自然语言接口实现经济导向的智能控制。

详情

展开后加载摘要…

URL PDF HTML 收藏