arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-07 至 2026-01-07 共收录 3 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 3 篇

2601.03005 2026-01-07 cs.CR cs.AI 85%

JPU: Bridging Jailbreak Defense and Unlearning via On-Policy Path Rectification

JPU: 通过在线策略路径校正弥合对抗防御与遗忘

Xi Wang, Songlei Jian, Shasha Li, Xiaopeng Li, Zhaoye Li, Bin Ji, Baosheng Wang, Jie Yu

机构 * National University of Defense Technology(国防科技大学)

专题命中 安全训练 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 JPU通过动态挖掘在线策略对抗样本,校正动态对抗路径以提升模型对抗攻击的鲁棒性。

Comments 14 pages, 6 figures, under review;

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19001 2026-01-07 cs.AI cs.LG 62%

ORPR: An OR-Guided Pretrain-then-Reinforce Learning Model for Inventory Management

ORPR:一种基于OR的预训练后再强化学习模型用于库存管理

Lingjie Zhao, Xue Yu, Yongzhi Qi, Hao Hu, Jianshen Zhang, Yingzheng Ma, Shuyu Han, Wei Qi, Zuo-Jun Max Shen

机构 * Department of Industrial Engineering, Tsinghua University(清华大学工业工程系) Supply Chain Tech Team Y, JD.com(京东供应链技术团队) Faculty of Engineering and Faculty of Business and Economics, The University of Hong Kong(香港大学工程学院和商学院)

专题命中 安全训练 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于OR的预训练后再强化学习模型,通过结合领域知识和结构化优化逻辑,提升库存管理的决策效率与成本效益。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02577 2026-01-07 cs.AI astro-ph.IM hep-ph 57%

Orchestral AI: A Framework for Agent Orchestration

Orchestral AI: 一个用于智能体协调的框架

Alexander Roman, Jacob Roman

机构 * Orchestral AI

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 Orchestral AI 提供了一个统一的Python框架,用于跨多个LLM供应商构建智能体,通过类型安全接口和自动工具模式生成,简化了工具调用和跨供应商集成。

Comments 17 pages, 3 figures. For more information visit https://orchestral-ai.com

详情

展开后加载摘要…

URL PDF HTML 收藏