arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-24 至 2025-11-24 共收录 4 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 4 篇

2511.16688 2025-11-24 cs.CL cs.AI 62%

Prompt-Based Value Steering of Large Language Models

基于提示的价值引导大型语言模型

Giulio Antonio Abbo, Tony Belpaeme

专题命中 安全训练 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于提示的价值引导方法,通过评估提示候选者对生成文本的价值引导能力,展示在不修改模型的情况下实现价值对齐的可行性。

Comments 9 pages, 1 figure, 4 tables. Presented at the 3rd International Workshop on Value Engineering in AI (VALE 2025), 28th European Conference on AI. To appear in Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17182 2025-11-24 cs.CY 57%

The Promotion Wall: Efficiency-Equity Trade-offs of Direct Promotion Regimes in Engineering Education

促进墙:工程教育中直接促进制度的效率-公平权衡

H. R. Paz

专题命中 安全训练 :safety(abstract);分类 cs.CY

AI总结 本文通过模拟研究发现,直接促进制度会导致退学率上升和公平差距扩大,而补充安全网的制度能部分缓解这一问题,同时降低学生压力。

Comments 42 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16916 2025-11-24 cs.AI 57%

Hybrid Differential Reward: Combining Temporal Difference and Action Gradients for Efficient Multi-Agent Reinforcement Learning in Cooperative Driving

混合差分奖励:结合时序差分和动作梯度用于高效合作驾驶多智能体强化学习

Ye Han, Lijun Zhang, Dejian Meng, Zhuang Zhang

机构 * School of Automotive Studies, Tongji University(交通学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出混合差分奖励机制,结合时序差分和动作梯度,提升多智能体协同驾驶的收敛速度和策略稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.16958 2025-11-24 econ.TH 50%

Real Option AI: Reversibility, Silence, and the Release Ladder

实时选项AI:可逆性、沉默与释放阶梯

I. Sebastian Buhai

专题命中 安全训练 :safety(abstract)

AI总结 本文研究了AI产品发布节奏作为战略实时选项的最优执行,揭示了可逆性、沉默与释放阶梯的内生机制,以及杠杆对不可逆性的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏