arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-11-27 至 2025-11-27 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2508.12398 2025-11-27 cs.CR cs.AI cs.CL 84%

Where to Start Alignment? Diffusion Large Language Model May Demand a Distinct Position

对齐何处开始?扩散大语言模型可能需要不同的位置

Zhixin Xie, Xurui Song, Jun Luo

专题命中 安全训练 :alignment(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MOSA方法,通过强化学习对齐dLLM中间生成与安全拒绝,提升安全性。

Comments Accepted for oral presentation at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.17846 2025-11-27 cs.RO cs.AI 79%

Safety Control of Service Robots with LLMs and Embodied Knowledge Graphs

服务机器人中结合大语言模型和具身知识图谱的安全控制

Yong Qi, Gabriel Kyebambo, Siyuan Xie, Wei Shen, Shenghui Wang, Bitao Xie, Bin He, Zhipeng Wang, Shuo Jiang

机构 * School of Electronic Information(电子信息学院) Artificial Intelligence, Shaanxi University of Science(人工智能,陕西科技大学)

专题命中 安全训练 :safety(title,abstract);分类 cs.AI

AI总结 本文提出结合大语言模型与具身知识图谱的方法,提升服务机器人安全控制,通过预定义指令和知识库验证增强安全实践。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15392 2025-11-27 cs.LG 57%

Learning in Stackelberg Mean Field Games: A Non-Asymptotic Analysis

在Stackelberg均场博弈中学习:非渐近分析

Sihan Zeng, Benjamin Patrick Evans, Sujay Bhatt, Leo Ardon, Sumitra Ganesh, Alec Koppel

机构 * J.P.Morgan AI Research(J.P.Morgan AI研究)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出AC-SMFG算法,首次在Stackelberg均场博弈中实现非渐近收敛保证,通过梯度对齐条件提升策略优化效率。

Comments Accepted at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21584 2025-11-27 cs.RO cs.AI 57%

Model-Based Policy Adaptation for Closed-Loop End-to-End Autonomous Driving

基于模型的策略适应用于闭环端到端自动驾驶

Haohong Lin, Yunzhi Zhang, Wenhao Ding, Jiajun Wu, Ding Zhao

机构 * CMU(卡内基梅隆大学) Stanford(斯坦福大学) NVIDIA(英伟达)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出基于模型的策略适应框架,通过生成反事实轨迹和训练Q值模型提升自动驾驶在闭环环境中的鲁棒性和安全性。

Comments Published at NeurIPS 2025: https://openreview.net/forum?id=4OLbpaTKJe

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20919 2025-11-27 physics.ed-ph hep-ex 50%

Virtual high voltage lab: gamified learning in a safe 3d environment

虚拟高压实验室:在安全3D环境中的游戏化学习

Vladyslav Pliuhin, Yevgen Tsegelnyk, Maria Sukhonos, Ihor Biletskyi, Sergiy Plankovskyy, Taras Sakhoshko

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出一个基于Unreal Engine 5的虚拟高压实验室,通过游戏化和沉浸式技术提升学生在高压工程学习中的参与度和实践技能,增强城市能源系统韧性。

Comments 54 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏