arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-08 至 2025-12-08 共收录 5 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 5 篇

2508.11222 2025-12-08 cs.SE cs.AI cs.CL cs.IR 84%

ORFuzz: Fuzzing the "Other Side" of LLM Safety -- Testing Over-Refusal

ORFuzz: 测试LLM安全的'另一面' -- 检测过度拒绝

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Jiashui Wang, Xinlei Ying, Long Liu, Wenhai Wang

机构 * Zhejiang University(浙江大学) Zhejiang University Huzhou Institute of Industrial Control Technology(浙江大学湖州工业控制技术研究所)

专题命中 安全训练 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 ORFuzz通过进化测试框架系统检测LLM的过度拒绝现象,生成高覆盖率的测试用例并建立新基准,提升LLM安全性。

Comments Accepted by ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05686 2025-12-08 eess.SY cs.SY 78%

LA-RL: Language Action-guided Reinforcement Learning with Safety Guarantees for Autonomous Highway Driving

LA-RL: 基于语言动作引导的安全强化学习用于自动驾驶高速公路驾驶

Yiming Shu, Jiahui Xu, Jiwei Tang, Ruiyang Gao, Chen Sun

专题命中 安全训练 :safety(title,abstract)

AI总结 LA-RL通过整合大语言模型的语义推理和改进的安全层,提升自动驾驶高速公路驾驶的效率与安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06211 2025-12-08 cs.CV 67%

iMotion-LLM: Instruction-Conditioned Trajectory Generation

iMotion-LLM:基于指令的轨迹生成

Abdulwahab Felemban, Nussair Hroub, Jian Ding, Eslam Abdelrahman, Xiaoqian Shen, Abduallah Mohamed, Mohamed Elhoseiny

机构 * King Abdullah University of Science and Technology (KAUST)(卡塔尔国王阿卜杜勒阿齐兹大学科学与技术学院) Meta Reality Labs(Meta现实实验室)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 iMotion-LLM通过结合预训练LLM与轨迹预测模块,实现基于文本指令的交互式运动生成,提升自动驾驶中的轨迹生成准确性和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05339 2025-12-08 cs.LG 57%

Taxonomy-Adaptive Moderation Model with Robust Guardrails for Large Language Models

具有鲁棒防护栏的分类适应调谐模型用于大型语言模型

Mahesh Kumar Nandwana, Youngwan Lim, Joseph Liu, Alex Yang, Varun Notibala, Nishchaie Khanna

机构 * Project Lead(项目负责人)

专题命中 安全训练 :safety(abstract);分类 cs.LG

AI总结 Roblox Guard 1.0通过指令微调提升大型语言模型的安全性,采用输入输出调谐和可扩展的安全分类评估框架。

Comments To be presented at AAAI-26 PerFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05172 2025-12-08 cs.CV cs.AI 57%

Semore: VLM-guided Enhanced Semantic Motion Representations for Visual Reinforcement Learning

Semore:基于VLM的增强语义运动表示用于视觉强化学习

Wentao Wang, Chunyang Liu, Kehua Sheng, Bo Zhang, Yan Wang

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 Semore通过结合VLM和CLIP实现高效的视觉强化学习,提升语义和运动表示的融合能力。

详情

展开后加载摘要…

URL PDF HTML 收藏