arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-23 至 2025-12-23 共收录 7 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全训练 7 篇

2512.18776 2025-12-23 cs.CY cs.HC 88%

"Even GPT Can Reject Me": Conceptualizing Abrupt Refusal Secondary Harm (ARSH) and Reimagining Psychological AI Safety with Compassionate Completion Standard (CCS)

即使GPT也可以拒绝我:概念化突然拒绝二次伤害(ARSH)并重新想象以同理心为核心的AI安全(CCS)

Yang Ni, Tong Yang

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出ARSH概念,通过CCS设计框架减少AI拒绝带来的心理伤害,提升人机交互的心理安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17196 2025-12-23 cs.LG 83%

Shape it Up! Restoring LLM Safety during Finetuning

Shape it Up! 修复微调过程中LLM的安全性

ShengYun Peng, Pin-Yu Chen, Jianfeng Chi, Seongmin Lee, Duen Horng Chau

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 动态安全塑造(DSS)通过细粒度安全信号在微调过程中动态增强安全内容,有效缓解安全风险,提升模型安全性。

Comments NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19238 2025-12-23 cs.CL cs.AI cs.LG 78%

Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation

识别与偏见相关的93个被污名化的群体特征及语言模型的安全防护措施

Anna-Maria Gueorguieva, Aylin Caliskan

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型对93个污名化群体的偏见来源,并测试了防护模型对减少偏见的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19361 2025-12-23 cs.LG 57%

Interpretable Hybrid Deep Q-Learning Framework for IoT-Based Food Spoilage Prediction with Synthetic Data Generation and Hardware Validation

可解释的混合深度Q学习框架用于基于物联网的食品变质预测:合成数据生成与硬件验证

Isshaan Singh, Divyansh Chawla, Anshu Garg, Shivin Mangal, Pallavi Gupta, Khushi Agarwal, Nimrat Singh Khalsa, Nandan Patel

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Vellore Institute of Technology(韦洛雷理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种结合LSTM和RNN的可解释混合深度Q学习框架,用于基于物联网的食品变质预测,通过合成数据生成和硬件验证提升预测准确性和决策效率,同时保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18669 2025-12-23 cs.AI 57%

IntelliCode: A Multi-Agent LLM Tutoring System with Centralized Learner Modeling

IntelliCode:一个具有集中式学习者建模的多智能体LLM辅导系统

Jones David, Shreya Ghosh

机构 * School of Computer Science and Engineering, VIT-AP University(计算机科学与工程学院,VIT-AP大学) School of Electrical and Computer Sciences, Indian Institute of Technology Bhubaneswar(电气与计算机科学学院,印度理工学院布巴内斯瓦尔学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 IntelliCode通过集中式学习者建模和多智能体协作,实现透明且可靠的LLM辅导系统,提升学习效率和课程适应性。

Comments Submitted to EACL 2026 System Demonstrations Track. 6 pages (main content), 6 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12815 2025-12-23 cs.LG 57%

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

从新颖性到模仿:用于离线强化学习的自蒸馏奖励

Gaurav Chaudhary, Laxmidhar Behera

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 ReLOAD通过自蒸馏生成内在奖励,解决离线强化学习中显式奖励标注的难题,实现稳健的策略学习并达到传统方法的性能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18504 2025-12-23 cs.CV cs.AI 57%

GTMA: Dynamic Representation Optimization for OOD Vision-Language Models

GTMA:面向视觉-语言模型的动态表示优化

Jensen Zhang, Ningyuan Liu, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 GTMA通过动态表示优化提升视觉-语言模型在分布外任务中的性能,有效解决模态不对称问题,提升零样本和少样本准确率15-20%。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏