arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-09 至 2026-01-09 共收录 10 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 其他安全 10 篇

2601.04262 2026-01-09 cs.LG cs.AI 88%

Safety-Utility Conflicts Are Not Global: Surgical Alignment via Head-Level Diagnosis

安全与效用冲突并非全球性:通过头部层面诊断的手术对齐

Wang Cai, Yilin Wen, Jinchang Hou, Du Su, Guoqiu Wang, Zhonghou Lv, Chenfu Bao, Yunfang Wu

机构 * Baidu Inc.(百度公司) School of Software and Microelectronics, Peking University(北京大学软件与微电子学院) School of Computer Science, Peking University(北京大学计算机学院) State Key Laboratory of AI Safety, Institute of Computing Technology, CAS(中国科学院计算技术研究所人工智能安全重点实验室)

专题命中 其他安全 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出CAST框架,通过头部层面诊断与稀疏微调相结合,解决LLMs中安全与效用冲突问题,减少训练损失并提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04605 2026-01-09 cs.CV 78%

Detection of Deployment Operational Deviations for Safety and Security of AI-Enabled Human-Centric Cyber Physical Systems

面向AI赋能的人本型网络物理系统的部署操作偏差检测

Bernard Ngabonziza, Ayan Banerjee, Sandeep K. S. Gupta

专题命中 其他安全 :safety(title,abstract)

AI总结 本文提出了一种基于个性化图像的新技术,用于检测AI赋能的人本型网络物理系统在部署中的操作偏差,以确保其安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16282 2026-01-09 cs.LG cs.AI 62%

CALM: A CKA-Guided Adaptive Layer-Wise Modularization Framework for LLM Quantization

CALM: 一种基于CKA的自适应层级模块化框架用于LLM量化

Jinhao Zhang, Yunquan Zhang, Daning Chen, JunSun, Zicheng Yan

机构 * Beijing University of Posts and Telecommunications(北京邮电大学) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Zhejiang University(浙江大学) University of Science and Technology of China(中国科学技术大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 CALM提出一种基于CKA的自适应层级模块化框架,通过独立评估各层最佳量化策略,提升LLM量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04632 2026-01-09 cs.CL cs.AI 62%

From National Curricula to Cultural Awareness: Constructing Open-Ended Culture-Specific Question Answering Dataset

从国家课程到文化意识:构建开放性文化特定问答数据集

Haneul Yoo, Won Ik Cho, Geunhye Kim, Jiyoon Han

机构 * KAIST AI Center(韩国国立科学技术院人工智能中心) Samsung Electronics(三星电子) Hankuk University of Foreign Studies(韩国外语大学)

专题命中 其他安全 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CuCu框架,利用国家课程构建文化特定的开放性问答数据集KCaQA,以提升语言模型在文化对齐方面的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04940 2026-01-09 cs.CR cs.AI 57%

CurricuLLM: Designing Personalized and Workforce-Aligned Cybersecurity Curricula Using Fine-Tuned LLMs

CurricuLLM: 利用微调大语言模型设计个性化且与劳动力市场对齐的网络安全课程

Arthur Nijdam, Harri Kähkönen, Valtteri Niemi, Paul Stankovski Wagner, Sara Ramezanian

机构 * Lund University, Department of Electrical University of Helsinki, Department of Computer Science, Helsinki, Finland Helsinki Institute for Information Technology, Helsinki, Finland Karlstad University, Department of Mathematics \& Computer Science, Karlstad, Sweden

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 CurricuLLM通过微调大语言模型设计个性化且与劳动力市场对齐的网络安全课程,解决课程与行业需求不匹配的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04888 2026-01-09 cs.AI 57%

SmartSearch: Process Reward-Guided Query Refinement for Search Agents

SmartSearch: 基于过程奖励的查询优化用于搜索代理

Tongyu Wen, Guanting Dong, Zhicheng Dou

机构 * Renmin University of China(中国人民大学)

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 SmartSearch通过过程奖励和查询优化机制提升搜索代理的查询质量与效率。

Comments 16 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04670 2026-01-09 cs.LG 57%

Learning Dynamics in RL Post-Training for Language Models

在语言模型中学习动态的强化学习后训练

Akiyoshi Tomihari

机构 * Department of Computer Science, The University of Tokyo(东京大学计算机科学系)

专题命中 其他安全 :alignment(abstract);分类 cs.LG

AI总结 本文提出分类器优先强化学习(CF-RL),通过优先更新分类器来提升语言模型的对齐性和推理能力,揭示了RL后训练中学习动态的机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04545 2026-01-09 cs.AI cs.PF 57%

Personalized Model-Based Design of Human Centric AI enabled CPS for Long term usage

面向长期使用的以人为本的人工智能增强型控制系统个性化建模设计

Bernard Ngabonziza, Ayan Banerjee, Sandeep K. S. Gupta

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 本文提出个性化建模方法,以解决人工智能增强的人本控制系统在长期使用中的安全、可持续性和安全性分析问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04381 2026-01-09 cs.CV cs.AI 57%

Few-Shot LoRA Adaptation of a Flow-Matching Foundation Model for Cross-Spectral Object Detection

为跨光谱目标检测的流匹配基础模型进行少样本LoRA适应

Maxim Clouser, Kia Khezeli, John Kalantari

机构 * Yrikka Inc.(Yrikka公司)

专题命中 其他安全 :safety(abstract);分类 cs.AI

AI总结 通过少样本LoRA适应流匹配基础模型,实现跨光谱目标检测的合成数据生成与提升

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03948 2026-01-09 cs.AI q-fin.TR 57%

Trade-R1: Bridging Verifiable Rewards to Stochastic Environments via Process-Level Reasoning Verification

Trade-R1: 通过过程级推理验证弥合可验证奖励与随机环境

Rui Sun, Yifan Sun, Sheng Xu, Li Zhao, Jing Li, Daxin Jiang, Cheng Hua, Zuo Bai

专题命中 其他安全 :alignment(abstract);分类 cs.AI

AI总结 Trade-R1通过过程级推理验证,将可验证奖励与随机金融环境连接,减少奖励黑客问题,DSR在跨市场泛化中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏