arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-12 至 2026-02-12 共收录 8 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 8 篇

2602.09621 2026-02-12 cs.CL cs.LG 84%

AlignTune: Modular Toolkit for Post-Training Alignment of Large Language Models

AlignTune: 大型语言模型后训练对齐的模块化工具包

R E Zera Marveen Lyngkhoi, Chirag Chawla, Pratinav Seth, Utsav Avaiya, Soham Bhattacharjee, Mykola Khandoga, Rui Yuan, Vinay Kumar Sankarapu

机构 * Lexsi Labs(Lexsi实验室)

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 AlignTune通过模块化工具包提供统一接口,支持监督微调和RLHF优化,解决后端干扰和不可复现问题,提升对齐研究的可控性和复现性。

Comments Library opensource and available at https://github.com/Lexsi-Labs/aligntune

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09653 2026-02-12 cs.AI 79%

ClinAlign: Scaling Healthcare Alignment from Clinician Preference

ClinAlign: 从医生偏好扩展医疗对齐

Shiwei Lyu, Xidong Wang, Lei Liu, Hao Zhu, Chaohe Zhang, Jian Wang, Jinjie Gu, Benyou Wang, Yue Shen

机构 * Ant Group(蚂蚁集团) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Peking University(北京大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.AI

AI总结 ClinAlign通过HealthRubrics和HealthPrinciples实现医疗输出与医生偏好的高效对齐,验证了资源高效的临床对齐方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10425 2026-02-12 cs.CV 78%

HII-DPO: Eliminate Hallucination via Accurate Hallucination-Inducing Counterfactual Images

HII-DPO: 通过准确的 hallucination-Inducing Counterfactual Images 消除幻觉

Yilin Yang, Zhenghui Guo, Yuke Wang, Omprakash Gnawali, Sheng Di, Chengming Zhang

机构 * University of Houston(休斯顿大学) Rice University(里士满大学) Argonne National Laboratory(阿贡国家实验室)

专题命中 偏好对齐 :DPO(title);alignment(abstract)

AI总结 HII-DPO通过生成准确的幻觉诱导图像,有效缓解了VLMs在语言偏见下的幻觉问题,提升了模型的对齐能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09718 2026-02-12 cs.CL cs.AI 73%

StatLLaMA: Multi-Stage training for domain-optimized statistical large language models

StatLLaMA:面向统计领域优化的多阶段训练方法

Jing-Yi Zeng, Guan-Hua Huang

机构 * Institute of Statistics, National Yang Ming Chiao Tung University(统计研究所,国立阳明交通大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 StatLLaMA通过多阶段训练方法优化统计领域,实现高效且平衡的模型性能。

Comments 31 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08835 2026-02-12 cs.AI cs.CY cs.LG 67%

Learning the Value Systems of Societies with Preference-based Multi-objective Reinforcement Learning

基于偏好多目标强化学习的学习社会价值观系统

Andrés Holgado-Sánchez, Peter Vamplew, Richard Dazeley, Sascha Ossowski, Holger Billhardt

机构 * CETINIA, University Rey Juan Carlos(CETINIA皇家卡洛斯大学) Federation University(联邦大学) Deakin University(德肯大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.CY、cs.LG

AI总结 本文提出基于偏好多目标强化学习的方法,用于在马尔可夫决策过程中学习社会价值系统,通过聚类和价值对齐模型实现不同用户群体的个性化价值偏好适应。

Comments 18 pages, 3 figures. To be published in proceedings of the 25th International Conference on Autonomous Agents and Multi-Agent Systems (AAMAS 2026). This is a full version that includes the supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11124 2026-02-12 cs.CV 50%

PhyCritic: Multimodal Critic Models for Physical AI

PhyCritic:面向物理AI的多模态批评模型

Tianyi Xiong, Shihao Wang, Guilin Liu, Yi Dong, Ming Li, Heng Huang, Jan Kautz, Zhiding Yu

专题命中 偏好对齐 :alignment(abstract)

AI总结 PhyCritic通过双阶段RLVR流程优化,提升物理AI任务中的感知和推理能力,实现对物理任务的高效评估和改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10869 2026-02-12 cs.CR 50%

Agentic Knowledge Distillation: Autonomous Training of Small Language Models for SMS Threat Detection

代理知识蒸馏:自主训练小型语言模型用于短信威胁检测

Adel ElZemity, Joshua Sylvester, Budi Arief, Rogério De Lemos

专题命中 偏好对齐 :DPO(abstract)

AI总结 本研究提出代理知识蒸馏方法,通过自主训练小型语言模型实现高效的短信威胁检测,实验显示教师LLM的选择对性能影响显著。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10418 2026-02-12 cs.CR cs.SE 50%

SecCodePRM: A Process Reward Model for Code Security

SecCodePRM: 一种用于代码安全的过程奖励模型

Weichen Yu, Ravi Mangal, Yinyi Luo, Kai Hu, Jingxuan He, Corina S. Pasareanu, Matt Fredrikson

专题命中 偏好对齐 :safety(abstract)

AI总结 SecCodePRM通过一种面向安全的过程奖励模型,提升代码安全性和检测效率,适用于完整代码漏洞检测、部分代码漏洞检测和安全代码生成。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏