arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-14 至 2026-01-14 共收录 55 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2601.08777 2026-01-14 cs.LG cs.AI cs.CL cs.GT 85%

Asymptotic Universal Alignment: A New Alignment Framework via Test-Time Scaling

渐近通用对齐:通过测试时间缩放实现的新对齐框架

Yang Cai, Weiqiang Zheng

机构 * Yale University(耶鲁大学)

专题命中 偏好对齐 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出了一种基于测试时间缩放的通用对齐框架,通过多玩家对齐游戏实现最优鲁棒性,解决了现有方法在输出多样性上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08441 2026-01-14 cs.AI 81%

YaPO: Learnable Sparse Activation Steering Vectors for Domain Adaptation

YaPO: 用于领域适应的可学习稀疏激活引导向量

Abdelaziz Bounhar, Rania Hossam Elmohamady Elbadry, Hadi Abdine, Preslav Nakov, Michalis Vazirgiannis, Guokan Shang

机构 * MBZUAI Ecole Polytechnique(巴黎政治学院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);safety(abstract);jailbreak(abstract)

AI总结 YaPO通过学习稀疏激活引导向量实现LLM的高效、稳定和细粒度对齐,适用于领域适应和文化对齐等任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08421 2026-01-14 cs.LG 70%

Coverage Improvement and Fast Convergence of On-policy Preference Learning

策略学习中的覆盖改进与快速收敛

Juno Kim, Jihun Yun, Jason D. Lee, Kwang-Sung Jun

机构 * UC Berkeley(伯克利大学) KRAFTON(KRAFTON公司) University of Arizona(亚利桑那大学)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.LG

AI总结 本文提出覆盖改进原理,通过分析在线策略学习中的覆盖变化,证明其在批量大小足够时能实现快速收敛,并设计混合采样器和奖励蒸馏方案,提升语言模型对齐性能。

Comments 46 pages, 2 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22462 2026-01-14 cs.AI 70%

Learning "Partner-Aware" Collaborators in Multi-Party Collaboration

在多方协作中学习“伙伴感知”的协作者

Abhijnan Nath, Nikhil Krishnaswamy

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.AI

AI总结 本文提出ICR算法,通过学习伙伴感知的协作者,提升多任务协作中的共同基础一致性与解决方案多样性。

Comments Fixed typographic errors in the previous manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02618 2026-01-14 cs.CL 70%

Alleviating Attention Hacking in Discriminative Reward Modeling through Interaction Distillation

通过交互蒸馏缓解判别奖励建模中的注意力黑客问题

Jianxiang Zang

机构 * College of Computer Science and Artificial Intelligence, Fudan University(计算机科学与人工智能学院,复旦大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出交互蒸馏方法,通过优化注意力机制提升判别奖励建模的稳定性与通用性,缓解注意力黑客问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09243 2026-01-14 cs.CL cs.AI 62%

CrisiText: A dataset of warning messages for LLM training in emergency communication

CrisiText: 一个用于LLM训练的紧急通讯警示信息数据集

Giacomo Gonella, Gian Maria Campedelli, Stefano Menini, Marco Guerini

机构 * Fondazione Bruno Kessler(布雷诺克瑟拉基金会) University of Trento(特伦托大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 CrisiText是首个大规模危机警示信息数据集,通过生成13种危机场景下的警示信息,提升LLM在紧急通讯中的训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15012 2026-01-14 cs.RO 50%

Learning Contextually-Adaptive Rewards via Calibrated Features

通过校准特征学习上下文自适应奖励

Alexandra Forsey-Smerek, Julie Shah, Andreea Bobu

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 偏好对齐 :safety(abstract)

AI总结 本文提出通过校准特征显式建模上下文相关的特征显著性,以提高奖励学习的样本效率和适应性。

Comments Proceedings of the 21st ACM/IEEE International Conference on Human-Robot Interaction (HRI '26), March 16 - 19, 2026, Edinburgh, Scotland, UK

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 8 篇

2601.08000 2026-01-14 cs.AI cs.SE 89%

Reasoning over Precedents Alongside Statutes: Case-Augmented Deliberative Alignment for LLM Safety

在法规中进行推理:结合案例的 deliberative 对齐方法用于 LLM 安全性

Can Jin, Rui Wu, Tong Che, Qixin Zhang, Hongwu Peng, Jiahui Zhao, Zhenting Wang, Wenqi Wei, Ligong Han, Zhao Zhang, Yuan Cao, Ruixiang Tang, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学) NVIDIA Research(NVIDIA研究) Nanyang Technological University(南洋理工大学) Adobe Research(Adobe研究) University of Connecticut(康涅狄格大学) Fordham University(福特汉姆大学) Google DeepMind(谷歌DeepMind)

专题命中 安全训练 :alignment(title,abstract);safety(title,abstract);harmlessness(abstract);分类 cs.AI

AI总结 本文提出CADA方法,通过案例增强的推理链进行强化学习,提升LLM的安全性和实用性,避免过度依赖规则。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08489 2026-01-14 cs.CL 79%

Surgical Refusal Ablation: Disentangling Safety from Intelligence via Concept-Guided Spectral Cleaning

手术拒绝消融:通过概念引导的频谱清洁分离安全与智能

Tony Cristofano

专题命中 安全训练 :safety(title,abstract);分类 cs.CL

AI总结 通过概念引导的频谱清洁技术,SRA有效分离语言模型的安全性与智能,减少拒绝行为的同时保持模型性能和分布稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08435 2026-01-14 cs.CL 79%

Fine-Mem: Fine-Grained Feedback Alignment for Long-Horizon Memory Management

细粒度反馈对齐的长期记忆管理:Fine-Mem

Weitao Ma, Xiaocheng Feng, Lei Huang, Xiachong Feng, Zhanyu Ma, Jun Xu, Jiuchong Gao, Jinghua Hao, Renqing He, Bing Qin

机构 * Harbin Institute of Technology(哈尔滨工业大学) Meituan(美团) Peng Cheng Laboratory(鹏城实验室) The University of Hong Kong(香港大学)

专题命中 安全训练 :alignment(title,abstract);分类 cs.CL

AI总结 Fine-Mem通过细粒度反馈对齐提升长周期内存管理,通过块级奖励和证据锚定奖励分配优化策略,实现更高效的内存操作与长期效用对齐。

Comments 18 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08089 2026-01-14 cs.LG cs.AI 73%

Q-realign: Piggybacking Realignment on Quantization for Safe and Efficient LLM Deployment

Q-realign: 量化驱动的对齐以实现安全高效的LLM部署

Qitao Tan, Xiaoying Song, Ningxi Cheng, Ninghao Liu, Xiaoming Zhai, Lingzi Hong, Yanzhi Wang, Zhen Xiang, Geng Yuan

机构 * University of Georgia(佐治亚大学) University of North Texas(北卡罗来纳州立大学) Hong Kong Polytechnic University(香港理工大学) Northeastern University(东北大学)

专题命中 安全训练 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 Q-realign通过量化驱动的对齐方法,在部署流程中实现安全高效的LLM部署,有效减少不安全行为并降低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08668 2026-01-14 cs.CL 57%

Analyzing Bias in False Refusal Behavior of Large Language Models for Hate Speech Detoxification

分析大型语言模型在仇恨言论净化中的虚假拒绝行为偏见

Kyuri Im, Shuzhou Yuan, Michael Färber

机构 * TU Dresden(德累斯顿理工大学)

专题命中 安全训练 :safety(abstract);分类 cs.CL

AI总结 研究分析了大型语言模型在仇恨言论净化中的虚假拒绝偏见,并提出通过中英互译策略减少此类拒绝行为。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08327 2026-01-14 cs.RO cs.AI 57%

Safe Heterogeneous Multi-Agent RL with Communication Regularization for Coordinated Target Acquisition

安全的异构多智能体强化学习与通信正则化用于协同目标获取

Gabriele Calzolari, Vidya Sumathy, Christoforos Kanellakis, George Nikolakopoulos

机构 * Department of Computer Science, Electrical and Space Engineering, Luleå University of Technology, Luleå, Sweden.(计算机科学与空间工程系,卢勒奥技术大学,卢勒奥,瑞典)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文提出了一种安全的异构多智能体强化学习框架,通过通信正则化和安全过滤器实现协同目标获取任务中的安全与稳定执行。

Comments 7 pages, 4 figures, submitted to the IFAC World Congress 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07972 2026-01-14 cs.CL 57%

Knowing But Not Doing: Convergent Morality and Divergent Action in LLMs

知晓而不做:在大语言模型中收敛的道德与发散的行为

Jen-tse Huang, Jiantong Qin, Xueli Qiu, Sharon Levy, Michelle R. Kaufman, Mark Dredze

机构 * Johns Hopkins University(约翰霍普金斯大学) Chinese University of Hong Kong(香港中文大学) Rutgers University(罗格斯大学)

专题命中 安全训练 :alignment(abstract);分类 cs.CL

AI总结 研究揭示了大语言模型在价值对齐训练下仍存在知识与行为之间的不一致,通过ValAct-15k数据集发现模型在情境决策上高度一致,但自我报告与实际行为关联较弱。

Comments 9 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08012 2026-01-14 cs.SE 50%

Towards Verifiably Safe Tool Use for LLM Agents

面向LLM代理工具使用的可验证安全性

Aarya Doshi, Yining Hong, Congying Xu, Eunsuk Kang, Alexandros Kapravelos, Christian Kästner

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种基于STPA的框架,通过形式化规范数据流和工具序列,实现LLM代理的可验证安全性,减少对人工标注的依赖。

Comments 4 pages, 1 figure; accepted to ICSE NIER 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 4 篇

2601.07878 2026-01-14 cs.LG cs.AI cs.CL 82%

Sliced-Wasserstein Distribution Alignment Loss Improves the Ultra-Low-Bit Quantization of Large Language Models

切片瓦瑟斯坦分布对齐损失提高了大语言模型的超低比特量化

Deyu Cao, Yixin Yin, Samin Aref

机构 * Department of Information and Communication Engineering, The University of Tokyo(信息与通信工程系,东京大学) Department of Computer Science, University of Toronto(计算机科学系,多伦多大学) Department of Mechanical and Industrial Engineering, University of Toronto(机械与工业工程系,多伦多大学)

专题命中 幻觉与事实性 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 切片瓦瑟斯坦分布对齐损失通过提升超低比特量化性能,有效恢复模型准确性。

Comments Post-peer-review accepted manuscript, 17 pages including the supplementary information

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07845 2026-01-14 cs.CV 78%

Edge-AI Perception Node for Cooperative Road-Safety Enforcement and Connected-Vehicle Integration

边缘AI感知节点用于协作道路安全执法和连接车辆整合

Shree Charran R, Rahul Kumar Dubey

机构 * Indian Institute of Science (IISc)(印度科学研究院) Bosch Global Software Technologies Private Limited (BGSW)(博世全球软件技术私人有限公司)

专题命中 幻觉与事实性 :safety(title,abstract)

AI总结 本文提出一种边缘AI感知节点,用于多类交通违规分析和安全事件传播,通过高精度检测和OCR处理提升执法效率,同时支持V2X协议与连接车辆协同提升道路安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08237 2026-01-14 cs.AI 57%

The End of Reward Engineering: How LLMs Are Redefining Multi-Agent Coordination

奖励工程的终结:大型语言模型如何重新定义多智能体协调

Haoran Su, Yandong Sun, Congjia Yu

机构 * New York University(纽约大学) Lerna AI

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文探讨了大型语言模型如何通过语义奖励规范和动态适应替代传统奖励工程,重新定义多智能体协调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12992 2026-01-14 cs.RO cs.CL cs.CV cs.MA 57%

UNCAP: Uncertainty-Guided Neurosymbolic Planning Using Natural Language Communication for Cooperative Autonomous Vehicles

UNCAP:基于自然语言通信的不确定性引导神经符号规划

Neel P. Bhatt, Po-han Li, Kushagra Gupta, Rohan Siva, Daniel Milan, Alexander T. Hogue, Sandeep P. Chinchali, David Fridovich-Keil, Zhangyang Wang, Ufuk Topcu

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL

AI总结 UNCAP通过自然语言通信和不确定性引导方法,提升多车辆协同自动驾驶系统的可扩展性和安全性。

Journal ref AAMAS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 安全评测 19 篇

2601.06663 2026-01-14 cs.AI 83%

SafePro: Evaluating the Safety of Professional-Level AI Agents

SafePro:评估专业级AI代理的安全性

Kaiwen Zhou, Shreedhar Jangam, Ashwin Nagarajan, Tejas Polu, Suhas Oruganti, Chengzhi Liu, Ching-Chen Kuo, Yuting Zheng, Sravana Narayanaraju, Xin Eric Wang

机构 * UCSC(加州大学圣塔 Cruz 分校) UCSB(加州大学圣塔 Barbara 分校) eBay(eBay 公司)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 SafePro通过高复杂度专业任务数据集评估专业级AI代理的安全性,揭示了现有模型在安全判断和对齐方面的不足,并提出了改进安全性的策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18882 2026-01-14 cs.CY 83%

Personalized Safety in LLMs: A Benchmark and A Planning-Based Agent Approach

大语言模型中的个性化安全:一个基准和基于规划的代理方法

Yuchen Wu, Edward Sun, Kaijie Zhu, Jianxun Lian, Jose Hernandez-Orallo, Aylin Caliskan, Jindong Wang

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CY

AI总结 本文提出个性化安全框架PENGUIN和RAISE,通过获取用户背景信息提升LLM的安全性,实验显示安全评分提升达31.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08673 2026-01-14 cs.AI cs.CY 81%

Why AI Alignment Failure Is Structural: Learned Human Interaction Structures and AGI as an Endogenous Evolutionary Shock

为何AI对齐失败是结构性的:学习的人类互动结构与AGI作为内生性演化冲击

Didier Sornette, Sandro Claudio Lera, Ke Wu

机构 * Institute of Risk Analysis, Prediction and Management (Risks-X)(风险分析、预测与管理研究所) Southern University of Science and Technology (SUSTech)(南方科技大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.CY

AI总结 本文探讨AI对齐失败的结构性问题,指出AGI作为内生性演化冲击,其风险源于放大人类智能、权力与矛盾,而非对抗意图。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08331 2026-01-14 cs.CL 74%

CLaS-Bench: A Cross-Lingual Alignment and Steering Benchmark

CLaS-Bench: 一种跨语言对齐与引导基准

Daniil Gurgurov, Yusser Al Ghussin, Tanja Baeumel, Cheng-Ting Chou, Patrick Schramowski, Marius Mosbach, Josef van Genabith, Simon Ostermann

机构 * Saarland University(萨尔兰大学) German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心(CERTAIN)) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) TU Darmstadt(德累斯顿技术大学) Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所(Mila)) McGill University(麦吉尔大学)

专题命中 安全评测 :alignment(title);分类 cs.CL

AI总结 CLaS-Bench是首个多语言引导基准,通过评估32种语言中的语言强制行为,验证了残差基于DiffMean方法在跨语言引导中的有效性。

Comments pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08420 2026-01-14 cs.CV 71%

MMLGNet: Cross-Modal Alignment of Remote Sensing Data using CLIP

MMLGNet: 利用CLIP实现遥感数据的跨模态对齐

Aditya Chaudhary, Sneha Barman, Mainak Singha, Ankit Jha, Girish Mishra, Biplab Banerjee

专题命中 安全评测 :alignment(title)

AI总结 MMLGNet通过CLIP实现遥感数据的跨模态对齐,利用多模态语言引导网络有效融合光谱、空间和几何信息,提升语义理解能力。

Comments Accepted at InGARSS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08342 2026-01-14 cs.CL 70%

Detecting Mental Manipulation in Speech via Synthetic Multi-Speaker Dialogue

通过合成多说话对话检测心理操控

Run Chen, Wen Liang, Ziwei Gong, Lin Ai, Julia Hirschberg

机构 * Columbia University(哥伦比亚大学) Red Hat(红帽公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出首个通过合成多说话对话检测心理操控的研究,揭示语音与文本在检测准确性上的差异,强调多模态对话系统中模态意识的重要性。

Comments Accepted to IWSDS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.21503 2026-01-14 cs.AI cs.CV 70%

MoHoBench: Assessing Honesty of Multimodal Large Language Models via Unanswerable Visual Questions

MoHoBench: 通过无法回答的视觉问题评估多模态大语言模型的诚实性

Yanxu Zhu, Shitong Duan, Xiangxu Zhang, Jitao Sang, Peng Zhang, Tun Lu, Xiao Zhou, Jing Yao, Xiaoyuan Yi, Xing Xie

机构 * Beijing Jiaotong University(北京交通大学) Fudan University(复旦大学) Microsoft Research Asia(微软亚洲研究院) Renmin University of China(中国人民大学)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 MoHoBench通过评估多模态大语言模型在面对无法回答的视觉问题时的诚实行为,揭示其诚实性受视觉信息影响,提出改进方法以提升模型可信度。

Comments AAAI2026 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09583 2026-01-14 cs.LG stat.ML 70%

YRC-Bench: A Benchmark for Learning to Coordinate with Experts

YRC-Bench:一种学习与专家协调的基准

Mohamad H. Danesh, Nguyen X. Khanh, Tu Trinh, Benjamin Plaut

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.LG

AI总结 YRC-Bench通过提供开放源代码基准,支持在无监督环境下学习与专家协调的方法研究。

Comments Accepted at TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08155 2026-01-14 cs.CV 67%

Instance-Aligned Captions for Explainable Video Anomaly Detection

实例对齐的描述用于可解释的视频异常检测

Inpyo Song, Minjun Joo, Joonhyung Kwon, Eunji Jeon, Jangwon Lee

机构 * SungKyunKwan University(顺 Kyun 峰大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract)

AI总结 本文提出实例对齐的描述方法,用于提升视频异常检测的可解释性和可信度,通过空间定位和实例关联增强解释的可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08490 2026-01-14 cs.CL cs.AI 62%

BenchOverflow: Measuring Overflow in Large Language Models via Plain-Text Prompts

BenchOverflow: 通过纯文本提示测量大语言模型中的溢出现象

Erin Feiglin, Nir Hutnik, Raz Lapid

机构 * Deepkeep(深保持)

专题命中 安全评测 :prompt injection(abstract);分类 cs.CL、cs.AI

AI总结 BenchOverflow通过纯文本提示策略评估大语言模型的溢出现象,揭示长度控制对可靠性、成本和可持续性的影响,提供标准化比较框架以优化部署和防御措施。

Comments Accepted at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08196 2026-01-14 cs.CL cs.AI cs.CR cs.LO cs.SE 62%

Evaluating Implicit Regulatory Compliance in LLM Tool Invocation via Logic-Guided Synthesis

通过逻辑引导合成评估LLM工具调用中的隐式监管合规性

Da Song, Yuheng Huang, Boqi Chen, Tianshuo Cong, Randy Goebel, Lei Ma, Foutse Khomh

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LogiSafetyGen框架,通过逻辑引导合成评估LLM在工具调用中的隐式监管合规性,揭示大模型在安全约束上的不足。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏