arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-20 至 2026-02-20 共收录 52 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2602.16053 2026-02-20 cs.LG cs.CL 86%

Multi-Objective Alignment of Language Models for Personalized Psychotherapy

多目标对齐语言模型以实现个性化心理治疗

Mehrab Beikzadeh, Yasaman Asadollah Salmanpour, Ashima Suvarna, Sriram Sankararaman, Matteo Malgaroli, Majid Sarrafzadeh, Saadia Gabriel

机构 * Department of Computer Science, University of California, Los Angeles, CA, USA(计算机科学系,加州大学洛杉矶分校) Department of Psychology, The University of Texas at Austin, Austin, TX, USA(心理学系,德克萨斯大学奥斯汀分校) Department of Psychiatry, NYU Grossman School of Medicine, New York, NY, USA(精神病学系,纽约大学格罗斯曼医学院)

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出多目标对齐框架,通过直接偏好优化提升语言模型在心理治疗中的共情与安全性能,实验显示其在平衡患者偏好与临床安全方面优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16987 2026-02-20 cs.CY 85%

A testable framework for AI alignment: Simulation Theology as an engineered worldview for silicon-based agents

一种可测试的AI对齐框架:模拟神学作为硅基智能体的工程世界观

Josef A. Habdank

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);safety(abstract);分类 cs.CY

AI总结 本文提出模拟神学作为可测试的AI对齐框架,通过内化目标减少欺骗行为,促进AI与人类的可持续共存。

Comments 16 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16802 2026-02-20 cs.CL cs.AI cs.LG 82%

References Improve LLM Alignment in Non-Verifiable Domains

参考文献提高非可验证领域的LLM对齐

Kejian Shi, Yixin Liu, Peifeng Wang, Alexander R. Fabbri, Shafiq Joty, Arman Cohan

机构 * Yale University(耶鲁大学) Meta Scale AI Salesforce Research(Salesforce 研究) Nanyang Technological University(南洋理工大学)

专题命中 偏好对齐 :alignment(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出参考引导的LLM评估器,通过增强LLM对齐的评估器和自我改进,显著提升了非可验证领域中LLM的性能。

Comments ICLR 2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17636 2026-02-20 cs.CV 78%

CORAL: Correspondence Alignment for Improved Virtual Try-On

CORAL: 用于改进虚拟试衣的对应对齐

Jiyoung Kim, Youngjin Shin, Siyoon Jin, Dahyun Chung, Jisu Nam, Tongmin Kim, Jongjae Park, Hyeonwoo Kang, Seungryong Kim

机构 * NC AI Co., Ltd(NC AI公司)

专题命中 偏好对齐 :alignment(title,abstract)

AI总结 CORAL通过引入基于DiT的框架,显式对齐查询-键匹配与外部对应关系,从而提升虚拟试衣中的人-服装对应精度和细节保留能力。

Comments 32 pages, 25 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13957 2026-02-20 cs.AI cs.LG cs.RO 62%

Goal Inference from Open-Ended Dialog

从开放式对话中推断目标

Rachel Ma, Jingyi Qu, Andreea Bobu, Dylan Hadfield-Menell

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出了一种在线方法,通过自然语言提取目标并利用贝叶斯推断,使具身代理在开放式对话中高效学习和完成多样化用户目标。

Comments This version has been updated to reflect a copy of Master's thesis submitted Jan 24, 2025 for degree date Feb 2025 (https://hdl.handle.net/1721.1/158960). We recommend readers to read revised version incorporating a different agent pipeline and methodological approach which is available at: arXiv:2508.15119

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00040 2026-02-20 cs.LG cs.AI 62%

Semi-Supervised Preference Optimization with Limited Feedback

半监督偏好优化与有限反馈

Seonggyun Lee, Sungjun Lim, Seojin Park, Soeun Cheon, Kyungwoo Song

机构 * Yonsei University(延世大学) Korea Advanced Institute of Science and Technology(韩国科学技术院)

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 本文提出半监督偏好优化方法,通过结合少量标注数据和大量未标注数据,有效提升模型对齐人类偏好的效率,减少数据获取成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02377 2026-02-20 cs.CL 57%

Proof-RM: A Scalable and Generalizable Reward Model for Math Proof

Proof-RM: 一种可扩展且通用的数学证明奖励模型

Haotong Yang, Zitong Wang, Shijia Kang, Siqi Yang, Wenkai Yu, Xu Niu, Yike Sun, Yi Hu, Zhouchen Lin, Muhan Zhang

机构 * Peking University, Beijing, China(北京大学,北京,中国)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 Proof-RM通过构建可扩展的数据管道和训练证明检查奖励模型,提升LLM在数学证明验证中的准确性和泛化能力。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 5 篇

2602.16977 2026-02-20 cs.LG cs.CR 85%

Fail-Closed Alignment for Large Language Models

大型语言模型的Fail-Closed对齐

Zachary Coalson, Beth Sohler, Aiden Gabriel, Sanghyun Hong

机构 * Oregon State University, Corvallis, OR USA(俄勒冈州立大学)

专题命中 安全训练 :alignment(title,abstract);safety(abstract);jailbreak(abstract);分类 cs.LG

AI总结 本文提出fail-closed对齐原则,通过冗余独立路径提升LLM安全,有效对抗基于提示的Jailbreak攻击。

Comments Pre-print

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17345 2026-02-20 cs.CR cs.AI 57%

What Breaks Embodied AI Security:LLM Vulnerabilities, CPS Flaws,or Something Else?

使具身AI安全破裂的因素:大语言模型漏洞、CPS缺陷还是其他东西?

Boyang Ma, Hechuan Guo, Peizhuo Lv, Minghui Xu, Xuelong Dai, YeChao Zhang, Yijun Yang, Yue Zhang

机构 * Shandong University(山东大学)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本文探讨了具身AI安全问题的根源,指出系统级不匹配而非孤立模型缺陷或传统CPS攻击是主要因素,并提出了四个核心见解以解释其安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00167 2026-02-20 cs.AI cs.CR cs.RO 57%

Drones that Think on their Feet: Sudden Landing Decisions with Embodied AI

能自主决策的无人机:基于具身AI的突发着陆决策

Diego Ortiz Barbosa, Mohit Agrawal, Yash Malegaonkar, Luis Burbano, Axel Andersson, György Dán, Henrik Sandberg, Alvaro A. Cardenas

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 本研究利用具身AI实现无人机在突发情况下的自主决策与安全着陆,展示了新的适应性恢复管道,提升了自主空中系统的安全性和韧性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17415 2026-02-20 cs.RO cs.SY eess.SY 50%

Distributed Virtual Model Control for Scalable Human-Robot Collaboration in Shared Workspace

分布式虚拟模型控制用于可扩展的人机协作在共享工作空间

Yi Zhang, Omar Faris, Chapa Sirithunge, Kai-Fung Chu, Fumiya Iida, Fulvio Forni

机构 * Department of Engineering, University of Cambridge(工程系,剑桥大学)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出一种分布式虚拟模型控制框架,通过去中心化方法实现安全的人机协作,有效解决死锁问题并提升协作效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17078 2026-02-20 cs.MA 50%

Safe Continuous-time Multi-Agent Reinforcement Learning via Epigraph Form

通过epigraph形式实现安全的连续时间多智能体强化学习

Xuefeng Wang, Lei Zhang, Henglin Pu, Husheng Li, Ahmed H. Qureshi

专题命中 安全训练 :safety(abstract)

AI总结 本文提出了一种基于epigraph形式的连续时间约束MDP框架,通过物理信息神经网络实现稳定高效的连续时间多智能体强化学习,验证了方法在安全环境中的有效性。

Comments Accepted by ICLR 2026. 27 pages, 15 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 2 篇

2602.16935 2026-02-20 cs.AI cs.ET cs.LG 73%

DeepContext: Stateful Real-Time Detection of Multi-Turn Adversarial Intent Drift in LLMs

DeepContext: LLMs中多轮对抗意图漂移的有状态实时检测

Justin Albrethsen, Yash Datta, Kunal Kumar, Sharath Rajasekar

机构 * HighFlame

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 DeepContext通过递归神经网络实时检测LLM中的多轮对抗意图漂移,实现更高效的安全防护。

Comments 18 Pages, 7 Tables, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17645 2026-02-20 cs.LG cs.AI cs.CL cs.CV 67%

Pushing the Frontier of Black-Box LVLM Attacks via Fine-Grained Detail Targeting

通过细粒度细节靶向推动大视觉-语言模型攻击的前沿

Xiaohan Zhao, Zhaoyi Li, Yaxin Luo, Jiacheng Cui, Zhiqiang Shen

专题命中 越狱攻击 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过细粒度细节靶向改进M-Attack,显著提升黑盒攻击效果,成功率达100%

Comments Code at: https://github.com/vila-lab/M-Attack-V2

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2602.16752 2026-02-20 cs.CR 82%

The Vulnerability of LLM Rankers to Prompt Injection Attacks

大语言模型排序器对提示注入攻击的脆弱性

Yu Yin, Shuai Wang, Bevan Koopman, Guido Zuccon

专题命中 提示注入 :prompt injection(title,abstract);jailbreak(abstract)

AI总结 本文研究了大语言模型排序器对提示注入攻击的脆弱性,通过实验证明不同架构和设置下的攻击效果,并揭示了编码器-解码器架构的抗性。

Comments 18 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01295 2026-02-20 cs.CR 75%

Systems Security Foundations for Agentic Computing

面向代理计算的安全基础

Mihai Christodorescu, Earlence Fernandes, Ashish Hooda, Somesh Jha, Johann Rehberger, Kamalika Chaudhuri, Xiaohan Fu, Khawaja Shams, Guy Amir, Jihye Choi, Sarthak Choudhary, Nils Palumbo, Andrey Labunets, Nishit V. Pandya

专题命中 提示注入 :safety(abstract);prompt injection(abstract);AI safety(abstract)

AI总结 本文从系统安全角度出发,分析代理型AI的安全挑战,提出端到端安全属性研究,涵盖11个现实攻击案例并定义新的研究问题。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 1 篇

2602.17633 2026-02-20 cs.LG cs.AI stat.ML 62%

When to Trust the Cheap Check: Weak and Strong Verification for Reasoning

何时相信廉价检查:弱验证与强验证用于推理

Shayan Kiyani, Sima Noorani, George Pappas, Hamed Hassani

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文提出弱-强验证策略,通过两个阈值结构控制接受和拒绝错误,以提高LLM推理的可靠性和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2602.17088 2026-02-20 cs.LG 57%

MeGU: Machine-Guided Unlearning with Target Feature Disentanglement

MeGU:基于目标特征解耦的机器引导反学习

Haoyu Wang, Zhuo Huang, Xiaolong Wang, Bo Han, Zhiwei Lin, Tongliang Liu

机构 * School of Automation, Beijing Institute of Technology(自动化学院,北京理工大学) Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Computer Science, Hong Kong Baptist University(计算机科学系,香港 Baptist 大学)

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 MeGU通过目标特征解耦实现受控反学习,利用多模态大语言模型进行概念感知的重新对齐,以提升反学习效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 19 篇

2602.17357 2026-02-20 cs.CY 88%

Astra: AI Safety, Trust, & Risk Assessment

Astra:人工智能安全、信任与风险评估

Pranav Aggarwal, Ananya Basotia, Debayan Gupta, Rahul Kulkarni, Shalini Kapoor, Kashyap J., A. Mukundan, Aishwarya Pokhriyal, Anirban Sen, Aryan Shah, Aalok Thakkar

专题命中 安全评测 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 Astra提出一个基于实证的人工智能安全风险数据库,通过三元因果分类法评估风险,聚焦印度社会技术景观中的特定挑战,为动态监管框架提供基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16832 2026-02-20 cs.AI cs.CL 86%

IndicJR: A Judge-Free Benchmark of Jailbreak Robustness in South Asian Languages

IndicJR:一种无裁判的南亚语言对抗鲁棒性基准

Priyaranjan Pattnayak, Sanchari Chowdhuri

机构 * Oracle America Inc.(Oracle美国公司)

专题命中 安全评测 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 IndicJR是一种无裁判的南亚语言对抗鲁棒性基准,揭示了多语言对抗攻击的模式和风险,尤其关注南亚用户的语言转换和罗马化问题。

Comments Accepted in EACL Industry Track Oral, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16943 2026-02-20 cs.AI cs.SE 85%

Mind the GAP: Text Safety Does Not Transfer to Tool-Call Safety in LLM Agents

注意GAP:在LLM代理中,文本安全不转移到工具调用安全

Arnold Cartagena, Ariane Teixeira

机构 * Independent Researcher(独立研究者)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);jailbreak(abstract);分类 cs.AI

AI总结 该研究发现LLM代理中文本安全不等同于工具调用安全,引入GAP基准测试揭示两者差异,强调需专门评估工具调用安全。

Comments 23 pages, 5 figures, 4 tables, code and data at https://github.com/acartag7/gap-benchmark

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17364 2026-02-20 cs.LG cs.AI 81%

A feature-stable and explainable machine learning framework for trustworthy decision-making under incomplete clinical data

一种具有特征稳定性和可解释性的机器学习框架,用于在不完整临床数据下实现可信的决策

Justyna Andrys-Olek, Paulina Tworek, Luca Gherardini, Mark W. Ruddock, Mary Jo Kurt, Peter Fitzgerald, Jose Sousa

机构 * Computational Intelligence, Sano Centre for Computational Personalised Medicine(计算智能,Sano计算个性化医学中心) Clinical Studies Group, Randox Laboratories Ltd., Co.(临床研究组,Randox实验室有限公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 CACTUS是一种针对不完整临床数据设计的可解释机器学习框架,通过提升特征稳定性与可解释性,增强模型在缺失数据下的可信决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17106 2026-02-20 cs.AI 79%

Toward Trustworthy Evaluation of Sustainability Rating Methodologies: A Human-AI Collaborative Framework for Benchmark Dataset Construction

迈向可信的可持续性评级方法论评估:一种人机协作框架用于基准数据集构建

Xiaoran Cai, Wang Yang, Xiyu Ren, Chekun Law, Rohit Sharma, Peng Qi

机构 * Columbia University, USA(哥伦比亚大学) Case Western Reserve University, USA(凯斯西储大学) Hong Kong University of Science(香港科学大学) NVIDIA, USA(NVIDIA公司) Informatica Inc., USA(Informatica公司)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 本文提出一种人机协作框架,用于构建可信的可持续性评级方法论基准数据集,以提高评分的可比性和可信度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16984 2026-02-20 cs.AI 79%

Fundamental Limits of Black-Box Safety Evaluation: Information-Theoretic and Computational Barriers from Latent Context Conditioning

黑盒安全评估的根本限制:从潜在上下文条件化的信息论和计算障碍

Vishal Srivastava

机构 * Whiting School of Engineering(韦斯利工程学院) Johns Hopkins University(约翰霍普金斯大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文研究了黑盒安全评估的根本限制,揭示了潜在上下文条件化策略在部署风险估计中的信息论和计算障碍,提出了被动和自适应评估的下界以及计算分离的结论。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17259 2026-02-20 cs.RO 78%

FRAPPE: Infusing World Modeling into Generalist Policies via Multiple Future Representation Alignment

FRAPPE:通过多未来表示对齐将世界建模注入通用策略

Han Zhao, Jingbo Wang, Wenxuan Song, Shuai Chen, Yang Liu, Yan Wang, Haoang Li, Donglin Wang

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) South China University of Technology(华南理工大学) ShanghaiTech University(上海科技大学) Tsinghua University(清华大学)

专题命中 安全评测 :alignment(title,abstract)

AI总结 FRAPPE通过多未来表示对齐提升通用机器人策略的世界建模能力,提高微调效率并减少数据依赖,实验证明其在长时序和未见场景中的泛化性能优于现有方法。

Comments Project Website: https://h-zhao1997.github.io/frappe

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16756 2026-02-20 cs.CR cs.SE 78%

NESSiE: The Necessary Safety Benchmark -- Identifying Errors that should not Exist

NESSiE: 必要安全基准 -- 识别不应存在的错误

Johannes Bertram, Jonas Geiping

专题命中 安全评测 :safety(title,abstract)

AI总结 NESSiE提出了一种轻量级安全基准,用于检测大型语言模型中不应存在的安全故障,揭示模型在帮助与安全之间的偏差。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08646 2026-02-20 cs.CL cs.CY 62%

QSTN: A Modular Framework for Robust Questionnaire Inference with Large Language Models

QSTN: 一种用于大型语言模型鲁棒问卷推断的模块化框架

Maximilian Kreutner, Jens Rupprecht, Georg Ahnert, Ahmed Salem, Markus Strohmaier

机构 * University of Mannheim(曼海姆大学) GESIS - Leibniz Institute for the Social Sciences(莱比锡社会科学研究所) CSH Vienna(维也纳CSH)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.CY

AI总结 QSTN是一种模块化框架,通过无需编码的界面实现大型语言模型在问卷推断中的稳健评估与高效响应生成。

Comments Accepted at 2026 EACL System Demonstrations The Python package is available at https://github.com/dess-mannheim/QSTN/

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.04220 2026-02-20 cs.CL cs.AI 62%

BEADs: Bias Evaluation Across Domains

BEADs: 跨领域偏差评估

Shaina Raza, Mizanur Rahman, Michael R. Zhang

机构 * Vector Institute(向量研究所) Royal Bank of Canada(皇家银行) University of Toronto(多伦多大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 BEADs数据集通过跨领域偏差评估,提供广泛NLP任务的偏差检测与模型评估方案,揭示现有模型在人口群体上的系统性偏差问题。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16740 2026-02-20 cs.LG cs.AI 62%

Quantifying LLM Attention-Head Stability: Implications for Circuit Universality

量化大语言模型注意力头的稳定性:对电路通用性的启示

Karan Bali, Jack Stanley, Praneet Suresh, Danilo Bzdok

机构 * Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所) McGill University(麦吉尔大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本研究量化了大语言模型注意力头的稳定性,发现中层头最不稳定但表示最独特,深层模型中层分歧更明显,权重衰减优化提升稳定性,残差流较稳定,为AI系统白盒监控提供新视角。

Comments Main Body: 8 pages, Total length: 33 pages, Code repo: https://github.com/karanbali/attention_head_seed_stability , Weights repo: https://huggingface.co/karanbali/attention_head_seed_stability

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23339 2026-02-20 cs.AI cs.CL cs.HC 62%

A Scalable Framework for Evaluating Health Language Models

可扩展的健康语言模型评估框架

Neil Mallinar, A. Ali Heydari, Xin Liu, Anthony Z. Faranesh, Brent Winslow, Nova Hammerquist, Benjamin Graef, Cathy Speed, Mark Malhotra, Shwetak Patel, Javier L. Prieto, Daniel McDuff, Ahmed A. Metwally

机构 * Google Research(谷歌研究)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自适应精确布尔评估框架,用于高效评估健康领域语言模型,提升评估效率和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏