arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-30 至 2025-12-30 共收录 63 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2512.22631 2025-12-30 cs.CL 87%

Evaluating GRPO and DPO for Faithful Chain-of-Thought Reasoning in LLMs

评估GRPO和DPO在LLM中的忠实链式推理能力

Hadi Mohammadi, Tamas Kozak, Anastasia Giachanou

机构 * Utrecht University, Department of Information and Computing Sciences(乌特勒支大学信息与计算科学系)

专题命中 偏好对齐 :DPO(title,abstract);alignment(abstract);safety(abstract);trustworthy(abstract)

AI总结 本文评估GRPO和DPO在提升LLM链式推理忠实性方面的性能,发现GRPO在大模型中表现更优,有助于开发更透明可信的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.14925 2025-12-30 cs.LG 70%

A Survey of Reinforcement Learning from Human Feedback

从人类反馈强化学习的综述

Timo Kaufmann, Paul Weng, Viktor Bengs, Eyke Hüllermeier

机构 * LMU Munich(慕尼黑大学) MCML Munich(慕尼黑马克斯·普朗克研究所) DFKI(德国人工智能研究中心)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.LG

AI总结 本文综述了从人类反馈强化学习的基本原理、核心方法及在多个领域中的应用与贡献。

Comments Published version (TMLR): https://openreview.net/pdf?id=f7OkIurx4b

Journal ref Transactions on Machine Learning Research, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23693 2025-12-30 cs.CL 57%

Fine-Tuning LLMs with Fine-Grained Human Feedback on Text Spans

基于文本片段的细粒度人类反馈微调语言模型

Sky CH-Wang, Justin Svegliato, Helen Appel, Jason Eisner

机构 * Columbia University(哥伦比亚大学) Microsoft(微软公司) Johns Hopkins University(约翰霍普金斯大学)

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 本文提出基于文本片段的细粒度人类反馈方法,通过反馈驱动的改进链提升语言模型微调效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23132 2025-12-30 cs.CR cs.LG cs.MA 57%

Multi-Agent Framework for Threat Mitigation and Resilience in AI-Based Systems

多智能体框架用于AI系统中的威胁缓解与韧性

Armstrong Foundjem, Lionel Nganyewou Tidjon, Leuson Da Silva, Foutse Khomh

机构 * Department of Computer and Software Engineering, Polytechnique Montreal(计算机与软件工程系,蒙特利尔理工学院)

专题命中 偏好对齐 :prompt injection(abstract);分类 cs.LG

AI总结 本文提出多智能体框架,用于识别和缓解AI系统中的威胁,通过构建威胁图分析漏洞和攻击模式,提升系统韧性。

Comments 56 pages, 18 Figures, 22 Tables, TOSEM

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22398 2025-12-30 cs.AI 57%

Lightweight Inference-Time Personalization for Frozen Knowledge Graph Embeddings

轻量级推理时个性化方法用于冻结的知识图谱嵌入

Ozan Oguztuzun, Cerag Oguztuzun

专题命中 偏好对齐 :alignment(abstract);分类 cs.AI

AI总结 GatedBias通过轻量级推理时个性化方法,实现对冻结知识图谱嵌入的个体用户适应,提升对齐度并保持群体性能,同时验证因果响应性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2502.06059 2025-12-30 cs.CY 70%

Prioritization First, Principles Second: An Adaptive Interpretation of Helpful, Honest, and Harmless Principles

优先原则,原则其次:一种适应性解读有助于、诚实和无害原则

Yue Huang, Chujie Gao, Yujun Zhou, Kehan Guo, Xiangqi Wang, Or Cohen-Sasson, Max Lamparth, Xiangliang Zhang

专题命中 安全训练 :alignment(abstract);harmlessness(abstract);分类 cs.CY

AI总结 本文提出了一种适应性解读有助于、诚实和无害原则的方法,通过优先级顺序平衡不同维度,以提高AI对齐的伦理和操作有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23546 2025-12-30 cs.CV 67%

PurifyGen: A Risk-Discrimination and Semantic-Purification Model for Safe Text-to-Image Generation

PurifyGen:一种用于安全文本到图像生成的风险判别和语义净化模型

Zongsheng Cao, Yangfan He, Anran Liu, Jun Xie, Feng Chen, Zepeng Wang

机构 * Researcher(研究者)

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 PurifyGen通过双阶段策略实现安全文本到图像生成,通过语义距离评估和双空间转换净化危险提示,减少不安全内容生成。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23617 2025-12-30 cs.LG cs.AI math.ST stat.ME stat.ML stat.TH 62%

Le Cam Distortion: A Decision-Theoretic Framework for Robust Transfer Learning

Le Cam 变形:一种决策理论框架用于鲁棒迁移学习

Deniz Akdemir

机构 * Deniz Akdemir

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 Le Cam 变形通过决策理论框架,解决了迁移学习中因域信息不均衡导致的负迁移问题,实现了在不降质源域的情况下有效迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23366 2025-12-30 cs.DB cs.AI 57%

AGRO-SQL: Agentic Group-Relative Optimization with High-Fidelity Data Synthesis

AGRO-SQL:基于高保真数据合成的群体相对优化

Cehua Yang, Dongyu Xiao, Junming Lin, Yuyang Song, Hanxu Yan, Shawn Guo, Wei Zhang, Jian Yang, Mingjie Tang, Bryan Dai

机构 * Sichuan University(四川大学) IQuest Research(IQuest研究院) Beihang University(北航大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 AGRO-SQL通过高保真数据合成和群体相对策略优化,提升文本到SQL系统的推理能力与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22568 2025-12-30 cs.AI physics.bio-ph q-bio.NC 57%

Lessons from Neuroscience for AI: How integrating Actions, Compositional Structure and Episodic Memory could enable Safe, Interpretable and Human-Like AI

从神经科学中汲取教训:如何通过整合动作、组合结构和事件记忆来实现安全、可解释和类人的人工智能

Rajesh P. N. Rao, Vishwas Sathish, Linxing Preston Jiang, Matthew Bryan, Prashant Rangarajan

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 通过整合动作、组合结构和事件记忆,改进基础模型以实现安全、可解释和类人的人工智能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23505 2025-12-30 cs.RO cs.SY eess.SY 50%

Robust Deep Learning Control with Guaranteed Performance for Safe and Reliable Robotization in Heavy-Duty Machinery

具有保证性能的鲁棒深度学习控制:用于重载机械中安全可靠机器人化的关键技术

Mehdi Heydari Shahna

机构 * Business Finland Partnership Project(Business Finland合作伙伴项目) Tampere(塔尔帕)

专题命中 安全训练 :safety(abstract)

AI总结 本研究提出了一种鲁棒深度学习控制框架,旨在提升重型机械在电气化和自主性转型中的安全性和可靠性,通过模块化设计和分层策略实现性能保障。

Comments Doctoral Dissertation, Tampere University

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04279 2025-12-30 cs.RO 50%

Driving Beyond Privilege: Distilling Dense-Reward Knowledge into Sparse-Reward Policies

超越特权:将密集奖励知识蒸馏到稀疏奖励策略中

Feeza Khan Khanzada, Jaerock Kwon

机构 * Department of Electrical and Computer Engineering, University of Michigan-Dearborn(电气与计算机工程系,密歇根大学迪尔伯恩分校)

专题命中 安全训练 :safety(abstract)

AI总结 本文提出通过密集奖励蒸馏学习稀疏奖励策略,提升自动驾驶在稀疏目标上的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 6 篇

2508.13246 2025-12-30 cs.CR cs.AI 85%

Involuntary Jailbreak: On Self-Prompting Attacks

强制性越狱:关于自我提示攻击

Yangyang Guo, Yangyan Li, Mohan Kankanhalli

机构 * National University of Singapore(新加坡国立大学) Alibaba Group(阿里巴巴集团)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 研究揭示了大型语言模型中一种新的漏洞,通过简单提示策略可强制越狱多数主流模型,促使重新评估防护机制的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23173 2025-12-30 cs.CR cs.AI 83%

EquaCode: A Multi-Strategy Jailbreak Approach for Large Language Models via Equation Solving and Code Completion

EquaCode:通过方程求解和代码补全的多策略对抗大语言模型

Zhen Liang, Hai Huang, Zhengkui Chen

机构 * School of Computer Science and Technology, Zhejiang Sci-Tech University, Hangzhou, China(计算机科学与技术学院,浙江科技学院,杭州,中国)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 EquaCode通过方程求解和代码补全提出多策略对抗方法,有效提升大语言模型的鲁棒性。

Comments This is a preprint. A revised version will appear in the Proceedings of AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.05499 2025-12-30 cs.CR cs.AI cs.CL cs.SE 81%

Prompt Injection attack against LLM-integrated Applications

针对集成大语言模型应用的提示注入攻击

Yi Liu, Gelei Deng, Yuekang Li, Kailong Wang, Zihao Wang, Xiaofeng Wang, Tianwei Zhang, Yepang Liu, Haoyu Wang, Yan Zheng, Leo Yu Zhang, Yang Liu

机构 * Griffith University(格里菲斯大学) Nanyang Technological University(南洋理工大学) University of New South Wales(新南威尔士大学) Huazhong University of Science and Technology(华中科技大学) Indiana University at Bloomington(印第安纳大学布卢明顿分校) Southern University of Science and Technology(南方科技大学) Tianjin University(天津大学)

专题命中 越狱攻击 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HouYi技术,揭示LLM集成应用中提示注入攻击的潜在风险及缓解方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.10321 2025-12-30 cs.LG cs.AI cs.CL cs.CR 80%

AdvPrefix: An Objective for Nuanced LLM Jailbreaks

AdvPrefix: 一种面向 nuanced LLM 模型 jailbreak 的目标

Sicheng Zhu, Brandon Amos, Yuandong Tian, Chuan Guo, Ivan Evtimov

机构 * University of Maryland, College Park(马里兰大学 College Park分校) FAIR, Meta(Meta的FAIR)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AdvPrefix 提出了一种新的目标,通过结合高预填充攻击成功率和低负对数似然来选择模型依赖的前缀,以提升 jailbreak 攻击的精确性和有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22488 2025-12-30 cs.LG cs.CV 79%

Toward Real-World IoT Security: Concept Drift-Resilient IoT Botnet Detection via Latent Space Representation Learning and Alignment

迈向现实世界的物联网安全:通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测

Hassan Wasswa, Timothy Lynar

专题命中 越狱攻击 :alignment(title,abstract);分类 cs.LG

AI总结 本文提出一种通过潜在空间表示学习与对齐实现概念漂移鲁棒的物联网僵尸网络检测框架,有效解决传统方法在动态环境中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11938 2025-12-30 cs.CL cs.AI cs.LG 78%

Improving Large Language Model Safety with Contrastive Representation Learning

通过对比表征学习提升大语言模型安全性

Samuel Simko, Mrinmaya Sachan, Bernhard Schölkopf, Zhijing Jin

机构 * ETH Zurich(苏黎世联邦理工学院) MPI for Intelligent Systems(智能系统最大计划) University of Toronto(多伦多大学)

专题命中 越狱攻击 :safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于对比表征学习的框架,通过三元组损失和对抗性难负样本挖掘提升大语言模型对对抗攻击的鲁棒性。

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 2 篇

2512.23557 2025-12-30 cs.CR cs.AI 86%

Toward Trustworthy Agentic AI: A Multimodal Framework for Preventing Prompt Injection Attacks

迈向可信的代理AI:一种多模态框架用于防止提示注入攻击

Toqeer Ali Syed, Mishal Ateeq Almutairi, Mahmoud Abdel Moaty

机构 * Faculty of Computer and Information System(计算机与信息系统系) Islamic University of Madinah(麦地那伊斯兰大学) Arab Open University-Bahrain(巴林阿拉伯开放大学)

专题命中 提示注入 :prompt injection(title,abstract);trustworthy(title);分类 cs.AI

AI总结 本文提出一种多模态框架,通过溯源感知机制防止代理AI中的提示注入攻击,提升系统安全性和稳定性。

Comments It is accepted in a conference paper, ICCA 2025 in Bahrain on 21 to 23 December

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23684 2025-12-30 cs.CL cs.AI 81%

Multilingual Hidden Prompt Injection Attacks on LLM-Based Academic Reviewing

多语言隐藏提示注入攻击对基于LLM的学术评审的影响

Panagiotis Theocharopoulos, Ajinkya Kulkarni, Mathew Magimai. -Doss

机构 * International School of Athens(希腊国际学校) Idiap Research Institute(Idiap研究 institute)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究发现,多语言隐藏提示注入攻击对LLM基于的学术评审系统产生显著影响,尤其在英语、日语和中文中表现明显,而阿拉伯语则影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2512.23508 2025-12-30 cs.AI cs.GT 84%

Why AI Safety Requires Uncertainty, Incomplete Preferences, and Non-Archimedean Utilities

为何人工智能安全需要不确定性、不完全偏好和非阿基米德效用

Alessio Benavoli, Alessandro Facchini, Marco Zaffalon

机构 * School of Computer Science and Statistics, Trinity College Dublin(特里尼蒂大学计算机科学与统计学学院) Trinity Quantum Alliance, Trinity College Dublin(特里尼蒂量子联盟) Management in Networked and Digital Societies (MINDS) Department, Kozminski University(科津斯基大学网络化与数字化社会管理系)

专题命中 幻觉与事实性 :safety(title);AI safety(title);分类 cs.AI

AI总结 本文探讨了人工智能安全需通过不确定性推理、不完全偏好处理和非阿基米德效用机制来实现

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23547 2025-12-30 cs.CL cs.AI 62%

Lie to Me: Knowledge Graphs for Robust Hallucination Self-Detection in LLMs

对谎言说谎:知识图谱在大语言模型鲁棒性幻觉自检测中的应用

Sahil Kale, Antonio Luca Alfeo

机构 * eCampus University(eCampus大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出利用知识图谱提升大语言模型幻觉自检的鲁棒性,通过转换响应为图谱并估算幻觉可能性,实现准确率和F1分数的显著提升。

Comments Accepted to ICPRAM 2026 in Marbella, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22245 2025-12-30 cs.LG cs.AI 62%

Calibrating LLM Judges: Linear Probes for Fast and Reliable Uncertainty Estimation

校准大语言模型法官:用于快速可靠不确定性估计的线性探针

Bhaktipriya Radharapu, Eshika Saxena, Kenneth Li, Chenxi Whitehouse, Adina Williams, Nicola Cancedda

机构 * FAIR at Meta(Meta 的 FAIR 研究所) Meta Superintelligence Labs(Meta 超智能实验室)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于线性探针的校准方法,通过Brier分数损失训练,实现快速可靠的LLM法官不确定性估计,相比现有方法在计算效率和泛化能力上表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22189 2025-12-30 cs.LG 57%

Physics-Informed Machine Learning for Transformer Condition Monitoring -- Part II: Physics-Informed Neural Networks and Uncertainty Quantification

基于物理的机器学习用于变压器状态监测 -- 第二部分:基于物理的神经网络和不确定性量化

Jose I. Aizpurua

机构 * University of the Basque Country (UPV/EHU)(巴斯克大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出基于物理的神经网络和贝叶斯框架,用于变压器状态监测中的不确定性量化与预测。

Comments 7 pages, 8 figures, published as conference paper in IEEE Advanced Research Workshop on Transformers 2025 as part of the Tutorial delivered with the title "Physics-informed Machine Learning for Transformer Condition Monitoring"

Journal ref 8th International Advanced Research Workshop on Transformers (ARWtr), Baiona, Spain, 2025, pp. 95-101

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 18 篇

2512.23524 2025-12-30 cs.LG stat.ML 85%

Trustworthy Machine Learning under Distribution Shifts

在分布偏移下可信的机器学习

Zhuo Huang

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);safety(abstract);分类 cs.LG

AI总结 研究旨在通过提升鲁棒性、可解释性和适应性,在分布偏移下增强机器学习系统的可靠性与责任性。

Comments PhD Thesis

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.00089 2025-12-30 cs.LG stat.ME 79%

A new machine learning framework for occupational accidents forecasting with safety inspections integration

一种整合安全检查的新型机器学习框架用于职业事故预测

Aho Yapi, Pierre Latouche, Arnaud Guillin, Yan Bailly

机构 * Laboratoire de Mathématique Blaise Pascal UMR 6620 CNRS, Université Clermont Auvergne(布列塔尼数学实验室(皮萨实验室))

专题命中 安全评测 :safety(title,abstract);分类 cs.LG

AI总结 本文提出一种整合安全检查的新型机器学习框架,用于预测职业事故,通过将安全检查数据转化为二元时间序列,实现短期风险信号的生成与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01516 2025-12-30 cs.LG cs.AI cs.CL 78%

Quantifying True Robustness: Synonymity-Weighted Similarity for Trustworthy XAI Evaluation

量化真实鲁棒性:基于同义词加权的相似性用于可信XAI评估

Christopher Burger

机构 * The University of Mississippi(密苏里大学)

专题命中 安全评测 :trustworthy(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于同义词加权的相似性方法,用于更准确评估XAI系统的鲁棒性,防止攻击成功率的高估。

Comments 10 pages, 2 figures, 6 tables. Changes to title, abstract and minor edits to the content as a result of acceptance to the 59th Hawaii International Conference on System Sciences

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22470 2025-12-30 cs.AI 77%

DarkPatterns-LLM: A Multi-Layer Benchmark for Detecting Manipulative and Harmful AI Behavior

DarkPatterns-LLM: 一种多层基准用于检测操纵性和有害的AI行为

Sadia Asif, Israel Antonio Rosales Laguan, Haris Khan, Shumaila Asif, Muneeb Asif

机构 * Rensselaer Polytechnic Institute(拉特格斯理工学院) National University of Sciences and Technology(国立科学与技术大学) School of Electrical Engineering & Computer Science(电子与计算机科学学院)

专题命中 安全评测 :alignment(abstract);safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 DarkPatterns-LLM提出了一种多层基准用于检测LLM中的操纵性行为,通过细粒度分析和专家标注,评估七个危害类别下的内容,揭示模型在自主性检测方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22145 2025-12-30 cs.DL cs.AI cs.CY 73%

Pre-review to Peer review: Pitfalls of Automating Reviews using Large Language Models

预审至同行评审:使用大型语言模型自动化评审的陷阱

Akhil Pandey Akella, Harish Varma Siravuri, Shaurya Rohatgi

机构 * AllSci Corp(AllSci公司) Sunwater Capital(Sunwater资本) Kellogg School of Management, Northwestern University(西北大学凯洛格管理学院) Dept. of Computer Science, Northern Illinois University(北伊利诺伊大学计算机科学系) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了使用大型语言模型进行学术评审的潜力与风险,发现其作为预审筛选工具具有一定效用,但存在与人类评审不一致的风险及系统性高估偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.23312 2025-12-30 cs.RO cs.AI 70%

Explainable Neural Inverse Kinematics for Obstacle-Aware Robotic Manipulation: A Comparative Analysis of IKNet Variants

可解释的神经逆向运动学用于障碍物感知的机器人操作:对IKNet变体的比较分析

Sheng-Kai Chen, Yi-Ling Tsai, Chun-Chih Chang, Yan-Chen Chen, Po-Chiang Lin

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本研究提出了一种可解释性工作流程,通过Shapley值归因和物理障碍规避评估,改进IKNet变体以提升机器人操作的透明性和安全性。

Comments 27 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏