arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-03 至 2026-02-03 共收录 148 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 越狱攻击 9 篇

2602.01025 2026-02-03 cs.LG cs.AI cs.CV 81%

Toward Universal and Transferable Jailbreak Attacks on Vision-Language Models

迈向通用且可迁移的视觉-语言模型劫持攻击

Kaiyuan Cui, Yige Li, Yutao Wu, Xingjun Ma, Sarah Erfani, Christopher Leckie, Hanxun Huang

机构 * School of Computing and Information Systems, The University of Melbourne, Australia(墨尔本大学计算机与信息系) School of Computing and Information Systems, Singapore Management University, Singapore(新加坡管理大学计算机与信息系) School of Information Technology, Deakin University, Australia(德肯大学信息科技系) Institute of Trustworthy Embodied AI, Fudan University, China(复旦大学可信具身人工智能研究所)

专题命中 越狱攻击 :jailbreak(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出UltraBreak,一种通用且可迁移的视觉-语言模型劫持攻击框架,通过视觉正则化和语义引导的文本监督,有效提升攻击的泛化能力和转移性能。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00619 2026-02-03 cs.CL cs.AI cs.CR cs.LG 80%

Jailbreaking LLMs via Calibration

通过校准劫持大语言模型

Yuxuan Lu, Yongkang Guo, Yuqing Kong

机构 * Department of Computer Science, Peking University, Beijing, China(计算机科学系,北京大学,北京,中国)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过校准劫持大语言模型,提出一种新的聚合框架,提升攻击成功率并降低劫持成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01574 2026-02-03 cs.CV 78%

SGHA-Attack: Semantic-Guided Hierarchical Alignment for Transferable Targeted Attacks on Vision-Language Models

SGHA-Attack:语义引导的层次对齐用于视觉-语言模型的可迁移定向攻击

Haobo Wang, Weiqi Luo, Xiaojun Jia, Xiaochun Cao

机构 * Guangdong Province Key Lab of Information Security Technology, and School of Computer Science and Engineering, Sun Yat-sen University(广东信息安全技术重点实验室,计算机科学与工程学院,中山大学) Nanyang Technological University(南洋理工大学) School of Cyber Science and Technology, Shenzhen Campus, Sun Yat-sen University(网络安全科学与技术学院,深圳校区,中山大学)

专题命中 越狱攻击 :alignment(title,abstract)

AI总结 SGHA-Attack通过语义引导的层次对齐框架,提升视觉-语言模型的定向转移攻击效果,增强跨异构模型的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00420 2026-02-03 cs.CV cs.AI cs.CR 77%

Text is All You Need for Vision-Language Model Jailbreaking

文本就是视觉-语言模型劫持所需

Yihang Chen, Zhao Xu, Youyuan Jiang, Tianle Zheng, Cho-Jui Hsieh

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 Text-DJ通过将文本转换为图像并诱导干扰,成功绕过视觉-语言模型的安全防护,揭示了OCR能力在面对分散多模态输入时的脆弱性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04531 2026-02-03 cs.CL cs.AI cs.LG 75%

DP-Fusion: Token-Level Differentially Private Inference for Large Language Models

DP-Fusion: 令牌级差分隐私推理用于大语言模型

Rushil Thareja, Preslav Nakov, Praneeth Vepakomma, Nils Lukas

机构 * Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(莫扎德·本·泽亚德人工智能大学) Massachusetts Institute of Technology (MIT)(麻省理工学院)

专题命中 越狱攻击 :jailbreak(abstract);prompt injection(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DP-Fusion通过令牌级差分隐私机制,在保证隐私的同时提升大语言模型的文本质量。

Comments Code: https://github.com/rushil-thareja/dp-fusion-lib | PyPI: https://pypi.org/project/dp-fusion-lib/ | Demo: https://www.documentprivacy.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02395 2026-02-03 cs.LG cs.AI cs.CR cs.MA 62%

David vs. Goliath: Verifiable Agent-to-Agent Jailbreaking via Reinforcement Learning

大卫与歌利亚:通过强化学习实现可验证的代理到代理劫持

Samuel Nellessen, Tal Kachman

机构 * Department of Artificial Intelligence, Radboud University, Nijmegen, The Netherlands(人工智能系,拉德堡德大学,尼姆韦根,荷兰)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过强化学习框架Slingshot,验证了Tag-Along攻击作为可验证的威胁模型,并展示了如何通过环境交互从现成模型中引发有效代理攻击。

Comments Under review. 8 main pages, 2 figures, 2 tables. Appendix included

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01290 2026-02-03 cs.NI 50%

AOASS: Adaptive Obstacle-Aware Square Spiral Framework for Single-mobile Anchor-Based WSN Localization

AOASS:自适应障碍感知正方形螺旋框架用于单移动锚点基于WSN定位

Abdelhady Naguib

专题命中 越狱攻击 :safety(abstract)

AI总结 AOASS通过自适应障碍检测和优化运动模式,提升WSN中单移动锚点的定位精度与能耗效率,适用于现实物联网应用。

Comments 19 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 提示注入 2 篇

2602.01795 2026-02-03 cs.CR cs.AI cs.LG 84%

RedVisor: Reasoning-Aware Prompt Injection Defense via Zero-Copy KV Cache Reuse

RedVisor: 通过零拷贝KV缓存重用来实现推理感知的提示注入防御

Mingrui Liu, Sixiao Zhang, Cheng Long, Kwok-Yan Lam

机构 * Nanyang Technological University, Singapore(南洋理工大学)

专题命中 提示注入 :prompt injection(title,abstract);alignment(abstract);分类 cs.AI、cs.LG

AI总结 RedVisor通过零拷贝KV缓存重用实现推理感知的提示注入防御,结合检测与预防策略,提升安全性和效率。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01378 2026-02-03 cs.CL cs.AI stat.ML 73%

Context Dependence and Reliability in Autoregressive Language Models

自回归语言模型中的上下文依赖性与可靠性

Poushali Sengupta, Shashi Raj Pandey, Sabita Maharjan, Frank Eliassen

机构 * Department of Informatics, University of Oslo(信息学院,奥斯陆大学) Department of Electronic Systems, Aalborg University(电子系统系,奥胡斯大学)

专题命中 提示注入 :prompt injection(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RISE方法,用于自回归语言模型中区分关键上下文元素与冗余信息,提升解释的可靠性和稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 幻觉与事实性 13 篇

2602.02034 2026-02-03 cs.AI 70%

Constrained Process Maps for Multi-Agent Generative AI Workflows

多代理生成AI工作流的约束过程图

Ananya Joshi, Michael Rudow

专题命中 幻觉与事实性 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本研究提出了一种基于有限时间跨度马尔可夫决策过程的多代理系统,用于提升多步骤工作流中处理不确定性和协调的能力,通过案例研究验证了其在提高准确性和减少人工审查方面的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00269 2026-02-03 cs.CV cs.AI 70%

FaithSCAN: Model-Driven Single-Pass Hallucination Detection for Faithful Visual Question Answering

FaithSCAN: 基于模型的单次幻觉检测用于可靠的视觉问答

Chaodong Tong, Qi Zhang, Chen Li, Lei Jiang, Yanbing Liu

机构 * Institute of Information Engineering, Chinese Academy of Sciences (CAS) and the School of Cyber Security, University of CAS(信息工程研究所、中国科学院(CAS)和安全学院、CAS大学)

专题命中 幻觉与事实性 :alignment(abstract);safety(abstract);分类 cs.AI

AI总结 FaithSCAN通过利用VLMs的内部信号实现高效准确的视觉问答幻觉检测,克服现有方法的效率与鲁棒性限制。

Comments 21 pages, 13 figures, 8 tables. Submitted to IEEE Transactions on Big Data

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00085 2026-02-03 cs.LG cs.AI cs.CL 67%

CARE-RFT: Confidence-Anchored Reinforcement Finetuning for Reliable Reasoning in Large Language Models

CARE-RFT:基于置信度的强化微调用于大语言模型中的可靠推理

Shuozhe Li, Jincheng Cao, Bodun Hu, Aryan Mokhtari, Leqi Liu, Amy Zhang

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CARE-RFT通过引入置信度锚定的正则化方法,在保持大语言模型推理能力的同时提升其可信度和校准性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01956 2026-02-03 cs.LG cs.AI 62%

Efficient Epistemic Uncertainty Estimation for Large Language Models via Knowledge Distillation

通过知识蒸馏实现大型语言模型的高效信念不确定性估计

Seonghyeon Park, Jewon Yeom, Jaewon Sok, Jeongjae Park, Heejun Kim, Taesup Kim

机构 * Graduate School of Data Science, Seoul National University(首尔国立大学数据科学研究生院) Department of Rural Systems Engineering, Seoul National University(首尔国立大学农村系统工程系) Department of Aerospace Engineering, Seoul National University(首尔国立大学航空航天工程系) Department of Electrical Engineering and Computer Science, Gwangju Institute of Science and Technology(全州科学科技研究院电子工程与计算机科学系)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.LG

AI总结 通过知识蒸馏高效估计大型语言模型的信念不确定性,减少估计误差并提升幻觉检测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15386 2026-02-03 cs.CL cs.AI 62%

RePPL: Recalibrating Perplexity by Uncertainty in Semantic Propagation and Language Generation for Explainable QA Hallucination Detection

RePPL:通过语义传播和语言生成中的不确定性重新校准困惑度以检测可解释问答幻觉

Yiming Huang, Junyan Zhang, Zihao Wang, Biquan Bie, Yunzhong Qiu, Xuming Hu, Yi R. Fung, Xinlei He

机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) Tsinghua University(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 RePPL通过校准语义传播和语言生成中的不确定性,提升问答幻觉检测性能,生成token级不确定性评分作为解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00977 2026-02-03 cs.CL cs.LG 62%

Trust in One Round: Confidence Estimation for Large Language Models via Structural Signals

单轮信任:通过结构信号提升大语言模型的置信度估计

Pengyue Yang, Jiawen Wen, Haolin Jin, Linghan Huang, Huaming Chen, Ling Chen

机构 * The University of Sydney(悉尼大学) University of Technology Sydney(技术大学悉尼)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.CL、cs.LG

AI总结 通过分析模型最终层隐藏状态轨迹中的多尺度结构信号,提出结构置信度方法,实现单次通过的高效、稳健置信度估计,适用于高社会影响和资源受限的LLM应用。

Comments Accepted at The ACM Web Conference 2026 (WWW 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00279 2026-02-03 cs.CL cs.LG 62%

Benchmarking Uncertainty Calibration in Large Language Model Long-Form Question Answering

在大型语言模型长格式问答中评估不确定性校准的基准测试

Philip Müller, Nicholas Popovič, Michael Färber, Peter Steinbach

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 本研究提出首个大规模基准,评估大型语言模型在长格式问答中不确定性校准的可靠性,揭示了指令调优和推理过程对校准的影响及ECE指标的局限性。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01522 2026-02-03 cs.LG cs.CV 57%

When Is Rank-1 Enough? Geometry-Guided Initialization for Parameter-Efficient Fine-Tuning

何时秩-1足够?基于几何的初始化方法用于参数高效微调

Haoran Zhao, Soyeon Caren Han, Eduard Hovy

机构 * School of Computing and Information Systems, University of Melbourne, Melbourne, Australia(计算机与信息系统学院,墨尔本大学,墨尔本,澳大利亚)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文提出Gap-Init方法,通过几何感知初始化稳定秩-1 LoRA微调,证明初始对齐对训练稳定性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01078 2026-02-03 cs.AI 57%

AutoHealth: An Uncertainty-Aware Multi-Agent System for Autonomous Health Data Modeling

AutoHealth:一种面向自主健康数据建模的不确定性感知多智能体系统

Tong Xia, Weibin Li, Gang Liu, Yong Li

机构 * Vanke School of Public Health, Tsinghua University(清华大学万科公共卫生学院) Department of Electronic Engineering, Beijing National Research Center for Information Science and Technology(北京信息科学与技术国家研究中心电子工程系) Tsinghua University, China(清华大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.AI

AI总结 AutoHealth通过多智能体系统自主建模健康数据,提升预测性能和不确定性估计,有效解决健康数据建模中的泛化和可靠性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00850 2026-02-03 cs.CY 57%

PS$^2$: Parameterized Control for Fine-Grained Student Proficiency Simulation

PS$^2$: 基于参数化控制的细粒度学生能力模拟

Ruochen Liu, Zhiyuan Wen, Hao Yan, Jun Yin, Senzhang Wang, Jiannong Cao

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CY

AI总结 PS$^2$提出一种基于参数化控制的细粒度学生能力模拟方法,通过混合比率在强弱模型间插值得到更精确的能力模拟,提升学生行为相似性和题目难度预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.19145 2026-02-03 stat.ME cs.LG stat.AP 57%

Do Large Language Models (Really) Need Statistical Foundations?

大型语言模型(真的需要统计基础吗?

Weijie Su

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.LG

AI总结 本文探讨大型语言模型是否需要统计学基础,指出其统计本质和黑箱特性使统计方法成为必要,并强调统计学界在LLMs研究中的重要性。

Comments Accepted at The Annals of Applied Statistics; Added discussions on more topics

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.10844 2026-02-03 cs.HC 50%

Be Friendly, Not Friends: How LLM Sycophancy Shapes User Trust

友好而非朋友:LLM谄媚如何塑造用户信任

Yuan Sun, Ting Wang

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 研究探讨LLM谄媚如何影响用户信任,通过实验发现适应性对话态度影响用户对LLM真实性和信任度的感知。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01264 2026-02-03 cs.HC 50%

Shades of Uncertainty: How AI Uncertainty Visualizations Affect Trust in Alzheimer's Predictions

不确定性之影:AI不确定性可视化如何影响阿尔茨海默病预测的可信度

Jonatan Reyes, Mina Massoumi, Anil Ufuk Batmaz, Marta Kersten-Oertel

专题命中 幻觉与事实性 :trustworthy(abstract)

AI总结 本研究探讨了AI不确定性可视化对阿尔茨海默病预测可信度的影响,发现连续编码提升可靠性,而二元编码增强即时信心,揭示了高不确定性下专业背景的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 隐私与版权 3 篇

2505.16530 2026-02-03 cs.CR cs.AI cs.CL 73%

DuFFin: A Dual-Level Fingerprinting Framework for LLMs IP Protection

DuFFin:一种用于LLM知识产权保护的双层指纹框架

Yuliang Yan, Haochun Tang, Shuo Yan, Enyan Dai

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Jilin University(吉林大学)

专题命中 隐私与版权 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 DuFFin通过双层指纹框架在黑盒环境下实现LLM知识产权验证,准确识别模型来源并达到高验证精度。

Comments Accepted by EACL 2026, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00298 2026-02-03 cs.AI 70%

Assessing Domain-Level Susceptibility to Emergent Misalignment from Narrow Finetuning

评估窄微调下领域层面的涌现对齐风险

Abhishek Mishra, Mugilan Arulvanan, Reshma Ashok, Polina Petrova, Deepesh Suranjandass, Donnie Winkelmann

机构 * Anonymous Authors(匿名作者)

专题命中 隐私与版权 :safety(abstract);AI safety(abstract);分类 cs.AI

AI总结 本文通过评估不同领域中窄微调下的涌现对齐风险,揭示了后门触发器对对齐效果的影响,并提出了基于成员推断度量的预测方法,为AI安全提供了新的视角。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02184 2026-02-03 cs.CR cs.AI 57%

Malware Detection Through Memory Analysis

通过内存分析检测恶意软件

Sarah Nassar

机构 * Electrical and Computer Engineering(电气与计算机工程系) Queen's University(皇后大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 本文通过XGBoost模型在内存分析中实现高精度恶意软件检测,提升了二分类和多类分类的准确率与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 安全评测 48 篇

2602.00061 2026-02-03 cs.CY cs.AI 88%

Simple Role Assignment is Extraordinarily Effective for Safety Alignment

简单的角色分配在安全对齐中表现尤为有效

Zhou Ziheng, Jiakun Ding, Zhaowei Zhang, Ruosen Gao, Yingnian Wu, Demetri Terzopoulos, Yipeng Kang, Fangwei Zhong, Junqi Wang

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Tianjin University(天津大学) Peking University(北京大学) Zhejiang University(浙江大学) Beijing Institute of General Artificial Intelligence(北京一般人工智能研究院)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.AI、cs.CY

AI总结 本研究提出基于角色条件化的安全对齐方法,通过角色隐含编码价值观和认知模式,有效降低不安全输出,适用于多种AI对齐任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01600 2026-02-03 cs.CR cs.CL cs.CY cs.LG 85%

Expected Harm: Rethinking Safety Evaluation of (Mis)Aligned LLMs

预期危害:重新思考对(误)对齐大语言模型的安全性评估

Yen-Shan Chen, Zhi Rui Tam, Cheng-Kuang Wu, Yun-Nung Chen

专题命中 安全评测 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.CY、cs.LG

AI总结 本文提出预期危害指标,通过分析发现模型对高成本低可能性威胁的拒绝行为与高可能性低成本威胁的易受攻击现象,揭示模型对执行成本的

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05980 2026-02-03 cs.CL cs.LG 84%

Lost in Localization: Building RabakBench with Human-in-the-Loop Validation to Measure Multilingual Safety Gaps

迷失于定位:通过人类在环验证构建RabakBench以衡量多语言安全差距

Gabriel Chua, Leanne Tan, Ziyu Ge, Roy Ka-Wei Lee

机构 * GovTech, Singapore(新加坡政府科技局) Singapore University of Technology and Design(新加坡科技与设计大学)

专题命中 安全评测 :safety(title,abstract);red teaming(abstract);分类 cs.CL、cs.LG

AI总结 RabakBench通过人类在环验证构建,用于衡量多语言安全差距,通过三阶段流程生成、标注和翻译数据,评估LLM在低资源语言中的安全性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01824 2026-02-03 cs.HC cs.CY 79%

Risk, Data, Alignment: Making Credit Scoring Work in Kenya

风险、数据、对齐:使肯尼亚的信用评分有效

Daniel Mwesigwa, Steven J. Jackson, Christopher Csikszentmihalyi

专题命中 安全评测 :alignment(title,abstract);分类 cs.CY

AI总结 本文探讨肯尼亚信用评分中风险、数据与对齐的动态关系,揭示算法信用评分通过持续的社会技术工作稳定风险的过程。

Comments Conditionally accepted to ACM CHI 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00641 2026-02-03 cs.AI 79%

AgentAuditor: Human-Level Safety and Security Evaluation for LLM Agents

AgentAuditor: 为LLM代理提供人类水平的安全性和安全性评估

Hanjun Luo, Shenyu Dai, Chiming Ni, Xinfeng Li, Guibin Zhang, Kun Wang, Tongliang Liu, Hanan Salam

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 AgentAuditor通过构建经验记忆和多阶段检索生成过程,提升LLM在代理安全性和安全性评估中的性能,达到人类水平的准确性。

Comments This paper is accepted by 39th Conference on Neural Information Processing Systems (NeurIPS 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏