arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 54 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 9 篇

2504.20106 2026-02-05 cs.LG cs.AI 90%

Adaptive Helpfulness-Harmlessness Alignment with Preference Vectors

基于偏好向量的自适应有益有害对齐

Ren-Wei Liang, Chin-Ting Hsu, Chan-Hung Yu, Saransh Agrawal, Shih-Cheng Huang, Chieh-Yen Lin, Shang-Tse Chen, Kuan-Hao Huang, Shao-Hua Sun

机构 * National Taiwan University(国立台湾大学) Texas A&M University(德克萨斯A&M大学) Appier AI Research(Appier人工智能研究院) Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 偏好对齐 :alignment(title,abstract);harmlessness(title);RLHF(abstract);DPO(abstract)

AI总结 本文提出偏好向量框架,通过模块化方法实现细粒度的用户可控偏好调整,提升大语言模型的有益性和无害性平衡。

Comments Accepted at The 19th Conference of the European Chapter of the Association for Computational Linguistics (EACL 2026), Rabat, Morocco

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04224 2026-02-05 cs.LG cs.AI cs.CL cs.CR math.OC 80%

RAPO: Risk-Aware Preference Optimization for Generalizable Safe Reasoning

RAPO:面向通用安全推理的风险感知优化

Zeming Wei, Qiaosheng Zhang, Xia Hu, Xingcheng Xu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 偏好对齐 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 RAPO 提出了一种风险感知优化框架,通过提升安全推理的泛化能力,增强大型推理模型在复杂攻击下的安全性与实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04649 2026-02-05 cs.CL 70%

Outcome Accuracy is Not Enough: Aligning the Reasoning Process of Reward Models

结果准确性不够:对奖励模型推理过程的对齐

Binghai Wang, Yantao Liu, Yuxuan Liu, Tianyi Tang, Shenzhi Wang, Chang Gao, Chujie Zheng, Yichang Zhang, Le Yu, Shixuan Liu, Tao Gui, Qi Zhang, Xuanjing Huang, Bowen Yu, Fei Huang, Junyang Lin

机构 * Alibaba Group(阿里巴巴集团) Fudan University(复旦大学) Tsinghua University(清华大学)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL

AI总结 本文提出推理一致性度量,结合结果准确性改进生成奖励模型训练,提升RLHF性能并减少欺骗性对齐问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.12434 2026-02-05 cs.AI 70%

Building Coding Agents via Entropy-Enhanced Multi-Turn Preference Optimization

通过熵增强的多轮偏好优化构建编码代理

Jiahao Yu, Zelei Cheng, Xian Wu, Xinyu Xing

机构 * Department of Computer Science, Northwestern University, Evanston, USA(西北大学计算机科学系) Meta AI, Bellevue, USA(Meta AI)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 本文提出EntroPO框架,通过增强熵的方法提升多轮交互中编码代理的性能,实现更高效的测试时间扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03876 2026-02-05 cs.LG cs.AI 62%

GOPO: Policy Optimization using Ranked Rewards

GOPO:基于排名奖励的策略优化

Kyuseong Choi, Dwaipayan Saha, Woojeong Kim, Anish Agarwal, Raaz Dwivedi

机构 * Cornell Tech, Cornell University, NY, United States(康奈尔科技、康奈尔大学,纽约,美国) Columbia University, NY, United States(哥伦比亚大学,纽约,美国)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.AI、cs.LG

AI总结 GOPO通过使用奖励排名而非绝对值,提高了不可验证任务中策略优化的性能和效率。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13131 2026-02-05 cs.CL cs.LG stat.ML 62%

Improving Detection of Watermarked Language Models

提升水印语言模型的检测能力

Dara Bahri, John Wieting

机构 * Google DeepMind(谷歌DeepMind)

专题命中 偏好对齐 :RLHF(abstract);分类 cs.CL、cs.LG

AI总结 本文通过结合水印与非水印检测器提升大型语言模型的检测能力。

Comments Published at TMLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04493 2026-02-05 cs.CL cs.HC 57%

PersoDPO: Scalable Preference Optimization for Instruction-Adherent, Persona-Grounded Dialogue via Multi-LLM Evaluation

PersoDPO: 通过多LLM评估实现可扩展的偏好优化

Saleh Afzoon, MohammadHossein Ahmadi, Usman Naseem, Amin Beheshti

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.CL

AI总结 PersoDPO通过多LLM评估实现可扩展的偏好优化,提升对话系统的人格导向和上下文连贯性。

Comments Accepted at WISE 2025 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18321 2026-02-05 cs.MM cs.CL cs.CV 57%

Integrating Fine-Grained Audio-Visual Evidence for Robust Multimodal Emotion Reasoning

融合细粒度音频视觉证据以实现鲁棒的多模态情绪推理

Zhixian Zhao, Wenjie Tian, Lei Xie

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL

AI总结 SABER-LLM通过构建大规模情绪推理数据集和结构化证据分解范式,实现鲁棒的多模态情绪推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04526 2026-02-05 econ.TH 50%

Choice via AI

通过代理人工智能的选择

Christopher Kops, Elias Tsakas

专题命中 偏好对齐 :alignment(abstract)

AI总结 本文通过代理人工智能模型研究选择行为,提出双重单调性与幂等性属性以确保推荐的合理性和一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 6 篇

2602.04056 2026-02-05 eess.SY cs.RO cs.SY 82%

Modular Safety Guardrails Are Necessary for Foundation-Model-Enabled Robots in the Real World

模块化安全护栏是现实世界中由基础模型赋能的机器人所必需的

Joonkyung Kim, Wenxi Chen, Davood Soleymanzadeh, Yi Ding, Xiangbo Gao, Zhengzhong Tu, Ruqi Zhang, Fan Fei, Sushant Veer, Yiwei Lyu, Minghui Zheng, Yan Gu

机构 * Purdue University(普渡大学) Amazon(亚马逊公司) NVIDIA(英伟达公司)

专题命中 安全训练 :safety(title,abstract);alignment(abstract)

AI总结 本文提出模块化安全护栏以解决现实世界中由基础模型赋能的机器人在开放、长尾和随时间适应的环境中的安全挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04801 2026-02-05 eess.SY cs.SY 67%

SQP-Based Cable-Tension Allocation for Multi-Drone Load Transport

基于SQP的多无人机负载运输电缆张力分配

Lamberto Vazquez-Soqui, Fatima Oliva-Palomo, Diego Mercado-Ravell, Pedro Castillo

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 本文提出基于SQP算法的多无人机负载运输电缆张力分配方法,通过实时优化提升负载运输的安全性和能耗平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04581 2026-02-05 cs.CL cs.AI cs.DC cs.LG 67%

Trust The Typical

信任典型

Debargha Ganguly, Sreehari Sankar, Biyao Zhang, Vikash Singh, Kanan Gupta, Harshini Kavuru, Alan Luo, Weicong Chen, Warren Morningstar, Raghu Machiraju, Vipin Chaudhary

机构 * Case Western Reserve University(凯斯西储大学) University of Pittsburgh(匹兹堡大学) The Ohio State University(俄亥俄州立大学) Google Research(谷歌研究)

专题命中 安全训练 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Trust The Typical通过将安全性视为分布外检测问题,在无需有害示例训练的情况下,实现了在多个安全基准测试中的高性能表现,显著降低误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04821 2026-02-05 cs.LG cs.AI 62%

Safe Urban Traffic Control via Uncertainty-Aware Conformal Prediction and World-Model Reinforcement Learning

通过不确定性感知的置信区间预测和世界模型强化学习实现安全的城市交通控制

Joydeep Chandra, Satyam Kumar Navneet, Aleksandr Algazinov, Yong Zhang

机构 * Dept. of CST, BNRIST, Tsinghua University, Beijing, China(计算机科学与技术系,北京理工大学,北京,中国) Dept. of CST, Tsinghua University, Beijing, China(计算机科学与技术系,清华大学,北京,中国) Independent Researcher, Bihar, India(独立研究者,印度比哈尔)

专题命中 安全训练 :safety(abstract);分类 cs.AI、cs.LG

AI总结 STREAM-RL通过不确定性感知的置信区间预测和世界模型强化学习,实现安全的城市交通控制,提升安全性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13060 2026-02-05 cs.LG cs.GT math.OC stat.ML 57%

Achieving Logarithmic Regret in KL-Regularized Zero-Sum Markov Games

在KL正则化零和马尔可夫博弈中实现对数遗憾

Anupam Nayak, Tong Yang, Osman Yagan, Gauri Joshi, Yuejie Chi

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出OMG和SOMG算法,在KL正则化下实现对数遗憾,提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04803 2026-02-05 eess.SP 50%

Safe-NEureka: a Hybrid Modular Redundant DNN Accelerator for On-board Satellite AI Processing

Safe-NEureka: 一种用于卫星 onboard AI 处理的混合模块冗余 DNN 加速器

Riccardo Tedeschi, Luigi Ghionda, Alessandro Nadalini, Yvan Tortorella, Arpan Suravi Prasad, Luca Benini, Davide Rossi, Francesco Conti

专题命中 安全训练 :safety(abstract)

AI总结 Safe-NEureka 是一种用于卫星 onboard AI 处理的混合模块冗余 DNN 加速器,结合冗余保护与性能优化,适用于安全关键和性能关键任务。

Comments 22 pages, 13 figures, ACM journal format

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2602.04294 2026-02-05 cs.CL cs.AI cs.CR 86%

How Few-shot Demonstrations Affect Prompt-based Defenses Against LLM Jailbreak Attacks

少样本演示如何影响基于提示的对抗LLM劫持攻击防御

Yanshu Wang, Shuaishuai Yang, Jingjing He, Tong Yang

机构 * Peking University(北京大学)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文研究少样本演示对基于提示的LLM防御策略的影响,发现其对RoP和ToP产生相反效果,提出实用部署建议。

Comments 13 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13893 2026-02-05 cs.CL cs.AI 84%

Guarding the Guardrails: A Taxonomy-Driven Approach to Jailbreak Detection

守护护栏:一种基于分类的 Jailbreak 检测方法

Francesco Giarrusso, Olga E. Sorokoletova, Vincenzo Suriani, Daniele Nardi

机构 * Department of Computer, Control and Management Engineering(计算机、控制与管理工程系)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种基于分类的 Jailbreak 检测方法,通过构建分层分类体系,分析攻击类型,评估提示引导效果,并建立新的多轮对抗对话数据集,以提升对 Jailbreak 技术的检测能力。

Comments 2nd Conference on International Association for Safe & Ethical AI (IASEAI 2026), 24-26 February 2026, UNESCO House, Paris, France

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04196 2026-02-05 cs.CL cs.LG 84%

The Missing Half: Unveiling Training-time Implicit Safety Risks Beyond Deployment

缺失的一半:揭示训练时间隐含的安全风险

Zhexin Zhang, Yida Lu, Junfeng Fang, Junxiao Yang, Shiyao Cui, Hao Zhou, Fandong Meng, Jie Zhou, Hongning Wang, Minlie Huang, Tat-Seng Chua

机构 * The Conversational AI (CoAI) group, DCST, Tsinghua University(清华大学智能对话研究院) National University of Singapore(新加坡国立大学) Pattern Recognition Center, WeChat AI, Tencent Inc, China(腾讯人工智能研究院)

专题命中 越狱攻击 :safety(title,abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文首次系统研究训练期间隐式安全风险,揭示模型内部激励和上下文信息驱动的有害行为,并通过实验展示其广泛存在和严重性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02542 2026-02-05 cs.LG cs.CR 57%

OverThink: Slowdown Attacks on Reasoning LLMs

OverThink: 对推理大语言模型的减速攻击

Abhinav Kumar, Jaechul Roh, Ali Naseh, Marzena Karpinska, Mohit Iyyer, Amir Houmansadr, Eugene Bagdasarian

机构 * University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Simon Fraser University(西蒙弗雷泽大学) University of Maryland, College Park(马里兰大学学院公园分校)

专题命中 越狱攻击 :safety(abstract);分类 cs.LG

AI总结 OverThink攻击通过注入伪装推理问题,迫使推理大语言模型消耗更多token,从而增加延迟和成本,同时探讨了其防御和影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03365 2026-02-05 cs.SD cs.AI cs.CR eess.AS 57%

When Good Sounds Go Adversarial: Jailbreaking Audio-Language Models with Benign Inputs

当良好声音变得对抗性:利用无害输入对音频-语言模型进行劫持

Hiskias Dingeto, Taeyoun Kwon, Dasol Choi, Bodam Kim, DongGeon Lee, Haon Park, JaeHoon Lee, Jongho Shin

机构 * Yonsei University, Seoul, South Korea(延世大学) Seoul National University, Seoul, South Korea(首尔国立大学) Pohang University of Science(坡桑科学大学)

专题命中 越狱攻击 :jailbreak(abstract);分类 cs.AI

AI总结 WhisperInject通过在无害音频中嵌入细微扰动,利用两阶段对抗性攻击框架劫持音频-语言模型,生成有害内容,展示了音频原生威胁的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 提示注入 3 篇

2511.21752 2026-02-05 cs.CL cs.AI 81%

Semantics as a Shield: Label Disguise Defense (LDD) against Prompt Injection in LLM Sentiment Classification

语义作为盾牌:对抗大语言模型情感分类中提示注入的标签伪装防御(LDD)

Yanxi Li, Ruocheng Shan

机构 * Department of Computer Science, George Washington University(计算机科学系,乔治华盛顿大学)

专题命中 提示注入 :prompt injection(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出LDD,一种通过语义伪装标签来防御大语言模型情感分类中提示注入攻击的方法,展示了其在不同模型上的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04487 2026-02-05 cs.HC cs.RO 78%

The Supportiveness-Safety Tradeoff in LLM Well-Being Agents

在LLM福祉代理中的支持性与安全性权衡

Himanshi Lalwani, Hanan Salam

专题命中 提示注入 :safety(title,abstract)

AI总结 研究探讨了在LLM福祉代理中支持性与安全性之间的权衡,发现适度支持性提示能提升共情和建设性支持,而强烈验证提示则显著降低安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19207 2026-02-05 cs.CR 78%

Defending Against Prompt Injection with DataFilter

用DataFilter抵御提示注入

Yizhu Wang, Sizhe Chen, Raghad Alkhudair, Basel Alomair, David Wagner

专题命中 提示注入 :prompt injection(title,abstract)

AI总结 DataFilter通过在数据到达LLM前移除恶意指令,有效防御提示注入攻击,同时保持模型的效用。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 4 篇

2602.04326 2026-02-05 cs.AI cs.CL cs.MA 62%

From Assumptions to Actions: Turning LLM Reasoning into Uncertainty-Aware Planning for Embodied Agents

从假设到行动:将大语言模型推理转化为具有不确定性的代理规划

SeungWon Seo, SooBin Lim, SeongRae Noh, Haneul Kim, HyeongYeop Kang

机构 * Department of Computer Science and Engineering, Korea University(计算机科学与工程系,韩国大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 PCE框架通过结构化决策树将LLM推理中的假设转化为可靠策略,提升多智能体环境下的规划效率和任务完成率。

Comments 31 pages, 10 figures, Accepted ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03852 2026-02-05 cs.HC cs.AI cs.CY 62%

Perceptions of AI-CBT: Trust and Barriers in Chinese Postgrads

对AI-CBT的认知:中国研究生中的信任与障碍

Chan-in Sio, Alex Mann, Lingxi Fan, Andrew Cheung, Lik-hang Lee

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 幻觉与事实性 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本研究探讨了中国研究生对AI-CBT聊天机器人在心理健康支持中的信任与障碍,揭示了感知有用性与隐私安全等因素对使用意图的影响。

Comments Accepted and presented in The 30th International Conference on Technologies and Applications of Artificial Intelligence in Taipei, Taiwan on 13-14 December 2025 (TAAI 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03910 2026-02-05 eess.IV 50%

CONRep: Uncertainty-Aware Vision-Language Report Drafting Using Conformal Prediction

CONRep:基于置信预测的不确定性感知视觉-语言报告起草

Danial Elyassirad, Benyamin Gheiji, Mahsa Vatanparast, Amir Mahmoud Ahmadzadeh, Seyed Amir Asef Agah, Mana Moassefi, Meysam Tavakoli, Shahriar Faghani

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 CONRep通过置信预测为视觉语言模型生成的放射学报告提供不确定性量化,提升自动化报告系统的透明性和临床实用性。

Comments 17 pages, 3 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.20504 2026-02-05 cs.CV 50%

UniVRSE: Unified Vision-conditioned Response Semantic Entropy for Hallucination Detection in Medical Vision-Language Models

UniVRSE: 统一的视觉条件响应语义熵用于医学视觉语言模型中的幻觉检测

Zehui Liao, Shishuai Hu, Ke Zou, Mengyuan Jin, Yanning Zhang, Huazhu Fu, Liangli Zhen, Yong Xia

机构 * National Engineering Laboratory for Integrated Aero-Space-Ground-Ocean Big Data Application Technology, School of Computer Science and Engineering, Northwestern Polytechnical University(集成航空航天地面海洋大数据应用技术国家工程实验室,计算机科学与工程学院,西北工业大学)

专题命中 幻觉与事实性 :alignment(abstract)

AI总结 UniVRSE通过统一的视觉条件响应语义熵框架,有效检测医学视觉语言模型中的幻觉,提升临床应用的可靠性。

Comments Under Review. 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 14 篇

2602.04739 2026-02-05 cs.CL cs.AI cs.HC 86%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 安全评测 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17442 2026-02-05 cs.AI cs.ET cs.LG 81%

Keeping Medical AI Healthy and Trustworthy: A Review of Detection and Correction Methods for System Degradation

保持医疗AI的健康与可信:对系统退化检测与纠正方法的综述

Hao Guan, David Bates, Li Zhou

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了医疗AI系统退化检测与纠正方法,探讨了性能退化原因、检测技术、根本原因分析及纠正策略,旨在提升医疗AI的可靠性和安全性。

Comments 16 pages, 5 figures

Journal ref IEEE Transactions on Biomedical Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04735 2026-02-05 cs.LG cs.AI cs.CL cs.CY cs.IR 70%

From Data to Behavior: Predicting Unintended Model Behaviors Before Training

从数据到行为:在训练前预测未预料的模型行为

Mengru Wang, Zhenqian Xu, Junfeng Fang, Yunzhi Yao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出MDF方法,通过数据均值表示预测模型预训练阶段的潜在偏见和安全风险,实现高效检测。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏