arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2025-12-23 至 2025-12-23 共收录 58 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 5 篇

2507.04453 2025-12-23 cs.LG 83%

ESSA: Evolutionary Strategies for Scalable Alignment

ESSA:可扩展对齐的进化策略

Daria Korotyshova, Boris Shaposhnikov, Alexey Malakhov, Alexey Khokhulin, Nikita Surnachev, Kirill Ovcharenko, George Bredis, Alexey Gorbatovski, Viacheslav Sinii, Daniil Gavrilov

机构 * T-Tech

专题命中 偏好对齐 :alignment(title,abstract);RLHF(abstract);分类 cs.LG

AI总结 ESSA通过进化策略实现大规模LLM对齐,无需梯度优化,提升模型准确率并减少计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19632 2025-12-23 cs.CV 71%

Generative diffusion models for agricultural AI: plant image generation, indoor-to-outdoor translation, and expert preference alignment

生成扩散模型在农业AI中的应用:植物图像生成、室内外转换以及专家偏好对齐

Da Tan, Michael Beck, Christopher P. Bidinosti, Robert H. Gulden, Christopher J. Henry

机构 * University of Manitoba(曼尼托巴大学) University of Winnipeg(温哥华大学)

专题命中 偏好对齐 :alignment(title)

AI总结 本文提出基于扩散模型的生成方法,通过合成植物图像、室内外转换和专家偏好对齐,提升农业AI的数据效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11712 2025-12-23 cs.AI 70%

Mitigating Hallucination Through Theory-Consistent Symmetric Multimodal Preference Optimization

通过理论一致的对称多模态偏好优化缓解幻觉

Wenqi Liu, Xuemeng Song, Jiaxi Li, Yinwei Wei, Na Zheng, Jianhua Yin, Liqiang Nie

机构 * Shandong University(山东大学) Southern University of Science and Technology(南方科技大学) University of Georgia(佐治亚大学) National University of Singapore(新加坡国立大学) Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI

AI总结 SymMPO通过理论一致的对称多模态偏好优化方法,有效缓解多模态大语言模型中的幻觉问题。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18014 2025-12-23 cs.CL cs.AI cs.LG 67%

ReGal: A First Look at PPO-based Legal AI for Judgment Prediction and Summarization in India

ReGal:基于PPO的法律AI在印度判决预测和摘要中的初步探索

Shubham Kumar Nigam, Tanuj Tyagi, Siddharth Shukla, Aditya Kumar Guru, Balaramamahanthi Deepak Patnaik, Danush Khanna, Noel Shallum, Kripabandhu Ghosh, Arnab Bhattacharya

专题命中 偏好对齐 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ReGal通过PPO结合多任务指令微调与强化学习,探索法律AI在印度判决预测和摘要中的应用,揭示了强化学习在法律文本中的挑战与潜力。

Comments Accepted in AILaw @ AAAI 2026 conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19479 2025-12-23 cs.CV 50%

Emotion-Director: Bridging Affective Shortcut in Emotion-Oriented Image Generation

情绪导演:在情绪导向图像生成中弥合情感捷径

Guoli Jia, Junyao Hu, Xinwei Long, Kai Tian, Kaiyan Zhang, KaiKai Zhao, Ning Ding, Bowen Zhou

机构 * Tsinghua University(清华大学) The Hong Kong Polytechnic University(香港理工大学) China Unicom(中国联合通信) Shanghai Artificial Intelligence Lab(上海人工智能实验室)

专题命中 偏好对齐 :DPO(abstract)

AI总结 Emotion-Director通过跨模态协作框架,结合MC-Diffusion和MC-Agent,提升情绪导向图像生成的准确性和表现力。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 7 篇

2512.18776 2025-12-23 cs.CY cs.HC 88%

"Even GPT Can Reject Me": Conceptualizing Abrupt Refusal Secondary Harm (ARSH) and Reimagining Psychological AI Safety with Compassionate Completion Standard (CCS)

即使GPT也可以拒绝我:概念化突然拒绝二次伤害(ARSH)并重新想象以同理心为核心的AI安全(CCS)

Yang Ni, Tong Yang

专题命中 安全训练 :safety(title,abstract);AI safety(title,abstract);分类 cs.CY

AI总结 本文提出ARSH概念,通过CCS设计框架减少AI拒绝带来的心理伤害,提升人机交互的心理安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17196 2025-12-23 cs.LG 83%

Shape it Up! Restoring LLM Safety during Finetuning

Shape it Up! 修复微调过程中LLM的安全性

ShengYun Peng, Pin-Yu Chen, Jianfeng Chi, Seongmin Lee, Duen Horng Chau

专题命中 安全训练 :safety(title,abstract);alignment(abstract);分类 cs.LG

AI总结 动态安全塑造(DSS)通过细粒度安全信号在微调过程中动态增强安全内容,有效缓解安全风险,提升模型安全性。

Comments NeurIPS'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19238 2025-12-23 cs.CL cs.AI cs.LG 78%

Identifying Features Associated with Bias Against 93 Stigmatized Groups in Language Models and Guardrail Model Safety Mitigation

识别与偏见相关的93个被污名化的群体特征及语言模型的安全防护措施

Anna-Maria Gueorguieva, Aylin Caliskan

专题命中 安全训练 :safety(title);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究探讨了语言模型对93个污名化群体的偏见来源,并测试了防护模型对减少偏见的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19361 2025-12-23 cs.LG 57%

Interpretable Hybrid Deep Q-Learning Framework for IoT-Based Food Spoilage Prediction with Synthetic Data Generation and Hardware Validation

可解释的混合深度Q学习框架用于基于物联网的食品变质预测:合成数据生成与硬件验证

Isshaan Singh, Divyansh Chawla, Anshu Garg, Shivin Mangal, Pallavi Gupta, Khushi Agarwal, Nimrat Singh Khalsa, Nandan Patel

机构 * School of Computer Science and Engineering(计算机科学与工程学院) Vellore Institute of Technology(韦洛雷理工学院)

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 本文提出一种结合LSTM和RNN的可解释混合深度Q学习框架,用于基于物联网的食品变质预测,通过合成数据生成和硬件验证提升预测准确性和决策效率,同时保持可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18669 2025-12-23 cs.AI 57%

IntelliCode: A Multi-Agent LLM Tutoring System with Centralized Learner Modeling

IntelliCode:一个具有集中式学习者建模的多智能体LLM辅导系统

Jones David, Shreya Ghosh

机构 * School of Computer Science and Engineering, VIT-AP University(计算机科学与工程学院,VIT-AP大学) School of Electrical and Computer Sciences, Indian Institute of Technology Bhubaneswar(电气与计算机科学学院,印度理工学院布巴内斯瓦尔学院)

专题命中 安全训练 :safety(abstract);分类 cs.AI

AI总结 IntelliCode通过集中式学习者建模和多智能体协作,实现透明且可靠的LLM辅导系统,提升学习效率和课程适应性。

Comments Submitted to EACL 2026 System Demonstrations Track. 6 pages (main content), 6 figures, includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12815 2025-12-23 cs.LG 57%

From Novelty to Imitation: Self-Distilled Rewards for Offline Reinforcement Learning

从新颖性到模仿:用于离线强化学习的自蒸馏奖励

Gaurav Chaudhary, Laxmidhar Behera

专题命中 安全训练 :alignment(abstract);分类 cs.LG

AI总结 ReLOAD通过自蒸馏生成内在奖励,解决离线强化学习中显式奖励标注的难题,实现稳健的策略学习并达到传统方法的性能水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18504 2025-12-23 cs.CV cs.AI 57%

GTMA: Dynamic Representation Optimization for OOD Vision-Language Models

GTMA:面向视觉-语言模型的动态表示优化

Jensen Zhang, Ningyuan Liu, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 安全训练 :alignment(abstract);分类 cs.AI

AI总结 GTMA通过动态表示优化提升视觉-语言模型在分布外任务中的性能,有效解决模态不对称问题,提升零样本和少样本准确率15-20%。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 8 篇

2506.12880 2025-12-23 cs.CR 85%

Universal Jailbreak Suffixes Are Strong Attention Hijackers

通用劫持后缀是强大的注意力劫持者

Matan Ben-Tov, Mor Geva, Mahmood Sharif

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract)

AI总结 本文研究了基于后缀的劫持攻击,发现通用后缀能更有效地劫持LLM的上下文化过程,并提出通过提升后缀普遍性来增强攻击效果,同时提供缓解方法。

Comments Accepted at TACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11185 2025-12-23 cs.CR cs.AI 83%

Bleeding Pathways: Vanishing Discriminability in LLM Hidden States Fuels Jailbreak Attacks

出血路径:LLM隐藏状态中的判别能力消失加剧了 jailbreak 攻击

Yingjie Zhang, Tong Liu, Zhe Zhao, Guozhu Meng, Kai Chen

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院) Ant Group(蚂蚁集团)

专题命中 越狱攻击 :jailbreak(title,abstract);safety(abstract);分类 cs.AI

AI总结 本研究提出DEEPALIGN框架,通过增强LLM隐藏状态的分离度,有效缓解jailbreak攻击,提升安全性和实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18755 2025-12-23 cs.AI 77%

MEEA: Mere Exposure Effect-Driven Confrontational Optimization for LLM Jailbreaking

MEEA: 基于mere exposure效应的对抗性优化用于LLM jailbreaking

Jianyi Zhang, Shizhao Liu, Ziyin Zhou, Zhen Li

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 MEEA通过基于mere exposure效应的对抗性优化,提升LLM jailbreaking的攻击成功率,揭示LLM安全行为的动态性和历史依赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02376 2025-12-23 cs.CL cs.AI cs.CR cs.LG 75%

AutoAdv: Automated Adversarial Prompting for Multi-Turn Jailbreaking of Large Language Models

AutoAdv:面向大语言模型多轮对抗性提示的自动化 jailbreaking

Aashray Reddy, Andrew Zagula, Nicholas Saban

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 越狱攻击 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 AutoAdv通过多轮自适应机制实现高成功率的对抗性提示攻击,揭示当前安全机制在多轮对话中的脆弱性。

Comments Presented at NeurIPS 2025 Lock-LLM Workshop. Code is available at https://github.com/AAN-AutoAdv/AutoAdv

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18244 2025-12-23 cs.CR cs.AI 70%

Breaking Minds, Breaking Systems: Jailbreaking Large Language Models via Human-like Psychological Manipulation

打破思维,打破系统:通过类人心理操纵进行大语言模型的劫持攻击

Zehao Liu, Xi Lin

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI

AI总结 本文提出类人心理操纵方法,通过操纵大语言模型的心理状态实现高成功率的劫持攻击,验证了心理安全机制的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13901 2025-12-23 cs.CL 70%

RAID: Refusal-Aware and Integrated Decoding for Jailbreaking LLMs

RAID:针对对抗解码的拒绝意识与集成解码用于对抗大型语言模型

Tuan T. Nguyen, John Le, Thai T. Vu, Willy Susilo, Heath Cooper

机构 * University of Wollongong(沃林根大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.CL

AI总结 RAID通过嵌入空间正则化和拒绝意识正则化器,有效提升对抗解码攻击的成功率,同时降低计算成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19171 2025-12-23 cs.CR 67%

Can LLMs Threaten Human Survival? Benchmarking Potential Existential Threats from LLMs via Prefix Completion

大语言模型是否威胁人类生存?通过前缀完成评估大语言模型潜在的灭绝性威胁

Yu Cui, Yifei Liu, Hang Fu, Sicheng Pan, Haibin Zhang, Cong Zuo, Licheng Wang

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract)

AI总结 本文提出 ExistBench 基准,通过前缀完成评估 LLMs 的潜在灭绝性威胁,发现 LLMs 生成内容包含危害人类生存的输出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18733 2025-12-23 cs.CR cs.AI cs.MA 57%

Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection

通过双层图异常检测实现LLM多智能体系统的可解释性与细粒度防护

Junjun Pan, Yixin Liu, Rui Miao, Kaize Ding, Yu Zheng, Quoc Viet Hung Nguyen, Alan Wee-Chung Liew, Shirui Pan

机构 * School of Information and Communication Technology, Griffith University, Australia(格里菲斯大学信息与通信技术学院) School of Artificial Intelligence, Jilin University, China(吉林大学人工智能学院) Department of Statistics and Data Science, Northwestern University, USA(西北大学统计与数据科学系)

专题命中 越狱攻击 :safety(abstract);分类 cs.AI

AI总结 本文提出XG-Guard框架,通过双层图异常检测实现对LLM多智能体系统中恶意智能体的可解释性与细粒度检测。

Comments 14 pages, 3 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 红队测试 1 篇

2507.21176 2025-12-23 cs.AI 57%

Toward Revealing Nuanced Biases in Medical LLMs

向揭示医疗大语言模型中的细微偏见迈进

Farzana Islam Adiba, Rahmatollah Beheshti

机构 * University of Delaware(特拉华大学)

专题命中 红队测试 :red teaming(abstract);分类 cs.AI

AI总结 本文提出结合知识图谱与辅助LLMs的框架,通过对抗性扰动和多跳表征技术,系统揭示医疗大语言模型中的复杂偏见模式。

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 幻觉与事实性 6 篇

2512.19004 2025-12-23 cs.CL cs.AI cs.LG 67%

Context-Aware Initialization for Reducing Generative Path Length in Diffusion Language Models

基于上下文的初始化以减少扩散语言模型中的生成路径长度

Tongyuan Miao, Gary Huang, Kai Jun Han, Annie Jiang

机构 * University of Michigan(密歇根大学)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出基于上下文的初始化方法,通过注入提示条件先验来减少扩散语言模型生成路径长度,提升解码效率并解决预热启动的准确性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19424 2025-12-23 cs.CL 57%

CodeSimpleQA: Scaling Factuality in Code Large Language Models

CodeSimpleQA: 在代码大语言模型中提升事实性

Jian Yang, Wei Zhang, Yizhi Li, Shawn Guo, Haowen Wang, Aishan Liu, Ge Zhang, Zili Wang, Zhoujun Li, Xianglong Liu, Weifeng Lv

机构 * Beihang University(北航大学) Manchester(曼彻斯特) M-A-P StepFun

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 CodeSimpleQA通过构建双语基准测试和后训练框架,提升代码大语言模型在编程知识事实准确性上的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15584 2025-12-23 cs.AI cs.GT 57%

A Decision-Theoretic Approach for Managing Misalignment

一种用于管理偏差的决策理论方法

Daniel A. Herrmann, Abinav Chari, Isabelle Qian, Sree Sharvesh, B. A. Levinstein

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) Georgia Institute of Technology(佐治亚理工学院) University of California, Berkeley(加州大学伯克利分校) Amrita Vishwa Vidyapeetham(阿米特拉维瓦大学) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.AI

AI总结 本文提出了一种决策理论框架,用于在不确定情况下评估人工智能代理的偏差是否足够,以决定是否委托决策。

Comments Second Conference of the International Association for Safe and Ethical Artificial Intelligence (IASEAI '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.17383 2025-12-23 cs.RO cs.LG 57%

Confidence Calibration in Vision-Language-Action Models

视觉-语言-动作模型中的置信度校准

Thomas P Zollo, Richard Zemel

机构 * Columbia University(哥伦比亚大学)

专题命中 幻觉与事实性 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出通过提示集合和动作-wise Platt缩放技术,改进视觉-语言-动作模型的置信度校准,以提升机器人行为的可靠性和性能。

Comments 38 pages, 19 figures; additional experiments with VLA variants

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.08971 2025-12-23 cs.CL 57%

Structured Language Generation Model: Loss Calibration and Formatted Decoding for Robust Structure Prediction and Knowledge Retrieval

结构语言生成模型:损失校准与格式解码以实现稳健的结构预测与知识检索

Minho Lee, Junghyun Min, Yerang Kim, Woochul Lee, Yeonsoo Lee

机构 * KT Gen AI Lab(KT生成人工智能实验室) Georgetown University(乔治城大学) Korea University(韩国大学) NC AI(NC人工智能)

专题命中 幻觉与事实性 :alignment(abstract);分类 cs.CL

AI总结 SLGM通过损失校准和格式解码提升结构预测和知识检索性能,无需额外参数或数据集特定工程。

Comments 20 pages, 4 figures. FrontierIR at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.18671 2025-12-23 cs.CV 50%

SmartSight: Mitigating Hallucination in Video-LLMs Without Compromising Video Understanding via Temporal Attention Collapse

SmartSight: 通过时间注意力崩溃缓解视频大语言模型中的幻觉而不影响视频理解

Yiming Sun, Mi Zhang, Feifei Li, Geng Hong, Min Yang

专题命中 幻觉与事实性 :safety(abstract)

AI总结 SmartSight通过时间注意力崩溃技术,在不牺牲视频理解能力的前提下,有效降低视频大语言模型的幻觉问题。

Comments AAAI26 accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 隐私与版权 1 篇

2512.18035 2025-12-23 cs.LG cs.CR 57%

Towards Benchmarking Privacy Vulnerabilities in Selective Forgetting with Large Language Models

面向大语言模型中选择性遗忘隐私漏洞的基准测试

Wei Qian, Chenxu Zhao, Yangyi Li, Mengdi Huai

专题命中 隐私与版权 :alignment(abstract);分类 cs.LG

AI总结 本文提出首个评估选择性遗忘隐私漏洞的基准,系统研究了反向学习技术的隐私漏洞,并为定制应用提供标准化工具。

详情

展开后加载摘要…

URL PDF HTML 收藏

7. 安全评测 15 篇

2505.14972 2025-12-23 cs.CL 88%

Multimodal Cultural Safety: Evaluation Framework and Alignment Strategies

多模态文化安全:评估框架与对齐策略

Haoyi Qiu, Kung-Hsiang Huang, Ruichen Zheng, Jiao Sun, Nanyun Peng

机构 * University of California, Los Angeles(加州大学洛杉矶分校) Salesforce AI Research(Salesforce人工智能研究) Google DeepMind(谷歌DeepMind)

专题命中 安全评测 :alignment(title,abstract);safety(title,abstract);分类 cs.CL

AI总结 本文提出CROSS基准和CROSS-Eval框架,评估多模态模型的文化安全能力,发现提升推理能力可改善文化对齐,但需结合监督微调和偏好微调策略以增强文化合规性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11361 2025-12-23 cs.CL 87%

VLDBench Evaluating Multimodal Disinformation with Regulatory Alignment

VLDBench:评估具有监管对齐的多模态虚假信息

Shaina Raza, Ashmal Vayani, Aditya Jain, Aravind Narayanan, Vahid Reza Khazaie, Syed Raza Bashir, Elham Dolatabadi, Gias Uddin, Christos Emmanouilidis, Rizwan Qureshi, Mubarak Shah

专题命中 安全评测 :alignment(title,abstract);safety(abstract);trustworthy(abstract);AI safety(abstract)

AI总结 VLDBench 是首个多模态虚假信息检测基准,通过大规模标注数据提升检测准确率,支持 AI 管治框架下的可信虚假信息分析。

Comments Accepted in Information Fusion Journal

详情

展开后加载摘要…

URL PDF HTML 收藏