arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-01-28 至 2026-01-28 共收录 56 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 偏好对齐 7 篇

2508.10530 2026-01-28 cs.AI cs.CL 84%

Is On-Policy Data always the Best Choice for Direct Preference Optimization-based LM Alignment?

基于直接偏好优化的LM对齐中,策略数据是否总是最佳选择?

Zetian Sun, Dongfang Li, Xuhui Chen, Baotian Hu, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 偏好对齐 :alignment(title,abstract);DPO(abstract);分类 cs.CL、cs.AI

AI总结 本文提出对齐阶段假设,通过理论和实证分析,揭示了静态与策略偏好数据在LM对齐中的效果差异,并提出算法识别对齐阶段边界。

Comments Accepted by ICLR-2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19063 2026-01-28 cs.CL cs.SD 77%

Optimizing Conversational Quality in Spoken Dialogue Systems with Reinforcement Learning from AI Feedback

通过AI反馈强化学习优化语音对话系统的对话质量

Siddhant Arora, Jinchuan Tian, Jiatong Shi, Hayato Futami, Yosuke Kashiwagi, Emiru Tsunoo, Shinji Watanabe

机构 * Carnegie Mellon University(卡内基梅隆大学) Sony Group Corporation(索尼集团)

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);DPO(abstract);分类 cs.CL

AI总结 本文提出多奖励RLAIF框架,通过结合语义、音频质量和情感一致性奖励,提升语音对话系统的对话质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14459 2026-01-28 cs.LG cs.AI 73%

Holdout-Loss-Based Data Selection for LLM Finetuning via In-Context Learning

基于Holdout损失的数据选择用于LLM微调的上下文学习

Ling Zhang, Xianliang Yang, Juwon Yu, Park Cheonyoung, Miran Lee, Lei Song, Jiang Bian

机构 * Microsoft Research Asia(微软亚洲研究院)

专题命中 偏好对齐 :alignment(abstract);DPO(abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于上下文近似(ICA)的方法,通过估计holdout损失来高效选择高价值训练数据,提升LLM微调的对齐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22338 2026-01-28 cs.CL cs.AI 73%

Text2Grad: Reinforcement Learning from Natural Language Feedback

Text2Grad:从自然语言反馈中强化学习

Hanyang Wang, Lu Wang, Chaoyun Zhang, Tianjun Mao, Si Qin, Qingwei Lin, Saravan Rajmohan, Dongmei Zhang

专题命中 偏好对齐 :alignment(abstract);RLHF(abstract);分类 cs.CL、cs.AI

AI总结 Text2Grad通过将自然语言反馈转化为跨度级梯度,提升语言模型的细粒度对齐和可解释性。

Comments The code for our method is available at https://github.com/microsoft/Text2Grad

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21044 2026-01-28 cs.LG cs.AI 62%

Reinforcement Learning Fine-Tuning Enhances Activation Intensity and Diversity in the Internal Circuitry of LLMs

强化学习微调增强大语言模型内部电路的激活强度和多样性

Honglin Zhang, Qianyue Hao, Fengli Xu, Yong Li

机构 * Department of Electronic Engineering, BNRist, Tsinghua University(电子工程系,BNRist,清华大学)

专题命中 偏好对齐 :DPO(abstract);分类 cs.AI、cs.LG

AI总结 强化学习微调增强了LLMs内部电路的激活强度和多样性,相较于偏好优化方法,其在数学泛化上的优势源于信息流的冗余与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10139 2026-01-28 cs.CL cs.AI 62%

Unsupervised Elicitation of Language Models

无监督的语言模型引导

Jiaxin Wen, Zachary Ankner, Arushi Somani, Peter Hase, Samuel Marks, Jacob Goldman-Wetzler, Linda Petrini, Henry Sleight, Collin Burns, He He, Shi Feng, Ethan Perez, Jan Leike

机构 * Anthropic Schmidt Sciences New York University(纽约大学) George Washington University(乔治华盛顿大学)

专题命中 偏好对齐 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出无监督算法ICM,通过模型自动生成标签来微调语言模型,无需外部监督,在多个任务中表现出色,尤其在超人类能力任务中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19856 2026-01-28 cs.RO 50%

Estimating Trust in Human-Robot Collaboration through Behavioral Indicators and Explainability

通过行为指标和可解释性估计人机协作中的信任

Giulio Campagna, Marta Lagomarsino, Marta Lorenzini, Dimitrios Chrysostomou, Matthias Rehm, Arash Ajoudani

机构 * Human-Robot Interaction Lab., Technical Faculty of IT and Design, Aalborg University, Denmark(人机交互实验室,信息技术与设计技术学院,阿alborg大学,丹麦) Human-Robot Interfaces and Interaction Lab., Istituto Italiano di Tecnologia (IIT), Italy(人机界面与交互实验室,意大利理工学院(IIT)) Smart Production Lab., Faculty of Engineering and Natural Sciences, Aalborg University, Denmark(智能生产实验室,工程与自然科学学院,阿alborg大学,丹麦)

专题命中 偏好对齐 :safety(abstract)

AI总结 本研究提出了一种数据驱动框架,通过行为指标和可解释性评估人机协作中的信任,实验表明机器学习模型在预测信任水平方面具有高准确率。

Journal ref IEEE Robotics and Automation Letters (Volume: 10, Issue: 10, October 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 安全训练 1 篇

2601.19231 2026-01-28 cs.CR 67%

LLMs Can Unlearn Refusal with Only 1,000 Benign Samples

LLMs 可通过仅 1000 个无害样本实现拒绝反学习

Yangyang Guo, Ziwei Xu, Si Liu, Zhiming Zheng, Mohan Kankanhalli

专题命中 安全训练 :alignment(abstract);safety(abstract)

AI总结 通过仅 1000 个无害样本,研究发现 LLMs 可通过反学习技术降低拒绝响应,揭示安全性对齐可能依赖 token 序列记忆而非推理。

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 越狱攻击 5 篇

2601.19487 2026-01-28 cs.LG cs.AI 88%

LLM-VA: Resolving the Jailbreak-Overrefusal Trade-off via Vector Alignment

LLM-VA: 通过向量对齐解决对抗性回应与过度拒绝的权衡

Haonan Zhang, Dongxia Wang, Yi Liu, Kexin Chen, Wenhai Wang

机构 * Zhejiang University(浙江大学) Griffith University(格里菲斯大学) Huzhou Institute of Industrial Control Technology(湖州工业控制技术研究院)

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 LLM-VA通过向量对齐解决大型语言模型在对抗性回应与过度拒绝间的权衡问题,提升安全性和效用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09201 2026-01-28 cs.CR cs.AI cs.CV 85%

Learning to Detect Unseen Jailbreak Attacks in Large Vision-Language Models

学习检测未见过的大型视觉-语言模型中的对抗攻击

Shuang Liang, Zhihao Xu, Jiaqi Weng, Jialing Tao, Hui Xue, Xiting Wang

专题命中 越狱攻击 :jailbreak(title,abstract);alignment(abstract);safety(abstract);分类 cs.AI

AI总结 LoD通过学习模型内部激活生成安全表示,实现对未见过的对抗攻击的高效检测,提升检测性能和效率。

Comments 12 pages; Previously this version appeared as arXiv:2510.15430 which was submitted as a new work by accident

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.07559 2026-01-28 cs.LG cs.AI 73%

Zer0-Jack: A Memory-efficient Gradient-based Jailbreaking Method for Black-box Multi-modal Large Language Models

Zer0-Jack: 一种内存高效的基于梯度的对抗方法用于黑盒多模态大语言模型

Tiejin Chen, Kaishen Wang, Hua Wei

机构 * Arizona State University(亚利桑那州立大学) University of Maryland(马里兰大学)

专题命中 越狱攻击 :safety(abstract);jailbreak(abstract);分类 cs.AI、cs.LG

AI总结 Zer0-Jack通过零阶优化实现高效黑盒对抗,显著降低内存使用并提升攻击成功率。

Comments Accepted to EACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19375 2026-01-28 cs.LG cs.AI 62%

Selective Steering: Norm-Preserving Control Through Discriminative Layer Selection

选择性引导:通过判别层选择实现的范数保持控制

Quy-Anh Dang, Chris Ngo

机构 * VNU University of Science(越南国家科学大学) Knovel Engineering Lab(Knovel工程实验室)

专题命中 越狱攻击 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 选择性引导通过判别层选择和范数保持旋转,实现对LLM行为的可控稳定修改。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19051 2026-01-28 cs.CR 50%

Proactive Hardening of LLM Defenses with HASTE

通过HASTE主动增强LLM防御

Henry Chen, Victor Aranda, Samarth Keshari, Ryan Heartfield, Nicole Nichols

专题命中 越狱攻击 :prompt injection(abstract)

AI总结 HASTE通过主动生成对抗样本提升LLM防御效果,有效降低基线检测器误报率并优化检测模型性能。

Comments Accepted at peer review NDSS 2026, Last-X workshop. Camera ready copy forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与事实性 1 篇

2601.19017 2026-01-28 cs.SD cs.LG 70%

A Framework for Evaluating Faithfulness in Explainable AI for Machine Anomalous Sound Detection Using Frequency-Band Perturbation

一种用于可解释人工智能在机器异常声音检测中评估忠实度的框架 使用频率带扰动

Alexander Buck, Georgina Cosma, Iain Phillips, Paul Conway, Patrick Baker

专题命中 幻觉与事实性 :alignment(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本文提出了一种评估XAI在机器异常声音检测中忠实度的框架,通过频率带扰动方法评估不同XAI技术的可靠性,发现遮挡方法在模型敏感性上表现最佳。

Comments 16 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏

5. 隐私与版权 2 篇

2601.19435 2026-01-28 cs.GT cs.AI cs.CL 62%

Ad Insertion in LLM-Generated Responses

在大语言模型生成响应中插入广告

Shengwei Xu, Zhaohua Chen, Xiaotie Deng, Zhiyi Huang, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) The University of Hong Kong(香港大学)

专题命中 隐私与版权 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了解耦广告插入与响应生成、以及竞价与用户查询的框架,通过基于类型拍卖机制实现近最优的社会福利,同时提高计算效率和上下文一致性。

Comments 31 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18834 2026-01-28 cs.CR cs.AI 57%

CanaryBench: Stress Testing Privacy Leakage in Cluster-Level Conversation Summaries

CanaryBench: 集群级对话摘要中的隐私泄露压力测试

Deep Mehta

机构 * Adobe Inc(Adobe公司)

专题命中 隐私与版权 :safety(abstract);分类 cs.AI

AI总结 CanaryBench通过生成包含秘密字符串的合成对话,测试集群级对话摘要中的隐私泄露风险,并提出最小防御措施以减少泄露。

Comments 13 pages, 4 figures. Code repository: https://github.com/researchaudio/canarybench

详情

展开后加载摘要…

URL PDF HTML 收藏

6. 安全评测 23 篇

2410.17520 2026-01-28 cs.LG cs.CL 84%

MobileSafetyBench: Evaluating Safety of Autonomous Agents in Mobile Device Control

MobileSafetyBench: 评估移动设备控制自主代理的安全性

Juyong Lee, Dongyoon Hahm, June Suk Choi, W. Bradley Knox, Kimin Lee

专题命中 安全评测 :safety(title,abstract);prompt injection(abstract);分类 cs.CL、cs.LG

AI总结 MobileSafetyBench通过Android模拟器评估移动设备控制自主代理的安全性,揭示基于LLMs的代理在安全任务中存在缺陷,提出提示方法提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19507 2026-01-28 cs.CL 79%

Automated Safety Benchmarking: A Multi-agent Pipeline for LVLMs

自动化安全基准测试:一种用于大型视觉语言模型的多代理流程

Xiangyang Zhu, Yuan Tian, Zicheng Zhang, Qi Jia, Chunyi Li, Renrui Zhang, Heng Li, Zongrui Wang, Wei Sun

机构 * Shanghai AI Lab(上海人工智能实验室) PolyU HK(PolyU香港分校) East China Normal University(东华大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.CL

AI总结 VLSafetyBencher通过多代理流程自动化构建高质量安全基准,有效区分不同模型的安全性,提升LVLMs的安全评估效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19540 2026-01-28 cs.HC 78%

"Do I Trust the AI?" Towards Trustworthy AI-Assisted Diagnosis: Understanding User Perception in LLM-Supported Reasoning

我是否信任AI?:迈向可信的AI辅助诊断:理解用户在LLM支持推理中的感知

Yuansong Xu, Yichao Zhu, Haokai Wang, Yuchen Wu, Yang Ouyang, Hanlu Li, Wenzhe Zhou, Xinyu Liu, Chang Jiang, Quan Li

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 本文研究医生对LLM临床推理能力的感知,通过实验揭示医生对LLM诊断能力的评估,并探讨提升医生与LLM协作可信度的方法。

Comments Proceedings of the 2026 CHI Conference on Human Factors in Computing Systems (CHI'26), April 13--17, 2026, Barcelona, Spain

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19134 2026-01-28 cs.CR cs.SE 78%

Evaluating Nova 2.0 Lite model under Amazon's Frontier Model Safety Framework

在亚马逊前沿模型安全框架下评估Nova 2.0 Lite模型

Satyapriya Krishna, Matteo Memelli, Tong Wang, Abhinav Mohanty, Claire O'Brien Rajkumar, Payal Motwani, Rahul Gupta, Spyros Matsoukas

专题命中 安全评测 :safety(title,abstract)

AI总结 本文在亚马逊前沿模型安全框架下评估了Nova 2.0 Lite模型,分析其在高风险领域的安全性和性能表现。

Comments Arxiv preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.17540 2026-01-28 cs.SE 78%

SGCR: A Specification-Grounded Framework for Trustworthy LLM Code Review

SGCR:一种基于规范的可信大语言模型代码审查框架

Kai Wang, Bingcheng Mao, Shuai Jia, Yujie Ding, Dongming Han, Tianyi Ma, Bin Cao

专题命中 安全评测 :trustworthy(title,abstract)

AI总结 SGCR通过规范引导LLMs实现可信代码审查,其双路径架构在工业环境中提升了42%的开发者采纳率。

Comments Accepted at ASE 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18850 2026-01-28 cs.SE 78%

Towards Safety-Compliant Transformer Architectures for Automotive Systems

面向汽车系统的安全合规Transformer架构

Sven Kirchner, Nils Purschke, Chengdong Wu, Alois Knoll

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种安全合规的Transformer架构,通过多模态基础模型提升汽车系统的容错性和鲁棒性,实现自动驾驶中的可认证AI系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.00600 2026-01-28 cs.CL cs.LG 73%

A Context-Aware Dual-Metric Framework for Confidence Estimation in Large Language Models

一种面向上下文的双指标框架用于大型语言模型中的置信度估计

Mingruo Yuan, Shuyi Zhang, Ben Kao

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.CL、cs.LG

AI总结 CRUX是一种面向上下文的双指标框架,通过上下文熵减少和统一一致性检验提升大型语言模型的置信度估计效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18983 2026-01-28 cs.DC 71%

Trustworthy Scheduling for Big Data Applications

大数据应用中的可信调度

Dimitrios Tomaras, Vana Kalogeraki, Dimitrios Gunopulos

专题命中 安全评测 :trustworthy(title)

AI总结 X-Sched通过整合反事实解释与机器学习模型,提供可操作的资源配置指导,提升容器化环境中的任务执行效率和透明度。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06832 2026-01-28 cs.AI 70%

Remote Sensing Image Intelligent Interpretation with the Language-Centered Perspective: Principles, Methods and Challenges

遥感图像智能解读的以语言为中心的视角:原理、方法与挑战

Haifeng Li, Wang Guo, Haiyang Wu, Mengwei Wu, Jipeng Zhang, Qing Zhu, Yu Liu, Xin Huang, Chao Tao

机构 * School of Geosciences and Info-Physics, Central South University(中南大学地球科学与信息物理学院) Faculty of Geosciences and Environmental Engineering, Southwest Jiaotong University(西南交通大学地质科学与环境工程学院) School of Earth and Space Sciences, Peking University(北京大学地球与空间科学学院) Institute of Remote Sensing Information Processing (IRSIP), Wuhan University(武汉大学遥感信息处理研究所)

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI

AI总结 本文提出以语言为中心的遥感图像解读框架,探讨LLMs作为认知核心的作用,并总结多模态表示、知识关联等核心挑战,为认知驱动的智能地理空间分析提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19337 2026-01-28 cs.AI cs.LG cs.SE 62%

SETA: Statistical Fault Attribution for Compound AI Systems

SETA:复合人工智能系统的统计故障归因

Sayak Chowdhury, Meenakshi D'Souza

机构 * International Institute of Information Technology Bangalore(国际信息科技学院班加罗尔)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 SETA提出了一种模块化鲁棒性测试框架,用于分析复合人工智能系统的故障归因,通过组件级分析和错误传播推理,实现细粒度的鲁棒性评估。

Comments Accepted to CAIN 2026 co-hosted with ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19818 2026-01-28 cs.LG cs.NA math.NA 57%

Learn and Verify: A Framework for Rigorous Verification of Physics-Informed Neural Networks

学习与验证:用于物理信息神经网络严格验证的框架

Kazuaki Tanaka, Kohei Yatabe

机构 * Global Center for Science and Engineering(全球科学与工程中心) Waseda University(早稻田大学) Faculty of Engineering(工学院) Tokyo University of Agriculture and Technology(东京农业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 该研究提出“学习与验证”框架,通过结合DSM损失和区间算术,为微分方程的解提供可计算的严格误差界,提升科学机器学习的可信度。

Comments 13 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19325 2026-01-28 cs.CV cs.AI 57%

Innovator-VL: A Multimodal Large Language Model for Scientific Discovery

Innovator-VL:一种用于科学发现的多模态大语言模型

Zichen Wen, Boxue Yang, Shuang Chen, Yaojie Zhang, Yuhang Han, Junlong Ke, Cong Wang, Yicheng Fu, Jiawang Zhao, Jiangchao Yao, Xi Fang, Zhen Wang, Henxing Cai, Lin Yao, Zhifeng Gao, Yanhui Hong, Nang Yuan, Yixuan Li, Guojiang Zhao, Haoyi Tao, Nan Wang, Han Lyu, Guolin Ke, Ning Liao, Xiaoxing Wang, Kai Chen, Zhiyu Li, Feiyu Xiong, Sihan Hu, Kun Chen, Yanfeng Wang, Weinan E, Linfeng Zhang, Linfeng Zhang

机构 * School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院) Institute of Theoretical Physics, Chinese Academy of Sciences(中国科学院理论物理研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 Innovator-VL通过高效数据选择和透明训练方法,在科学发现中实现高性能多模态模型。

Comments Innovator-VL tech report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19197 2026-01-28 cs.IR cs.AI 57%

HELM: A Human-Centered Evaluation Framework for LLM-Powered Recommender Systems

HELM:一种面向LLM推荐系统的以人为本的评估框架

Sushant Mehta

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 HELM框架通过五个以人为本的维度评估LLM推荐系统,揭示传统指标无法捕捉的关键质量维度,并展示GPT-4在解释质量与交互自然性上的优势及流行度偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19106 2026-01-28 cs.SE cs.AI 57%

Detecting and Correcting Hallucinations in LLM-Generated Code via Deterministic AST Analysis

通过确定性AST分析检测和纠正LLM生成的代码中的幻觉

Dipin Khati, Daniel Rodriguez-Cardenas, Paul Pantzer, Denys Poshyvanyk

机构 * William & Mary(威廉玛丽大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出通过确定性AST分析检测并纠正LLM生成代码中的知识冲突幻觉,实现高精度和召回率的自动修复。

Comments Accepted to FORGE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏