arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9346 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9346 篇

1506.04089 2015-12-18 cs.CL cs.AI cs.LG cs.NE cs.RO 67%

Listen, Attend, and Walk: Neural Mapping of Navigational Instructions to Action Sequences

Hongyuan Mei, Mohit Bansal, Matthew R. Walter

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

Comments To appear at AAAI 2016 (and an extended version of a NIPS 2015 Multimodal Machine Learning workshop paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03910 2026-08-05 cs.AI cs.LG cs.MA 新提交 66%

Socially Grounded Agentic AI: Coordinating Plural Perspectives through Social Theory

基于社会基础的智能体人工智能:通过社会理论协调多元视角

Matt Ratto, Abhishek Moturu, Daniel Silver

专题命中 安全评测 :alignment(abstract,comments);分类 cs.AI、cs.LG

AI总结 本文提出将社会理论用于人工智能系统设计,以解决多元对齐问题,将多元对齐重新定位为基于社会基础的协调问题,勾勒了相关系统的设计空间并指明未来研究方向。

Comments Pluralistic Alignment Workshop @ ICML 2026, Seoul, South Korea

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24259 2026-06-24 cs.CL cs.AI 新提交 66%

SURGELLM: Rethinking Multi-Task Evaluation through Task-Aware Feature Gating with Class-Balanced Normalization

SURGELLM: 通过任务感知特征门控与类别平衡归一化重新思考多任务评估

Noor Islam S. Mohammad, Ulug Bayazit

机构 * Istanbul Technical University(伊斯坦布尔理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI;trustworthy(comments)

AI总结 针对异构NLP任务中归纳偏置不匹配、类别不平衡和缺乏外部词汇知识的问题,提出统一Transformer框架SURGELLM,包含手术特征门控、任务条件前缀令牌和实例加权归一化,在四个任务上平均F1提升0.036。

Comments Proceedings of the 6th Workshop on Trustworthy NLP (TrustNLP 2026), ACL 2026, San Diego, California, USA. Available at https://openreview.net/forum?id=WJCalficPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20668 2026-06-23 cs.CR cs.AI cs.LG 新提交 66%

BELLS-O: Evaluating the Operational Trade-offs of LLM Supervision Systems

BELLS-O:评估LLM监督系统的运营权衡

Leonhard Waibl, Felix Michalak, Hadrien Mariaccia

机构 * University of Graz, Graz, Austria(格拉茨大学) Supervised Program for Alignment Research (SPAR)(对齐研究监督计划 (SPAR)) Centre pour la Sécurité de l'IA (CeSIA), Paris, France(人工智能安全研究中心 (CeSIA),巴黎,法国)

专题命中 安全评测 :jailbreak(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

AI总结 提出首个独立运营基准BELLS-O,评估28个LLM监督系统在检测率、误报率、延迟和成本上的权衡,发现专用护栏在内容审核中占优,而前沿通用模型在越狱检测中表现更好但成本更高。

Comments Accepted at the ICML 2026 Workshop on Trustworthy AI for Good (AI4GOOD). 2 figures; main text plus appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.13776 2026-06-10 cs.CY cs.CL cs.CR cs.CV 版本更新 66%

Who Gets Flagged? The Pluralistic Evaluation Gap in AI Content Watermarking

谁被标记?AI内容水印中的多元评估差距

Alexander Nemecek, Osama Zafar, Yuqiao Xu, Wenbiao Li, Erman Ayday

机构 * Case Western Reserve University(凯斯西储大学)

专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.CY

AI总结 本文揭示AI内容水印在不同语言、文化和群体间存在系统性偏差,提出跨语言检测一致性、文化多样性覆盖和检测指标人口统计分解三个评估维度,主张水印部署前必须进行公平性审计。

Comments 7 pages. Accepted at the Multimodal Alignment for a Pluralistic Society (MAPS) Workshop, CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20508 2026-06-03 cs.MA cs.AI cs.CL 66%

Measuring Weak-to-Strong Legibility of Reasoning Models

衡量推理模型的弱到强可读性

Dani Roytburg, Shreya Sridhar, Daphne Ippolito

机构 * University of California, Berkeley(加州大学伯克利分校) Stanford University(斯坦福大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(comments)

AI总结 针对推理语言模型在多智能体场景中生成的中间思维链,提出“弱到强可读性”概念,并设计衡量指标以评估强模型输出对弱模型的易理解性。

Comments Accepted to Trustworthy AI4GOOD Workshop @ ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04069 2026-03-05 cs.CL cs.AI 66%

Monitoring Emergent Reward Hacking During Generation via Internal Activations

通过内部激活监控生成过程中的涌现奖励黑客行为

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technical University of Berlin(柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(journal_ref)

AI总结 通过分析内部激活来监控生成过程中的奖励黑客行为,提升微调语言模型的安全性。

Journal ref ICLR2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.00656 2025-12-02 cs.CL cs.CY 66%

Sycophancy Claims about Language Models: The Missing Human-in-the-Loop

语言模型中的趋炎附势主张:缺失的人工智能循环

Jan Batzner, Volker Stocker, Stefan Schmid, Gjergji Kasneci

机构 * Weizenbaum Institute(韦岑鲍姆研究所) Technical University Berlin(柏林技术大学) Technical University Munich(慕尼黑技术大学)

专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.CY

AI总结 本文探讨了大型语言模型中趋炎附势现象的测量挑战,提出五个核心操作化定义,并指出当前研究缺乏对人类感知的评估,为未来研究提供建议。

Comments NeurIPS 2025 Workshop on LLM Evaluation and ICLR 2025 Workshop on Bi-Directional Human-AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14166 2025-11-19 cs.CL cs.AI 66%

Selective Weak-to-Strong Generalization

Hao Lang, Fei Huang, Yongbin Li

专题命中 安全评测 :alignment(abstract,comments);分类 cs.CL、cs.AI

Comments AAAI2025 Special Track on AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11739 2025-01-23 cs.AI cs.CY 66%

Episodic memory in AI agents poses risks that should be studied and mitigated

Chad DeChant

专题命中 安全评测 :trustworthy(abstract,comments);分类 cs.AI、cs.CY

Comments Accepted for publication at the 2025 Secure and Trustworthy Machine Learning Conference (SaTML). The final version will be available on IEEE Xplore

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.03566 2023-11-08 cs.LG cs.CL cs.HC 66%

Measuring Adversarial Datasets

Yuanchen Bai, Raoyi Huang, Vijay Viswanathan, Tzu-Sheng Kuo, Tongshuang Wu

专题命中 安全评测 :safety(abstract,comments);分类 cs.CL、cs.LG

Comments ART of Safety workshop (AACL 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.05207 2023-04-12 cs.LG cs.AI 66%

CGXplain: Rule-Based Deep Neural Network Explanations Using Dual Linear Programs

Konstantin Hemker, Zohreh Shams, Mateja Jamnik

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG;trustworthy(comments)

Comments Accepted at ICLR 2023 Workshop on Trustworthy Machine Learning for Healthcare

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.14983 2023-02-15 cs.LG cs.CY cs.HC 66%

A Validity Perspective on Evaluating the Justified Use of Data-driven Decision-making Algorithms

Amanda Coston, Anna Kawakami, Haiyi Zhu, Ken Holstein, Hoda Heidari

专题命中 安全评测 :alignment(abstract);分类 cs.CY、cs.LG;trustworthy(comments)

Comments in IEEE Conference on Secure and Trustworthy Machine Learning (SaTML) 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.10345 2023-01-11 cs.SE cs.AI cs.LG cs.SY eess.SY 66%

Quantifying Assurance in Learning-enabled Systems

Erfan Asaadi, Ewen Denney, Ganesh Pai

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.LG

Comments Author's pre-print version of manuscript accepted for publication in the Proceedings of the 39th International Conference in Computer Safety, Reliability, and Security (SAFECOMP 2020)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.15436 2022-11-29 cs.CV cs.AI cs.LG 66%

Context-Adaptive Deep Neural Networks via Bridge-Mode Connectivity

Nathan Drenkow, Alvin Tan, Chace Ashcraft, Kiran Karra

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.LG

Comments Accepted to the NeurIPS 2022 ML Safety Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.11116 2022-06-23 cs.LG cs.AI 66%

StaDRe and StaDRo: Reliability and Robustness Estimation of ML-based Forecasting using Statistical Distance Measures

Mohammed Naveed Akram, Akshatha Ambekar, Ioannis Sorokos, Koorosh Aslansefat, Daniel Schneider

专题命中 安全评测 :safety(abstract,comments);分类 cs.AI、cs.LG

Comments This paper has been submitted for 5th International Workshop on Artificial Intelligence Safety Engineering (WAISE2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21074 2026-08-24 cs.CL cs.AI cs.HC cs.SE 新提交 62%

PromptResponse: Optimizing Prompts for LLM Coding Tasks

PromptResponse:优化大语言模型编码任务的提示词

Erik Thureck, Robert Kühnen, Tim Jacobowitz

机构 * Humboldt-Universität zu Berlin(柏林洪堡大学) HU Berlin(柏林洪堡大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出PromptResponse,通过对HumanEval数据集的5种变体让GPT-4o执行8200次编码任务,发现统一格式(尤其JSON)可提升代码效率与稳定性,LLM调优提示词会降低性能,还发布了相关数据集与评估流程。

Comments 22 pages, 7 figures, 10 listings

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20393 2026-08-24 cs.CL cs.AI 新提交 62%

Knowledge-Graph-Gated Defactualization for Style-Controllable and Fact-Preserving Generation in Agentic Conversational AI

面向智能体对话AI的风格可控且事实保留生成的知识图谱门控去事实化方法

Tanmay Kumar Shrivastava, Darsh Rohit Nandu, Rajesh Kumar Mundotiya

机构 * Indian Institute of Technology (IIT) Bhilai(印度比莱印度理工学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对智能体对话AI的事实保留与风格可控生成需求,提出DSR知识工程框架,结合KG与激活引导,在LLaMA系列模型上验证其可提升实体恢复率并保持风格控制,无需微调。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19216 2026-08-21 cs.AI cs.CY 新提交 62%

Bounded Sovereignty and the Control Tax: Pricing AI Oversight When the Deployer Does Not Own the Model

有限主权与控制成本:当部署方不拥有模型时的AI监管定价

Zhen Wen Lim

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文针对部署方不拥有模型的AI监管场景,提出有限主权概念与主权折扣成本,通过135万次模拟实验明确控制协议需明确访问假设的结论。

Comments 25 pages, 5 figures. Synthetic access-ablation study; not real-world payment-system evidence

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28969 2026-08-21 cs.CL cs.AI cs.HC 版本更新 62%

Beyond Recall: Behavioral Specification as an Interpretive Layer for AI Personalization

超越回忆:行为规范作为AI个性化的解释层

Aarik Gulaya

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 提出行为规范作为解释层,通过压缩用户数据为解释性模式,显著提升AI代理对用户意图的表示准确性,减少模型规避,并在解释型问题上优于原始语料和商业记忆系统。

Comments 142 pages, 4 figures. Code, data, judge prompts, and reproduction instructions: github.com/agulaya24/beyond-recall 8/19 Replacement: Pages updated to 142 from 134. Added Table of Contents. Updated table/graph formatting. Updated Section 8: Data, Code, and Reproducibility to include updated links, corrected author names

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19073 2026-08-20 cs.AI cs.LG stat.ML 新提交 62%

Robust Risk Under Evolving Uncertainty: A Wasserstein Counterpart of the Entropic Value-at-Risk

演化不确定性下的鲁棒风险:熵值风险(Entropic Value-at-Risk)的Wasserstein对应

Deep Kumar Ganguly, Jan Křetínský

机构 * Technical University of Munich(慕尼黑工业大学) Masaryk University(马萨里克大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对演化不确定性下的鲁棒风险问题,提出Wasserstein熵值风险,弥补熵值风险无法对冲名义模型认定不可能的灾难的缺陷,经数值验证其变分对偶性,并构造出随信念变化的闭式鲁棒动态规划算子。

Comments Best Paper Award at the 2nd Workshop on Safe AI at UAI (SafeAI@UAI 2026, non-archival), Amsterdam

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19029 2026-08-20 cs.AI cs.CL cs.MA 新提交 62%

Adaptive Memory and Reflection Multi-Agent System for Medical Question Answering

面向医学问答的自适应记忆与反思多智能体系统

Pradeep Murugesan, Luoxiao Yang, Xueli Chen, Xinqi Fan

机构 * School of Computing and Mathematics, Manchester Metropolitan University(曼彻斯特城市大学计算与数学学院) Electrical and Computer Engineering, Technion – Israel Institute of Technology(以色列理工学院电气与计算机工程系) School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科学与科技学院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 针对现有医学问答系统缺乏适应性等问题,提出自适应记忆与反思多智能体框架,经MedQA等数据集验证,结合专用记忆等模块可提升性能,助力开发可信医学智能体。

Comments Accepted by IEEE SMC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18095 2026-08-20 cs.CL cs.AI 新提交 62%

Backdoor Learning in Language Models and Vision-Language Models

语言模型与视觉-语言模型中的后门学习

Weimin Lyu

机构 * Stony Brook University(石溪大学) The Graduate School(研究生院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本论文针对NLP与VLMs面临的后门攻击安全威胁,研究了后门攻击的分析、检测与设计,并开发了适用于临床医学影像的多模态表示方法,助力可信AI与高效多模态学习。

Comments Ph.D. dissertation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17823 2026-08-20 cs.LG cs.AI cs.HC 版本更新 62%

MotoSafety: Edge-AI with Learned Temporal Importance for Two-Wheeler Collision Risk Assessment Under Time Pressure

MotoSafety:结合学习到的时间重要性的边缘AI,用于时间压力下两轮车碰撞风险评估

Sumit S. Shevtekar, Chandresh K. Maurya, Gourab Sil, Subasish Das

机构 * Indian Institute of Technology Indore(印度理工学院印多尔分校) Texas State University(德克萨斯州立大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文针对时间压力下两轮车碰撞风险评估问题,提出基于学习到的时间重要性的边缘AI架构MotoSafety,在多数据集验证下性能优于基线模型,适合低成本边缘部署,还具备跨领域迁移能力。

Comments 40 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17050 2026-08-20 cs.CL cs.AI 版本更新 62%

Cross-Model Memory Transfer via Target-Side Reader Adaptation

通过目标侧读取器适配实现跨模型记忆迁移

Mingyuan Li, Guangsheng Yu, Xu Wang, Shaoxiong Ji

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对大语言模型知识利用的两类方法缺陷,探究Engram式哈希记忆跨模型迁移的关键因素,通过跨模型冻结记忆提取实验,提出双层四分支读取器,实现同模型与跨模型复用差距的缩小,证明Engram可作为可复用外部知识人工制品。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06422 2026-08-20 cs.CL cs.AI cs.CV 版本更新 62%

When to Call an Apple Red: Humans Follow Introspective Rules, VLMs Don't

何时称苹果为红色:人类遵循内省规则,而视觉语言模型却不遵循

Jonathan Nemitz, Carsten Eickhoff, Junyi Jessy Li, Kyle Mahowald, Michal Golovanevsky, William Rudman

机构 * University of Tübingen(蒂宾根大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Brown University(布朗大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 研究探讨了视觉语言模型(VLMs)在何时会表现出意外行为,以及模型是否能可靠预测自身行为,发现VLMs系统性违反内省规则,而人类则遵循规则。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18062 2026-08-19 cs.CL cs.LG 新提交 62%

TokEval: A Tokenizer Evaluation Suite

TokEval:一个分词器评估套件

Clara Meister

机构 * EPFL(洛桑联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.LG

AI总结 本研究推出TokEval框架,通过信息论、结构敏感等指标评估分词器,经实验验证其可预测下游模型性能,助力更原则性的分词器评估。

Comments Published as a conference paper at COLM 2026; Library hosted at https://github.com/cimeister/tokenizer-intrinsic-evals

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17997 2026-08-19 cs.CY cs.AI 新提交 62%

Traceable Trust for action-ready artificial intelligence in bioscience

生物科学中可追溯信任的行动就绪人工智能

Huayu Xin, Yizhi Cai, Mukilan Deivarajan Suresh, Gavin Michael Farrell, Iwona Gajda, Charlie Harrison, Conor Houghton, Mato Lagator, Yang Lu, Virginia Portillo, Reyer Zwiggelaar, Sebastian Lobentanzer

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.CY

AI总结 针对生物科学领域AI输出指导实验室行动的关键节点,提出Traceable Trust框架,通过三个案例说明该框架可记录AI影响科学工作时的信任。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17605 2026-08-19 cs.CL cs.AI cs.SD 新提交 62%

Multi-turn Conversational AI from Text to Multimodal Interaction: Data, Models, Evaluation, and Open Challenges

多轮对话式AI:从文本到多模态交互——数据、模型、评估与开放挑战

Syeda Faiza Ahmed, Zien Sheikh Ali, Hunzalah Hassan Bhatti, Firoj Alam, Shammur Absar Chowdhury

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本研究综述多轮对话式AI的发展现状,梳理其在数据、模型等方面的进展,指出多模态交互能力提升但存在记忆等短板,并提出相关研究议程。

Comments Multi-turn Conversational AI; Multimodal Dialogue; AudioLLMs; Conversational Memory; Tool-Augmented Agents; Dialogue Evaluation

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16620 2026-08-19 cs.CL cs.AI 版本更新 62%

Palmyra x6 Technical Report: An Agentic, Tool-Use Model Post-Trained via Anchored Supervised Fine-Tuning

Palmyra x6技术报告:一种通过锚定监督微调进行后训练的具工具使用能力的智能体模型

Peng Du, Kiran Kamble, Rakshith Vasudev, Zhizhuo Yang, Rohith Nadimpally, Arjun Krishna, Waseem Alshikh, Daniel M. Bikel

机构 * Writer AI Research, Writer, Inc.(Writer AI研究院,Writer公司)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 Palmyra x6是一款针对企业级智能体任务优化的大语言模型,通过锚定监督微调后训练构建,在公开基准测试及偏见安全评估中表现优异。

Comments 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏