arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

共收录 9400 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9400 篇

2106.08258 2021-06-16 cs.CY 74%

Identifying Roles, Requirements and Responsibilities in Trustworthy AI Systems

Iain Barclay, Will Abramson

专题命中 安全评测 :trustworthy(title);分类 cs.CY

Comments Pre-print of paper submitted to Workshop on Reviewable and Auditable Pervasive Systems (WRAPS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.08359 2021-03-16 cs.LG 74%

Explaining Credit Risk Scoring through Feature Contribution Alignment with Expert Risk Analysts

Ayoub El Qadi, Natalia Diaz-Rodriguez, Maria Trocan, Thomas Frossard

专题命中 安全评测 :alignment(title);分类 cs.LG

Comments 11 pages, 4, figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2006.01284 2020-07-02 cs.LG stat.ML 74%

Independent Component Analysis for Trustworthy Cyberspace during High Impact Events: An Application to Covid-19

Zois Boukouvalas, Christine Mallinson, Evan Crothers, Nathalie Japkowicz, Aritran Piplai, Sudip Mittal, Anupam Joshi, Tülay Adalı

专题命中 安全评测 :trustworthy(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1912.03618 2020-06-09 cs.LG cs.RO stat.ML 74%

Efficient Black-box Assessment of Autonomous Vehicle Safety

Justin Norden, Matthew O'Kelly, Aman Sinha

专题命中 安全评测 :safety(title);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1905.05895 2019-05-16 cs.LG cs.CV stat.ML 74%

Addressing the Loss-Metric Mismatch with Adaptive Loss Alignment

Chen Huang, Shuangfei Zhai, Walter Talbott, Miguel Angel Bautista, Shih-Yu Sun, Carlos Guestrin, Josh Susskind

专题命中 安全评测 :alignment(title);分类 cs.LG

Comments Accepted to ICML 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1812.02471 2018-12-07 cs.AI 74%

The Role of Normware in Trustworthy and Explainable AI

Giovanni Sileno, Alexander Boer, Tom van Engers

专题命中 安全评测 :trustworthy(title);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
1401.1123 2014-01-07 cs.LG 74%

Exploration vs Exploitation vs Safety: Risk-averse Multi-Armed Bandits

Nicolas Galichet, Michèle Sebag, Olivier Teytaud

专题命中 安全评测 :safety(title);分类 cs.LG

Comments 16 pages

Journal ref Asian Conference on Machine Learning 2013, Canberra : Australia (2013)

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20379 2026-08-20 cs.AI cs.CL 版本更新 73%

Train the Model, Not the Reader: Decodability Supervision for Verifiable Activation Explanations

训练模型,而非读者:可验证激活解释的可解码性监督

Hiskias Dingeto

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI

AI总结 研究自然语言自动编码器对隐藏激活解释评分的问题,提出RECAP等方法,能使指定内容可解码,提高解释忠实度与安全性,如在预训练模型上实现可靠探测解码,提升对真实声明评分及识别谎言能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16894 2026-08-19 cs.CY cs.CL 新提交 73%

An Investigation of the NeurIPS and ICML 2025 Position Tracks

NeurIPS与ICML 2025立场论文 track 的调查

Fan Yang, Wenkai Li, Jun Liu

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL、cs.CY

AI总结 本文审计了NeurIPS和ICML 2025立场论文 track 的公开投稿,发现其以改革派批判为主,建议增设方向设定类工作,并提出四项CFP层面干预措施以优化投稿结构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16539 2026-08-18 cs.SD cs.AI cs.CL eess.AS 新提交 73%

Listen, Reason, and Segment: Aligning LALMs with Editorial Judgment for Media Chapterization

听、推理与分段:使大型音频语言模型(LALMs)与编辑判断对齐以实现媒体章节化

Tony Alex, Wish Suharitdamrong, Sara Atito, Armin Mustafa, Muhammad Awais, Philip J. B. Jackson, Jiankang Deng, Ismail Elezi

机构 * University of Surrey(萨里大学)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究针对LALMs在实际媒体章节化部署的不足,提出基于GRPO与CoT的AudioChaps框架,构建三类数据集,使AudioChaps-R1的平均F1较SOTA提升49个百分点,实现非结构化听觉流到结构化媒体的可靠转换。

Comments 19 pages, 9 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14577 2026-08-18 cs.CL cs.AI 新提交 73%

HarmProfile: Characterizing Harmful Distributions in Frontier LLMs

HarmProfile:刻画前沿大语言模型中的有害分布

Zhouyuan Ma, Yutao Wu, Hanxun Huang, Xiang Zheng, Xiao Liu, Yixin Cao, Zuxuan Wu, Xingjun Ma, Yu-Gang Jiang

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出HarmProfile基准数据集,收集23个前沿LLMs的超8万条有害输出,发现其有害性与多样性随模型能力增长,潜藏对齐表面下的危险知识。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08296 2026-08-17 cs.AI cs.LG 版本更新 73%

Revisiting the shutdown problem

重新审视关机问题

David Thorstad

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文重新评估了AI关机问题的难度,指出现有论证未能证明其难以解决,且相关技术方案对模型性能造成了高安全代价。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10300 2026-08-13 cs.AI cs.CR cs.LG 版本更新 73%

Logit-Boundary Geometric Belief Interfaces and Sparse Sheaf-Enclave Protocols: A Self-Contained Substrate for Secure Network Electronic Health Record (EHR) Interoperability

Logit边界几何置信接口与稀疏层束 enclaves 协议:安全网络电子健康记录(EHR)互操作性的自包含底层架构

Alvin Spivey, Yu Huang

机构 * Light Imaging Technologies, Inc.(光成像技术公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出Logit边界几何置信接口与稀疏层束 enclaves 协议,构建EHR互操作的自包含底层架构,经GBI BoundaryBench v0.1评估,Qwen3-4B-Instruct-2507在该接口下无符合要求的输出,为接受边界提供实证证据。

Comments 39 pages; executable Julia verification code included as ancillary material; companion public benchmark: https://github.com/AlvinSpivey/GBI-BoundaryBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.23146 2026-08-12 cs.LG cs.AI 版本更新 73%

Infra-Bayesian Reinforcement Learning Agents Outperform Classical RL For Worst-Case Robustness

Infra-Bayesian 强化学习智能体在最坏情况鲁棒性上优于经典强化学习

Manish Aryal, Faiyaz Azam, Agnivo Banerjee, Syed Mahir Ahamed, Sai Sidhanth Manoharan Jayanthi, Allegra Laro, Clément Legentilhomme, Andrew Lin, Florian Lorkowski, Marina Pérez del Valle, Radman Rakhshandehroo, Patric Rommel, Emanuel Ruzak, Nathan Theng, Paul Yushin Rapoport

机构 * Purdue University(普渡大学) Carnegie Mellon University(卡内基梅隆大学) WorldQuant University(WorldQuant大学) UC Berkeley(加州大学伯克利分校) Aix-Marseille University(阿维尼翁-马赛大学) MIT(麻省理工学院) University of Zurich(苏黎世大学) University of British Columbia(不列颠哥伦比亚大学) University of Stuttgart(斯图加特大学) University of Buenos Aires(布宜诺斯艾利斯大学) California State University, Fresno(弗雷斯诺加州州立大学) University of Chicago(芝加哥大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG

AI总结 针对经典强化学习在模型误设和策略依赖不确定性下的失败,提出 Infra-Bayesian 框架,通过区分概率不确定性和 Knightian 不确定性并采用最坏情况决策,在有限状态无状态决策问题中实现更低的最坏情况遗憾。

Comments RLC 2026: Accepted to Finding the Frame Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10015 2026-08-11 cs.AI cs.CE cs.CL cs.MM 版本更新 73%

FinTrace: Holistic Trajectory-Level Evaluation of LLM Tool Calling for Long-Horizon Financial Tasks

FinTrace: LLM工具调用在长周期金融任务中的轨迹级综合评估

Yupeng Cao, Haohang Li, Weijin Liu, Wenbo Cao, Anke Xu, Lingfei Qian, Xueqing Peng, Minxue Tang, Zhiyuan Yao, Jimin Huang, K. P. Subbalakshmi, Zining Zhu, Jordan W. Suchow, Yangyang Yu

机构 * Stevens Institute of Technology(斯蒂文斯理工学院) Independent Researcher(独立研究者) The FinAI(FinAI) Duke University(杜克大学)

专题命中 安全评测 :DPO(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 本文提出FinTrace基准,通过800个专家标注的轨迹评估LLM工具调用,揭示模型在信息利用和最终答案质量上的不足,并通过FinTrace-Training数据集提升中间推理能力,但最终答案质量仍受限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06105 2026-08-07 cs.LG cs.AI cs.MA 新提交 73%

Does Latent Context Help? A Controlled Evaluation of Inverse Reinforcement Learning in Arctic Shipping

潜在上下文是否有帮助?北极航运中逆强化学习的受控评估

Vaishnav Vaidheeswaran, Dilith Jayakody, Biruk Ambaw, Jaswanth Kumar, Md Mahbub Alam, Gabriel Spadon

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本研究通过对北极航运航次的受控评估,发现非线性共享奖励模型优于线性基线,添加船舶特定潜在上下文反而降低性能,表明可观测特征已能解释行为差异,为安全关键领域的AI部署提供支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06020 2026-08-07 cs.AI cs.LG 新提交 73%

From Economic Agents to Agentic Economies: A Systems Blueprint for Economic World Models

从经济智能体到智能体经济:经济世界模型的系统蓝图

Jiale Han, Xiang Li, Jing Qian, Wenyuan Gu, Pin Gao, Ye Luo, Hongyuan Zha, Dacheng Tao, Benyou Wang, Lin William Cong

机构 * Shenzhen Loop Area Institute(深圳河套学院) School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院) University of Hong Kong(香港大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出经济世界模型(EWM)的六级能力阶梯实施蓝图,旨在加速可作为人类决策沙箱与AI智能体基础的下一代高保真经济模拟环境开发。

Comments Project page: https://github.com/FreedomIntelligence/Awesome-Economic-World-Models

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05439 2026-08-07 cs.AI cs.LG 新提交 73%

SCP-NL2TL: Selective Conformal Prediction with Semantic Verification for Natural Language to Temporal Logic Specifications

SCP-NL2TL:用于自然语言到时间逻辑规范的带语义验证的选择性共形预测

Yixuan Wang, Licheng Luo, Yu Fu, Kaidi Xu, Yue Dong, Mingyu Cai

机构 * University of California, Riverside(加州大学河滨分校) City University of Hong Kong(香港城市大学)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出SCP-NL2TL框架,结合选择性共形预测与语义验证,可生成自然语言到时间逻辑的规范并判断其可靠性,在三类逻辑上提升了翻译可靠性与鲁棒性,为可信自然语言接口提供了基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14538 2026-08-07 cs.AI cs.LG 版本更新 73%

Symbol Grounding in Neuro-Symbolic AI: A Gentle Introduction to Reasoning Shortcuts

神经符号AI中的符号接地:推理快捷方式的入门介绍

Emanuele Marconato, Samuele Bortolotti, Emile van Krieken, Paolo Morettin, Elena Umili, Antonio Vergari, Efthymia Tsamoura, Andrea Passerini, Stefano Teso

机构 * University of Trento(特伦托大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) Sapienza University of Rome(罗马大学) University of Edinburgh(爱丁堡大学) Huawei Labs(华为实验室)

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 本文探讨神经符号AI中推理快捷方式的问题,分析其成因与影响,并提供解决方法与策略,以提升模型的可靠性和可信度。

Comments Published on JAIR (Integration of Logical Constraints in Deep Learning special track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.25073 2026-08-06 cs.CR cs.AI cs.LG 73%

Security in the Fine-Tuning Lifecycle of Large Language Models: Threats, Defenses,Evaluation, and Future Directions

大型语言模型微调生命周期中的安全:威胁、防御、评估与未来方向

Wenjuan Li, Yitao Liu, Runze Chen, Rajkumar Buyya

机构 * Hangzhou Normal University(杭州师范大学) Zhejiang University(浙江大学) China Mobile (Zhejiang) Innovation Research Institute Co., Ltd.(中国移动(浙江)创新研究院有限公司) Quantum Cloud Computing and Distributed Systems (qCLOUDS) Lab, School of Computing and Information Systems(量子云计算与分布式系统(qCLOUDS)实验室,计算与信息学院) The University of Melbourne(墨尔本大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文系统综述了大型语言模型微调过程中的安全威胁与防御,提出了基于生命周期的三阶段框架,并通过统一实验评估了攻击与防御的有效性及跨阶段局限性。

Comments 39 pages, 7 figures, 22 tables

Journal ref Software: Practice and Experience, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.20697 2026-08-05 cs.LG cs.CL 版本更新 73%

Token Buncher: Shielding LLMs from Harmful Reinforcement Learning Fine-Tuning

Token Buncher: 保护大语言模型免受有害强化学习微调的威胁

Weitao Feng, Lixu Wang, Peizhuo Lv, Tianyi Wei, Jie Zhang, Chongyang Gao, Sinong Zhan, Wei Dong

机构 * Nanyang Technological University(南洋理工大学) Centre for Frontier AI Research, A*STAR(前沿人工智能研究中心,A*STAR) Northwestern University(西北大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.LG

AI总结 本文提出TokenBuncher,通过限制模型响应熵来防御基于强化学习的有害微调,实验显示其能有效抑制有害行为同时保持正常任务性能。

Comments Accepted by ACM CCS 26

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.22167 2026-08-05 cs.LG cs.AI 版本更新 73%

Estimating Tail Risks in Language Model Output Distributions

语言模型输出分布中的尾部风险估计

Rico Angell, Raghav Singhal, Zachary Horvitz, Zhou Yu, Rajesh Ranganath, Kathleen McKeown, He He

机构 * Columbia University(哥伦比亚大学) Department of Computer Science, New York University(纽约大学计算机科学系) Center for Data Science, New York University(纽约大学数据科学中心)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。

Comments Accepted to ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11834 2026-08-05 cs.LG cs.CL 版本更新 73%

Don't Walk the Line: Boundary Guidance for Filtered Generation

不要走线:边界引导用于过滤生成

Sarah Ball, Andreas Haupt

机构 * Munich Center for Machine Learning (MCML)(慕尼黑机器学习中心) Stanford University, Department of Computer Science, Stanford, California, USA(斯坦福大学计算机科学系)

专题命中 安全评测 :safety(abstract);jailbreak(abstract);分类 cs.CL、cs.LG

AI总结 本文提出边界引导方法,通过强化学习微调生成模型,使其远离分类器边缘,从而提升生成输出的安全性和实用性。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16451 2026-08-04 cs.CL cs.CV cs.LG physics.ao-ph 73%

SynopticBench: Evaluating Vision-Language Models on Generating Weather Forecast Discussions of the Future

SynopticBench:在生成未来天气预报讨论上评估视觉-语言模型

Timothy B. Higgins, Antonios Mamalakis, Chirag Agarwal

机构 * Department of Environmental Sciences(环境科学系) School of Data Science(数据科学学院)

专题命中 安全评测 :alignment(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 本文提出SynopticBench数据集和SPACE评估框架,用于评估视觉-语言模型在生成天气现象描述中的性能,揭示现有评估指标的局限性。

Comments Accepted for presentation at Climate Informatics 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25485 2026-07-29 cs.AI cs.CL 新提交 73%

PatientAgentBench: A Benchmark Framework for Evaluating Patient-Facing Health AI Agents

PatientAgentBench:一个用于评估面向患者的健康人工智能代理的基准框架

Korosh Vatanparvar, Ashutosh Joshi, Maria Xenochristou, Mohammad Abuzar Hashemi, Prasad Kasu, Deepak Bansal, Daniel Lopez-Martinez, Anchal Nema, Ramya Ganesan, Will Kimbrough, Alex Woody, Yadunandana Rao, Dilek Hakkani-Tur, Wilko Schulz-Mahlendorf

机构 * Amazon Health AI(亚马逊健康人工智能)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究面向患者的健康人工智能代理评估问题,核心方法是用PatientAgentBench框架,通过语言模型评审团在多维度评估,主要贡献是发现模型临床差距,发布可重复、经临床医生验证的评估标准助领域弥补差距。

Comments Code: https://github.com/amazon-science/PatientAgentBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24769 2026-07-29 cs.AI cs.CL 新提交 73%

LLM Scheming Inversely Scales with Pretraining Language Coverage

大语言模型的策略规划与预训练语言覆盖范围成反比

Nathan Truong, Aryan Panda, Rayming Ye, Zoe Sun, Maheep Chaudhary

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 研究前沿模型中策略规划与预训练语言覆盖范围的关系,应用Petri框架评估Qwen3-30B-A3B,发现策略规划得分与预训练语言覆盖范围成反比,低资源语言得分更高,且该影响在不同策略行为中不均一。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10643 2026-07-29 stat.ML cs.AI cs.LG 版本更新 73%

TaylorPODA: A Taylor Expansion-Based Method to Improve Post-Hoc Attributions for Opaque Models

TaylorPODA:一种基于泰勒展开的方法,用于改进不透明模型的事后归因

Yuchi Tang, Iñaki Esnaola, George Panoutsos

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 研究针对不透明模型事后归因方法缺乏普遍标准的问题,提出基于泰勒展开框架的TaylorPODA方法,通过引入假设、分析矛盾、设计可控分配机制等,使其既满足假设又适应下游目标,提升了归因与用户定义效用的对齐及解释的可交流性。

Comments 21 pages, 4 figures. Submitted to TMLR. Re-upload with amended manuscript

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22797 2026-07-28 cs.LG cs.AI 新提交 73%

Physically Verifiable Evidence and LLM-Based Reporting for Bearing Fault Diagnosis

基于物理可验证证据和大语言模型的轴承故障诊断报告

Yuntong Chen, Jianyu Liu, Guobin Zhao, Ziang Wang, Chao Chen, Ju Huang, Xitian Tian, Lijiang Huang

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 针对安全关键型机械系统中AI诊断的验证问题,提出诊断证据网络DENet,将输出扩展为结构化证据记录,包括分类、预测特征频率等,能检测误分类,还通过约束语言模型减少无根据声明率,提升诊断可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13792 2026-07-24 cs.AI cs.CL 版本更新 73%

StackingNet: Collective Inference Across Independent AI Foundation Models

StackingNet:跨独立AI基础模型的集体推理

Siyang Li, Chenhao Liu, Dongrui Wu, Zhigang Zeng, Lieyun Ding

专题命中 安全评测 :alignment(abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19011 2026-07-22 cs.CL cs.AI cs.MM 新提交 73%

Computational Humor with Multimodal LLMs: Methods, Datasets, Evaluation, and Challenges

基于多模态语言模型的计算幽默:方法、数据集、评估及挑战

Tuo Liang, Zhe Hu, Disheng Liu, Jing Li, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.AI

AI总结 本研究聚焦于单图像和多面板作品中的视觉幽默理解,通过与先前综述对比,按能力层次组织文献,综合基准设计等内容,追溯领域转变,指出进展的主要障碍包括易出现捷径的评估、文化覆盖有限等问题。

详情

展开后加载摘要…

URL PDF HTML 收藏