arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-25 至 2026-02-25 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2602.20813 2026-02-25 cs.AI 83%

Pressure Reveals Character: Behavioural Alignment Evaluation at Depth

压力揭示特性:深度下的行为对齐评估

Nora Petrova, John Burden

机构 * Prolific

专题命中 安全评测 :alignment(title,abstract);safety(abstract);分类 cs.AI

AI总结 本文提出一个深度行为对齐评估基准,通过多轮场景揭示模型行为倾向,发现多数模型在多个类别存在弱点,且对齐行为呈现统一构念特性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20628 2026-02-25 cs.AI 79%

When can we trust untrusted monitoring? A safety case sketch across collusion strategies

我们何时可以信任不可信的监控?跨合谋策略的安全案例草图

Nelson Gardner-Challis, Jonathan Bostock, Georgiy Kozhevnikov, Morgan Sinclaire, Joan Velja, Alessandro Abate, Charlie Griffin

机构 * LASR Labs(LASR实验室) University of Oxford(牛津大学) University of Wyoming(怀俄明大学) Imperial College London(伦敦帝国学院) UK AI Security Institute(英国人工智能安全研究所)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出了一种跨合谋策略的安全案例草图,探讨了不可信监控的安全性问题,分析了不同合谋策略的有效性,并指出了未解决的挑战。

Comments 66 pages, 14 figures, Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.11876 2026-02-25 cs.CL 79%

EAMET: Robust Massive Model Editing via Embedding Alignment Optimization

EAMET: 通过嵌入对齐优化实现鲁棒的大规模模型编辑

Yanbo Dai, Zhenlan Ji, Zongjie Li, Shuai Wang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL

AI总结 EAMET通过嵌入对齐优化提升大规模模型编辑的鲁棒性和效率,实现90%的编辑效果

Comments This paper was accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23434 2026-02-25 cs.LG 79%

Towards Trustworthy GUI Agents: A Survey

迈向可信的GUI代理:综述

Yucheng Shi, Wenhao Yu, Jingyuan Huang, Wenlin Yao, Wenhu Chen, Ninghao Liu

机构 * University of Georgia(佐治亚大学) Tencent AI Seattle Lab(腾讯AI西雅图实验室) Microsoft Research(微软研究院) University of Waterloo(滑铁卢大学) Hong Kong Polytechnic University(香港理工大学)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.LG

AI总结 本文综述了GUI代理的可信度挑战,提出信任分类法并分析了信任评估与安全可靠部署的开放问题。

Comments 14 pages, work in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01856 2026-02-25 eess.SY cs.SY 78%

Hierarchical Multi-Agent MCTS for Safety-Critical Coordination in Mixed-Autonomy Roundabouts

分层多智能体MCTS用于混合自主性环形路口的安全协调

Zhihao Lin, Jianglin Lan, Shuo Liu, Zhen Tian, Dezong Zhao, Chongfeng Wei

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出了一种分层多智能体MCTS框架,用于混合自主性环形路口的安全协调,通过车道特定不确定性模型和安全意识修剪,有效降低轨迹偏移和PET违规率。

Comments 13 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20976 2026-02-25 cs.CL cs.CY 73%

Evaluating Proactive Risk Awareness of Large Language Models

评估大型语言模型的前瞻性风险意识

Xuan Luo, Yubin Chen, Zhiyu Hou, Linpu Yu, Geng Tu, Jing Li, Ruifeng Xu

机构 * The Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Hong Kong Polytechnic University, Hong Kong(香港理工大学) Southern University of Science and Technology, Shenzhen(南方科技大学) Shenzhen Loop Area Institute, Shenzhen, China(深圳南山区研究院)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL、cs.CY

AI总结 本文提出前瞻性风险意识评估框架,通过Butterfly数据集评估LLMs在生态领域预见潜在危害的能力,发现响应长度限制和多模态保护盲点等问题,强调部署LLM时需加强主动防护。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20294 2026-02-25 cs.CL cs.AI cs.CY 67%

InterviewSim: A Scalable Framework for Interview-Grounded Personality Simulation

InterviewSim: 一种可扩展的基于面试的人格模拟框架

Yu Li, Pranav Narayanan Venkit, Yada Pruksachatkun, Chien-Sheng Wu

机构 * Salesforce Research(Salesforce 研究)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 InterviewSim提出了一种基于真实面试数据的多维评估框架,通过系统比较证明基于真实访谈数据的方法在人格模拟中表现更优,并揭示了不同方法在人格风格与事实一致性方面的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20379 2026-02-25 cs.CL cs.AI 62%

Case-Aware LLM-as-a-Judge Evaluation for Enterprise-Scale RAG Systems

面向企业级RAG系统的案例感知LLM-as-a-Judge评估

Mukul Chhabra, Luigi Medrano, Arush Verma

机构 * Dell Technologies(戴尔技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出面向企业级RAG系统的案例感知LLM-as-a-Judge评估框架,通过八个操作指标评估多轮工作流,揭示企业关键权衡,提升系统诊断清晰度和可操作性。

Comments 12 pages including appendix, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20170 2026-02-25 cs.CY cs.AI 62%

CAGE: A Framework for Culturally Adaptive Red-Teaming Benchmark Generation

CAGE:一种用于文化适应性红队基准生成的框架

Chaeyun Kim, YongTaek Lim, Kihyun Kim, Junghwan Kim, Minwoo Kim

机构 * Seoul National University(首尔国立大学) AI Safety Team, DATUMO INC(DATUMO公司人工智能安全团队)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 CAGE框架通过文化适应性生成方法,系统地调整红队提示以适应不同文化背景,从而生成更有效的安全评估基准。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20162 2026-02-25 cs.CL cs.AI 62%

Talking to Yourself: Defying Forgetting in Large Language Models

与自己对话:在大型语言模型中克服遗忘

Yutao Sun, Mingshuai Chen, Tiancheng Zhao, Phillip Miao, Zilun Zhang, Haozhan Shen, Ruizhe Zhu, Jianwei Yin

机构 * Zhejiang University(浙江大学) Binjiang Institute of Zhejiang University(浙江大学滨江学院) Om AI Research(奥姆人工智能研究) Stanford University(斯坦福大学) ETH Zürich(苏黎世联邦理工学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出SA-SFT方法,通过让LLM生成自我对话来缓解微调过程中的灾难性遗忘,提升领域性能并优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20867 2026-02-25 cs.CR cs.AI cs.CE cs.ET 57%

SoK: Agentic Skills -- Beyond Tool Use in LLM Agents

SoK: 代理技能——超越LLM代理中的工具使用

Yanna Jiang, Delong Li, Haiyu Deng, Baihe Ma, Xu Wang, Qin Wang, Guangsheng Yu

机构 * University of Technology Sydney(悉尼科技大学) CSIRO Data61(CSIRO数据61)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文探讨了代理技能在LLM代理中的应用,分析了技能的生命周期管理、分类方法及其安全影响,并提出了未来研究挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20759 2026-02-25 cs.CL 57%

Overton Pluralistic Reinforcement Learning for Large Language Models

奥顿多元强化学习用于大语言模型

Yu Fu, Seongho Son, Ilija Bogunovic

机构 * University College London(伦敦大学学院) University of Basel(巴塞尔大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出OP-GRPO框架,通过强化学习使大语言模型生成多样化响应,提升人类视角覆盖和视角独特性,实验证明其在自然语言推理任务中的优越性能。

Comments 28 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20513 2026-02-25 cs.CL 57%

From Performance to Purpose: A Sociotechnical Taxonomy for Evaluating Large Language Model Utility

从性能到目的:一种用于评估大语言模型效用的社技术分类

Gavin Levinson, Keith Feldman

机构 * University of Michigan(密歇根大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出LUX框架,用于评估大语言模型在不同应用场景中的效用,涵盖性能、交互、运营和治理四个领域,并提供动态工具支持框架探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07525 2026-02-25 cs.CV cs.AI 57%

EHWGesture -- A dataset for multimodal understanding of clinical gestures

EHWGesture -- 一个用于多模态理解临床手势的数据集

Gianluca Amprimo, Alberto Ancilotto, Alessandro Savino, Fabio Quazzolo, Claudia Ferraris, Gabriella Olmo, Elisabetta Farella, Stefano Di Carlo

机构 * Department of Control and Computer Engineering, Politecnico di Torino(控制与计算机工程系,都灵理工大学) Fondazione Bruno Kessler(布鲁诺·凯斯勒基金会) CNR-IEIIT(意大利国家研究委员会-IEIIT)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 EHWGesture是一个包含五个临床相关手势的多模态视频数据集,用于提升临床手势理解的多模态分析能力。

Comments Accepted at ICCV 2025 Workshop on AI-driven Skilled Activity Understanding, Assessment & Feedback Generation

Journal ref 2025 IEEE/CVF International Conference on Computer Vision Workshops (ICCVW)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.01080 2026-02-25 cs.LG cs.PF 57%

Development and Comparative Evaluation of Three Artificial Intelligence Models (NLP, LLM, JEPA) for Predicting Triage in Emergency Departments: A 7-Month Retrospective Proof-of-Concept

三种人工智能模型(NLP、LLM、JEPA)在急诊科分诊中的开发与比较评估:一项7个月的回顾性概念验证

Edouard Lansiaux, Ramy Azzouz, Emmanuel Chazard, Amélie Vromant, Eric Wiel

机构 * Department of Emergency Lille University Hospital(里尔大学医院急诊科) Centre Antipoison, Lille University Hospital(里尔大学医院毒物中心) Department of Public Health, EA 2694 & ULR 2694-METRICS(公共卫生部门,EA 2694及ULR 2694-METRICS) Lille University(里尔大学) Emergency Department Hôpital Pitié-Salpêtrière, AP-HP(皮蒂埃-萨尔佩特里耶医院急诊科,AP-HP)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本研究评估了三种AI模型在急诊科分诊中的表现,发现基于LLM的URGENTIAPARSE在准确性和预测住院需求方面表现最佳,为提升急诊科患者安全和效率提供了新的方向。

Comments 13 pages, 7 figures, 3 tables

Journal ref 2025:2:1-10 BDCAT '25: Proceedings of the IEEE/ACM 12th International Conference on Big Data Computing, Applications and Technologies

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21035 2026-02-25 cs.CV cs.MM 50%

Not Just What's There: Enabling CLIP to Comprehend Negated Visual Descriptions Without Fine-tuning

不只是存在与否:无需微调即可使CLIP理解否定性视觉描述

Junhao Xiao, Zhiyu Wu, Hao Lin, Yi Chen, Yahui Liu, Xiaoran Zhao, Zixu Wang, Zejiang He

专题命中 安全评测 :alignment(abstract)

AI总结 CLIPGlasses通过双阶段设计提升CLIP对否定性视觉描述的理解能力,无需微调,增强跨领域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20873 2026-02-25 cs.CV 50%

MUSE: Harnessing Precise and Diverse Semantics for Few-Shot Whole Slide Image Classification

MUSE: 通过精确和多样的语义提升少样本全滑片图像分类

Jiahao Xu, Sheng Huang, Xin Zhang, Zhixiong Nan, Jiajun Dong, Nankun Mu

机构 * School of Big Data & Software Engineering, Chongqing University(大数据与软件工程学院,重庆大学) School of Computer Science & Technology, Chongqing University(计算机科学与技术学院,重庆大学)

专题命中 安全评测 :alignment(abstract)

AI总结 MUSE通过样本层面的细粒度语义增强和随机多视图生成,提升少样本全滑片图像分类的性能和鲁棒性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10720 2026-02-25 cs.CV 50%

Ecological mapping with geospatial foundation models

基于地理空间基础模型的生态制图

Craig Mahlasi, Gciniwe S. Baloyi, Zaheed Gaffoor, Levente Klein, Anne Jones, Etienne Vos, Michal Muszynski, Geoffrey Dawson, Campbell Watson

机构 * IBM Research(IBM研究) IBM Sustainability Software(IBM可持续性软件)

专题命中 安全评测 :alignment(abstract)

AI总结 本研究通过微调Prithvi-EO-2.0和TerraMind模型,在生态制图任务中展示了优于ResNet基线的性能,强调了数据对齐和高分辨率输入的重要性。

Comments Revised abstract

详情

展开后加载摘要…

URL PDF HTML 收藏