arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-03-05 至 2026-03-05 共收录 27 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 27 篇

2507.15796 2026-03-05 cs.AI 84%

From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0

从隐私到信任在代理时代:通过信任报告2.0的视角,对可信联邦学习中挑战的分类

Nuria Rodríguez-Barroso, Mario García-Márquez, M. Victoria Luzón, Francisco Herrera

机构 * Department of Computer Science and Artificial Intelligence, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(计算机科学与人工智能系,数据科学与计算智能安达卢西亚研究 institute,格拉纳达大学) Department of Software Engineering, Andalusian Research Institute in Data Science and Computational Intelligence (DaSCI) University of Granada(软件工程系,数据科学与计算智能安达卢西亚研究 institute,格拉纳达大学)

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract);分类 cs.AI

AI总结 本文通过信任报告2.0提出可信联邦学习的挑战分类,强调信任作为持续维持的操作条件,并引入协调蓝图以处理跨要求的权衡和治理对齐。

Comments Already published in Information Fusion

Journal ref Rodríguez-Barroso, et. al. (2026). From Privacy to Trust in the Agentic Era: A Taxonomy of Challenges in Trustworthy Federated Learning Through the Lens of Trust Report 2.0. Information Fusion, 104236

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17509 2026-03-05 cs.CL 83%

Annotation-Efficient Universal Honesty Alignment

标注高效通用诚实对齐

Shiyu Ni, Keping Bi, Jiafeng Guo, Minghao Tang, Jingtong Wu, Zengxin Han, Xueqi Cheng

机构 * State Key Laboratory of AI Safety(人工智能安全国家重点实验室) Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 安全评测 :alignment(title,abstract);trustworthy(abstract);分类 cs.CL

AI总结 EliCal通过两阶段框架实现高效标注的通用诚实对齐,仅需少量正确性标注即可达到接近最优的对齐效果。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03303 2026-03-05 cs.CL cs.AI 81%

HumanLM: Simulating Users with State Alignment Beats Response Imitation

HumanLM: 通过状态对齐模拟用户优于响应模仿

Shirley Wu, Evelyn Choi, Arpandeep Khatua, Zhanghan Wang, Joy He-Yueya, Tharindu Cyril Weerasooriya, Wei Wei, Diyi Yang, Jure Leskovec, James Zou

机构 * Stanford University(斯坦福大学) New York University(纽约大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.CL、cs.AI

AI总结 HumanLM通过状态对齐模拟用户,优于响应模仿,显著提升对齐分数和真实用户相似性。

Comments 27 pages, 17 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21782 2026-03-05 cs.AI 79%

Benchmarking MLLM-based Web Understanding: Reasoning, Robustness and Safety

基于MLLM的网页理解基准测试:推理、鲁棒性与安全性

Junliang Liu, Jingyu Xiao, Wenxin Tang, Zhixian Wang, Zipeng Xie, Wenxuan Wang, Minrui Zhang, Shuanghe Yu

机构 * Dalian Maritime University(大连海事大学) The Chinese University of Hong Kong(香港中文大学) Tsinghua University(清华大学) Nanyang Technological University(南洋理工大学) Xi'an Jiaotong University(西安交通大学) Renmin University of China(中国人民大学) Wuhan University(武汉大学)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 本文提出WebRRSBench基准测试,评估多模态大语言模型在网页理解中的推理、鲁棒性和安全性能力,揭示模型在复杂交互任务中的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.06743 2026-03-05 cs.RO cs.AI 79%

TPK: Trustworthy Trajectory Prediction Integrating Prior Knowledge For Interpretability and Kinematic Feasibility

TPK: 通过整合先验知识实现可解释性和运动学可行性轨迹预测

Marius Baden, Ahmed Abouelazm, Christian Hubschneider, Yin Wu, Daniel Slieter, J. Marius Zöllner

机构 * FZI Research Center for Information Technology(弗赖堡信息科技研究中心) Karlsruhe Institute of Technology(卡尔斯鲁厄理工学院) CARIAD SE

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI

AI总结 TPK通过整合车辆、行人和自行车的交互和运动学先验知识,提高轨迹预测的可解释性和物理可行性。

Comments First and Second authors contributed equally; Accepted in the 36th IEEE Intelligent Vehicles Symposium (IV 2025) for oral presentation; Winner of the best paper award

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03340 2026-03-05 cs.CY 79%

Trustworthy AI Posture (TAIP): A Framework for Continuous AI Assurance of Agentic Systems at Horizontal and Vertical scale

可信AI姿态(TAIP):一种用于在横向和纵向规模上持续确保代理系统AI可信度的框架

Guy Lupo, Bao Quoc Vo, Natania Locke

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.CY

AI总结 TAIP框架通过将可信度定义为持续生成的信号,提供了一种在横向和纵向尺度上持续确保代理系统AI可信度的方法,结合本体模型和证据门限基准,实现可重用的AI保证对象。

Comments 40 Pages, 13 Figures, 7 Tables,

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17204 2026-03-05 cs.LG cs.CE 79%

SpecBridge: Bridging Mass Spectrometry and Molecular Representations via Cross-Modal Alignment

SpecBridge: 通过跨模态对齐弥合质谱与分子表示

Yinkai Wang, Yan Zhou Chen, Xiaohui Chen, Li-Ping Liu, Soha Hassoun

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 SpecBridge通过跨模态对齐方法提升质谱数据中分子鉴定的准确性,利用冻结的基础模型实现高效检索。

Comments We have found a problem in the preprocessing/evaluation pipeline

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03978 2026-03-05 cs.RO cs.GR 78%

Map-Agnostic And Interactive Safety-Critical Scenario Generation via Multi-Objective Tree Search

基于多目标树搜索的无地图交互式安全关键场景生成

Wenyun Li, Zejian Deng, Chen Sun

机构 * Department of Mathematics, The University of Hong Kong (HKU)(香港大学数学系) Department of Data and Systems Engineering, HKU(香港大学数据与系统工程系)

专题命中 安全评测 :safety(title,abstract)

AI总结 本文提出一种基于多目标树搜索的无地图交互式安全关键场景生成方法,通过统一评估函数平衡探索与风险,生成真实且多样化的碰撞事件以提升自动驾驶系统的鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03811 2026-03-05 cs.SD cs.MM eess.AS 78%

Robust LLM-based Audio-Visual Speech Recognition with Sparse Modality Alignment and Visual Unit-Guided Refinement

鲁棒的基于大语言模型的音频视觉语音识别与稀疏模态对齐和视觉单元引导的细化

Fei Su, Cancan Li, Juan Liu, Wei Ju, Hongbin Suo, Ming Li

机构 * School of Computer Science, Wuhan University, China(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University, China(武汉大学人工智能学院) School of Artificial Intelligence, The Chinese University of Hong Kong, Shenzhen, China(香港中文大学(深圳)人工智能学院) AI Center, OPPO, China(OPPO人工智能中心) Digital Innovation Research Center, Duke Kunshan University, China(杜克大学昆山数字创新研究中心)

专题命中 安全评测 :alignment(title,abstract)

AI总结 本文提出AVUR-LLM,通过稀疏模态对齐和视觉单元引导细化,提升音频视觉语音识别的鲁棒性,在LRS3数据集上取得显著性能提升。

Comments submitted to Interspeech 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04142 2026-03-05 cs.LG 70%

A Multi-Agent Framework for Interpreting Multivariate Physiological Time Series

多智能体框架用于解释多变量生理时间序列

Davide Gabrielli, Paola Velardi, Stefano Faralli, Bardh Prenkaj

机构 * Sapienza University of Rome Rome Italy ISTC-CNR \& Sapienza University of Rome Rome Italy Technical University of Munich Munich Germany Sapienza University of Rome ISTC-CNR \& Sapienza University of Rome Technical University of Munich

专题命中 安全评测 :safety(abstract);trustworthy(abstract);分类 cs.LG

AI总结 本研究提出Vivaldi多智能体框架,通过对比不同模型表现,发现智能体系统在非思考模型中提升解释质量,但在思考模型中反而降低相关性,强调了计算外部化在医疗AI中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04123 2026-03-05 cs.CL 70%

FINEST: Improving LLM Responses to Sensitive Topics Through Fine-Grained Evaluation

FINEST: 通过细粒度评估改进LLM对敏感话题的响应

Juhyun Oh, Nayeon Lee, Chani Jung, Jiho Jin, Junho Myung, Jongwon Lee, Taeui Song, Alice Oh

专题命中 安全评测 :safety(abstract);harmlessness(abstract);分类 cs.CL

AI总结 FINEST通过细粒度评估分类法,改进LLM对敏感话题的响应,显著减少错误率并提升帮助性与安全性。

Comments Accepted to EACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04124 2026-03-05 cs.AI cond-mat.mtrl-sci cs.CL cs.LG 67%

BeamPERL: Parameter-Efficient RL with Verifiable Rewards Specializes Compact LLMs for Structured Beam Mechanics Reasoning

BeamPERL: 参数高效强化学习与可验证奖励用于结构梁力学推理

Tarjei Paule Hage, Markus J. Buehler

机构 * Department of Mechanical Engineering(机械工程系) Massachusetts Institute of Technology(麻省理工学院) Department of Civil and Environmental Engineering(土木与环境工程系) Schwarzman College of Computing(施瓦茨曼计算学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 BeamPERL通过参数高效强化学习与可验证奖励,提升紧凑语言模型在结构梁力学推理中的能力,发现精确奖励无法保证可转移的物理推理,需结合结构化推理支架以实现稳健科学推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03315 2026-03-05 cs.CL cs.AI cs.LG 67%

M-QUEST -- Meme Question-Understanding Evaluation on Semantics and Toxicity

M-QUEST -- 周期性问题理解评估在语义和毒性上

Stefano De Giorgis, Ting-Chih Chen, Filip Ilievski

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 M-QUEST提出一个语义框架和基准,用于自动提取迷因知识,评估模型在毒性理解上的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04069 2026-03-05 cs.CL cs.AI 66%

Monitoring Emergent Reward Hacking During Generation via Internal Activations

通过内部激活监控生成过程中的涌现奖励黑客行为

Patrick Wilhelm, Thorsten Wittkopp, Odej Kao

机构 * Technical University of Berlin(柏林技术大学) BIFOLD - Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究所)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI;trustworthy(journal_ref)

AI总结 通过分析内部激活来监控生成过程中的奖励黑客行为,提升微调语言模型的安全性。

Journal ref ICLR2026 Workshop: Principled Design for Trustworthy AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03911 2026-03-05 cs.AI cs.CL cs.CR 62%

From Threat Intelligence to Firewall Rules: Semantic Relations in Hybrid AI Agent and Expert System Architectures

从威胁情报到防火墙规则:混合AI代理和专家系统架构中的语义关系

Chiara Bonfanti, Davide Colaiacomo, Luca Cagliero, Cataldo Basile

机构 * Department of Control and Computer Engineering(控制与计算机工程系)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用语义关系从威胁情报中提取信息,通过神经符号方法生成防火墙规则以缓解网络威胁。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24178 2026-03-05 cs.CL cs.AI 62%

MuSaG: A Multimodal German Sarcasm Dataset with Full-Modal Annotations

MuSaG:一个包含完整模态标注的多模态德语讽刺数据集

Aaron Scott, Maike Züfle, Jan Niehues

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 MuSaG是一个包含多模态标注的德语讽刺数据集,通过对比人类标注与多种模型性能,揭示了多模态模型在现实场景中的改进需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25106 2026-03-05 cs.CL cs.AI cs.IR 62%

Towards Personalized Deep Research: Benchmarks and Evaluations

迈向个性化深度研究:基准与评估

Yuan Liang, Jiaxian Li, Yuqing Wang, Piaohong Wang, Motong Tian, Pai Liu, Shuofei Qiao, Runnan Fang, He Zhu, Ge Zhang, Minghao Liu, Yuchen Eleanor Jiang, Ningyu Zhang, Wangchunshu Zhou

机构 * OPPO Zhejiang University(浙江大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出PDR-Bench,首个用于评估深度研究代理个性化能力的基准,通过结合多样化任务与真实用户档案,评估个性化对齐、内容质量和事实可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16985 2026-03-05 cs.CV cs.AI cs.LG cs.RO 62%

Extremely Simple Multimodal Outlier Synthesis for Out-of-Distribution Detection and Segmentation

极简多模态异常合成用于分布外检测与分割

Moru Liu, Hao Dong, Jessica Kelly, Olga Fink, Mario Trapp

机构 * Technical University of Munich(慕尼黑技术大学) ETH Zürich(苏黎世联邦理工学院) Fraunhofer IKS(弗劳恩霍夫研究所) EPFL(苏黎世联邦理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文提出极简多模态异常合成方法Feature Mixing,通过理论支持提升OOD检测性能,实验表明其在多个数据集上达到最优效果,速度提升显著。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03330 2026-03-05 cs.CL cs.AI 62%

Certainty robustness: Evaluating LLM stability under self-challenging prompts

确定性鲁棒性:在自我挑战提示下评估LLM的稳定性

Mohammadreza Saadat, Steve Nemzer

机构 * TELUS Digital(TELUS数字公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出确定性鲁棒性基准,评估LLM在自我挑战提示下的稳定性与适应性平衡,揭示模型在交互压力下的可靠性差异。

Comments 20 pages, 7 tables Benchmark and evaluation study of large language models

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04325 2026-03-05 cs.CV cs.LG 57%

Scalable Evaluation of the Realism of Synthetic Environmental Augmentations in Images

可扩展性评估合成环境增强图像的真实性

Damian J. Ruck, Paul Vautravers, Oliver Chalkley, Jake Thomas

机构 * Advai Ltd(Advai有限公司)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种可扩展框架,用于评估合成环境增强图像的真实性,发现生成式AI在大多数条件下优于基于规则的方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04212 2026-03-05 cs.SE cs.CL 57%

Code Fingerprints: Disentangled Attribution of LLM-Generated Code

代码指纹:解耦的LLM生成代码归因

Jiaxun Guo, Ziyuan Yang, Mengyu Sun, Hui Wang, Jingfeng Lu, Yi Zhang

机构 * School of Cyber Science and Engineering, Sichuan University, Chengdu, China(四川大学计算机科学与工程学院)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出DCAN网络,通过解耦语义与风格信息,实现对LLM生成代码的多模型归因。

Comments 11 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03903 2026-03-05 cs.CV cs.LG 57%

From Misclassifications to Outliers: Joint Reliability Assessment in Classification

从误分类到异常值:分类中的联合可靠性评估

Yang Li, Youyang Sha, Yinzhi Wang, Timothy Hospedales, Xi Shen, Shell Xu Hu, Xuanlong Yu

机构 * Intellindust AI Lab(智联工业人工智能实验室) Samsung AI Center(三星人工智能中心)

专题命中 安全评测 :trustworthy(abstract);分类 cs.LG

AI总结 本文提出联合评估框架和双评分函数,提升分类器可靠性,适用于不同场景的稳健模型部署。

Comments 15 pages, 3 figures. The source code is publicly available at https://github.com/Intellindust-AI-Lab/SUREPlus

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03633 2026-03-05 cs.CR cs.AI 57%

Goal-Driven Risk Assessment for LLM-Powered Systems: A Healthcare Case Study

面向目标的风险评估用于LLM驱动系统:一个医疗案例研究

Neha Nagaraja, Hayretdin Bahsi

机构 * School of Informatics, Computing, and Cyber Systems(信息学、计算与网络系统学院) Northern Arizona University(北亚利桑那大学) Department of Software Science(软件科学系) Tallinn University of Technology(塔林技术大学)

专题命中 安全评测 :prompt injection(abstract);分类 cs.AI

AI总结 本文提出了一种面向目标的风险评估方法,用于评估LLM驱动系统的安全风险,通过攻击树详细分析威胁向量和攻击路径,以提升医疗系统等复杂系统的安全性。

Comments To appear in the HealthSec Workshop at the 2025 IEEE Annual Computer Security Applications Conference (ACSAC)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22730 2026-03-05 cs.CL 57%

Extending Czech Aspect-Based Sentiment Analysis with Opinion Terms: Dataset and LLM Benchmarks

扩展捷克基于方面的情感分析:数据集和大语言模型基准

Jakub Šmíd, Pavel Přibáň, Pavel Král

机构 * Department of Computer Science and Engineering(计算机科学与工程系) NTIS -- New Technologies for the Information Society(信息社会新技术)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种针对捷克语的ABSA数据集和翻译对齐方法,通过实验展示了其在低资源语言中的应用效果和改进。

Comments Accepted for the 15th edition of the Language Resources and Evaluation Conference (LREC 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13471 2026-03-05 cs.SE cs.AI 57%

An LLM Agentic Approach for Legal-Critical Software: A Case Study for Tax Prep Software

一种针对法律关键软件的LLM代理方法:以税务准备软件为例

Sina Gogani-Khiabani, Ashutosh Trivedi, Diptikalyan Saha, Saeid Tizpaz-Niari

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) University of Colorado Boulder(科罗拉多大学波德分校) IBM Research(IBM研究院)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出一种基于LLM的代理方法,用于开发法律关键软件,通过税务准备软件案例研究,展示了如何利用多代理系统和元测试技术提升法律规范到可执行代码的可靠性。

Comments To appear at ICSE 26. 12 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03640 2026-03-05 cs.RO 50%

MistyPilot: An Agentic Fast-Slow Thinking LLM Framework for Misty Social Robots

MistyPilot: 一种面向Misty社交机器人的代理快速-缓慢思考LLM框架

Xiao Wang, Lu Dong, Jingchen Sun, Ifeoma Nwogu, Srirangaraj Setlur, Venu Govindaraju

机构 * State University of New York at Buffalo(纽约州立大学布法罗分校)

专题命中 安全评测 :alignment(abstract)

AI总结 MistyPilot通过代理驱动的LLM框架,实现社交机器人中工具选择、协调及参数配置的高效执行,提升任务效率与情感一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05449 2026-03-05 cs.HC 50%

Bloom: Designing for LLM-Augmented Behavior Change Interactions

Bloom:为LLM增强的行为改变交互设计

Matthew Jörke, Defne Genç, Valentin Teutschbein, Shardul Sapkota, Sarah Chung, Paul Schmiedmayer, Maria Ines Campero, Abby C. King, Emma Brunskill, James A. Landay

专题命中 安全评测 :safety(abstract)

AI总结 Bloom通过整合LLM的健康教练聊天机器人,探索LLM在促进长期健康行为改变中的作用,发现其在心理层面的积极影响优于短期身体活动提升。

详情

展开后加载摘要…

URL PDF HTML 收藏