arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-04 至 2026-02-04 共收录 17 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 17 篇

2501.18533 2026-02-04 cs.CV cs.CL cs.CR 83%

Rethinking Bottlenecks in Safety Fine-Tuning of Vision Language Models

重新审视视觉语言模型安全微调中的瓶颈

Yi Ding, Lijun Li, Bing Cao, Jing Shao

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Purdue University(普渡大学) Tianjin University(天津大学)

专题命中 安全评测 :safety(title,abstract);harmlessness(abstract);分类 cs.CL

AI总结 本文提出多图像安全数据集,通过增强视觉推理能力,提升模型在安全关键任务中的性能与通用能力。

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03263 2026-02-04 cs.AI 83%

CSR-Bench: A Benchmark for Evaluating the Cross-modal Safety and Reliability of MLLMs

CSR-Bench: 一种评估多模态大语言模型跨模态安全性和可靠性的基准

Yuxuan Liu, Yuntian Shi, Kun Wang, Haoting Shen, Kun Yang

机构 * Zhejiang University(浙江大学) Fudan University(复旦大学) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.AI

AI总结 CSR-Bench通过四个压力测试模式评估多模态大语言模型的跨模态安全性和可靠性,发现模型在多模态输入下表现下降,且安全提升可能源于拒绝导向的启发式方法。

Comments 25 pages, 1 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02629 2026-02-04 cs.CR cs.AI cs.LG 81%

Trustworthy Blockchain-based Federated Learning for Electronic Health Records: Securing Participant Identity with Decentralized Identifiers and Verifiable Credentials

基于区块链的可信联邦学习用于电子健康记录:利用去中心化标识符和可验证凭证保障参与者身份

Rodrigo Tertulino, Ricardo Almeida, Laercio Alencar

机构 * Federal Institute of Education, Science, and Technology of Rio Grande do Norte (IFRN)(里约格兰德北教育科学和技术联邦学院)

专题命中 安全评测 :trustworthy(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于区块链的可信联邦学习框架,利用去中心化标识符和可验证凭证保障医疗数据安全,有效抵御Sybil攻击,提升模型预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03255 2026-02-04 cs.AI 79%

LPS-Bench: Benchmarking Safety Awareness of Computer-Use Agents in Long-Horizon Planning under Benign and Adversarial Scenarios

LPS-Bench: 在长周期规划中评估计算机使用代理的安全意识基准测试

Tianyu Chen, Chujia Hu, Ge Gao, Dongrui Liu, Xia Hu, Wenjie Wang

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 LPS-Bench通过评估长周期规划中计算机使用代理的安全意识,揭示现有系统在安全行为维持方面的不足,并提出缓解策略以提升安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03100 2026-02-04 cs.AI 79%

Risky-Bench: Probing Agentic Safety Risks under Real-World Deployment

Risky-Bench: 探索现实部署中智能体安全风险

Jingnan Zheng, Yanzhen Luo, Jingjun Xu, Bingnan Liu, Yuxin Chen, Chenhang Cui, Gelei Deng, Chaochao Lu, Xiang Wang, An Zhang, Tat-Seng Chua

机构 * National University of Singapore(国立新加坡大学) University of Science and Technology of China(中国科学技术大学) Southern University of Science and Technology(南方科技大学) University of Electronic Science and Technology of China(电子科技大学) Nanyang Technological University(南洋理工大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);分类 cs.AI

AI总结 Risky-Bench通过基于现实部署的安全原则,系统评估智能体在复杂任务中的安全风险,适用于多种部署场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15090 2026-02-04 cs.LG cs.GT econ.TH 79%

Emergent Alignment via Competition

通过竞争实现涌现对齐

Natalie Collina, Surbhi Goel, Aaron Roth, Emily Ryu, Mirah Shi

机构 * Department of Computer and Information Sciences, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Department of Computer Science, Cornell University(计算机科学系,康奈尔大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.LG

AI总结 通过竞争实现AI与人类价值观的对齐,证明在特定条件下战略竞争可产生与完全对齐模型相当的结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20658 2026-02-04 cond-mat.mtrl-sci cs.LG 74%

Trustworthy AI-based crack-tip segmentation using domain-guided explanations

基于领域引导解释的可信AI裂缝尖端分割

Jesco Talies, Eric Breitbarth, David Melching

机构 * Institute for Frontier Materials on Earth and in Space, German Aerospace Center (DLR)(地球和空间前沿材料研究所,德国航空航天中心(DLR))

专题命中 安全评测 :trustworthy(title);分类 cs.LG

AI总结 本文提出一种结合可解释AI和领域先验知识的注意力引导训练框架,用于提升裂缝尖端分割任务的模型泛化能力和解释可信度。

Comments This is the Accepted Manuscript version of an article accepted for publication in Machine Learning: Science and Technology. IOP Publishing Ltd is not responsible for any errors or omissions in this version of the manuscript or any version derived from it. The Version of Record is available online at https://doi.org/10.1088/2632-2153/ae3660

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02862 2026-02-04 cs.AI cs.LG 73%

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

STEER: 通过受约束的质量多样性搜索实现推理时间的风险控制

Eric Yang, Jong Ha Lee, Jonathan Amar, Elissa Ye, Yugang Jia

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.AI、cs.LG

AI总结 STEER通过受约束的质量多样性搜索实现推理时间的风险控制,提供可调节的决策保守性调整,提升临床分诊等场景下的行为覆盖和准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03704 2026-02-04 cs.CL cs.AI 62%

Cognitively Diverse Multiple-Choice Question Generation: A Hybrid Multi-Agent Framework with Large Language Models

具有大语言模型的混合多智能体框架的认知多样性多项选择题生成

Yu Tian, Linh Huynh, Katerina Christhilf, Shubham Chakraborty, Micah Watanabe, Tracy Arner, Danielle McNamara

机构 * Arizona State University(亚利桑那州立大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 ReQUESTA通过混合多智能体框架生成认知多样化的多项选择题,提升生成的题目难度、区分度和语义一致性。

Comments This manuscript is under review at Electronics

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02932 2026-02-04 cs.CL cs.AI 62%

Equal Access, Unequal Interaction: A Counterfactual Audit of LLM Fairness

平等接入,不平等互动:对大语言模型公平性的反事实审计

Alireza Amiri-Margavi, Arshia Gharagozlou, Amin Gholami Davodi, Seyed Pouyan Mousavi Davoudi, Hamidreza Hasani Balyani

机构 * Computational Modeling and Simulation University of Pittsburgh(计算建模与仿真大学匹兹堡大学) Mathematics & Statistics Department University of Minnesota Duluth(数学与统计学系明尼苏达大学 Duluth分校) Independent Researcher in AI and Statistics(人工智能与统计学独立研究者) Hardware Technology Organization(硬件技术组织)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI

AI总结 本文通过反事实提示设计,评估了GPT-4和LLaMA在不同人口身份下的互动质量差异,发现即使接入平等,模型在互动质量上仍存在系统性差异。

Comments 13 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02781 2026-02-04 cs.CR cs.AI cs.LG 62%

Evaluating False Alarm and Missing Attacks in CAN IDS

评估CAN入侵检测系统中的误报和遗漏攻击

Nirab Hossain, Pablo Moriano

机构 * Department of Applied Mathematics University of Colorado Boulder(应用数学系科罗拉多大学波德摩尔分校)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.LG

AI总结 本文通过评估CAN IDS在对抗性攻击下的性能,揭示了其在误报和遗漏攻击方面的脆弱性,强调了对抗鲁棒性在安全关键汽车系统中的重要性。

Comments 8 pages, 2 figures, and 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19120 2026-02-04 cs.IR cs.AI cs.LG 62%

RobustExplain: Evaluating Robustness of LLM-Based Explanation Agents for Recommendation

RobustExplain: 评估基于LLM的推荐解释代理的鲁棒性

Guilin Zhang, Kai Zhao, Jeffrey Friedman, Xu Chu

机构 * Workday

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI、cs.LG

AI总结 RobustExplain提出首个评估框架,用于衡量LLM生成推荐解释的鲁棒性,揭示当前模型鲁棒性较低,较大模型稳定性更高。

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00642 2026-02-04 cs.CL 57%

LegalOne: A Family of Foundation Models for Reliable Legal Reasoning

LegalOne:一种用于可靠法律推理的基础模型家族

Haitao Li, Yifan Chen, Shuo Miao, Qian Dong, Jia Chen, Yiran Hu, Junjie Chen, Minghao Qin, Yueyue Wu, Yujia Zhou, Qingyao Ai, Yiqun Liu, Cheng Luo, Quan Zhou, Ya Zhang, Jikun Hu

机构 * Department of Computer Science, Tsinghua University(清华大学计算机科学系) Quancheng Laboratory(清华云城实验室) University of Waterloo, Canada(加拿大滑铁卢大学) China University of Political Science and Law(中国政法大学) MegaTech.AI Inc(MegaTech.AI公司)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL

AI总结 LegalOne通过三阶段流程提升法律推理能力,结合领域适应、代理推理蒸馏和课程强化学习,在法律任务中取得超越通用LLMs的性能。

Comments 25 pages, v1

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03285 2026-02-04 cs.AI 57%

MeetBench-XL: Calibrated Multi-Dimensional Evaluation and Learned Dual-Policy Agents for Real-Time Meetings

MeetBench-XL: 一种经过校准的多维评估和学习双策略代理用于实时会议

Yuelin Hu, Jun Xu, Bingcong Lu, Zhengxue Cheng, Hongwei Hu, Ronghua Wu, Li Song

机构 * Shanghai Jiao Tong University(上海交通大学) Institute for Clarity in Documentation(清晰文档研究所) Inria Paris-Rocquencourt(法国巴黎-罗克琴特研究所) Rajiv Gandhi University(拉朱·甘地大学) Tsinghua University(清华大学) Palmer Research Laboratories(帕勒研究实验室)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MeetBench-XL通过多维评估和学习双策略代理提升实时会议AI助手的性能与效率

Comments accepted by AAAI2026 ws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01155 2026-02-04 cs.AI cs.SE 57%

Multi-Agent Causal Reasoning System for Error Pattern Rule Automation in Vehicles

多智能体因果推理系统用于车辆中错误模式规则自动化

Hugo Math, Julian Lorenz, Stefan Oelsner, Rainer Lienhart

机构 * BMW Group(宝马集团) Augsburg University(奥格斯堡大学)

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 CAREP通过多智能体系统自动发现车辆错误模式规则,提供透明因果解释,提升故障诊断的自动化与可解释性。

Comments 7 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 50%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 安全评测 :safety(abstract)

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12553 2026-02-04 cs.LO cs.SE 50%

Cargo Sherlock: An SMT-Based Checker for Software Trust Costs

Cargo Sherlock: 基于 SMT 的软件信任成本检查器

Muhammad Hassnain, Anirudh Basu, Ethan Ng, Caleb Stanford

专题命中 安全评测 :trustworthy(abstract)

AI总结 Cargo Sherlock 是一种基于 SMT 的软件信任成本检查器,通过结合形式化方法和人为因素,用于检测供应链攻击并评估软件依赖项的信任成本。

Comments 12 pages, 7 figures. To appear at the International Conference on Formal Methods for Software Engineering (FormaliSE), April 2026

详情

展开后加载摘要…

URL PDF HTML 收藏