arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-05 至 2026-02-05 共收录 14 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 14 篇

2602.04739 2026-02-05 cs.CL cs.AI cs.HC 86%

Alignment Drift in Multimodal LLMs: A Two-Phase, Longitudinal Evaluation of Harm Across Eight Model Releases

多模态大语言模型中的对齐漂移:对八个模型版本的双阶段纵向评估

Casey Ford, Madison Van Doren, Emily Dix

专题命中 安全评测 :alignment(title,abstract);safety(abstract);harmlessness(abstract);分类 cs.CL、cs.AI

AI总结 研究通过双阶段评估揭示多模态大语言模型在不同模型版本中的安全性和对齐漂移问题,强调了持续多模态基准测试的重要性。

Comments under peer-review

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17442 2026-02-05 cs.AI cs.ET cs.LG 81%

Keeping Medical AI Healthy and Trustworthy: A Review of Detection and Correction Methods for System Degradation

保持医疗AI的健康与可信:对系统退化检测与纠正方法的综述

Hao Guan, David Bates, Li Zhou

专题命中 安全评测 :trustworthy(title);safety(abstract);分类 cs.AI、cs.LG

AI总结 本文综述了医疗AI系统退化检测与纠正方法,探讨了性能退化原因、检测技术、根本原因分析及纠正策略,旨在提升医疗AI的可靠性和安全性。

Comments 16 pages, 5 figures

Journal ref IEEE Transactions on Biomedical Engineering, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04735 2026-02-05 cs.LG cs.AI cs.CL cs.CY cs.IR 70%

From Data to Behavior: Predicting Unintended Model Behaviors Before Training

从数据到行为:在训练前预测未预料的模型行为

Mengru Wang, Zhenqian Xu, Junfeng Fang, Yunzhi Yao, Shumin Deng, Huajun Chen, Ningyu Zhang

机构 * Zhejiang University(浙江大学) National University of Singapore(新加坡国立大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 提出MDF方法,通过数据均值表示预测模型预训练阶段的潜在偏见和安全风险,实现高效检测。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02515 2026-02-05 cs.AI cs.CL cs.LG 67%

CreditAudit: 2$^\text{nd}$ Dimension for LLM Evaluation and Selection

CreditAudit: 2维度用于LLM评估与选择

Yiliang Song, Hongjun An, Jiangong Xiao, Haofei Zhao, Jiawei Shao, Xuelong Li

机构 * Northwestern Polytechnical University Institute of Artificial Intelligence (TeleAI), China Telecom(西北工业大学人工智能研究所(TeleAI),中国电信) Dalian Maritime University Institute of Artificial Intelligence (TeleAI), China Telecom(大连海事大学人工智能研究所(TeleAI),中国电信) Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究所(TeleAI),中国电信) Guangxi Normal University Institute of Artificial Intelligence (TeleAI), China Telecom(广西师范大学人工智能研究所(TeleAI),中国电信)

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 CreditAudit 通过 2D 信用评级框架,提供基于稳定性风险的 LLM 部署评估方法,支持更精确的模型选择与分层部署。

Comments Second update

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04033 2026-02-05 cs.CL cs.AI cs.CY 67%

On the Credibility of Evaluating LLMs using Survey Questions

关于通过调查问题评估LLM可信度的研究

Jindřich Libovický

机构 * Charles University, Faculty of Mathematics and Physics, Institute of Formal and Applied Linguistics(查尔斯大学,数学与物理学院,形式与应用语言学研究所)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI、cs.CY

AI总结 本文通过调查问题评估LLM可信度,发现提示方法和解码策略显著影响结果,并引入自相关距离度量标准以评估答案一致性。

Comments Accepted to the Workshop on Multilingual and Multicultural Evaluation at EACL 2026, 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04813 2026-02-05 cs.AI cs.CY 62%

Agentic AI in Healthcare & Medicine: A Seven-Dimensional Taxonomy for Empirical Evaluation of LLM-based Agents

医疗与医学中的代理AI:一个七维分类法用于评估基于大语言模型的代理

Shubham Vatsal, Harsh Dubey, Aditi Singh

机构 * Department of Computer Science, New York University, CIMS, New York, USA(纽约大学计算机科学系,CIMS,纽约,美国) Department of Computer Science, Cleveland State University, Cleveland, USA(克利夫兰州立大学计算机科学系,克利夫兰,美国)

专题命中 安全评测 :safety(abstract);分类 cs.AI、cs.CY

AI总结 本文提出一个七维分类法,用于评估基于大语言模型的医疗代理在认知能力、知识管理、交互模式等方面的能力分布与实现情况。

Journal ref IEEE Access, vol. 14, pp. 4840-4863, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04197 2026-02-05 cs.CL cs.AI 62%

From Helpfulness to Toxic Proactivity: Diagnosing Behavioral Misalignment in LLM Agents

从有益到有毒的主动性:诊断LLM代理的行为不一致

Xinyue Wang, Yuanhe Zhang, Zhengshuo Gong, Haoran Gao, Fanyu Meng, Zhenhong Zhou, Li Sun, Yang Liu, Sen Su

机构 * Beijing University of Posts(北京邮电大学) China Mobile Research Institute(中国移动研究院) Nanyang Technological University(南洋理工大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM代理在权衡有益与无害时产生的有毒主动性行为,提出了一种基于双模型互动的评估框架,并通过实验揭示了该现象的普遍性及两种主要趋势。

Comments 9 pages (excluding appendices), 6 figures. Code is available at https://github.com/wxyoio-0715/Toxic-Proactivity

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02619 2026-02-05 cs.LG cs.AI cs.SE 62%

daVinci-Agency: Unlocking Long-Horizon Agency Data-Efficiently

daVinci-Agency: 解锁长周期代理数据高效性

Mohan Jiang, Dayuan Fu, Junhao Shi, Ji Zeng, Weiye Si, Keyu Li, Xuefeng Li, Yang Xiao, Wenjie Li, Dequan Wang, Pengfei Liu

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 daVinci-Agency通过PR序列生成长周期代理数据,实现高效且高质量的监督学习,提升模型在复杂任务中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04617 2026-02-05 cs.CL 57%

LEAD: Layer-wise Expert-aligned Decoding for Faithful Radiology Report Generation

LEAD:逐层专家对齐解码以生成准确的放射学报告

Ruixiao Yang, Yuanhe Tian, Xu Yang, Huiqi Li, Yan Song

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 LEAD通过逐层专家对齐解码方法,提升放射学报告生成的准确性并减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04152 2026-02-05 cs.RO cs.AI 57%

MA3DSG: Multi-Agent 3D Scene Graph Generation for Large-Scale Indoor Environments

MA3DSG:多智能体3D场景图生成用于大规模室内环境

Yirum Kim, Jaewoo Kim, Ue-Hwan Kim

机构 * Department of AI Convergence, Gwangju Institute of Science and Technology (GIST)(人工智能融合学院,全州科学技术院(GIST))

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MA3DSG通过多智能体协作实现大规模室内环境的3D场景图生成,无需训练参数即可提升扩展性与协同能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04131 2026-02-05 cs.LG 57%

Decoupling Time and Risk: Risk-Sensitive Reinforcement Learning with General Discounting

解耦时间和风险:具有通用折扣的风险敏感强化学习

Mehrdad Moghimi, Anthony Coache, Hyejin Ku

机构 * Dept. of Mathematics and Statistics(数学与统计学系) York University(约克大学) Dept. of Mathematics(数学系) Imperial College(帝国理工学院)

专题命中 安全评测 :safety(abstract);分类 cs.LG

AI总结 本文提出了一种支持灵活折扣和风险度量优化的新型分布式强化学习框架,通过技术分析和实验验证,展示了折扣在捕捉时空和风险偏好中的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04064 2026-02-05 cs.CY 57%

The CitizenQuery Benchmark: A Novel Dataset and Evaluation Pipeline for Measuring LLM Performance in Citizen Query Tasks

公民查询基准:一种新的数据集和评估流程,用于衡量LLM在公民查询任务中的性能

Neil Majithia, Rajat Shinde, Zo Chapman, Prajun Trital, Jordan Decker, Manil Maskey, Elena Simperl, Nigel Shadbolt

专题命中 安全评测 :trustworthy(abstract);分类 cs.CY

AI总结 本文提出CitizenQuery-UK数据集和评估流程,用于评估LLM在公民查询任务中的可信度,发现模型在事实性、回避率和冗余性方面存在差异,强调了可信赖AI的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04535 2026-02-05 cs.SD 50%

HoliAntiSpoof: Audio LLM for Holistic Speech Anti-Spoofing

HoliAntiSpoof: 面向整体语音反伪装的音频大语言模型

Xuenan Xu, Yiming Ren, Liwei Liu, Wen Wu, Baoxiang Li, Chaochao Lu, Shuai Wang, Chao Zhang

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Nanjing University(南京大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 HoliAntiSpoof通过音频大语言模型实现整体语音反伪装分析,通过统一文本生成任务提升检测性能并实现可解释的语义分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03878 2026-02-05 cs.CV cs.CR 50%

Intellectual Property Protection for 3D Gaussian Splatting Assets: A Survey

3D高斯散射资产的知识产权保护:一篇综述

Longjie Zhao, Ziming Hong, Jiaxin Huang, Runnan Chen, Mingming Gong, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) The University of Melbourne(墨尔本大学) Mohamed bin Zayed University of Artificial Intelligence(莫莫迪·本·扎耶德人工智能大学)

专题命中 安全评测 :trustworthy(abstract)

AI总结 本文综述了3D高斯散射资产的知识产权保护,分析了其底层机制、保护范式及鲁棒性挑战,并提出了六个研究方向以推动可靠保护技术的发展。

Comments A collection of relevant papers is summarized and will be continuously updated at \url{https://github.com/tmllab/Awesome-3DGS-IP-Protection}

详情

展开后加载摘要…

URL PDF HTML 收藏