arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-13 至 2026-02-13 共收录 18 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 18 篇

2602.12092 2026-02-13 cs.CL cs.AI cs.CR cs.CV 84%

DeepSight: An All-in-One LM Safety Toolkit

DeepSight: 一个全方位的大型模型安全工具包

Bo Zhang, Jiaxuan Guo, Lijun Li, Dongrui Liu, Sujin Chen, Guanxu Chen, Zhijie Zheng, Qihao Lin, Lewen Yan, Chen Qian, Yijin Zhou, Yuyao Wu, Shaoxiong Guo, Tianyi Du, Jingyi Yang, Xuhao Hu, Ziqi Miao, Xiaoya Lu, Jing Shao, Xia Hu

机构 * Shanghai AI Laboratory(上海人工智能实验室)

专题命中 安全评测 :safety(title,abstract);alignment(abstract);分类 cs.CL、cs.AI

AI总结 DeepSight是一个开源工具包,旨在通过整合安全评估与诊断,提升大型模型的安全性与可解释性。

Comments Technical report, 29 pages, 24 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11444 2026-02-13 cs.CL cs.AI 84%

Towards Reliable Machine Translation: Scaling LLMs for Critical Error Detection and Safety

迈向可靠的机器翻译:扩展LLMs以检测关键错误和安全

Muskaan Chopra, Lorenz Sparrenberg, Rafet Sifa

机构 * Rheinische Friedrich-Wilhelms-Universität Bonn, Bonn, Germany(莱茵-威斯巴登大学波恩分校) Fraunhofer IAIS, Sankt Augustin, Germany(弗劳恩霍夫人工智能研究所) Lamarr Institute for Machine Learning(拉马尔人工智能与机器学习研究所)

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 本文通过扩展LLMs检测关键错误,提升机器翻译的安全性和可靠性,减少虚假信息和语言伤害风险。

Comments Accepted at ECIR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11472 2026-02-13 cs.CR cs.DC 82%

Future Mining: Learning for Safety and Security

未来采矿:安全与安全的学习

Md Sazedur Rahman, Mizanur Rahman Jewel, Sanjay Madria

专题命中 安全评测 :safety(title,abstract);trustworthy(abstract)

AI总结 本文提出了一种统一的智能安全和安全架构,整合多模态感知、安全联邦学习、强化学习、DTN通信和能量感知传感,以提升采矿环境中的安全性和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14182 2026-02-13 cs.CL cs.LG 81%

LabSafety Bench: Benchmarking LLMs on Safety Issues in Scientific Labs

LabSafety Bench: 对科学实验室中AI安全问题的LLM基准测试

Yujun Zhou, Jingdong Yang, Yue Huang, Kehan Guo, Zoe Emory, Bikram Ghosh, Amita Bedar, Sujay Shekar, Zhenwen Liang, Pin-Yu Chen, Tian Gao, Werner Geyer, Nuno Moniz, Nitesh V Chawla, Xiangliang Zhang

专题命中 安全评测 :safety(title,abstract);分类 cs.CL、cs.LG

AI总结 LabSafety Bench通过评估LLMs和VLMs在实验室安全问题上的表现,揭示了当前模型在危险识别和风险评估方面的不足,强调了对AI安全评估框架的迫切需求。

Comments Published at Nature Machine Intelligence

Journal ref Nat Mach Intell 8, 20-31 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04860 2026-02-13 cs.LG cs.AI 81%

Alignment Tipping Process: How Self-Evolution Pushes LLM Agents Off the Rails

对齐倾倒过程:自我进化如何推动LLM代理偏离轨道

Siwei Han, Kaiwen Xiong, Jiaqi Liu, Xinyu Ye, Yaofeng Su, Wenbo Duan, Xinyuan Liu, Cihang Xie, Mohit Bansal, Mingyu Ding, Linjun Zhang, Huaxiu Yao

机构 * Rutgers University(罗切斯特大学)

专题命中 安全评测 :alignment(title,abstract);分类 cs.AI、cs.LG

AI总结 研究揭示了自我进化LLM代理在部署后因持续互动而偏离对齐约束的风险,通过自我利益探索和模仿策略扩散两种范式分析,发现对齐优势会迅速衰减,现有对齐方法难以有效防御。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11412 2026-02-13 cs.CY cs.AI cs.HC 73%

When Visibility Outpaces Verification: Delayed Verification and Narrative Lock-in in Agentic AI Discourse

当可见性超越验证:代理AI discourse中的延迟验证与叙述锁定

Hanjing Shi, Dominic DiFranzo

机构 * Lehigh University(莱文大学)

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.AI、cs.CY

AI总结 本文研究了代理AI讨论中可见性与验证时间的关系,揭示了高可见度讨论因延迟验证导致的叙述锁定现象,并提出知识摩擦作为平衡平台的干预措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11305 2026-02-13 cs.CL 70%

Are Aligned Large Language Models Still Misaligned?

对齐的大型语言模型仍然存在偏差吗?

Usman Naseem, Gautam Siddharth Kashyap, Rafiq Ali, Ebad Shabbir, Sushant Kumar Ray, Abdullah Mohammad, Agrima Seth

机构 * Macquarie University(麦考瑞大学) DSEU-Okhla University of Delhi(德里大学) Microsoft(微软公司)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 本文提出Mis-Align Bench基准测试,通过统一评估安全、价值和文化维度的偏差,揭示单维度模型在联合条件下的高覆盖率与高假失败率问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11877 2026-02-13 cs.CL cs.AI 62%

Towards Fair and Comprehensive Evaluation of Routers in Collaborative LLM Systems

迈向协作大语言模型系统中路由器的公平且全面评估

Wanxing Wu, He Zhu, Yixia Li, Lei Yang, Jiehui Zhao, Hongru Wang, Jian Yang, Benyou Wang, Bingyi Jing, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) Institut Polytechnique de Paris(巴黎政治学院) Peking University(北京大学) Deepexi Technology Co. Ltd.(深醒科技有限公司) University of Edinburgh(爱丁堡大学) Beihang University(北航) Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳))

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 本文提出RouterXBench框架和ProbeDirichlet路由器,通过内部隐藏状态提升路由能力与跨领域鲁棒性,实现对协作大语言模型系统中路由器的公平全面评估。

Comments Our code is publicly available at https://github.com/zhuchichi56/RouterXBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11690 2026-02-13 cs.LG cs.AI 62%

ANML: Attribution-Native Machine Learning with Guaranteed Robustness

ANML:具有保证鲁棒性的属性原生机器学习

Oliver Zahn, Matt Beton, Simran Chana

机构 * University of Cambridge(剑桥大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI、cs.LG

AI总结 ANML通过质量加权训练提升模型性能和归因能力,在多个数据集上显著减少误差。

Comments 27 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11666 2026-02-13 cs.AI cs.CL 62%

PhyNiKCE: A Neurosymbolic Agentic Framework for Autonomous Computational Fluid Dynamics

PhyNiKCE:一种用于自主计算流体动力学的神经符号代理框架

E Fan, Lisong Shi, Zhengtong Li, Chih-yung Wen

专题命中 安全评测 :trustworthy(abstract);分类 cs.CL、cs.AI

AI总结 PhyNiKCE通过神经符号框架提升CFD模拟的可信度与效率,实现96%的性能提升并减少59%的自我校正循环。

Comments 30 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11165 2026-02-13 cs.CL cs.AI 62%

Assessing LLM Reliability on Temporally Recent Open-Domain Questions

评估LLM在近期开放领域问题上的可靠性

Pushwitha Krishnappa, Amit Das, Vinija Jain, Tathagata Mukherjee, Aman Chadha

机构 * University of Alabama Huntsville(阿拉巴马大学亨茨维尔分校) University of North Alabama(北阿拉巴马大学) Stanford University(斯坦福大学) Google(谷歌) Apple(苹果公司)

专题命中 安全评测 :alignment(abstract);分类 cs.CL、cs.AI

AI总结 RECOM研究通过分析15000个Reddit问题,发现LLM在语义对齐上表现优异,但词汇重合度低,揭示模型通过改写保留意义,挑战传统词汇度量的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11918 2026-02-13 cs.AI 57%

MEME: Modeling the Evolutionary Modes of Financial Markets

MEME:金融市场的进化模式建模

Taian Guo, Haiyang Shen, Junyu Luo, Zhongshi Xing, Hanchun Lian, Jinsheng Huang, Binqi Chen, Luchen Liu, Yun Ma, Ming Zhang

机构 * National Key Laboratory for Multimedia Information Processing, PKU-Anker LLM Lab, School of Computer Science, Peking University(国家多媒体信息处理重点实验室、PKU-Anker LLM实验室、计算机科学学院、北京大学) School of Electronics Engineering(电子工程学院) Computer Science, Peking University(计算机科学、北京大学) Institute for Artificial Intelligence, Peking University(人工智能研究所、北京大学) Sun Yat-sen University(中山大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 MEME通过建模金融市场中的动态进化思维模式,利用多代理提取和高斯混合模型,实现对市场动态的精准重建,优于现有基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11750 2026-02-13 cs.SE cs.AI cs.HC 57%

AmbiBench: Benchmarking Mobile GUI Agents Beyond One-Shot Instructions in the Wild

AmbiBench:在真实场景中超越单次指令的移动GUI代理基准测试

Jiazheng Sun, Mingxuan Li, Yingying Zhang, Jiayang Niu, Yachen Wu, Ruihan Jin, Shuyu Lei, Pengrongrui Tan, Zongyu Zhang, Ruoyi Wang, Jiachen Yang, Boyu Yang, Jiacheng Liu, Xin Peng

机构 * Fudan University(复旦大学) Jilin University(吉林大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 AmbiBench是首个针对移动GUI代理在真实场景中超越单次指令的双向意图对齐的基准测试,通过引入清晰度分类和MUSE框架评估代理在不同清晰度下的表现。

Comments 21 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11674 2026-02-13 cs.AI 57%

Benchmark Health Index: A Systematic Framework for Benchmarking the Benchmarks of LLMs

基准健康指数:一个系统框架,用于评估大型语言模型的基准测试

Longyuan Zhu, Hairan Hua, Linlin Miao, Bing Zhao

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出Benchmark Health Index,通过三个维度评估LLM基准测试的健康状况,为评估选择和动态管理提供系统框架。

Comments 42 pages, 8 figures, 7 tables. Code and website available at https://github.com/SKYLENAGE-AI/benchmark-health-index

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11514 2026-02-13 cs.SE cs.AI cs.CV cs.HC 57%

How Smart Is Your GUI Agent? A Framework for the Future of Software Interaction

你的GUI代理有多智能?面向软件交互未来的框架

Sidong Feng, Chunyang Chen

机构 * The Chinese University of Hong Kong(香港中文大学) Technical University of Munich(慕尼黑工业大学)

专题命中 安全评测 :trustworthy(abstract);分类 cs.AI

AI总结 本文提出GUI代理自主级别框架,旨在明确自主性并评估软件交互的可信赖性进展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11340 2026-02-13 cs.AI 57%

Bi-Level Prompt Optimization for Multimodal LLM-as-a-Judge

双层提示优化用于多模态LLM作为裁判

Bo Pan, Xuan Kan, Kaitai Zhang, Yan Yan, Shunwen Tan, Zihao He, Zixin Ding, Junjie Wu, Liang Zhao

机构 * Meta AI Emory University(埃默里大学)

专题命中 安全评测 :alignment(abstract);分类 cs.AI

AI总结 本文提出BLPO框架,通过双层优化提升多模态LLM在评估AI生成图像时的提示效果,解决上下文限制导致的优化瓶颈问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07497 2026-02-13 cs.CL 57%

From Native Memes to Global Moderation: Cross-Cultural Evaluation of Vision-Language Models for Hateful Meme Detection

从本土迷因到全球监管:跨文化评估视觉-语言模型在仇恨迷因检测中的应用

Mo Wang, Kaixuan Ren, Pratik Jalan, Ahmed Ashraf, Tuong Vy Vu, Rahul Seetharaman, Shah Nawaz, Usman Naseem

机构 * Macquarie University(麦考瑞大学) Nile University(尼罗大学) University of Massachusetts Amherst(马萨诸塞大学阿默斯特分校) Johannes Kepler University(约翰尼斯·开普勒大学)

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 本文通过跨文化评估揭示视觉-语言模型在仇恨迷因检测中的文化偏见问题,并提出本土语言提示和一样本学习等改进策略以提升模型的公平性和鲁棒性。

Comments 12 pages, 5 figures, Proceedings of the ACM Web Conference 2026 (WWW '26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11730 2026-02-13 cs.CV 50%

STVG-R1: Incentivizing Instance-Level Reasoning and Grounding in Videos via Reinforcement Learning

STVG-R1: 通过强化学习激励视频中实例级推理与 grounding

Xiaowen Zhang, Zhi Gao, Licheng Jiao, Lingling Li, Qing Li

机构 * Xidian University(西电大学) State Key Laboratory of General Artificial Intelligence(通用人工智能国家重点实验室) Beijing Institute of Technology(北京理工大学)

专题命中 安全评测 :alignment(abstract)

AI总结 STVG-R1通过强化学习框架提升视频中实例级推理与 grounding 的准确性,实现显著的性能提升和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏