arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型对齐与安全

大模型对齐、安全、越狱、红队、提示注入和可信评测。

2026-02-11 至 2026-02-11 共收录 9 信号源:cs.CL, cs.AI, cs.CY, cs.LG

1. 安全评测 9 篇

2602.09947 2026-02-11 cs.CR 82%

Trustworthy Agentic AI Requires Deterministic Architectural Boundaries

可信的代理AI需要确定性的架构边界

Manish Bhattarai, Minh Vu

专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)

AI总结 本文提出三位一体防御架构,通过确定性的架构执行解决代理AI的安全问题,强调架构调解对可信AI应用的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09339 2026-02-11 cs.CL 70%

Understanding Risk and Dependency in AI Chatbot Use from User Discourse

理解AI聊天机器人使用中的风险与依赖性:从用户话语出发

Jianfeng Zhu, Karin G. Coifman, Ruoming Jin

专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL

AI总结 本研究通过分析用户话语揭示AI聊天机器人使用中的心理风险维度,发现自我调节困难和对自主性、控制和技术风险的恐惧为主要特征。

Comments 21 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09147 2026-02-11 cs.CL 70%

Overview of PAN 2026: Voight-Kampff Generative AI Detection, Text Watermarking, Multi-Author Writing Style Analysis, Generative Plagiarism Detection, and Reasoning Trajectory Detection

PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测

Janek Bevendorff, Maik Fröbe, André Greiner-Petter, Andreas Jakoby, Maximilian Mayerl, Preslav Nakov, Henry Plutz, Martin Potthast, Benno Stein, Minh Ngoc Ta, Yuxia Wang, Eva Zangerle

机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) University of Applied Sciences BFI(应用科学大学BFI) Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) University of Kassel(卡塞尔大学) INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) University of Innsbruck(因斯布鲁克大学)

专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL

AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.10017 2026-02-11 cs.CL 57%

SCORE: Specificity, Context Utilization, Robustness, and Relevance for Reference-Free LLM Evaluation

SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估

Homaira Huda Shomee, Rochana Chaturvedi, Yangxinyu Xie, Tanwi Mallick

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Argonne National Laboratory(阿贡国家实验室) University of Pennsylvania(宾夕法尼亚大学)

专题命中 安全评测 :alignment(abstract);分类 cs.CL

AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09757 2026-02-11 cs.LG 57%

Towards Poisoning Robustness Certification for Natural Language Generation

面向自然语言生成的中毒鲁棒性认证

Mihnea Ghitu, Matthew Wicker

机构 * Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国)

专题命中 安全评测 :alignment(abstract);分类 cs.LG

AI总结 本文提出TPA算法,通过计算最小中毒预算认证自然语言生成的有效性和稳定性,为安全关键应用提供可证明的鲁棒性保障。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17528 2026-02-11 cs.NI cs.AI 57%

Evaluating Device-First Continuum AI (DFC-AI) for Autonomous Operations in the Energy Sector

评估面向能源行业的设备优先连续AI(DFC-AI)用于自主操作

Siavash M. Alamouti, Fay Arjomandi, Michel Burger, Bashar Altakrouri

专题命中 安全评测 :safety(abstract);分类 cs.AI

AI总结 本文评估了DFC-AI在能源领域自主操作中的应用,证明其在无网络环境下的稳定性和成本优势。

Comments 10 pages, 4 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15935 2026-02-11 cs.DB cs.CL cs.CR 57%

MAPS: A Multilingual Benchmark for Agent Performance and Security

MAPS: 一种多语言评估基准,用于代理性能和安全

Omer Hofman, Jonathan Brokman, Oren Rachmil, Shamik Bose, Vikas Pahuja, Toshiya Shimizu, Trisha Starostina, Kelly Marchisio, Seraphina Goldfarb-Tarrant, Roman Vainshtein

机构 * Fujitsu Research of Europe(富士通欧洲研究部) Fujitsu Limited(富士通有限公司) Cohere

专题命中 安全评测 :safety(abstract);分类 cs.CL

AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。

Comments Accepted to EACL 2026 findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08682 2026-02-11 cs.CV 50%

ALIVE: Animate Your World with Lifelike Audio-Video Generation

ALIVE: 用逼真音频视频生成动画你的世界

Ying Guo, Qijun Gan, Yifu Zhang, Jinlai Liu, Yifei Hu, Pan Xie, Dongjun Qian, Yu Zhang, Ruiqi Li, Yuqi Zhang, Ruibiao Lu, Xiaofeng Mei, Bo Han, Xiang Yin, Bingyue Peng, Zehuan Yuan

机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)

专题命中 安全评测 :alignment(abstract)

AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。

Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05142 2026-02-11 physics.soc-ph cs.RO 50%

Modelling Pedestrian Behaviour in Autonomous Vehicle Encounters Using Naturalistic Dataset

利用自然数据集建模行人与自动驾驶车辆相遇时的行为

Rulla Al-Haideri, Bilal Farooq

机构 * IEEE Intelligent Vehicles Symposium (IV)(IEEE智能车辆会议)

专题命中 安全评测 :safety(abstract)

AI总结 本研究利用NuScenes数据集,通过混合模型分析行人与自动驾驶车辆相遇时的行为,发现风险感知和运动效率影响行人运动调整。

详情

展开后加载摘要…

URL PDF HTML 收藏