Trustworthy Agentic AI Requires Deterministic Architectural Boundaries
可信的代理AI需要确定性的架构边界
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)
AI总结 本文提出三位一体防御架构,通过确定性的架构执行解决代理AI的安全问题,强调架构调解对可信AI应用的必要性。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
可信的代理AI需要确定性的架构边界
专题命中 安全评测 :trustworthy(title,abstract);alignment(abstract)
AI总结 本文提出三位一体防御架构,通过确定性的架构执行解决代理AI的安全问题,强调架构调解对可信AI应用的必要性。
理解AI聊天机器人使用中的风险与依赖性:从用户话语出发
专题命中 安全评测 :safety(abstract);AI safety(abstract);分类 cs.CL
AI总结 本研究通过分析用户话语揭示AI聊天机器人使用中的心理风险维度,发现自我调节困难和对自主性、控制和技术风险的恐惧为主要特征。
Comments 21 pages, 5 figures
PAN 2026概览:Voight-Kampff生成式AI检测、文本水印、多作者写作风格分析、生成式抄袭检测及推理轨迹检测
机构 * Friedrich Schiller University Jena(耶纳弗里德里希·施勒格尔大学) ; University of Applied Sciences BFI(应用科学大学BFI) ; Mohamed bin Zayed University of Artificial Intelligence(马尔代夫 bin Zayed 人工智能大学) ; University of Kassel(卡塞尔大学) ; INSAIT, Sofia University ``St. Kliment Ohridski''(INSAIT,索菲亚大学『圣克莱门特·奥赫里迪斯』) ; University of Innsbruck(因斯布鲁克大学)
专题命中 安全评测 :alignment(abstract);safety(abstract);分类 cs.CL
AI总结 PAN 2026旨在通过客观评估推进计算风格学和文本取证,涵盖生成式AI检测、文本水印、多作者写作分析、抄袭检测及推理轨迹检测等五个新旧任务。
SCORE:特定性、上下文利用、鲁棒性与相关性用于无参考LLM评估
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Argonne National Laboratory(阿贡国家实验室) ; University of Pennsylvania(宾夕法尼亚大学)
专题命中 安全评测 :alignment(abstract);分类 cs.CL
AI总结 本文提出了一种无参考评估框架,用于评估LLM在高风险领域任务中的特定性、鲁棒性、相关性和上下文利用,通过精心编纂的数据集和人工评估验证了多指标评估的必要性。
面向自然语言生成的中毒鲁棒性认证
机构 * Department of Computing, Imperial College London, London, UK(计算系,伦敦帝国学院,伦敦,英国)
专题命中 安全评测 :alignment(abstract);分类 cs.LG
AI总结 本文提出TPA算法,通过计算最小中毒预算认证自然语言生成的有效性和稳定性,为安全关键应用提供可证明的鲁棒性保障。
评估面向能源行业的设备优先连续AI(DFC-AI)用于自主操作
专题命中 安全评测 :safety(abstract);分类 cs.AI
AI总结 本文评估了DFC-AI在能源领域自主操作中的应用,证明其在无网络环境下的稳定性和成本优势。
Comments 10 pages, 4 figures, 6 tables
MAPS: 一种多语言评估基准,用于代理性能和安全
机构 * Fujitsu Research of Europe(富士通欧洲研究部) ; Fujitsu Limited(富士通有限公司) ; Cohere
专题命中 安全评测 :safety(abstract);分类 cs.CL
AI总结 MAPS是一个多语言评估基准,用于评估代理AI在不同语言和任务中的性能与安全性。
Comments Accepted to EACL 2026 findings
ALIVE: 用逼真音频视频生成动画你的世界
机构 * Bytedance ALIVE Team(字节跳动ALIVE团队)
专题命中 安全评测 :alignment(abstract)
AI总结 ALIVE通过结合预训练文本到视频模型与新的音频视频生成技术,实现了逼真的音频视频生成和动画,展示了优于开源和商业解决方案的性能。
Comments Technical report for ALIVE. Bytedance ALIVE Team. Homepage: https://foundationvision.github.io/Alive/
利用自然数据集建模行人与自动驾驶车辆相遇时的行为
机构 * IEEE Intelligent Vehicles Symposium (IV)(IEEE智能车辆会议)
专题命中 安全评测 :safety(abstract)
AI总结 本研究利用NuScenes数据集,通过混合模型分析行人与自动驾驶车辆相遇时的行为,发现风险感知和运动效率影响行人运动调整。