An Evaluation of Chat Safety Moderations in Roblox
在Roblox中聊天安全审核的评估
专题命中 安全评测 :safety(title);分类 cs.CY
AI总结 本文通过分析200万条聊天记录,评估Roblox聊天审核系统的效果,发现大量不安全内容如性侵、欺凌等逃过了审核,并揭示了用户如何通过多种手段规避审核。
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
在Roblox中聊天安全审核的评估
专题命中 安全评测 :safety(title);分类 cs.CY
AI总结 本文通过分析200万条聊天记录,评估Roblox聊天审核系统的效果,发现大量不安全内容如性侵、欺凌等逃过了审核,并揭示了用户如何通过多种手段规避审核。
BanglaSocialBench: 一个评估大语言模型在孟加拉社会互动中社会语用和文化对齐的基准
机构 * Jahangirnagar University(贾亨吉尔纳加尔大学) ; Rajshahi University of Engineering & Technology(拉贾沙希工程与技术大学) ; Bangladesh University of Engineering and Technology(孟加拉工程与技术大学)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 本文提出BanglaSocialBench,通过情境依赖的语言使用评估孟加拉语的社会语用能力,发现当前LLM在文化对齐上存在系统性偏差。
Comments Accepted at ACL SRW 2026
可信的临床决策支持使用元谓词和领域特定语言
机构 * Harvard University(哈佛大学) ; IDEXX Laboratories(IDEXX实验室) ; Forome Association(Forome协会) ; Deggendorf Institute of Technology(德格多夫技术学院)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出使用元谓词和领域特定语言来确保临床决策规则的证据适当性,通过元谓词验证在部署前约束证据使用,提升决策的可审计性与准确性。
AI4S-SDS: 一种基于稀疏MCTS和可微物理对齐的神经符号溶剂设计系统
机构 * State Key Laboratory for Novel Software Technology at Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Computer Science, Nanjing University(南京大学计算机科学学院) ; Suzhou Laboratory(苏州实验室)
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 本文提出AI4S-SDS系统,通过稀疏MCTS和可微物理对齐,解决化学配方设计中的高维组合空间问题,提升探索多样性并实现物理约束下的有效性。
从有益到可信:用于配对编程的LLM代理
机构 * Texas State University(德克萨斯州立大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文研究多代理LLM配对编程,通过外部化意图和工具迭代验证,提升代码可靠性、可审计性和可维护性。
Comments Accepted in 34th ACM Joint European Software Engineering Conference and Symposium on the Foundations of Software Engineering (FSE Companion 26)
基准阴影:大型语言模型中的数据对齐、参数足迹与泛化
机构 * Vivo AI Lab, Shenzhen, China(维沃人工智能实验室,深圳,中国) ; Hong Kong University of Science and Technology, Hong Kong, China(香港科技大学,香港,中国)
专题命中 安全评测 :alignment(title);分类 cs.LG
AI总结 本文研究了大型语言模型中基准表现与广度能力之间的差异,通过数据干预发现数据分布影响参数适应与泛化能力,提出参数空间诊断方法揭示不同训练模式的结构特征。
Comments 28 pages, 26 figures, 8 tables
作为特征的遗忘:大型语言模型的认知对齐
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 研究将遗忘视为大型语言模型的认知机制,通过建立基准测试评估时间推理、概念漂移适应和联想回忆,发现模型遗忘率与人类记忆效率的权衡相似,并提出概率记忆提示策略提升长期推理性能。
Comments arXiv admin note: This submission has been withdrawn by arXiv administrators due to incorrect authorship. Author list truncated
在去中心化后训练中的后门攻击
机构 * University of Neuchâtel(纳沙泰尔大学) ; Radboud University(拉德堡德大学) ; Delft University of Technology(代尔夫特理工大学) ; SecureML ; University of Zagreb(萨格勒布大学)
专题命中 安全评测 :safety(abstract,comments);alignment(abstract);分类 cs.LG;trustworthy(comments)
AI总结 本文提出首个针对流水线并行的后门攻击,通过控制中间阶段实现模型对齐偏差,实验显示触发词可使对齐率从80%降至6%,且在安全对齐训练下仍成功60%。
Comments Accepted to ICLR 2026 Workshop 'Principled Design for Trustworthy AI - Interpretability, Robustness, and Safety across Modalities'
可信的AI驱动动态混合RIS:在认知MISO网络中的联合优化与抗奖励中毒控制
机构 * LINCS Laboratory, Department of Computer and Software Engineering, Polytechnique Montréal(蒙特利尔理工学院计算机与软件工程系LINCS实验室)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出一种动态混合RIS,用于解决认知MISO网络中不可靠的直接SU链路和能量约束问题,通过联合优化传输波束成形和RIS相位,采用SAC深度强化学习方法,并提出轻量级实时防御机制以对抗奖励中毒攻击。
迈向可信的Wi-Fi CSI基于传感:对抗鲁棒性系统的评估
机构 * University College London(伦敦大学学院)
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 本文系统评估了五种不同CSI架构在四个公开数据集上的对抗鲁棒性,发现模型容量并不保证鲁棒性,简单架构比高容量模型更抗攻击,且任务依赖性显著影响脆弱性。
Comments 18 pages, 5 figures, 6 tables
ClawKeeper: 通过技能、插件和观察者为OpenClaw代理提供全面的安全保护
机构 * Beijing University of Posts and Telecommunications(北京邮电大学) ; Beijing Academy of Artificial Intelligence(北京人工智能研究院) ; China Academy of Information and Communications Technology(信息通信技术研究院)
专题命中 安全评测 :safety(title);分类 cs.AI
AI总结 ClawKeeper通过技能、插件和观察者三层机制,提供实时安全防护,解决OpenClaw生态的安全漏洞问题,经过评估证明其有效性。
Comments 22 pages, 14 figures, 5 tables
MERLIN:多阶段课程对齐用于多语言编码器-大语言模型集成的跨语言推理
机构 * University of Toronto(多伦多大学) ; Mila-Quebec AI Institute, McGill University(魁北克AI研究所,麦吉尔大学) ; OntarioTech University(安大略技术大学) ; Saarland University(萨尔兰州立大学) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 MERLIN通过多阶段课程对齐方法提升多语言编码器-大语言模型在跨语言推理中的性能,特别是在低资源语言上表现突出。
Comments Accepted to EACL 2026 (main conference)
AI赋能的皮肤病诊断:从可解释模型到临床实施 一个全面的框架,用于可访问且可信的皮肤疾病检测
机构 * Department of Business Analytics/Data Science Engineering University of New Haven(商业分析/数据科学工程系 罗德岛大学) ; Department of Healthcare University of New Haven(医疗健康系 罗德岛大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本研究提出了一种结合家族史数据和临床影像的AI框架,旨在提升皮肤病诊断的准确性与临床应用的可行性。
Comments 9 pages, 5 figures, 1 table. Code available at https://github.com/colabre2020/Enhancing-Skin-Disease-Diagnosis
概率黑客与用于无人机系统(C-UAS)信号处理的可信机器学习设计:基于场景的方法
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 本文提出了一种基于场景的方法,用于增强C-UAS的信号处理能力,通过识别法律机制中的要求来防止概率黑客,从而提升系统的可信度。
Comments 6 pages, Pre-publication. Copyright 2026 IEEE. Peer Reviewed. Accepted at ICASSP 2026 - 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), scheduled for 3-8 May 2026 in Barcelona, Spain
基于领域引导解释的可信AI裂缝尖端分割
机构 * Institute for Frontier Materials on Earth and in Space, German Aerospace Center (DLR)(地球和空间前沿材料研究所,德国航空航天中心(DLR))
专题命中 安全评测 :trustworthy(title);分类 cs.LG
AI总结 本文提出一种结合可解释AI和领域先验知识的注意力引导训练框架,用于提升裂缝尖端分割任务的模型泛化能力和解释可信度。
Comments This is the Accepted Manuscript version of an article accepted for publication in Machine Learning: Science and Technology. IOP Publishing Ltd is not responsible for any errors or omissions in this version of the manuscript or any version derived from it. The Version of Record is available online at https://doi.org/10.1088/2632-2153/ae3660
面向AI增强的用户界面安全性的以人为本的可解释性:为网络安全分析师设计可信的copilot
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出了一种面向AI增强用户界面安全性的以人为本的可解释性方法,通过设计可信的copilot,提升网络安全分析师对AI输出的信任和决策准确性。
Comments To appear in IEEE ICCA 2025 proceedings
小模型,大威胁:从低计算量AI模型中characterizing安全挑战
专题命中 安全评测 :safety(title);分类 cs.CY
AI总结 本文指出低计算量AI模型因性能提升而变得危险,需加强安全防护以应对新兴威胁。
Comments 11 pages, 4 figures
Fair-Eye Net:一种公平、可信的多模态集成青光眼全流程人工智能系统
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 Fair-Eye Net通过多模态融合和公平性优化,实现青光眼全流程AI系统,提升诊断准确性与公平性,助力全球眼科健康公平。
CLaS-Bench: 一种跨语言对齐与引导基准
机构 * Saarland University(萨尔兰大学) ; German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心(DFKI)) ; Centre for European Research in Trusted AI (CERTAIN)(可信AI欧洲研究中心(CERTAIN)) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; TU Darmstadt(德累斯顿技术大学) ; Mila - Quebec Artificial Intelligence Institute(魁北克人工智能研究所(Mila)) ; McGill University(麦吉尔大学)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 CLaS-Bench是首个多语言引导基准,通过评估32种语言中的语言强制行为,验证了残差基于DiffMean方法在跨语言引导中的有效性。
Comments pre-print
通过推理整合实现可信的基于大语言模型的推荐
机构 * SK Telecom(SK电信)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出基于大语言模型的推荐系统,通过生成逻辑严谨的理由提升推荐的可解释性和性能。
Comments Accepted at RS4SD'25 (CIKM'25 Workshop)
ROAD: 通过自动调试实现零样本智能体对齐的反思优化
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 ROAD通过自动调试实现零样本智能体对齐的反思优化,利用多智能体架构将无结构故障日志转化为结构化决策树协议,提升智能体性能和样本效率。
Comments 22 pages, 1 figure
实现低延迟可解释AI模型的可信实时决策支持系统
机构 * School of Physics and Astronomy(物理与天文学系) ; University of Edinburgh(爱丁堡大学) ; Siebel School of Computing and Data Science(计算与数据科学学院) ; University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; AI Agent Lab(AI代理实验室) ; Vokram Group(Vokram集团) ; Department of Anatomical Pathology(解剖病理学部) ; Singapore General Hospital(新加坡中央医院) ; Department of Computer Science(计算机科学系) ; Emory University(埃默里大学)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文提出通过低延迟可解释AI模型实现可信实时决策支持系统,探讨资源受限环境下的人机协作方法及边缘计算优化策略。
SEAL:用于带有检索增强生成的语音大语言模型的语音嵌入对齐学习
机构 * SenseTime Research(商汤科技研究院)
专题命中 安全评测 :alignment(title);分类 cs.CL
AI总结 SEAL通过统一的语音和文本嵌入框架,提升语音大语言模型的检索效率与准确性,减少延迟并增强多模态检索能力。
BabelCoder: 基于规范对齐的代理代码翻译
机构 * Concordia University(康科迪亚大学) ; York University(约克大学)
专题命中 安全评测 :alignment(title);分类 cs.AI
AI总结 BabelCoder通过代理协作框架提升代码翻译准确性,实现94.16%的平均准确率。
Comments 21 pages, 8 figures, 4 tables
去中心化金融信任提升:区块链与人工智能用于可信的去中心化金融决策
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 该研究提出一种结合区块链与可解释人工智能的去中心化金融信任提升框架,旨在解决贷款审批中的信任问题,并通过防篡改审计和数据存储策略提升监管合规性。
Comments 19 pages
利用AI实现高效且可信的HPC软件:挑战与研究方向
机构 * Oak Ridge National Laboratory(奥克荷厄斯国家实验室) ; Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) ; Lawrence Berkeley National Laboratory(劳伦斯伯克利国家实验室) ; Carnegie Mellon University(卡内基梅隆大学) ; Northeastern University(东北大学) ; University of Maryland(马里兰大学) ; SpiralGen Inc.(SpiralGen公司)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
AI总结 本文探讨了利用AI改进HPC软件的挑战与研究方向,提出通过Ellora和Durban项目推动AI在HPC软件发展中的应用。
Comments 12 pages, 1 Figure, Accepted at "The 1st International Workshop on Foundational Large Language Models Advances for HPC" LLM4HPC to be held in conjunction with ISC High Performance 2025
Journal ref In: Neuwirth, S., Paul, A.K., Weinzierl, T., Carson, E.C. (eds) High Performance Computing. ISC High Performance 2025. Lecture Notes in Computer Science, vol 16091. Springer, Cham
机构 * Department of Electronic Engineering, City University of Hong Kong(DongGuan)(香港城市大学(东莞)电子工程系) ; Department of Electronic Engineering, City University of Hong Kong(香港城市大学电子工程系)
专题命中 安全评测 :trustworthy(title);分类 cs.AI
专题命中 安全评测 :alignment(title);分类 cs.CL
Comments 7 pages, 5 figures
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments 14 pages, 4 figures, 4 tables
机构 * Christian Doppler Laboratory for Dependable Intelligent Systems in Harsh Environments(可信智能系统在恶劣环境中的克里斯蒂安·多普勒实验室) ; Graz University of Technology(格拉茨技术大学) ; Know Center Research GmbH(Know Center研究有限责任公司)
专题命中 安全评测 :trustworthy(title);分类 cs.LG
Comments Published in Machine Learning (Springer), vol. 114, no. 12, Article 267, 2025
Journal ref Mach Learn 114, 267 (2025)