Best Arm Identification with Safety Constraints
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments 7 pages, 5 figures, 2021 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Published in Sensors
Journal ref Sensors 2021, 21, 2032
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments In submission, 16 pages (including appendix)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Accepted at IROS2020. Project site: https://denkiwakame.github.io/l2b/
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments Accepted by Information and Software Technology. arXiv admin note: substantial text overlap with arXiv:1908.06540
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments 9 pages
Journal ref IAES International Journal of Artificial Intelligence (IJ-AI) Vol. 9, No. 3, September 2020, pp. 439~447, ISSN: 2252-8938, DOI: 10.11591/ijai.v9.i3.pp439-447
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Accepted to the 37th International Conference on Machine Learning (ICML 2020)
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments 6 pages, 7 figure, 1 table
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Extended version (12 Pages), Short version submitted to Learning for Dynamics & Control (L4DC) 2020 Conference
专题命中 安全训练 :safety(title,abstract);分类 cs.LG
Comments Accepted at Safe AI workshop at AAAI 2020
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
专题命中 安全训练 :trustworthy(title,abstract);分类 cs.CY
Comments Position paper, accepted by The 1st Workshop on Distributed Ledger of Things (DLoT 2018), co-located with EAI Mobiquitous 2018. Nov. 5, 2018, New York, NY, USA
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments 12 pages, 7 figures
专题命中 安全训练 :safety(title,abstract);分类 cs.AI
Comments Accepted by International Conference on Computer Aided Verification (CAV) 2018
专题命中 安全训练 :safety(title,abstract);分类 cs.CY
Comments Big Data, 2017
在不可控代理中使用重建的控制屏障函数实现分布式安全关键控制
专题命中 安全训练 :safety(title,abstract)
AI总结 本文研究了在存在不确定行为的不可控代理的多智能体系统中分布式安全关键控制的问题,提出了一种新的重建控制屏障函数方法,通过分布式自适应观测器获得其他代理的状态估计来重建耦合的控制屏障函数,并设计了安全关键二次规划控制器,证明了所提出的分布式控制方案在不确定动态环境中能够严格保证系统安全。
Journal ref Y. Peng, W. Wang, J. Yan and M. Yu, "Distributed Safety Critical Control among Uncontrollable Agents Using Reconstructed Control Barrier Functions," 2026 European Control Conference (ECC), Reykjavík, Iceland, 2026, pp. 1084-1089
专题命中 安全训练 :alignment(title,abstract)
Comments Bidirectional Human-AI Alignment (Bi-Align) Workshop @ ICLR 2025
专题命中 安全训练 :safety(title,abstract)
Comments 7 Pages, accepted for Safety of Industrial Automated Systems, SIAS 2024
低宜人性人格条件化用于安全的大语言模型微调
机构 * Hong Kong University of Science and Technology(香港科技大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
AI总结 针对温暖微调降低大语言模型安全性的问题,提出基于低宜人性人格的改写流水线,在保持对话温暖的同时降低越狱成功率与有害输出率。
Comments 9 pages, 8 tables, 5 figures
语义自验证的NP难下界复杂度
机构 * University of Cambridge(剑桥大学)
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.CL、cs.AI
AI总结 本文证明语义自验证问题在特定框架下为NP完全,通过将3SAT问题归约到SSV,揭示了即使简化形式的语义自验证也面临计算障碍,对AI安全和公平性方法有重要影响。
Comments EACL 2026
机构 * OpenAI
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
机构 * University of Arizona(亚利桑那大学)
专题命中 安全训练 :safety(abstract);prompt injection(abstract);AI safety(abstract);分类 cs.AI、cs.LG