A Framework for Inherently Safer AGI through Language-Mediated Active Inference
机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究院)
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
机构 * IBM T.J. Watson Research Center(IBM T.J. Watson研究院)
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
机构 * University of Pennsylvania(宾夕法尼亚大学) ; NASA Ames and CMU(NASA阿姆斯特朗研究中心和卡内基梅隆大学) ; The University of Texas at Austin(德克萨斯大学奥斯汀分校) ; Cornell University(康奈尔大学) ; Penn(宾夕法尼亚大学) ; UT Austin(德克萨斯大学奥斯汀分校) ; CMU(卡内基梅隆大学)
专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI、cs.CY
专题命中 安全训练 :alignment(abstract);RLHF(abstract);safety(abstract);分类 cs.CL、cs.AI
专题命中 安全训练 :safety(abstract);trustworthy(abstract);AI safety(abstract);分类 cs.AI、cs.LG
Comments v2 with fixed formatting for URLs and hyperlinks
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments ICML 2024 NextGenAISafety workshop version with links to implementation and dataset
专题命中 安全训练 :alignment(abstract);safety(abstract);jailbreak(abstract);分类 cs.CL、cs.AI
Comments 13 pages, 2 figures
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
专题命中 安全训练 :alignment(abstract);safety(abstract);AI safety(abstract);分类 cs.AI、cs.LG
将离策略令牌转换为策略内令牌:一种改进大语言模型对齐的插件方法
机构 * Renmin University of China(中国人民大学)
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.LG
AI总结 研究针对大语言模型强化学习后训练中离策略数据问题,提出选择性重要性采样(SIS),受拒绝采样启发,以离策略模型为提议分布进行令牌级拒绝测试,理论证明可减少梯度估计差距,实验验证其有效性。
AI知识蒸馏中的可靠性-安全性权衡:一种重整化群方法
专题命中 安全训练 :safety(title,abstract)
AI总结 该研究基于统计力学构建知识蒸馏的粗粒化模型,以参数K表征危险辨别能力,揭示了AI蒸馏中可靠性与安全性的权衡关系,为多代蒸馏提供了可检验的标度预测。
通过激活分析检测语言模型中的安全训练修改
专题命中 安全训练 :safety(title,abstract)
AI总结 本研究提出AMS工具,通过激活空间几何结构检测语言模型的安全训练修改,在14种模型配置上验证了其有效性,可区分四类安全训练修改中的前三者。
Journal ref IEEE Access, vol. 14, pp. 91723-91737, 2026
MonitorVLM-v2:用于实时安全违规检测的已部署视觉-语言框架
机构 * School of Mechanical Engineering, University of Science and Technology Beijing(北京科技大学机械工程学院) ; The Laboratory for Computational Sensing and Robotics, Johns Hopkins University(约翰霍普金斯大学计算传感与机器人实验室)
专题命中 安全训练 :safety(title,abstract)
AI总结 本文提出MonitorVLM-v2框架,将VLM安全评估转化为有限符号空间概率推理,结合SymPO算法与熵驱动分类机制,在地下矿部署中实现19.45倍提速,确认违规量达人工检查的2.78倍,满足实时可审计工业监控需求。
交互式对齐
专题命中 安全训练 :alignment(title,abstract)
AI总结 研究交互式主体与人类福祉的长期对齐问题,采用人工智能主体模拟和进化博弈论框架两种方法,结果显示进化博弈论可近似宪法主体经济动态,实用规范执行能更有效维持长期对齐。
Comments 53 pages, 18 Figures, 3 tables
通过政治轴审计大语言模型中的对齐可控性
专题命中 安全训练 :alignment(title);分类 cs.CL、cs.AI、cs.CY
AI总结 研究通过对7个大语言模型进行基于提示可控性的压力测试,探讨其在政治轴上的对齐可控性,发现上下文框架起主要作用,模型移动方式有别,强调政治坐标审计需考虑分散性等可控性因素,并发布相关数据和代码。
Comments 17 pages, 6 figures, 4 tables. Accepted at AIES 2026 (AAAI/ACM Conference on AI, Ethics, and Society). This version includes the supplementary appendix. Code and data: https://github.com/mbrcic/llm-political-steerability (Zenodo DOI 10.5281/zenodo.21489805)
具有安全保障的自重构机器人船分布式运动规划
机构 * KU Leuven(鲁汶大学) ; University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Nanyang Technological University(南洋理工大学) ; SMART(新加坡制造技术研究院) ; SENSEable City Laboratory, Massachusetts Institute of Technology(麻省理工学院可感知城市实验室) ; Computer Science and Artificial Intelligence Lab (CSAIL), Massachusetts Institute of Technology(麻省理工学院计算机科学与人工智能实验室)
专题命中 安全训练 :safety(title,abstract)
AI总结 研究水生自重构机器人多智能体形状形成与重构问题,提出将分布式MPC与CBF相结合的混合框架,利用ADMM求解MPC方案,通过局部优化和信息交换计算轨迹,并应用基于CBF的滤波器保障安全,经仿真和实验验证了框架的有效性与可扩展性。
Comments Submitted to IEEE
Safe-Night VLA: 通过热感知视觉-语言-动作模型看见未见事物以实现安全关键操作
机构 * Munich Institute of Robotics and Machine Intelligence (MIRMI), Technical University of Munich (TUM)(慕尼黑机器人与机器智能研究所(MIRMI),技术大学慕尼黑(TUM))
专题命中 安全训练 :safety(title,abstract)
AI总结 Safe-Night VLA通过整合热感知技术,实现了安全关键操作中的非可见领域感知与稳健执行。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)
SIVA-RL:用于多模态强化学习的灵敏度不变视觉对齐
机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Shanghai Jiao Tong University(上海交通大学) ; Sichuan University(四川大学) ; The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) ; University of Macau(澳门大学)
专题命中 安全训练 :alignment(title,abstract)
AI总结 研究多模态强化学习中视觉语言模型预测与视觉证据结合问题,提出SIVA-RL框架,通过特定方法构建局部干预并以奖励下降为权重驱动对齐,在多基准测试中相比基线改进了模型。
Comments 27 pages, 11 figures
完美演示造就差劲教师:从关键运动片段学习鲁棒对齐
机构 * Zhejiang University(浙江大学) ; Shanghai Innovation Institute(上海创新研究院) ; Hong Kong University of Science and Technology (GZ)(香港科技大学(广州)) ; Nanjing University(南京大学)
专题命中 安全训练 :alignment(title,abstract)
AI总结 针对精细操作中流畅演示因压缩关键对齐动作导致策略学习不足的问题,提出数据级重采样和表示级STAIR特征,利用稠密运动感知监督提升策略鲁棒性。
VLM-CASE:面向前瞻安全自动驾驶的视觉语言模型赋能上下文自适应安全包络
机构 * Department of Civil and Environmental Engineering, The Pennsylvania State University(宾夕法尼亚州立大学土木与环境工程系) ; Department of Civil Engineering, Stony Brook University(石溪大学土木工程系)
专题命中 安全训练 :safety(title,abstract)
AI总结 针对恶劣工况下自动驾驶感知与性能退化、仅能事后响应的问题,提出基于微调VLM的上下文自适应安全包络框架,实现前瞻安全控制,在多场景仿真中性能优于基线方法。
基于参数安全证明的自适应防护
专题命中 安全训练 :safety(title,abstract)
AI总结 本文提出一种编程语言框架,允许专家静态指定自适应防护,以确保学习代理的安全控制范围,并在运行时获取知识时变得更加宽松。
Journal ref Proceedings of the ACM on Programming Languages, Volume 9, Issue OOPSLA1, 2025
AI训练集群的预调度共振安全准则
专题命中 安全训练 :safety(title,abstract)
AI总结 针对AI训练集群在BSP协议下对电网产生的周期性功率波动,提出一种预调度安全准则,通过解析两区域摇摆方程,界定危险迭代周期带,并量化集群规模上限。
Comments Submitted for North American Power Symposium (NAPS) 2026, October 11 - 13, 2026
Safe-SAGE: 通过拉普拉斯调制泊松安全函数实现安全交互的社会-语义自适应引导
机构 * Caltech MCE(Caltech机械工程系) ; Tufts ME(Tufts大学机械工程系)
专题命中 安全训练 :safety(title,abstract)
AI总结 提出Safe-SAGE框架,结合泊松安全函数与拉普拉斯引导场,融合多传感器点云与视觉语义分割,通过多层安全滤波器实现腿式机器人在语义丰富动态环境中的安全导航。
Comments Accepted to the 2026 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS 2026). Copyright transferred to IEEE
基于CBF的去中心化安全滤波器:面向输入受限的协同导弹系统碰撞避免
专题命中 安全训练 :safety(title,abstract)
AI总结 针对多飞行器拦截场景,提出基于鲁棒控制屏障函数的去中心化安全滤波器,通过事件触发和松弛变量优化实现碰撞避免,兼顾计算效率与可扩展性。
Comments 7 pages, 5 figures, accepted for presentation at the 2026 American Control Conference (ACC 2026)
基于拍卖的责任分配用于可扩展的去中心化安全滤波器在多智能体协同避碰中
专题命中 安全训练 :safety(title,abstract)
AI总结 提出基于高阶控制屏障函数和拍卖责任分配的可扩展去中心化安全滤波器,通过非对称分配约束减少计算负荷,实现多智能体协同避碰。
Comments 6 pages, 3 figures, accepted for presentation at the IFAC World Congress 2026
SAFER-Nav: 通过分割感知微调增强视觉机器人导航的安全性
机构 * Dept. of Electronic Engineering, Sogang University(西江大学电子工程系) ; Dept. of Computer Science, Rice University(莱斯大学计算机科学系) ; Vertical Labs, Co., Ltd.(Vertical Labs 有限公司)
专题命中 安全训练 :safety(title,abstract)
AI总结 提出SAFER-Nav方法,通过分割感知微调将障碍物边界和可通行空间结构直接融入导航策略,降低碰撞频率并保持目标到达性能。
超越单一策略:评估LLM聊天机器人中组合的组织特定策略对齐
专题命中 安全训练 :alignment(title,abstract)
AI总结 针对现有基准忽视的组合策略违规问题,提出COPAL工具,通过经验推导的交互模式和显式处理契约生成触发组合策略失败的查询,在9个模型中平均错误率达33.1%。
将对抗性攻击者驱赶至安全区域以保护关键安全基础设施
专题命中 安全训练 :safety(title,abstract)
AI总结 本文研究了在城市环境中防御关键安全基础设施免受对抗性空中攻击的问题,通过圆形弧形防御者阵型,在存在矩形障碍物的情况下,利用向量场引导法则将攻击者驱赶至预定义的安全区域。提出了一种新的有限时间稳定控制器,用于引导防御者形成 desired 阵型并避免障碍物和相互碰撞。
Comments ACC 2019
多智能体安全性的自动通信需求生成
专题命中 安全训练 :safety(title,abstract)
AI总结 本文研究多智能体系统中通信需求的自动生成,提出无需协调的可控前驱运算符以确定安全约束下的自主行为,展示连接延迟上限和自触发协调方案的应用。
Comments In Proceedings SCAV 2018, arXiv:1804.03406
Journal ref EPTCS 269, 2018, pp. 3-16
ICAN-Deploy:面向安全关键具身智能体的身份稳定金丝雀部署
机构 * Harbin Institute of Technology(哈尔滨工业大学) ; Heriot-Watt University, Malaysia Campus(赫瑞-沃德大学马来西亚分校) ; Fraunhofer Institute for Applied Information Technology(弗劳恩霍夫应用信息技术研究所) ; Soochow University(苏州大学)
专题命中 安全训练 :safety(title,abstract)
AI总结 提出ICAN-Deploy中间件,通过分离能力名称与版本,在安全关键具身智能体的金丝雀部署中保持身份哈希不变,避免重新认证。
Comments 14 pages, 6 figures, 4 tables