Learning Optimal Personalized Treatment Rules Using Robust Regression Informed K-NN
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216
AI 大模型
大模型对齐、安全、越狱、红队、提示注入和可信评测。
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments Machine Learning for Health (ML4H) Workshop at NeurIPS 2018 arXiv:1811.07216
专题命中 安全训练 :safety(abstract);分类 cs.LG
专题命中 安全训练 :safety(abstract);分类 cs.AI
Comments 8 pages
专题命中 安全训练 :alignment(abstract);分类 cs.CY
Comments 6 pages
专题命中 安全训练 :safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);分类 cs.AI
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments Videos of our experiments are available at: https://sites.google.com/site/mlleavenotrace/
专题命中 安全训练 :trustworthy(abstract);分类 cs.LG
Comments 9 pages, 10 figures
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments Accepted to ICML 2017
专题命中 安全训练 :safety(abstract);分类 cs.AI
Comments arXiv admin note: text overlap with arXiv:1501.05120
Journal ref European Journal of Scientific Research, ISSN 1450-216X / 1450-202X Vol.117 No.1 January, 2014, pp. 35-55
专题命中 安全训练 :safety(abstract);分类 cs.LG
Comments 15 pages, 2 figures
Spike-Killer:面向真实Windows工作站安全性能诊断的证据门控大语言模型辅助方案
专题命中 安全训练 :trustworthy(abstract);safety(comments)
AI总结 该研究提出Spike-Killer,一种人在环的证据门控工作流,用于安全诊断Windows工作站的帧时间问题,以CS2为目标应用验证了其可审计性,为LLM辅助智能体提供了可信操作模式。
Comments 6 pages. Experience report; no causal CS2 frame-time improvement or autonomous-safety claim is made
机构 * Technical University of Munich(慕尼黑工业大学) ; Continental AG(大陆集团) ; Technical University of Berlin(柏林工业大学)
专题命中 安全训练 :safety(abstract,journal_ref)
Journal ref 2024 IEEE International Conference on Vehicular Electronics and Safety (ICVES)
专题命中 安全训练 :safety(abstract,comments)
Comments Accepted to the 2024 European Control Conference. See Section VI.B (in particular, Theorem 1, Proposition 2, and Remark 2) for updates incorporating new results (from Reference 3) on almost-sure safety of ZCBFs
机构 * University of California, Berkeley(加州大学伯克利分校) ; Columbia University(哥伦比亚大学) ; Johns Hopkins University(约翰霍普金斯大学)
专题命中 安全训练 :alignment(comments,journal_ref);分类 cs.AI、cs.LG
Comments Accepted by ICML 2025 Workshop on Models of Human Feedback for AI Alignment
Journal ref ICML 2025 Workshop on Models of Human Feedback for AI Alignment
会喊“狼来了”的守卫:恐怖词汇如何导致智能体防护栏拒绝合法操作
专题命中 安全训练 :safety(abstract)
AI总结 本研究构建了首个针对智能体防护栏过度安全问题的基准Cautious Bench,发现防护栏存在名称迷信效应,会因对象名称而非授权上下文过度拒绝合法操作。
Self-OPD:无需教师模型的流匹配模型的在线策略蒸馏
机构 * Tsinghua University(清华大学) ; Zhejiang University(浙江大学) ; Alibaba Group(阿里巴巴集团)
专题命中 安全训练 :alignment(abstract)
AI总结 本文提出Self-OPD,一种无需教师模型的流匹配模型在线策略蒸馏框架,通过分支SDE候选与奖励比较优化速度场,在基准测试中优于现有无教师的RL和OPD方法。
Comments 19 pages, 10 figures
打破舍入陷阱:保护LLM免受量化条件后门攻击
专题命中 安全训练 :alignment(abstract)
AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。
AirMoE:在无线边缘实现无线分布式混合专家(Mixture-of-Experts,MoE)推理
专题命中 安全训练 :alignment(abstract)
AI总结 AirMoE是利用AirComp实现无线分布式MoE推理的框架,通过双时间尺度策略解决AirComp带来的挑战,在ARC-Easy基准上显著提升了E2E推理准确性,尤其适用于强设备异构场景。
Heimdall: 形式化验证的遗留 eBPF 程序到 Rust 的自动迁移
专题命中 安全训练 :safety(abstract)
AI总结 本文提出 Heimdall,一个利用大语言模型将遗留 libbpf C 程序自动翻译为 Aya Rust 的管道,通过静态分析和符号执行确保迁移后程序行为等价,并修复了 eBPF 程序中六类源级漏洞,包括未报告的信息泄露。
智能体何时能安全地进行检查点、分叉、恢复与合并?执行编辑的精确检查
专题命中 安全训练 :safety(abstract)
AI总结 该研究针对智能体的检查点、分叉等执行编辑操作,提出一种精确判定编辑安全性的算法,通过形式化方法验证,相关成果已在 Lean 中实现并开源。
Comments 24 pages
AgentFlow:一种以流为中心的策略语言与框架,用于保障大语言模型智能体系统的安全
专题命中 安全训练 :safety(abstract)
AI总结 本文提出以流为中心的AgentFlow策略语言与框架,通过运行时监控与SMT验证保障LLM智能体系统安全,在多基准测试中显著降低入侵率并提升效用。
面向多区域住宅建筑节能HVAC控制的安全深度强化学习
专题命中 安全训练 :safety(abstract)
AI总结 该研究针对多区域住宅建筑HVAC控制的能耗-安全问题,提出带安全认证的深度强化学习框架,在仿真中训练PPO与SAC智能体,验证了其在降低能耗、减少舒适度违规方面的有效性及安全保证的可行性。
Comments 6 pages, 5 figures. Accepted to IEEE Conference on Control Technology and Applications (CCTA) 2026
基于相位分解强化学习的分布式多机器人月球货物运输
机构 * Tohoku University(东北大学) ; École Centrale de Lille(里尔中央理工学院) ; Institut Teknologi Bandung(万隆理工学院)
专题命中 安全训练 :safety(abstract)
AI总结 提出相位分解强化学习框架,将月球货物运输分解为提升、运输和放置三个阶段,分别优化联合状态策略,实现分布式机器人协同运输,仿真和硬件实验验证了可靠性。
Comments 8 pages, 9 Figures, Accepted at IROS2026
面向自主位姿估计的几何扰动鲁棒性验证
机构 * Airbus SAS(空中客车公司) ; IRT Saint-Exupery(圣埃克苏佩里技术研究院)
专题命中 安全训练 :safety(abstract)
AI总结 本文针对自主位姿估计的几何扰动鲁棒性验证问题,提出基于全局利普希茨优化(GLO)的方法,在YOLOv8-Pose模型上验证其可高效定位失效模式并剪枝80%以上搜索空间,为鲁棒自主感知验证提供了新途径。
Comments 15 pages, 7 figures
大语言模型智能体何时有用?自动驾驶车辆边缘的感知期限感知混合关键度任务调度
专题命中 安全训练 :safety(abstract)
AI总结 该研究针对自动驾驶车辆边缘MEC的混合关键度任务调度,构建强启发式算法,发现LLM控制平面仅在安全关键任务激增时优于静态启发式算法。
Comments 8 pages, 5 figures, and 4 tables
机构 * City College of New York(纽约城市学院)
专题命中 安全训练 :safety(abstract)
Comments 5 pages,3 figures, 1 table, CVPR DriveX workshop
Journal ref DriveX Workshop at IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR), 2026
简短公告:拜占庭SMR中隐藏状态授权的公平绑定
专题命中 安全训练 :safety(abstract)
AI总结 针对拜占庭SMR中隐藏状态授权问题,提出公平预留/使用协议,满足授权安全性与先到者活性,解决隐藏资源安全动态分配问题。
Comments Accepted at DISC 2026
先见后答:面向视觉语言模型的无训练视觉层分析
机构 * Leibniz Universität Hannover(汉诺威莱布尼茨大学) ; University of Bath(巴斯大学)
专题命中 安全训练 :alignment(abstract)
AI总结 该研究提出无需训练的视觉数据集熵(VDE)方法,可预测视觉语言模型的最优视觉层,缩小搜索范围,相比GW距离更具实用性。
Comments ECCVW'26 eXCV
面向6G AI-RAN的深度强化学习:一项综合调查
专题命中 安全训练 :trustworthy(abstract)
AI总结 本文针对6G开放AI-RAN,首次开展深度强化学习(DRL)综合调查,梳理DRL基础、O-RAN感知框架、DRL应用分类及相关研究方向,填补了DRL方法论与O-RAN部署间的系统关联空白。