Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies
大语言模型是否遵循自身规则?对自我声明安全政策的反思审计
机构 * Microsoft(微软)
AI总结 本文提出SNCA框架,通过提取模型自述安全规则并形式化为类型谓词,评估模型行为一致性,发现模型在安全政策与行为间存在系统性差距。
大厂专区
大语言模型是否遵循自身规则?对自我声明安全政策的反思审计
机构 * Microsoft(微软)
AI总结 本文提出SNCA框架,通过提取模型自述安全规则并形式化为类型谓词,评估模型行为一致性,发现模型在安全政策与行为间存在系统性差距。
Litmus (Re)Agent:一种用于多语言模型预测评估的基准和代理系统
机构 * Microsoft Corporation, India(微软公司(印度)) ; Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) ; Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)
AI总结 本文提出Litmus (Re)Agent代理系统,通过结构化代理推理方法,在缺乏直接证据的情况下评估多语言模型性能,尤其在转移密集场景中表现突出。
SPPO:用于长时间 horizon 推理任务的序列级 PPO
机构 * Southern University of Science and Technology(南方科技大学) ; INFLY TECH ; Beijing University of Posts and Telecommunications(北京邮电大学) ; Microsoft Research Asia(微软亚洲研究院) ; Shanghai University of Finance and Economics(上海财经大学) ; Tsinghua University(清华大学)
AI总结 本文提出 SPPO,一种结合 PPO 的样本效率与结果稳定性的序列级算法,通过将推理过程转化为序列级上下文老虎机问题,实现低方差优势信号生成,提升推理 LLM 的对齐性能。
Comments ACL 2026 Main
构建更好的自主网络防御环境
机构 * The Alan Turing Institute(艾伦·图灵研究所) ; University College London(伦敦大学学院) ; Cornell University(康奈尔大学) ; Vanderbilt University(范德比尔特大学) ; Microsoft(微软) ; NSA(美国国家安全局)
AI总结 本文通过工作坊总结,提出构建更有效的强化学习环境框架和最佳实践指南,以提升自主网络防御系统的训练与评估。
PSIRNet:基于深度学习的自由呼吸快速获取晚期增强成像
机构 * Health Futures, Microsoft Research(微软研究院健康未来) ; Center for Data Science, New York University(纽约大学数据科学中心) ; Center for Advanced Imaging Innovation and Research (CAI2R), Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系高级成像创新与研究中心) ; Bernard and Irene Schwartz Center for Biomedical Imaging, Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系伯纳德和艾琳·施瓦茨生物医学成像中心) ; Institute of Cardiovascular Science, University College London(伦敦大学学院心血管科学研究所) ; Barts Heart Centre, Barts Health NHS Trust(巴茨健康NHS信托巴茨心脏中心)
AI总结 本文提出PSIRNet深度学习方法,通过单次呼吸获取两心跳数据生成诊断级自由呼吸PSIR晚期增强成像,相比传统需多次运动校正信号平均的方法,将扫描时间减少8-24倍。
Comments 25 pages, 5 figures, 4 tables
InstrAct:迈向指令视频中的动作中心理解
机构 * Pennsylvania State University(宾夕法尼亚州立大学) ; Microsoft Research(微软研究院) ; Nanyang Technological University(南洋理工大学)
AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。
ActionNex:云计算中的虚拟故障管理器
机构 * Microsoft PRIMO(微软PRIMO) ; Microsoft Research(微软研究院) ; Microsoft Azure Core(微软Azure Core)
AI总结 本文提出ActionNex,一个生产级智能系统,通过多模态信号处理和分层记忆子系统,实现故障管理的端到端支持,包括实时更新、知识蒸馏和基于角色和阶段的最优行动推荐,实验表明其在真实Azure故障中达到71.4%的精度和52.8-54.8%的召回率。
Mnemis:基于分层图的双路检索用于长期LLM记忆
机构 * Microsoft(微软)
AI总结 Mnemis提出一种结合系统1相似性搜索和系统2全局选择机制的新型记忆框架,通过分层图实现语义层次的自顶向下检索,提升长期记忆检索性能。
Comments Accepted to ACL2026
REACT3D: 交互式物理3D场景中关节的恢复
机构 * ETH Zurich(苏黎世联邦理工学院) ; Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) ; Microsoft Spatial AI Lab(微软空间人工智能实验室)
AI总结 REACT3D通过零样本框架实现静态3D场景到可交互模拟的转换,解决了标注过程繁琐的问题,提升了多任务应用的兼容性与效率。
Comments Accepted at IEEE Robotics and Automation Letters (RA-L)
Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 5, pp. 5954-5961, May 2026