arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-04-13 至 2026-04-13 共收录 9
2604.09189 2026-04-13 cs.CL cs.AI cs.LG

Do LLMs Follow Their Own Rules? A Reflexive Audit of Self-Stated Safety Policies

大语言模型是否遵循自身规则?对自我声明安全政策的反思审计

Avni Mittal

机构 * Microsoft(微软)

AI总结 本文提出SNCA框架,通过提取模型自述安全规则并形式化为类型谓词,评估模型行为一致性,发现模型在安全政策与行为间存在系统性差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08970 2026-04-13 cs.CL cs.AI cs.HC cs.MA

Litmus (Re)Agent: A Benchmark and Agentic System for Predictive Evaluation of Multilingual Models

Litmus (Re)Agent:一种用于多语言模型预测评估的基准和代理系统

Avni Mittal, Shanu Kumar, Sandipan Dandapat, Monojit Choudhury

机构 * Microsoft Corporation, India(微软公司(印度)) Mohamed bin Zayed University of Artificial Intelligence (MBZUAI)(穆罕默德·本·扎耶德人工智能大学) Indian Institute of Technology Hyderabad(印度理工学院海得拉巴分校)

AI总结 本文提出Litmus (Re)Agent代理系统,通过结构化代理推理方法,在缺乏直接证据的情况下评估多语言模型性能,尤其在转移密集场景中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08865 2026-04-13 cs.AI

SPPO: Sequence-Level PPO for Long-Horizon Reasoning Tasks

SPPO:用于长时间 horizon 推理任务的序列级 PPO

Tianyi Wang, Yixia Li, Long Li, Yibiao Chen, Shaohan Huang, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Southern University of Science and Technology(南方科技大学) INFLY TECH Beijing University of Posts and Telecommunications(北京邮电大学) Microsoft Research Asia(微软亚洲研究院) Shanghai University of Finance and Economics(上海财经大学) Tsinghua University(清华大学)

AI总结 本文提出 SPPO,一种结合 PPO 的样本效率与结果稳定性的序列级算法,通过将推理过程转化为序列级上下文老虎机问题,实现低方差优势信号生成,提升推理 LLM 的对齐性能。

Comments ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08805 2026-04-13 cs.CR cs.AI

Building Better Environments for Autonomous Cyber Defence

构建更好的自主网络防御环境

Chris Hicks, Elizabeth Bates, Shae McFadden, Isaac Symes Thompson, Myles Foley, Ed Chapman, Nickolas Espinosa Dice, Ankita Samaddar, Joshua Sylvester, Himanshu Neema, Nicholas Butts, Nate Foster, Ahmad Ridley, Zoe M, Paul Jones

机构 * The Alan Turing Institute(艾伦·图灵研究所) University College London(伦敦大学学院) Cornell University(康奈尔大学) Vanderbilt University(范德比尔特大学) Microsoft(微软) NSA(美国国家安全局)

AI总结 本文通过工作坊总结,提出构建更有效的强化学习环境框架和最佳实践指南,以提升自主网络防御系统的训练与评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08781 2026-04-13 eess.IV cs.AI cs.CV eess.SP physics.med-ph

PSIRNet: Deep Learning-based Free-breathing Rapid Acquisition Late Enhancement Imaging

PSIRNet:基于深度学习的自由呼吸快速获取晚期增强成像

Arda Atalik, Hui Xue, Rhodri H. Davies, Thomas A. Treibel, Daniel K. Sodickson, Michael S. Hansen, Peter Kellman

机构 * Health Futures, Microsoft Research(微软研究院健康未来) Center for Data Science, New York University(纽约大学数据科学中心) Center for Advanced Imaging Innovation and Research (CAI2R), Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系高级成像创新与研究中心) Bernard and Irene Schwartz Center for Biomedical Imaging, Department of Radiology, NYU Grossman School of Medicine(纽约大学格罗斯曼医学院放射学系伯纳德和艾琳·施瓦茨生物医学成像中心) Institute of Cardiovascular Science, University College London(伦敦大学学院心血管科学研究所) Barts Heart Centre, Barts Health NHS Trust(巴茨健康NHS信托巴茨心脏中心)

AI总结 本文提出PSIRNet深度学习方法,通过单次呼吸获取两心跳数据生成诊断级自由呼吸PSIR晚期增强成像,相比传统需多次运动校正信号平均的方法,将扫描时间减少8-24倍。

Comments 25 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08762 2026-04-13 cs.CV cs.AI

InstrAct: Towards Action-Centric Understanding in Instructional Videos

InstrAct:迈向指令视频中的动作中心理解

Zhuoyi Yang, Jiapeng Yu, Reuben Tan, Boyang Li, Huijuan Xu

机构 * Pennsylvania State University(宾夕法尼亚州立大学) Microsoft Research(微软研究院) Nanyang Technological University(南洋理工大学)

AI总结 本文提出InstrAction框架,通过数据驱动策略和辅助目标提升指令视频中动作识别与建模,建立InstrAct基准测试集,优于现有视频基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.03512 2026-04-13 cs.AI

ActionNex: A Virtual Outage Manager for Cloud Computing

ActionNex:云计算中的虚拟故障管理器

Zhenfeng Lin, Haoji Hu, Ming Hao, Xuchao Zhang, Ryan Zhang, Junhao Li, Ze Li, Oleg Kulygin, Chetan Bansal, Hatay Tuna, Murali Chintalapati, Sheila Jiang, Salman Zafar, Angie Anderson

机构 * Microsoft PRIMO(微软PRIMO) Microsoft Research(微软研究院) Microsoft Azure Core(微软Azure Core)

AI总结 本文提出ActionNex,一个生产级智能系统,通过多模态信号处理和分层记忆子系统,实现故障管理的端到端支持,包括实时更新、知识蒸馏和基于角色和阶段的最优行动推荐,实验表明其在真实Azure故障中达到71.4%的精度和52.8-54.8%的召回率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15313 2026-04-13 cs.CL

Mnemis: Dual-Route Retrieval on Hierarchical Graphs for Long-Term LLM Memory

Mnemis:基于分层图的双路检索用于长期LLM记忆

Zihao Tang, Xin Yu, Ziyu Xiao, Zengxuan Wen, Zelin Li, Jiaxi Zhou, Hualei Wang, Haohua Wang, Haizhen Huang, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Microsoft(微软)

AI总结 Mnemis提出一种结合系统1相似性搜索和系统2全局选择机制的新型记忆框架,通过分层图实现语义层次的自顶向下检索,提升长期记忆检索性能。

Comments Accepted to ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11340 2026-04-13 cs.CV cs.RO

REACT3D: Recovering Articulations for Interactive Physical 3D Scenes

REACT3D: 交互式物理3D场景中关节的恢复

Zhao Huang, Boyang Sun, Alexandros Delitzas, Jiaqi Chen, Marc Pollefeys

机构 * ETH Zurich(苏黎世联邦理工学院) Max Planck Institute for Informatics(马克斯·普朗克信息学研究所) Microsoft Spatial AI Lab(微软空间人工智能实验室)

AI总结 REACT3D通过零样本框架实现静态3D场景到可交互模拟的转换,解决了标注过程繁琐的问题,提升了多任务应用的兼容性与效率。

Comments Accepted at IEEE Robotics and Automation Letters (RA-L)

Journal ref IEEE Robotics and Automation Letters, vol. 11, no. 5, pp. 5954-5961, May 2026

详情

展开后加载摘要…

URL PDF HTML 收藏