Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR
反叛学生:通过自蒸馏RLVR反转教师信号进行推理探索
机构 * Microsoft Research(微软研究院) ; KAIST(韩国科学技术院)
AI总结 本文提出RLRT,通过反转自蒸馏信号增强正确路径上的推理,提升RLVR性能,建立信息不对称作为新设计轴。
大厂专区
反叛学生:通过自蒸馏RLVR反转教师信号进行推理探索
机构 * Microsoft Research(微软研究院) ; KAIST(韩国科学技术院)
AI总结 本文提出RLRT,通过反转自蒸馏信号增强正确路径上的推理,提升RLVR性能,建立信息不对称作为新设计轴。
Oracle Poisoning:污染知识图谱以武器化AI代理推理
机构 * Microsoft(微软) ; UNSW Canberra(新南威尔士大学堪培拉分校) ; SAP ; OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)
AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。
Comments 26 pages, 3 fugres, 16 tables
工具赋能AI代理的安全风险:对特权执行环境的系统分析
机构 * Microsoft Corporation, USA(微软公司)
AI总结 本文系统分析了云托管AI代理的安全风险,通过三个代表性场景展示风险,并讨论了缓解策略及其权衡。研究发现,许多风险源于过度授权工具、能力意图不匹配和环境权威泄露。
Comments Extended author preprint. A shortened version has been accepted as a short paper at IEEE COMPSAC 2026. 7 pages, 3 figures/tables
CodeClinic:评估临床推理代理的编码技能自动化
机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。
位置:避免为每个企业任务过度使用大语言模型
机构 * Eka Labs AI ; Microsoft(微软) ; SAP
AI总结 本文提出企业任务应避免过度依赖大语言模型,主张通过模块化架构提升可靠性与可维护性。
Delulu:一种经过验证的多语言基准,用于检测填充中间任务中的代码幻觉
机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) ; Microsoft(微软)
AI总结 Delulu是一个包含1951个跨7种语言和4种幻觉类型的填充中间任务样本的多语言基准,通过对抗性流程筛选出经过验证的样本,评估了11种开放式FIM模型,证明了任务内在难度而非模型家族特定。
统一科学交流:跨科学媒体的细粒度对应
机构 * IIIT Hyderabad(IIIT海得拉尔学院) ; Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)
AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。
Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026
MAGIC: 多步优势门多智能体强化学习中的多步优势门因果影响
机构 * Dalian University of Technology(大连理工大学) ; Microsoft(微软) ; Microsoft, Beijing, China(微软(北京,中国))
AI总结 MAGIC通过多步优势门因果影响方法,估计多智能体强化学习中多步动作影响,将其中的有益行为转化为内在奖励,提升协调性。
STRIVE:结构化时空探索用于视频问答的强化学习
机构 * University of Bonn(波恩大学) ; Microsoft(微软) ; Meta ; Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)
AI总结 STRIVE通过构建多时空变体和联合归一化提升视频问答的奖励信号,采用重要性感知采样机制增强策略更新稳定性,实验表明在多个大模型上提升了视频推理性能。
EventTSF: 基于事件的非平稳时间序列预测
机构 * Griffith University, Australia(澳大利亚格里菲斯大学) ; Xidian University, China(西安电子科技大学) ; Yunnan University, China(云南大学) ; Microsoft Research Asia, China(微软亚洲研究院)
AI总结 本文提出EventTSF框架,通过分步扩散整合时间序列与文本事件,解决非平稳时间序列预测中的多模态交互问题,实验显示在7个数据集上优于12个基线模型。
Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)
Simulus:结合高效样本世界模型代理的改进
机构 * Technion(技术ion大学) ; Microsoft Research(微软研究院) ; ByteDance Seed(字节跳动种子实验室)
AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。
Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature
ArchRAG: 基于属性社区的分层检索增强生成
机构 * Microsoft(微软)
AI总结 ArchRAG通过引入属性社区和层次聚类方法,提升图数据检索效率与生成准确性,降低token消耗。
Comments Published in Proceedings of the AAAI Conference on Artificial Intelligence, 2026
Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(19), 15868-15876, 2026
内在缪子:在黎曼矩阵流形上的谱优化
机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) ; Indian Institute of Technology Bombay, India(印度理工学院班加罗尔,印度) ; University of Sydney, Australia(悉尼大学,澳大利亚) ; Microsoft India(微软印度)
AI总结 本文提出内在缪子框架,通过在固定秩、SPD、Stiefel和Grassmann流形上实现闭式更新,解决传统缪子在流形参数上的泛化问题,并提供收敛保证。
Comments Code: https://github.com/1bang118/manifold-intrinsic-muon
生成无泄漏的基准以评估鲁棒的RAG
机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) ; New Jersey Institute of Technology(新泽西理工学院) ; University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research(微软研究院)
AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。
揭示偏好能否澄清大语言模型对齐与引导?
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Research(微软研究院)
AI总结 本文提出一种经验方法,通过估计LLM在决策任务中的隐含偏好,评估模型是否一致地追求目标,是否能描述其目标,以及提示是否能可靠引导策略。
受人类启发的记忆架构用于大语言模型代理
机构 * Microsoft(微软)
AI总结 本文提出一种受生物启发的记忆架构,通过六个认知机制解决内存积累问题,并引入合成校准方法提升评估准确性。
Comments 10 pages, 4 tables. Preprint; comments welcome
无需训练的空间几何形状编码(技术报告)
机构 * Microsoft Research(微软研究院)
AI总结 本文提出XShapeEnc,一种无需训练的通用空间几何形状编码策略,通过分解几何形状和姿态,利用正交Zernike基和频率传播操作,实现高效、可逆且频率丰富的紧凑表示,适用于多种二维空间任务。
Comments Training-Free 2D Geometric Shape Encoding
有意违背:自动检测代理轨迹中的故障
机构 * University of Washington(华盛顿大学) ; Microsoft Research(微软研究院)
AI总结 本文提出AgentPex工具,通过提取规则自动评估代理轨迹,发现传统仅关注结果的评估方法无法检测到关键流程故障,如错误的工作流路由、不安全的工具使用或违反提示规则的情况。
Comments Accepted at ACM CAIS 2026
当代理人言辞与行为不一致时:从LLMs中验证提取的信念
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Microsoft Research(微软研究院)
AI总结 本文提出一种决策理论框架,通过提取概率判断和决策并检验其一致性,验证LLMs的信念是否合理,发现最强模型的不一致程度较小。
专家评估与心理健康AI安全测试中人类反馈的局限性
机构 * Stanford University(斯坦福大学) ; University College London(伦敦大学学院) ; Microsoft(微软)
AI总结 本研究探讨了在心理健康AI安全测试中,专家评估与人类反馈的有效性,发现专家间一致性差,揭示了专家分歧是社会技术现象,建议转向保留专家分歧的对齐方法。
Comments 17 pages, 7 pages of appendix, 21 tables
GraphBench: 图学习下一代基准测试
机构 * RWTH Aachen University(亚琛RWTH大学) ; University of Oxford(牛津大学) ; Mila – Quebec AI Institute(魁北克AI研究所) ; Technion - Israel Institute of Technology(技术学院-以色列理工学院) ; ETAS Research University of Stuttgart(斯图加特大学ETAS研究所) ; Google Research(谷歌研究) ; Microsoft Research(微软研究院)
AI总结 GraphBench 提供标准化评估协议和统一超参数调优框架,用于评估图学习任务中的泛化能力,推动图学习领域的发展。
WATCH:大范围考古遗址跟踪用于变化检测
机构 * Microsoft AI for Good Research Lab(微软AI for Good研究实验室) ; Iconem, Paris, France(Iconem公司,巴黎,法国) ; Planet Labs PBC(Planet Labs公司)
AI总结 WATCH通过三种方法实现大规模考古遗址变化检测,利用卫星影像和基础模型嵌入,提高遗址保护的效率和准确性。