arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-05-12 至 2026-05-12 共收录 22
2605.10781 2026-05-12 cs.LG cs.CL

Rebellious Student: Reversing Teacher Signals for Reasoning Exploration with Self-Distilled RLVR

反叛学生:通过自蒸馏RLVR反转教师信号进行推理探索

Jeonghye Kim, Jiwon Jeon, Dongsheng Li, Yuqing Yang

机构 * Microsoft Research(微软研究院) KAIST(韩国科学技术院)

AI总结 本文提出RLRT,通过反转自蒸馏信号增强正确路径上的推理,提升RLVR性能,建立信息不对称作为新设计轴。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09822 2026-05-12 cs.CR cs.AI

Oracle Poisoning: Corrupting Knowledge Graphs to Weaponise AI Agent Reasoning

Oracle Poisoning:污染知识图谱以武器化AI代理推理

Ben Kereopa-Yorke, Guillermo Diaz, Holly Wright, Reagan Johnston, Ron F. Del Rosario, Timothy Lynar

机构 * Microsoft(微软) UNSW Canberra(新南威尔士大学堪培拉分校) SAP OWASP Gen AI Security Project(OWASP生成式人工智能安全项目)

AI总结 本文研究了通过污染知识图谱来破坏AI代理推理的攻击方法,展示了六个针对生产级代码知识图谱的攻击场景,揭示了攻击者熟练度对信任度的影响,并评估了多种防御措施的有效性。

Comments 26 pages, 3 fugres, 16 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09721 2026-05-12 cs.CR cs.AI

Security Risks in Tool-Enabled AI Agents: A Systematic Analysis of Privileged Execution Environments

工具赋能AI代理的安全风险:对特权执行环境的系统分析

Hardik Goel

机构 * Microsoft Corporation, USA(微软公司)

AI总结 本文系统分析了云托管AI代理的安全风险,通过三个代表性场景展示风险,并讨论了缓解策略及其权衡。研究发现,许多风险源于过度授权工具、能力意图不匹配和环境权威泄露。

Comments Extended author preprint. A shortened version has been accepted as a short paper at IEEE COMPSAC 2026. 7 pages, 3 figures/tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09675 2026-05-12 cs.AI cs.MA

CodeClinic: Evaluating Automation of Coding Skills for Clinical Reasoning Agents

CodeClinic:评估临床推理代理的编码技能自动化

Timothy Ossowski, Xinchi Liu, Danyal Maqbool, Vaibhav Dhanuka, Sheng Zhang, Hoifung Poon, Majid Afshar, Tyler Bradshaw, Junjie Hu

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Microsoft Research(微软研究院)

AI总结 CodeClinic通过MIMIC-IV构建基准,评估LLM代理是否能合成和组合可重用的临床技能,而非依赖固定工具库,包含纵向ICU监控和组合信息检索任务,提升多步推理效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09365 2026-05-12 cs.AI cs.CL

Position: Avoid Overstretching LLMs for every Enterprise Task

位置:避免为每个企业任务过度使用大语言模型

Kuldeep Singh, Anson Bastos, Isaiah Onando Mulang'

机构 * Eka Labs AI Microsoft(微软) SAP

AI总结 本文提出企业任务应避免过度依赖大语言模型,主张通过模块化架构提升可靠性与可维护性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07024 2026-05-12 cs.LG cs.AI

Delulu: A Verified Multi-Lingual Benchmark for Code Hallucination Detection in Fill-in-the-Middle Tasks

Delulu:一种经过验证的多语言基准,用于检测填充中间任务中的代码幻觉

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

AI总结 Delulu是一个包含1951个跨7种语言和4种幻觉类型的填充中间任务样本的多语言基准,通过对抗性流程筛选出经过验证的样本,评估了11种开放式FIM模型,证明了任务内在难度而非模型家族特定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05831 2026-05-12 cs.CV

Unifying Scientific Communication: Fine-Grained Correspondence Across Scientific Media

统一科学交流:跨科学媒体的细粒度对应

Megha Mariam K. M, Vineeth N. Balasubramanian, C. V. Jawahar

机构 * IIIT Hyderabad(IIIT海得拉尔学院) Microsoft Research India & IIT Hyderabad(微软研究院印度分部及IIIT海得拉尔学院)

AI总结 本文提出MCD数据集,通过整合科研论文、演示视频、解释视频和幻灯片,评估不同模型在发现跨格式细粒度对应关系中的能力,揭示了视觉语言模型和嵌入模型的优缺点。

Comments Accepted at the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Findings Track, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01805 2026-05-12 cs.MA cs.LG

MAGIC: Multi-Step Advantage-Gated Causal Influence for Multi-agent Reinforcement Learning

MAGIC: 多步优势门多智能体强化学习中的多步优势门因果影响

Haohan Yu, Jinmiao Cong, Shengzhi Wang, Lu Wang, Chanjuan Liu

机构 * Dalian University of Technology(大连理工大学) Microsoft(微软) Microsoft, Beijing, China(微软(北京,中国))

AI总结 MAGIC通过多步优势门因果影响方法,估计多智能体强化学习中多步动作影响,将其中的有益行为转化为内在奖励,提升协调性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01824 2026-05-12 cs.CV

STRIVE: Structured Spatiotemporal Exploration for Reinforcement Learning in Video Question Answering

STRIVE:结构化时空探索用于视频问答的强化学习

Emad Bahrami, Olga Zatsarynna, Parth Pathak, Sunando Sengupta, Juergen Gall, Mohsen Fayyaz

机构 * University of Bonn(波恩大学) Microsoft(微软) Meta Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔人工智能与机器学习研究所)

AI总结 STRIVE通过构建多时空变体和联合归一化提升视频问答的奖励信号,采用重要性感知采样机制增强策略更新稳定性,实验表明在多个大模型上提升了视频推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13434 2026-05-12 cs.LG cs.AI

EventTSF: Event-Aware Non-Stationary Time Series Forecasting

EventTSF: 基于事件的非平稳时间序列预测

Yunfeng Ge, Ming Jin, Yiji Zhao, Hongyan Li, Bo Du, Chang Xu, Shirui Pan

机构 * Griffith University, Australia(澳大利亚格里菲斯大学) Xidian University, China(西安电子科技大学) Yunnan University, China(云南大学) Microsoft Research Asia, China(微软亚洲研究院)

AI总结 本文提出EventTSF框架,通过分步扩散整合时间序列与文本事件,解决非平稳时间序列预测中的多模态交互问题,实验显示在7个数据集上优于12个基线模型。

Comments Accepted by the 35th International Joint Conference on Artificial Intelligence (IJCAI 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11537 2026-05-12 cs.LG cs.AI

Simulus: Combining Improvements in Sample-Efficient World Model Agents

Simulus:结合高效样本世界模型代理的改进

Lior Cohen, Kaixin Wang, Bingyi Kang, Uri Gadot, Shie Mannor

机构 * Technion(技术ion大学) Microsoft Research(微软研究院) ByteDance Seed(字节跳动种子实验室)

AI总结 本文提出Simulus,一种模块化的基于标记的世界模型代理,通过整合灵活的标记化框架、内在动机、优先世界模型回放和回归-分类方法,提升了样本效率,适用于多个基准测试。

Comments Revised version: updated title, abstract, and framing to better reflect our contributions and situate the work within the literature

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09891 2026-05-12 cs.IR cs.AI

ArchRAG: Attributed Community-based Hierarchical Retrieval-Augmented Generation

ArchRAG: 基于属性社区的分层检索增强生成

Shu Wang, Yixiang Fang, Yingli Zhou, Xilin Liu, Yuchi Ma

机构 * Microsoft(微软)

AI总结 ArchRAG通过引入属性社区和层次聚类方法,提升图数据检索效率与生成准确性,降低token消耗。

Comments Published in Proceedings of the AAAI Conference on Artificial Intelligence, 2026

Journal ref Proceedings of the AAAI Conference on Artificial Intelligence, 40(19), 15868-15876, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.09238 2026-05-12 cs.LG cs.AI

Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds

内在缪子:在黎曼矩阵流形上的谱优化

Yibang Li, Bihari Lal Pandey, Ravi Sah, Andi Han, Cyrus Mostajeran, Pratik Jawanpuria, Bamdev Mishra

机构 * Nanyang Technological University, Singapore(南洋理工大学,新加坡) Indian Institute of Technology Bombay, India(印度理工学院班加罗尔,印度) University of Sydney, Australia(悉尼大学,澳大利亚) Microsoft India(微软印度)

AI总结 本文提出内在缪子框架,通过在固定秩、SPD、Stiefel和Grassmann流形上实现闭式更新,解决传统缪子在流形参数上的泛化问题,并提供收敛保证。

Comments Code: https://github.com/1bang118/manifold-intrinsic-muon

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08838 2026-05-12 cs.CL cs.AI

Generating Leakage-Free Benchmarks for Robust RAG Evaluation

生成无泄漏的基准以评估鲁棒的RAG

Jiayi Liu, Jiaxing Zhang, Bowen Jin, Jennifer Neville

机构 * Department of Computer Science, Purdue University(普渡大学计算机科学系) New Jersey Institute of Technology(新泽西理工学院) University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院)

AI总结 本文提出SeedRG方法,通过半合成方式生成无知识泄漏的RAG评估基准,解决基准老化问题,确保评估的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08556 2026-05-12 cs.LG

Can Revealed Preferences Clarify LLM Alignment and Steering?

揭示偏好能否澄清大语言模型对齐与引导?

Khurram Yamin, Jingjing Tang, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

AI总结 本文提出一种经验方法,通过估计LLM在决策任务中的隐含偏好,评估模型是否一致地追求目标,是否能描述其目标,以及提示是否能可靠引导策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08538 2026-05-12 cs.AI cs.CL cs.IR cs.LG

Human-Inspired Memory Architecture for LLM Agents

受人类启发的记忆架构用于大语言模型代理

Doga Kerestecioglu, Alexei Robsky, Clemens Vasters, Anshul Sharma, Yitzhak Kesselman

机构 * Microsoft(微软)

AI总结 本文提出一种受生物启发的记忆架构,通过六个认知机制解决内存积累问题,并引入合成校准方法提升评估准确性。

Comments 10 pages, 4 tables. Preprint; comments welcome

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07522 2026-05-12 cs.CV

Training-free Spatially Grounded Geometric Shape Encoding (Technical Report)

无需训练的空间几何形状编码(技术报告)

Yuhang He

机构 * Microsoft Research(微软研究院)

AI总结 本文提出XShapeEnc,一种无需训练的通用空间几何形状编码策略,通过分解几何形状和姿态,利用正交Zernike基和频率传播操作,实现高效、可逆且频率丰富的紧凑表示,适用于多种二维空间任务。

Comments Training-Free 2D Geometric Shape Encoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.23806 2026-05-12 cs.SE cs.AI

Willful Disobedience: Automatically Detecting Failures in Agentic Traces

有意违背:自动检测代理轨迹中的故障

Reshabh K Sharma, Shraddha Barke, Benjamin Zorn

机构 * University of Washington(华盛顿大学) Microsoft Research(微软研究院)

AI总结 本文提出AgentPex工具,通过提取规则自动评估代理轨迹,发现传统仅关注结果的评估方法无法检测到关键流程故障,如错误的工作流路由、不安全的工具使用或违反提示规则的情况。

Comments Accepted at ACM CAIS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06286 2026-05-12 cs.AI

When Agents Say One Thing and Do Another: Validating Elicited Beliefs from LLMs

当代理人言辞与行为不一致时:从LLMs中验证提取的信念

Khurram Yamin, Jingjing Tang, Santiago Cortes-Gomez, Amit Sharma, Eric Horvitz, Bryan Wilder

机构 * Carnegie Mellon University(卡内基梅隆大学) Microsoft Research(微软研究院)

AI总结 本文提出一种决策理论框架,通过提取概率判断和决策并检验其一致性,验证LLMs的信念是否合理,发现最强模型的不一致程度较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18061 2026-05-12 cs.AI cs.HC

Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing

专家评估与心理健康AI安全测试中人类反馈的局限性

Kiana Jafari, Paul Ulrich Nikolaus Rust, Duncan Eddy, Robbie Fraser, Nina Vasan, Darja Djordjevic, Akanksha Dadlani, Max Lamparth, Eugenia Kim, Mykel Kochenderfer

机构 * Stanford University(斯坦福大学) University College London(伦敦大学学院) Microsoft(微软)

AI总结 本研究探讨了在心理健康AI安全测试中,专家评估与人类反馈的有效性,发现专家间一致性差,揭示了专家分歧是社会技术现象,建议转向保留专家分歧的对齐方法。

Comments 17 pages, 7 pages of appendix, 21 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04475 2026-05-12 cs.LG cs.AI cs.NE stat.ML

GraphBench: Next-generation graph learning benchmarking

GraphBench: 图学习下一代基准测试

Timo Stoll, Chendi Qian, Ben Finkelshtein, Ali Parviz, Darius Weber, Fabrizio Frasca, Hadar Shavit, Antoine Siraudin, Arman Mielke, Marie Anastacio, Erik Müller, Maya Bechler-Speicher, Michael Bronstein, Mikhail Galkin, Holger Hoos, Mathias Niepert, Bryan Perozzi, Jan Tönshoff, Christopher Morris

机构 * RWTH Aachen University(亚琛RWTH大学) University of Oxford(牛津大学) Mila – Quebec AI Institute(魁北克AI研究所) Technion - Israel Institute of Technology(技术学院-以色列理工学院) ETAS Research University of Stuttgart(斯图加特大学ETAS研究所) Google Research(谷歌研究) Microsoft Research(微软研究院)

AI总结 GraphBench 提供标准化评估协议和统一超参数调优框架,用于评估图学习任务中的泛化能力,推动图学习领域的发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.08160 2026-05-12 cs.CV cs.AI

WATCH: Wide-Area Archaeological Site Tracking for Change Detection

WATCH:大范围考古遗址跟踪用于变化检测

Girmaw Abebe Tadesse, Titien Bartette, Andrew Hassanali, Allen Kim, Jonathan Chemla, Andrew Zolli, Yves Ubelmann, Caleb Robinson, Inbal Becker-Reshef, Juan Lavista Ferres

机构 * Microsoft AI for Good Research Lab(微软AI for Good研究实验室) Iconem, Paris, France(Iconem公司,巴黎,法国) Planet Labs PBC(Planet Labs公司)

AI总结 WATCH通过三种方法实现大规模考古遗址变化检测,利用卫星影像和基础模型嵌入,提高遗址保护的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏