arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-05-19 至 2026-05-19 共收录 20
2605.18284 2026-05-19 cs.SE cs.AI

CommitDistill: A Lightweight Knowledge-Centric Memory Layer for Software Repositories

CommitDistill: 一种轻量级的知识导向内存层用于软件仓库

Divya Chukkapalli, Thejesh Avula, Aditya Aggarwal, Harsimran Singh, Amith Tallanki

机构 * Microsoft Corporation(微软公司)

AI总结 本文提出CommitDistill,一种轻量级的知识导向内存层,通过确定性正则表达式从本地git历史中提取类型化知识单元,并通过TF-IDF检索器进行检索,以提高软件仓库中历史信息的利用率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18204 2026-05-19 stat.ML cs.LG

Forward-Learned Discrete Diffusion: Learning how to noise to denoise faster

前向学习离散扩散:学习如何更快地噪声去噪声

Grigory Bartosh, Teodora Pandeva, Sushrut Karmalkar, Javier Zazo

机构 * University of Amsterdam(阿姆斯特丹大学) Microsoft Research, Cambridge(微软研究院,剑桥)

AI总结 本文提出前向学习离散扩散(FLDD),通过引入可学习的前向(噪声)过程,减少目标分布与模型分布之间的差距,实现少步生成。该方法采用非马尔可夫形式,利用可学习的边缘和后验分布,使生成过程保持因子化同时匹配噪声过程定义的目标。实验表明,在相同采样步数下,FLDD生成的样本质量优于传统离散扩散模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15239 2026-05-19 cs.LG

Reducing the Safety Tax in LLM Safety Alignment with On-Policy Self-Distillation

通过在线策略自我蒸馏减少大语言模型安全对齐的安全部署税

Yu Fu, Longxuan Yu, Haz Sameen Shahgir, Zhipeng Wei, Hui Liu, N. Benjamin Erichson, Yue Dong

机构 * International Computer Science Institute(国际计算机科学研究所) Microsoft(微软) Berkeley Lab(伯克利实验室)

AI总结 本文提出了一种名为OPSA的在线策略自我蒸馏方法,通过引入教师翻转率指标,有效减少大语言模型在安全对齐过程中因分布不匹配导致的安全税,实验显示其在不同模型规模上均优于传统方法。

Comments 20 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11391 2026-05-19 cs.CV cs.AI cs.CL

DocReward: A Document Reward Model for Structuring and Stylizing

DocReward: 一种用于文档结构化和风格化的文档奖励模型

Junpeng Liu, Yuzhong Zhao, Bowen Cao, Jiayu Ding, Yilin Jia, Tengchao Lv, Yupan Huang, Wenshan Wu, Shaohan Huang, Nan Yang, Li Dong, Lei Cui, Tao Ge, Xun Wang, Huitian Jiao, Sun Mao, FNU Kartik, Si-Qing Chen, Wai Lam, Furu Wei

机构 * CUHK(香港大学) UCAS(中国科学技术大学) XJTU(西安交通大学) UMich(密歇根大学) Microsoft(微软)

AI总结 本文提出DocReward,一种用于评估文档结构和风格的奖励模型,通过构建包含117,000对文档的DocPair数据集,采用Bradley-Terry损失训练,有效提升了文档生成的结构和风格专业性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18109 2026-05-19 cs.AI cs.CV cs.RO

TaskGround: Structured Executable Task Inference for Full-Scene Household Reasoning

TaskGround:全场景家庭推理的结构化可执行任务推断

ZhiYuan Feng, Yu Deng, Ruichuan An, Zhenhua Liu, Qixiu Li, Keming Wu, Zhiying Du, Weijie Wang, Haoxiao Wang, Shuang Chen, Sicheng Xu, Yaobo Liang, Jiaolong Yang, Baining Guo

机构 * Tsinghua University(清华大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Fudan University(复旦大学) Zhejiang University(浙江大学)

AI总结 本文提出TaskGround框架,通过结构化任务推断提升全场景家庭推理能力,其核心贡献是引入FullHome评估套件,验证了在家庭场景中执行任务结构推断的重要性,并展示了紧凑本地模型在实际家庭部署中的有效性。

Comments Project page: https://aaronfengzy.github.io/TaskGround/

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17885 2026-05-19 cs.CL cs.AI

Multi-agent AI systems outperform human teams in creativity

多智能体AI系统在创造力上超越人类团队

Tiancheng Hu, Yixuan Jiang, Haotian Li, José Hernández-Orallo, Xing Xie, Nigel Collier, David Stillwell, Luning Sun

机构 * Microsoft Research Asia(微软亚洲研究院)

AI总结 研究探讨了多智能体AI系统在创造力任务中的表现,发现其在四个多样化问题解决任务中,比单智能体和人类团队更具创造力,核心方法是通过语义空间路径分析生成过程,主要贡献是揭示了AI和人类团队在创造力预测上的不同机制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17829 2026-05-19 cs.AI

Interactive Evaluation Requires a Design Science

交互评估需要一种设计科学

Keyang Xuan, Peiyang Song, Pan Lu, Pengrui Han, Wenkai Li, Zhenyu Zhang, Zexue He, Wenyue Hua, Manling Li, Jiaxuan You, Adrian Weller, Yizhong Wang, Jiaxin Pei

机构 * University of Texas Austin(德克萨斯大学奥斯汀分校) California Institute of Technology(加州理工学院) Carnegie Mellon University(卡内基梅隆大学) Stanford University(斯坦福大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Northwestern University(西北大学) University of Cambridge(剑桥大学)

AI总结 本文探讨了交互评估应被视为一种原则性的评估范式,而非仅仅是新的智能体基准。通过定义评估为证据到判断的自主映射,文章展示了交互评估如何改变这一映射的两方面,并提出双轴分类法,制定设计原则和报告标准,分析了长期评估挑战在轨迹层面的再现。

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17613 2026-05-19 cs.AR cs.LG

VeriCache: Turning Lossy KV Cache into Lossless LLM Inference

VeriCache: 将损失性KV缓存转换为无损LLM推理

Jiayi Yao, Samuel Shen, Kuntai Du, Shaoting Feng, Dongjoo Seo, Rui Zhang, Yuyang Huang, Yuhan Liu, Shan Lu, Junchen Jiang

机构 * University of Chicago(芝加哥大学) Tensormesh Inc.(Tensormesh公司) Samsung Semiconductor(三星半导体) Microsoft Research(微软研究院)

AI总结 本文提出VeriCache框架,通过利用压缩的KV缓存生成token并验证其与完整KV缓存的一致性,实现了与完整KV缓存解码相同输出的同时保持高解码吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01658 2026-05-19 cs.AI

CORAL: Towards Autonomous Multi-Agent Evolution for Open-Ended Discovery

CORAL:迈向自主多智能体进化以实现开放性发现

Ao Qu, Han Zheng, Zijian Zhou, Yihao Yan, Yihong Tang, Shao Yong Ong, Fenglu Hong, Kaichen Zhou, Chonghe Jiang, Minwei Kong, Jiacheng Zhu, Xuan Jiang, Sirui Li, Cathy Wu, Bryan Kian Hsiang Low, Jinhua Zhao, Paul Pu Liang

机构 * MIT(麻省理工学院) NUS(新加坡国立大学) MiniMax McGill(麦吉尔大学) Stanford(斯坦福大学) SambaNova Meta Singapore-MIT Alliance for Research and Technology(新加坡-麻省理工联合研究技术联盟) Amazon(亚马逊) Microsoft(微软)

AI总结 本文提出CORAL框架,通过自主多智能体进化方法,实现了在开放性问题上的发现,展示了智能体自主性和多智能体进化对提升开放性发现的显著效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06388 2026-05-19 cs.LG cs.DS stat.ML

Truthful Calibration Errors for Multi-Class Prediction

多类预测中的诚实校准误差

Yuxuan Lu, Yifan Wu, Jason Hartline, Lunjia Hu

机构 * Peking University(北京大学) Northwestern University(西北大学) Microsoft Research, New England(微软研究院(新英格兰)) Northeastern University(东北大学) Khoury College of Computer Sciences(计算机科学学院)

AI总结 本文研究了多类预测中诚实校准误差的实用作用,提出了完美诚实校准误差以处理标签分布的多维线性属性,并分析了这些诚实误差在决策理论上的影响,从而解释并缓解了分箱校准误差的排名鲁棒性问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17044 2026-05-19 cs.AI

PersonaArena: Dynamic Simulation for Evaluating and Enhancing Persona-Level Role-Playing in Large Language Models

PersonaArena: 用于评估和提升大语言模型层面角色扮演的动态模拟

Wenlong Shi, Jianxun Lian, Mingqi Wu, Haiming Qin, Mingyang Zhou, Xing Xie, Naipeng Chao, Hao Liao

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Microsoft Research Asia(微软亚洲研究院) Microsoft Gaming(微软游戏) Provincial Key Laboratory of Intelligent Communication and Digital Society Governance, Shenzhen University(深圳大学省级智能通信与数字社会治理重点实验室)

AI总结 本文提出PersonaArena框架,通过动态模拟评估和提升大语言模型在角色扮演层面的能力,利用用户生成的社会内容构建细致的个性库,并在模拟社交环境中进行多轮上下文丰富的交互,通过多代理辩论裁判实现全面公正的评估。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14498 2026-05-19 cs.CL

GroupMemBench: Benchmarking LLM Agent Memory in Multi-Party Conversations

GroupMemBench: 多方对话中LLM代理记忆的基准测试

Jingbo Yang, Kwei-Herng Lai, Xiaowen Wang, Shiyu Chang, Yaar Harari, Evgeniy Gabrilovich

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Microsoft(微软)

AI总结 本文提出GroupMemBench,用于评估多方对话中LLM代理的记忆能力,揭示现有记忆系统在群体动态、信念跟踪和语言适应方面的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.10759 2026-05-19 cs.LG cs.CV

Reinforce Adjoint Matching: Scaling RL Post-Training of Diffusion and Flow-Matching Models

强化共轭匹配:扩散和流匹配模型的后训练强化学习扩展

Andreas Bergmeister, Stefanie Jegelka, Nikolas Nüsken, Carles Domingo-Enrich, Jakiw Pidstrigach

机构 * MIT CSAIL(麻省理工学院计算机科学与人工智能实验室) King's College London(伦敦国王学院) Microsoft Research New England(微软研究院新英格兰分部) University of Oxford(牛津大学)

AI总结 本文提出Reinforce Adjoint Matching方法,通过强化学习后训练优化扩散和流匹配模型,无需SDE回滚或梯度,提升生成质量与人类偏好匹配度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17338 2026-05-19 cs.SE cs.CL

Precise Debugging Benchmark: Is Your Model Debugging or Regenerating?

精确调试基准:你的模型是在调试还是重生成?

Wang Bill Zhu, Miaosen Chai, Shangshang Wang, Yejia Liu, Song Bian, Honghua Dong, Willie Neiswanger, Robin Jia

机构 * University of Southern California(南加州大学) Microsoft(微软) University of Wisconsin–Madison(威斯康星大学麦迪逊分校) University of Toronto(多伦多大学)

AI总结 本文提出PDB基准,评估LLM调试能力,发现前沿模型调试精度低,即使受指令引导也难以达到高精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21185 2026-05-19 cs.LG

The Diffusion Duality, Chapter II: $Ψ$-Samplers

扩散对偶性,第二章:Ψ-采样器

Justin Deschenaux, Caglar Gulcehre, Subham Sekhar Sahoo

机构 * EPFL, Lausanne, Switzerland(苏黎世联邦理工学院,洛桑分校) Microsoft AI(微软人工智能) Cornell Tech, NY(康奈尔科技)

AI总结 本文提出了一种通用的预测-校正采样器,用于离散扩散模型,提升了语言和图像建模的生成质量,并展示了其在训练效率上的优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11895 2026-05-19 cs.LG cs.AI cs.SE

DevBench: A Realistic, Developer-Informed Benchmark for Code Generation Models

DevBench:一个现实的、面向开发者的代码生成模型基准测试

Adarsh Kumarappan, Pareesa Ameneh Golnari, Wen Wen, Xiaoyu Liu, Gabriel Ryan, Yuting Sun, Shengyu Fu, Elsie Nallipogu

机构 * California Institute of Technology(加州理工学院) Microsoft(微软公司)

AI总结 DevBench通过真实开发者数据和生成模型合成,构建了包含六种编程语言和任务的1800个实例,评估大语言模型在代码补全任务中的表现,揭示模型在语法精度、语义推理和实用价值上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.14634 2026-05-19 cs.HC cs.AI

Human-LLM Compound System for Scientific Ideation through Facet Recombination and Novelty Evaluation

基于领域重构与新颖性评估的人机协同科学构想系统

Marissa Radensky, Simra Shahid, Raymond Fok, Pao Siangliulue, Tom Hope, Daniel S. Weld

机构 * University of Washington(华盛顿大学) Microsoft(微软) Allen Institute for AI(人工智能研究院)

AI总结 Scideator通过领域重构与新颖性评估模块,帮助用户在科学构想中生成更具创造性的想法,实验显示其在想法探索和表达性方面优于传统LLM方法。

Comments Updated based on most recent submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10102 2026-05-19 cs.IR cs.AI cs.CL

Trustworthiness in Retrieval-Augmented Generation Systems: A Survey

检索增强生成系统中的可信度:综述

Yujia Zhou, Wenbo Zhang, Jingying Shao, Yan Liu, Xiaoxi Li, Jiajie Jin, Hongjin Qian, Zheng Liu, Chaozhuo Li, Jason Chen Zhang, Zhicheng Dou, Philip S. Yu, Jiaxin Mao

机构 * Tsinghua University(清华大学) Renmin University of China(中国人民大学) The Chinese University of Hong Kong(香港中文大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院) Hong Kong Polytechnic University(香港理工大学) Microsoft Research Asia(微软亚洲研究院) University of Illinois(伊利诺伊大学)

AI总结 本文综述了检索增强生成系统中可信度的关键维度,提出Trust-RAG Compass框架,评估事实性、鲁棒性等六个方面,并建立评估基准,揭示不同LLM在可信度方面的性能差异,指出未来研究方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16402 2026-05-19 cs.CV

WinDeskGround: A Benchmark for Robust GUI Grounding in Complex Multi-Window Desktop Environments

WinDeskGround:复杂多窗口桌面环境中的鲁棒GUI定位基准

Haoren Zhao, Tianyi Chen, Zhen Wang

机构 * School of Cyberspace, Hangzhou Dianzi University, Hangzhou, China(杭州电子科技大学信息学院) Microsoft(微软公司)

AI总结 本文提出WinDeskGround基准,通过参数生成复杂桌面场景,评估GUI定位鲁棒性。实验显示顶级模型在简单环境表现佳,但部分遮挡下准确率下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16311 2026-05-19 cs.LG cs.DC

SignMuon: Communication-Efficient Distributed Muon Optimization

SignMuon:高效的分布式μon优化

Neel Mishra, Kushagara Trivedi, Pawan Kumar

机构 * Microsoft(微软公司) IIIT Hyderabad(Hyderabad印度理工学院)

AI总结 本文提出Sign-Muon优化器,结合signSGD的符号聚合与Muon的极步框架,通过矩阵感知的1位优化方法,在减少通信开销的同时提升训练效率,实验表明其在多个数据集上均取得最佳性能。

Comments 40 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏