arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-04 至 2026-08-04 共收录 11
2608.02441 2026-08-04 cs.AI 新提交

Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

智能体商业世界:一种可审计可验证的氛围式商业环境

Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Springbrand(斯普林布兰德公司) Northwestern University(西北大学) Rutgers University(罗格斯大学) Arizona State University(亚利桑那州立大学) University of California San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(Mohamed bin Zayed 人工智能大学) Microsoft AI(微软人工智能部门)

AI总结 该研究提出智能体商业世界(ACWorld)环境,通过氛围式商业协议(VCP)实现可审计可验证的氛围式商业智能体评估,构建含两类轨道的基准并验证模型性能,分析得出过程级证据对评估智能体的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01810 2026-08-04 cs.CL 新提交

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析

Divyansh Singh, Reza Davari, Afra Mashhadi

机构 * Microsoft(微软公司) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01616 2026-08-04 cs.LG cs.DS 新提交

Online Algorithms via Minimax and Posterior Matching

基于极小极大与后验匹配的在线算法

Thomas Kesselheim, Marco Molinaro, Kalen Patton, Sahil Singla

机构 * University of Bonn(波恩大学) Institute of Computer Science, University of Bonn(波恩大学计算机科学学院) Microsoft Research(微软研究院) PUC-Rio(里约热内卢天主教大学) Georgia Tech(佐治亚理工学院) School of Mathematics, Georgia Tech(佐治亚理工学院数学学院) School of Computer Science, Georgia Tech(佐治亚理工学院计算机科学学院)

AI总结 该研究基于极小极大视角提出后验匹配原理,将在线算法竞争分析简化为贝叶斯在线设计,为多类在线问题提供最优或接近最优保证,构建了可复用的理论框架。

Comments To appear at FOCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01361 2026-08-04 cs.AI 新提交

High-Stakes Decisions with Language Models: Insights from Emergency Triage

基于语言模型的高风险决策:来自急诊分诊的见解

Khurram Yamin, Christopher Kelly, Bryan Wilder, Eric Horvitz

机构 * Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究以急诊分诊为案例,将语言模型的高风险决策置于概率决策框架内,发现语言模型可根据效用调整建议,强调高风险场景下需将其作为概率决策系统评估。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01004 2026-08-04 cs.LG cs.AI cs.SE 新提交

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线

Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das

机构 * Microsoft(微软) Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。

Comments Extended abstract accepted at the SERI 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00101 2026-08-04 cs.AI cs.LG 新提交

Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析

Banruo Liu, Haoran Qiu, Íñigo Goiri, Rodrigo Fonseca, Ricardo Bianchini, Esha Choukse

机构 * Microsoft Azure Research(微软Azure研究院) Microsoft Azure(微软Azure)

AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00036 2026-08-04 cs.CL cs.AI 新提交

XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding

XL-DocBench:基于证据的超长文档理解基准测试

Hongchen Wei, Yuanzhe Wang, Bei Liu, Yifan Yang, Qi Dai, Ruichun Ma, Kai Qiu, Yunsheng Li, Dongdong Chen, Chong Luo, Zhenzhong Chen, Baining Guo

机构 * Wuhan University(武汉大学) Microsoft(微软)

AI总结 XL-DocBench是含1519个问题、最长2303页的人工验证超长文档理解基准,覆盖多页证据、结构化内容等场景,可用于评估LLMs在专业文档理解中的实际表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26246 2026-08-04 cs.LG 版本更新

Weak-to-Strong On-Policy Distillation

弱到强在线策略蒸馏

Fangxu Yu, Weijia Xu, Michael Xu, Tianyi Zhou, Zinan Lin

机构 * University of Maryland(马里兰大学) Microsoft Research(微软研究院) MBZUAI(穆罕默德·本·扎耶德人工智能大学)

AI总结 本文提出W2S-OPD框架,从多个弱模型蒸馏提升强学生模型,在数学、代码基准测试中优于OPD,可让学生超越领域教师,监督源更弱时仍能提升性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31449 2026-08-04 cs.LG stat.ML 版本更新

Contextual Slate GLM Bandits with Limited Adaptivity

有限自适应性下的上下文式板GLM赌博机

Tanmay Goyal, Sukruta Prakash Midigeshi, Gaurav Sinha

机构 * Microsoft Research India(微软研究院印度)

AI总结 针对有限自适应性的上下文式板赌博机问题,提出两种算法B-SlateGLinCB和RS-SlateGLinCB,分别适用于批处理和少切换设置,在多样性假设下实现与非线性参数无关的遗憾界,并具有计算效率。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07666 2026-08-04 cs.CR cs.AI 版本更新

SoK: DARPA's AI Cyber Challenge (AIxCC): Competition Design, Architectures, and Lessons Learned

SoK: DARPA 人工智能网络挑战赛 (AIxCC):竞赛设计、架构与经验教训

Cen Zhang, Younggi Park, Fabian Fleischer, Yu-Fu Fu, Jiho Kim, Dongkwan Kim, Youngjoon Kim, Qingxiao Xu, Andrew Chin, Ze Sheng, Hanqing Zhao, Michael Pelican, David J. Musliner, Jeff Huang, Jon Silliman, Mikel Mcdaniel, Jefferson Casavant, Isaac Goldthwaite, Nicholas Vidovich, Matthew Lehman, Taesoo Kim

机构 * Georgia Institute of Technology(佐治亚理工学院) Texas A&M University(德克萨斯大学) Smart Information Flow Technologies (SIFT)(智能信息流技术公司) Kudu Dynamics(Kudu动态公司) Microsoft(微软)

AI总结 本文系统分析 DARPA 人工智能网络挑战赛 (AIxCC),探讨其竞赛设计、决赛系统的架构方法,并总结驱动性能的因素、技术进展及未来研究方向。

Comments Camera ready version, systematization of Knowledge and post-competition analysis of DARPA AIxCC (2023-2025)

Journal ref USENIX Security 2026

详情

展开后加载摘要…

URL PDF HTML 收藏