arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-08-04 至 2026-08-04 共收录 8
2608.02441 2026-08-04 cs.AI 新提交

Agentic Commerce World: An Auditable and Verifiable Environment for Vibe Commerce

智能体商业世界:一种可审计可验证的氛围式商业环境

Shicheng Fan, Mingdai Yang, Duohao Wang, Canyu Chen, Yongfeng Zhang, Hua Wei, Manling Li, Julian McAuley, Kun Zhang, Philip S. Yu, Kejing Yu, Zhiwei Liu

机构 * University of Illinois at Chicago(伊利诺伊大学芝加哥分校) Springbrand(斯普林布兰德公司) Northwestern University(西北大学) Rutgers University(罗格斯大学) Arizona State University(亚利桑那州立大学) University of California San Diego(加州大学圣迭戈分校) Carnegie Mellon University(卡内基梅隆大学) MBZUAI(Mohamed bin Zayed 人工智能大学) Microsoft AI(微软人工智能部门)

AI总结 该研究提出智能体商业世界(ACWorld)环境,通过氛围式商业协议(VCP)实现可审计可验证的氛围式商业智能体评估,构建含两类轨道的基准并验证模型性能,分析得出过程级证据对评估智能体的必要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01810 2026-08-04 cs.CL 新提交

RADAR: Rubric-Aware Dependency and Redundancy Analysis for LLM-as-Judge Evaluation

RADAR:用于LLM作为评判者评估的基于 Rubric 的依赖与冗余分析

Divyansh Singh, Reza Davari, Afra Mashhadi

机构 * Microsoft(微软公司) University of Florida(佛罗里达大学) University of Washington(华盛顿大学)

AI总结 本文提出 RADAR 框架,用于在 LLM 作为评判者的大规模评估前,通过少量探针估计评估标准间的耦合,验证显示其可恢复人类标准间高相关性,提供审计信号。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01616 2026-08-04 cs.LG cs.DS 新提交

Online Algorithms via Minimax and Posterior Matching

基于极小极大与后验匹配的在线算法

Thomas Kesselheim, Marco Molinaro, Kalen Patton, Sahil Singla

机构 * University of Bonn(波恩大学) Institute of Computer Science, University of Bonn(波恩大学计算机科学学院) Microsoft Research(微软研究院) PUC-Rio(里约热内卢天主教大学) Georgia Tech(佐治亚理工学院) School of Mathematics, Georgia Tech(佐治亚理工学院数学学院) School of Computer Science, Georgia Tech(佐治亚理工学院计算机科学学院)

AI总结 该研究基于极小极大视角提出后验匹配原理,将在线算法竞争分析简化为贝叶斯在线设计,为多类在线问题提供最优或接近最优保证,构建了可复用的理论框架。

Comments To appear at FOCS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01423 2026-08-04 cs.AI cs.GT cs.LG 新提交

Scoring Rules! Statistical and Strategic Alignment for Text Evaluation Metrics

评分规则!文本评估指标的统计对齐与策略对齐

Shengwei Xu, Yuxuan Lu, Yifan Wu, Jason Hartline, Grant Schoenebeck

机构 * University of Michigan(密歇根大学) Peking University(北京大学) Microsoft Research(微软研究院) Northwestern University(西北大学)

AI总结 该研究针对文本评估指标,提出统计与策略对齐概念及三项测试原则,开发基于互信息的指标设计框架,发现 LLM-as-a-Judge 相关性高但易操纵,新指标鲁棒性强且相关性具竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01361 2026-08-04 cs.AI 新提交

High-Stakes Decisions with Language Models: Insights from Emergency Triage

基于语言模型的高风险决策:来自急诊分诊的见解

Khurram Yamin, Christopher Kelly, Bryan Wilder, Eric Horvitz

机构 * Microsoft(微软) Carnegie Mellon University(卡内基梅隆大学)

AI总结 本研究以急诊分诊为案例,将语言模型的高风险决策置于概率决策框架内,发现语言模型可根据效用调整建议,强调高风险场景下需将其作为概率决策系统评估。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01004 2026-08-04 cs.LG cs.AI cs.SE 新提交

Who Belongs in the Eval Set? A Capability-Taxonomy-Driven Pipeline for Curating Regression Eval Sets in Agent-Extensibility Platforms

哪些应该进入评估集?面向智能体可扩展性平台的、基于能力分类法的回归评估集编建流水线

Tezan Sahu, Aritra Das, Pankaj Mittal, Sudipta Das

机构 * Microsoft(微软) Indian Institute of Technology Roorkee(鲁尔基印度理工学院)

AI总结 针对智能体可扩展性平台的回归评估集编建问题,提出基于能力分类法的流水线,通过三个组件实现查询决策,可适配带类型化能力分类法的各类编建场景。

Comments Extended abstract accepted at the SERI 2026 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00101 2026-08-04 cs.AI cs.LG 新提交

Agentic Coding in the Wild: Characterizing GitHub Copilot Traces at Production Scale

野外环境下的智能体编码:生产规模下GitHub Copilot轨迹的特征分析

Banruo Liu, Haoran Qiu, Íñigo Goiri, Rodrigo Fonseca, Ricardo Bianchini, Esha Choukse

机构 * Microsoft Azure Research(微软Azure研究院) Microsoft Azure(微软Azure)

AI总结 该研究对GitHub Copilot等AI编码智能体的生产规模轨迹进行特征分析,揭示其工作负载特性,设计轻量级空闲预测器,为智能体原生LLM服务基础设施提供实证基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00036 2026-08-04 cs.CL cs.AI 新提交

XL-DocBench: Benchmarking Evidence-Grounded Extra-Long Document Understanding

XL-DocBench:基于证据的超长文档理解基准测试

Hongchen Wei, Yuanzhe Wang, Bei Liu, Yifan Yang, Qi Dai, Ruichun Ma, Kai Qiu, Yunsheng Li, Dongdong Chen, Chong Luo, Zhenzhong Chen, Baining Guo

机构 * Wuhan University(武汉大学) Microsoft(微软)

AI总结 XL-DocBench是含1519个问题、最长2303页的人工验证超长文档理解基准,覆盖多页证据、结构化内容等场景,可用于评估LLMs在专业文档理解中的实际表现。

详情

展开后加载摘要…

URL PDF HTML 收藏