arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-06-03 至 2026-06-03 共收录 7
2606.03203 2026-06-03 cs.AI

MedCUA-Bench: A Screenshot-Only Benchmark for Clinical Computer-Use Agents

MedCUA-Bench: 一个仅基于截图的临床计算机使用代理基准测试

Jia Yu, Zilong Wang, Xinyang Jiang, Dongsheng Li, Shuo Wang

机构 * Microsoft Research Asia(微软亚洲研究院) Digital Medical Research Center, School of Basic Medical Sciences, Fudan University(复旦大学基础医学院数字医学研究中心) Shanghai Key Laboratory of MICCAI(上海MICCAI重点实验室)

AI总结 提出 MedCUA-Bench,一个覆盖10个医学领域18个临床场景的交互式基准,通过确定性检查器评估任务完成和五个临床安全维度,揭示当前代理在真实临床软件上的性能差距。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03130 2026-06-03 cs.LG

Synthetic Hallucinations, Real Gains: Hard Negatives from Frontier Models for FIM Hallucination Mitigation

合成幻觉,真实收益:来自前沿模型的硬负样本用于FIM幻觉缓解

Mahdi Erfanian, Nelson Daniel Troncoso, Aashna Garg, Amabel Gale, Xiaoyu Liu, Pareesa Ameneh Golnari, Shengyu Fu

机构 * University of Illinois Chicago(伊利诺伊大学芝加哥分校) Microsoft(微软)

AI总结 针对小型开源代码模型在IDE自动补全中产生的填充中间(FIM)幻觉问题,提出一种无需执行的替代方法:利用前沿代码模型合成看似合理但错误的补全作为硬负样本,通过对比合成幻觉与真实开发者编辑的差异作为监督微调信号,在Delulu基准上提升精确匹配18.8个百分点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.02618 2026-06-03 cs.CE cs.AI cs.MA physics.chem-ph

Closed-Loop Molecular Design with Calibrated Deference

闭环分子设计中的校准式退让

Newman Cheng, Gordon Broadbent, Jason Dong, Syed Mohammed Ali Hussaini, Farman Ullah, Morris Sharp, Gabrielle Barnes, Nanlin Guo, Deyu Zou, Karin Strauss, William Chappell, David G. Kwabi, Bichlien H. Nguyen, Jake A. Smith

机构 * Microsoft Discovery & Quantum(微软发现与量子) Microsoft Research(微软研究院) Department of Chemical and Environmental Engineering, Yale University(耶鲁大学化学与环境工程系) CanAm Bioresearch Inc.(CanAm 生物研究公司)

AI总结 提出CLIO智能体,通过持续更新的信念状态图和递归计划-行动循环实现校准式退让,在闭环人机协作中成功设计出性能优于文献基准的AORFB负极电解液。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12925 2026-06-03 cs.SE cs.AI

AgentLens: Revealing The Lucky Pass Problem in SWE-Agent Evaluation

AgentLens: 揭示 SWE-Agent 评估中的幸运通过问题

Priyam Sahoo, Gaurav Mittal, Xiaomin Li, Shengjie Ma, Benjamin Steenhoek, Pingping Lin, Yu Hu

机构 * University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft(微软)

AI总结 针对软件工程智能体评估中仅依赖最终补丁是否通过测试的二元信号问题,提出AgentLens框架进行过程级评估,通过构建前缀树接受器参考和上下文敏感意图标注器,识别出10.7%的通过轨迹存在“幸运通过”行为,并基于质量分数将轨迹分为幸运、扎实和理想三个等级。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00392 2026-06-03 cs.LG

Localized, High-resolution Geographic Representations with Slepian Functions

基于Slepian函数的局部高分辨率地理表示

Arjun Rao, Ruth Crasto, Tessa Ooms, David Rolnick, Konstantin Klemmer, Marc Rußwurm

机构 * Department of Computer Science, University of Colorado Boulder(科罗拉多大学波德分校计算机科学系) Microsoft(微软公司) University College London(伦敦大学学院) McGill University(麦吉尔大学) Mila–Quebec AI Institute(魁北克AI研究所) University of Bonn, Germany(德国波恩大学) University of Wageningen, Netherlands(荷兰瓦赫宁根大学)

AI总结 提出利用球面Slepian函数构建地理编码器,在感兴趣区域内集中表示能力,实现高分辨率且计算高效,并引入混合Slepian-球谐编码器平衡局部与全局性能,在分类、回归等任务中优于基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
1108.5359 2026-06-03 math.NA cs.CV cs.NA

Solving Principal Component Pursuit in Linear Time via $l_1$ Filtering

通过 $l_1$ 滤波在线性时间内求解主成分追踪

Risheng Liu, Zhouchen Lin, Siming Wei, Zhixun Su

机构 * School of Mathematical Sciences, Dalian University of Technology(大连理工大学数学科学学院) Key Lab. of Machine Perception (MOE), Peking University(北京大学机器感知重点实验室) Microsoft Research Asia(微软亚洲研究院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院)

AI总结 提出一种名为 $l_1$ 滤波的算法,以 $O(r^2(m+n))$ 复杂度精确求解主成分追踪问题,实现线性时间内的核范数最小化,并具有高度可并行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
1012.0365 2026-06-03 math.NA cs.AI cs.NA math.OC

A Block Lanczos with Warm Start Technique for Accelerating Nuclear Norm Minimization Algorithms

一种加速核范数最小化算法的块Lanczos热启动技术

Zhouchen Lin, Siming Wei

机构 * Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

AI总结 提出块Lanczos热启动(BLWS)技术,利用前次迭代的主奇异子空间初始化块Lanczos过程以加速核范数最小化算法中的部分SVD计算,实验表明可加速2-3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏