arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-07-07 至 2026-07-07 共收录 7
2606.09426 2026-07-07 cs.AI 版本更新

WeaveBench: A Long-Horizon, Real-World Benchmark for Computer-Use Agents with Hybrid Interfaces

WeaveBench: 面向混合接口的长期、真实世界计算机使用代理基准

Wanli Li, Bowen Zhou, Yunyao Yu, Zhou Xu, Yifan Yang, Dongsheng Li, Caihua Shan

机构 * Zhejiang University(浙江大学) Microsoft Research Asia(微软亚洲研究院) Tsinghua University(清华大学)

AI总结 提出WeaveBench基准,包含114个跨8个真实工作领域的长期混合接口任务,要求代理结合GUI和CLI/代码操作,最佳PassRate仅41.2%,揭示现有评估的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29563 2026-07-07 cs.AI cs.CV cs.RO 版本更新

Planning with the Views

通过场景自我探索进行视图规划

Kangrui Wang, Linjie Li, Zhengyuan Yang, Shiqi Chen, Zihan Wang, Li Fei-Fei, Jiajun Wu, Leonidas Guibas, Lijuan Wang, Manling Li

机构 * Northwestern University(西北大学) University of Washington(华盛顿大学) Microsoft(微软) University of Oxford(牛津大学) Stanford University(斯坦福大学)

AI总结 提出ViewSuite基准测试揭示VLM在多步视图规划中的不足,并设计迭代框架通过自我探索和视图图蒸馏将Qwen2.5-VL-7B的交互式视图规划准确率从2.5%提升至47.8%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19778 2026-07-07 cs.SD cs.IR cs.LG cs.MM 版本更新

Enhancing Automatic Chord Recognition via Pseudo-Labeling and Knowledge Distillation

通过伪标签和知识蒸馏增强自动和弦识别

Nghia Phan, Rong Jin, Gang Liu, Xiao Dong

机构 * California State University, Fullerton, CA, USA(加州州立大学弗里蒙特分校) Microsoft, Redmond, WA, USA(微软公司) Beijing Normal-Hong Kong Baptist University, China(北京师范大学-香港 Baptist大学)

AI总结 本文提出一种两阶段训练方法,利用预训练模型和未标记音频,通过伪标签和知识蒸馏提升和弦识别性能,实验显示学生模型在多个指标上优于传统监督学习和预训练模型。

Comments 8 pages, 6 figures, 4 tables. Accepted to DAFx26

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02296 2026-07-07 cs.CL cs.IR 版本更新

Knowing When Not to Answer: Lightweight KB-Aligned OOD Detection for Safe RAG

知道何时不回答:用于安全检索增强生成的轻量级知识库对齐的域外检测

Ilias Triantafyllopoulos, Renyi Qu, Salvatore Giorgi, Brenda Curtis, Lyle H. Ungar, João Sedoc

机构 * New York University(纽约大学) National Institute on Drug Abuse(国家成瘾医学研究所) University of Pennsylvania(宾夕法尼亚大学) Microsoft(微软公司)

AI总结 研究用于检索增强生成(RAG)系统的轻量级、知识库对齐的域外检测,通过PCA处理知识库嵌入,用方差保留或t检验排序选择子空间评分查询,评估规则和分类器,发现低维检测器性能好且更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.14833 2026-07-07 eess.IV cs.CV q-bio.QM 版本更新

Cell as Point: One-Stage Framework for Efficient Cell Tracking

细胞即点:高效细胞追踪的单阶段框架

Yaxuan Song, Jianan Fan, Heng Huang, Mei Chen, Weidong Cai

机构 * School of Computer Science, The University of Sydney(悉尼大学计算机科学学院) Department of Computer Science, University of Maryland College Park(马里兰大学学院公园分校计算机科学系) Microsoft(微软公司)

AI总结 提出细胞追踪单阶段框架CAP,将细胞视为点,利用轨迹相关性联合追踪,消除检测或分割需求。创新采用自适应事件引导采样和滚动窗口推理策略,解决数据不平衡与长序列推理问题,性能优于现有方法。

Comments 34 pages, 8 figures, 8 tables. Accepted by Pattern Recognition. Code is available at https://github.com/YXSong000/CAP

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12116 2026-07-07 cs.LG cs.AI cs.CL 版本更新

DynamixSFT: Dynamic Mixture Optimization of Instruction Tuning Collections

DynamixSFT:指令微调集合的动态混合优化

Haebin Shin, Lei Ji, Xiao Liu, Zhiwei Yu, Hyunwoo Yoo, Qi Chen, Yeyun Gong

机构 * University of Michigan(密歇根大学) Microsoft Research(微软研究院) KAIST AI(韩国科学技术院人工智能研究所) Drexel University(德雷塞尔大学)

AI总结 针对不断涌现的指令微调数据集,提出DynamixSFT动态自动优化方法。将问题转化为多臂老虎机设置,采用Prior-scaled Boltzmann Exploration和1-Step Look-ahead Reward更新采样概率,有效优化数据集并减少计算开销。

Comments ACL 2026 Findings

Journal ref Findings of the Association for Computational Linguistics: ACL 2026, pp. 39590-39603

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.00296 2026-07-07 cs.LG cs.CR 版本更新

VLMGuard: Bootstrapping Malicious Prompt Detectors from Unlabeled Vision-Language Prompts in the Wild

VLMGuard:从野生未标记视觉语言提示中引导恶意提示检测器

Junlin Fang, Wenyu Chen, Reshmi Ghosh, Robert Sim, Ahmed Salem, Vitor R. Carvalho, Emily Lawton, Sharon Li, Jack W. Stokes, Sean Du

机构 * College of Computing and Data Science(计算与数据科学学院) Nanyang Technological University(南洋理工大学) School of Physical and Mathematical Sciences(物理与数学科学学院) Microsoft Corp.(微软公司) Department of Computer Sciences(计算机科学系) University of Wisconsin-Madison(威斯康星大学麦迪逊分校)

AI总结 研究针对视觉语言模型易受恶意输入影响的问题,提出VLMGuard框架,利用野生未标记用户提示,通过自动恶意估计分数区分良性和恶意样本,训练二进制提示分类器,无需额外人工标注,效果优于现有方法。

Comments Accepted to Transactions on Machine Learning Research (07/2026)

详情

展开后加载摘要…

URL PDF HTML 收藏