arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

Microsoft(微软)

2026-06-23 至 2026-06-23 共收录 15
2606.23583 2026-06-23 cs.CL 新提交

Evaluation Awareness Is Not One Capability: Evidence from Open Language Models

评估意识并非单一能力:来自开放语言模型的证据

Nilesh Nayan, Aishwarya Sampath Kumar, Rishiraj Girmal, Shivani Anilkumar, Sankaran Vaidyanathan, David A. Nader Palacio, Reshmi Ghosh, Soundararajan Srinivasan

机构 * University of Massachusetts, Amherst(马萨诸塞大学阿默斯特分校) Microsoft Corp.(微软公司)

AI总结 通过37个开放权重模型实验,发现语言模型对评估线索的检测、行为变化和表征可控性三个维度弱耦合,表明评估意识是多维的,单一分数无法可靠预测部署安全。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23459 2026-06-23 cs.CL 新提交

TriggerBench: Investigating Prospective Memory for Large Language Models

TriggerBench: 探究大型语言模型的前瞻记忆

Tianhua Zhang, Xinjiang Wang, Qianxi Zhang, Qi Chen, Kun Li, Yaoqi Chen, Dingdong Wang, Helen Meng, Yan Lu

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 提出TriggerBench基准,系统评估LLM的前瞻记忆能力,发现其存在精度-召回权衡、注意力脆弱性,且比回溯记忆更难,可作为推理能力的指标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22995 2026-06-23 cs.LG cs.AI cs.CL 新提交

Group-Graph Policy Optimization for Long-Horizon Agentic Reinforcement Learning

组图策略优化用于长程智能体强化学习

Yunan Wang, Minghui Song, Zihan Zhang, Shaohan Huang, Haizhen Huang, Furu Wei, Weiwei Deng, Feng Sun, Qi Zhang

机构 * Peking University(北京大学) Microsoft Corporation(微软公司)

AI总结 提出G2PO算法,通过构建全局状态转移图并引入组聚合状态值估计和边中心优势估计,解决长程智能体强化学习中的奖励稀疏和信用分配粗粒度问题,在WebShop等基准上显著提升成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22570 2026-06-23 cs.CL 新提交

What are Key Factors for Updates in RL for LLM Reasoning?

RL提升LLM推理能力的关键更新因素是什么?

Peidong Wang, Demi Wang, Xufang Luo, Jiahang Xu, Xiaocui Yang, Shi Feng, Yuqing Yang, Dongsheng Li

机构 * School of Computer Science and Engineering, Northeastern University(东北大学计算机科学与工程学院) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学)

AI总结 通过理论分析RLVR更新,发现离策略程度影响重要性采样比率分布和裁剪行为,提出自适应裁剪策略优化(ACPO),在多种推理基准上优于DAPO和CISPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21736 2026-06-23 cs.CV 新提交

Adversarial Domain Prompt Tuning and Generation for Single Domain Generalization

对抗域提示调优与生成用于单域泛化

Zhipeng Xu, De Cheng, Xinyang Jiang, Nannan Wang, Dongsheng Li, Xinbo Gao

机构 * Xidian University(西安电子科技大学) Microsoft Research Asia(微软亚洲研究院) Chongqing University of Posts and Telecommunications(重庆邮电大学)

AI总结 提出渐进式对抗提示调优框架,利用预训练扩散模型生成多样域风格图像,实现单域泛化,性能超越现有方法。

Comments 12 pages, 6 figures, accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21406 2026-06-23 cs.RO cs.CV 新提交

Robot Self-Improvement via Human-Video Dynamics Models

机器人通过人类视频动力学模型自我改进

Hanzhi Chen, Anran Zhang, Simon Schaefer, Kejia Chen, Shi Chen, Daniel Cremers, Oier Mees, Stefan Leutenegger

机构 * ETH Zurich(苏黎世联邦理工学院) Technical University of Munich(慕尼黑工业大学) Microsoft(微软) MCML(慕尼黑机器学习中心)

AI总结 提出DGAC方法,利用人类视频学习跨本体的动作、动力学和价值表征,使机器人能从自身失败中自主改进,在7个真实操作任务中将成功率从40%提升至81%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20868 2026-06-23 cs.CR cs.AI 新提交

Can LLMs Reason About Brand Ownership? An Empirical Study of Domain Attribution Intelligence

LLM能否推理品牌所有权?领域归属智能的实证研究

Fathima Mashood, Mohamed Nabeel

机构 * Google(谷歌) Microsoft(微软)

AI总结 针对品牌域名归属歧义问题,首次系统评估LLM在域名枚举、开放归属和二元分类三项任务中的品牌智能表现,发现模型依赖外部工具(如WHOIS)才能实现高精度所有权验证。

Comments llm, brand intelligence, whois, search, squatting domains, brand domains

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20629 2026-06-23 cs.MA cs.AI cs.LG 新提交

Specialize Roles, Mix Deployments: Pushing the Cost-Accuracy Frontier of LLM Agent Teams

专业化角色,混合部署:推动LLM代理团队的成本-精度前沿

Yinsicheng Jiang, Liang Cheng, Yeqi Huang, Yufan Zhao, Zhan Lu, Li Dong, Wenda Li, Edoardo Ponti, Luo Mai

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院)

AI总结 提出AgentCARD基准,通过角色感知评估和帕累托前沿分析,发现异构团队在成本-精度前沿上优于同构团队,混合部署可降低12倍成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12120 2026-06-23 cs.LG math.OC 新提交

A Riemannian Approach to Low-Rank Optimal Transport

低秩最优传输的黎曼方法

Pratik Jawanpuria, Bamdev Mishra

机构 * Centre for Machine Intelligence and Data Science, IIT Bombay(印度理工学院孟买分校机器智能与数据科学中心) Microsoft India(微软印度)

AI总结 提出黎曼几何框架用于低秩最优传输,通过将平衡与不平衡秩r正因子耦合建模为光滑子流形,并采用Fisher-Rao乘积度量,实现高效的一阶和二阶求解器,在收敛速度和性能上超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07954 2026-06-23 cs.LG cs.AI 新提交

Minibatch Selection for Language Models via Partition Matroid Constrained Gradient Matching

基于划分拟阵约束梯度匹配的小批量选择

Prayas Agrawal, Prateek Chanda, Ishita Khatri, Ganesh Ramakrishnan, Bamdev Mishra, Pratik Jawanpuria

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔) Department of Computer Science and Engineering(计算机科学与工程系) Centre for Machine Intelligence and Data Science(机器智能与数据科学中心) Microsoft Research India(微软印度研究院) Microsoft India(微软印度)

AI总结 提出PartitionSel方法,通过划分拟阵约束下的梯度匹配效用最大化,实现跨域小批量选择,减少冗余并提升训练兼容性,在LLM微调中取得鲁棒性提升。

Comments 28 pages, 12 figures, ICML 2026

Journal ref Proceedings of the 43rd International Conference on Machine Learning (ICML 2026), Seoul, South Korea, PMLR 306, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03378 2026-06-23 stat.ML cs.LG

Understanding and Improving Shampoo and SOAP via Kullback-Leibler Minimization

通过Kullback-Leibler最小化理解并改进洗发水与SOAP

Wu Lin, Scott C. Lowe, Felix Dangel, Runa Eschenhagen, Zikun Xu, Roger B. Grosse

机构 * Vector Institute(向量研究所) University of Cambridge(剑桥大学) Microsoft(微软) University of Toronto(多伦多大学)

AI总结 本文通过将估计过程转化为KL散度最小化下的协方差估计,改进了Shampoo和SOAP,提出KL-Shampoo和KL-SOAP方法,在神经网络预训练中表现更优,且无需依赖Adam。

Comments an extended version of the ICLR 2026 paper (added a paragraph in Sec 3.2 about short-sided KL-Shampoo as scaled Muon when momentum is disabled)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01624 2026-06-23 cs.CV 版本更新

PISCES: Annotation-free Text-to-Video Post-Training via Optimal Transport-Aligned Rewards

PISCES: 基于最优传输对齐奖励的无标注文本到视频后训练

Minh-Quan Le, Gaurav Mittal, Cheng Zhao, David Gu, Dimitris Samaras, Mei Chen

机构 * Microsoft(微软) Stony Brook University(石溪大学)

AI总结 提出PISCES算法,通过双重最优传输对齐奖励模块,无需人工标注即可提升文本生成视频的质量和语义对齐,在VBench上超越现有方法。

Comments Accepted to ICML 2026. Project page and code: https://roar-ai.github.io/pisces/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02561 2026-06-23 cs.CV cs.AI 版本更新

Oracle-RLAIF: An Improved Fine-Tuning Framework for Multi-modal Video Models using Reinforcement Learning from Ranking Feedback

Oracle-RLAIF:一种利用排名反馈强化学习改进多模态视频模型微调框架的方法

Derek Shi, Ruben Glatt, Christine Klymko, Shubham Mohole, Hongjun Choi, Shashank Kushwaha, Sam Sakla, Felipe Leno da Silva

机构 * Stanford University(斯坦福大学) Lawrence Livermore National Laboratory(劳伦斯利弗莫尔国家实验室) Microsoft(微软公司)

AI总结 提出Oracle-RLAIF框架,用通用排序器替代奖励模型,结合基于GRPO的排名损失函数GRPO_rank,实现更高效的多模态视频模型微调,在多个基准上优于现有方法。

Comments Proceedings of the 39th Annual Conference on Neural Information Processing Systems, ARLET Workshop (Aligning Reinforcement Learning Experimentalists and Theorists)

Journal ref Transactions on Machine Learning Research, Vol. 2026, June 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.14792 2026-06-23 cs.CY cs.AI cs.CL 版本更新

Measuring Human Contribution in AI-Assisted Content Generation

衡量AI辅助内容生成中的人类贡献

Yueqi Xie, Tao Qi, Jingwei Yi, Xiyuan Yang, Ryan Whalen, Junming Huang, Qian Ding, Yu Xie, Xing Xie, Fangzhao Wu

机构 * Princeton University(普林斯顿大学) Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) The University of Hong Kong(香港大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学)

AI总结 针对AI辅助内容生成中人类贡献度难以量化的问题,提出基于信息论的框架,通过互信息与自信息之比计算人类信息贡献比例,实验证明能有效区分不同创意领域的人类贡献程度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.07822 2026-06-23 eess.SP cs.AI cs.HC cs.LG 版本更新

Exploration of LLMs, EEG, and behavioral data to measure and support attention and sleep

探索LLMs、EEG和行为数据以测量和支持注意力与睡眠

Akane Sano, Judith Amores, Mary Czerwinski

机构 * Rice University(里士大学) Microsoft Research(微软研究院)

AI总结 本文探索利用大语言模型(LLMs)结合脑电图(EEG)和活动数据估计注意力状态、睡眠阶段和质量,并生成改善建议和引导想象脚本,发现LLMs能基于行为特征评估睡眠质量,但基于EEG和活动数据的检测需更多训练数据。

详情

展开后加载摘要…

URL PDF HTML 收藏