arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-04-14 至 2026-04-14 共收录 18
2604.11742 2026-04-14 cs.CL cs.AI

Discourse Diversity in Multi-Turn Empathic Dialogue

多轮共情对话中的语篇多样性

Hongli Zhan, Emma S. Gueorguieva, Javier Hernandez, Jina Suh, Desmond C. Ong, Junyi Jessy Li

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Microsoft Research(微软研究院) University of Washington(华盛顿大学)

AI总结 研究探讨了大型语言模型在多轮共情对话中语篇策略的多样性问题,提出MINT框架通过强化学习提升对话多样性,显著提高共情效果并减少重复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11716 2026-04-14 cs.AI cs.CL

SWE-AGILE: A Software Agent Framework for Efficiently Managing Dynamic Reasoning Context

SWE-AGILE:一种用于高效管理动态推理上下文的软件代理框架

Shuquan Lian, Juncheng Liu, Yazhe Chen, Yuhong Chen, Hui Li

机构 * Microsoft(微软)

AI总结 SWE-AGILE通过动态推理上下文策略平衡推理深度与效率,实现高效多轮软件工程任务处理,实验证明其在SWE-Bench-Verified上优于7B-8B模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05837 2026-04-14 cs.CL

EEPO: Exploration-Enhanced Policy Optimization via Sample-Then-Forget

EEPO:通过采样后遗忘的探索增强策略优化

Liang Chen, Xueting Han, Qizhou Wang, Bo Han, Jing Bai, Hinrich Schutze, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Microsoft Research Asia(微软亚洲研究院) Hong Kong Baptist University(香港浸会大学) LMU Munich(慕尼黑大学) MoE Key Laboratory of High Confidence Software Technologies(教育部高可信软件技术重点实验室)

AI总结 EEPO通过两阶段 rollout 和自适应遗忘机制提升探索能力,在五个推理基准中超越 GRPO,取得显著性能提升。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.11003 2026-04-14 cs.AI cs.LG

Sanity Checks for Agentic Data Science

代理数据科学的合理性检查

Zachary T. Rewolinski, Austin V. Zane, Hao Huang, Chandan Singh, Chenglong Wang, Jianfeng Gao, Bin Yu

机构 * Dept. of Statistics UC Berkeley(加州大学伯克利分校统计系) Dept. of EECS UC Berkeley(加州大学伯克利分校电子工程与计算机科学系) Microsoft Research(微软研究院) Center for Computational Biology UC Berkeley(加州大学伯克利分校计算生物学中心)

AI总结 本文提出基于PCS框架的轻量级合理性检查,用于验证代理数据科学输出的可靠性,通过扰动检测信号与噪声区分,揭示不支持的结论,并在合成数据和真实数据集上验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10994 2026-04-14 cs.CV

LumiMotion: Improving Gaussian Relighting with Scene Dynamics

LumiMotion:通过场景动态改进高斯光照明

Joanna Kaleta, Piotr Wójcik, Kacper Marzol, Tomasz Trzciński, Kacper Kania, Marek Kowalski

机构 * Warsaw University of Technology(华沙理工大学) Sano Centre for Computational Medicine(Sano计算医学中心) Inst. for Biomedical Informatics, Univ. Hospital of Cologne(科隆大学医院生物医学信息学研究所) University of Cologne(科隆大学) CMMC Cologne(科隆CMMC) Jagiellonian University(雅盖隆大学) IDEAS Research Institute(IDEAS研究所) Microsoft(微软)

AI总结 本文提出LumiMotion,通过利用场景动态元素作为监督信号,改进高斯反渲染方法,在动态场景中实现更准确的光照与材质分离,实验表明在albedo估计和场景照明中分别提升了23%和15%。

Comments CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10952 2026-04-14 cs.LG

UniPROT: Uniform Prototype Selection via Partial Optimal Transport with Submodular Guarantees

UniPROT: 通过部分最优传输与子模性保证的统一原型选择

Prateek Chanda, Prayas Agrawal, Karthik S. Gurumoorthy, Ganesh Ramakrishnan, Bamdev Mishra, Pratik Jawanpuria

机构 * Department of Computer Science and Engineering, Indian Institute of Technology Bombay(印度理工学院孟买分校计算机科学与工程系) Centre for Machine Intelligence and Data Science, Indian Institute of Technology Bombay(印度理工学院孟买分校机器智能与数据科学中心) Microsoft Research India(微软研究院印度) Walmart Global Tech, India(沃尔玛全球技术印度) Microsoft India(微软印度)

AI总结 UniPROT通过部分最优传输和子模性保证,解决原型选择中的类别不平衡问题,提升少数类表现而不影响多数类准确性。

Comments 25 pages, 31 figures. Accepted as a poster at AISTATS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10701 2026-04-14 cs.LG cs.AI cs.CL

Bringing Value Models Back: Generative Critics for Value Modeling in LLM Reinforcement Learning

带回价值模型:生成式批评者在大语言模型强化学习中的价值建模

Zikang Shan, Han Zhong, Liwei Wang, Li Zhao

机构 * Peking University(北京大学) Microsoft Research Asia(微软亚洲研究院)

AI总结 本文提出生成式批评者GenAC,通过链式推理改进价值建模,提升RL性能。

Comments 16 pages including appendix, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01692 2026-04-14 cs.LG cs.AI

Reasoning as Gradient: Scaling MLE Agents Beyond Tree Search

推理作为梯度:超越树搜索的MLE代理扩展

Yifei Zhang, Xu Yang, Xiao Yang, Bowen Xian, Qizheng Li, Shikai Fang, Jingyuan Li, Jian Wang, Mingrui Xu, Weiqing Liu, Jiang Bian

机构 * Nanjing University(南京大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Zhejiang University(浙江大学) Wuhan University(武汉大学) Hong Kong University of Science and Technology(香港科技大学)

AI总结 本文提出Gome,一种基于梯度优化的MLE代理,通过将结构化诊断推理映射到梯度计算,实现更高效的优化。实验显示,随着模型能力增强,梯度优化在前沿模型中表现更优,且在受限预算下达到35.1%的任何奖牌率。

Comments 36 pages, 6 figures, 17 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.17755 2026-04-14 cs.CL

HyperGraphPro: Progress-Aware Reinforcement Learning for Structure-Guided Hypergraph RAG

HyperGraphPro: 为结构引导的超图RAG设计的进度感知强化学习

Jinyoung Park, Sanghyeok Lee, Omar Zia Khan, Hyunwoo J. Kim, Joo-Kyung Kim

机构 * KAIST(韩国科学技术院) Microsoft(微软) Amazon(亚马逊)

AI总结 HyperGraphPro通过结合语义相关性和图连接性,改进超图检索机制,采用基于进度的逐步策略优化,提升多步推理的准确性和生成质量。

Comments In progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06101 2026-04-14 cs.LG cs.AI cs.CL

SynthAgent: Adapting Web Agents with Synthetic Supervision

SynthAgent:通过合成监督适应网络代理

Zhaoyang Wang, Yiming Liang, Xuchao Zhang, Qianhui Wu, Siwei Han, Anson Bastos, Rujia Wang, Chetan Bansal, Baolin Peng, Jianfeng Gao, Saravan Rajmohan, Huaxiu Yao

机构 * UNC-Chapel Hill(北卡罗来纳大学教堂山分校) Purdue University(普渡大学) Microsoft(微软)

AI总结 本文提出SynthAgent框架,通过任务和轨迹双重细化提升合成数据质量,从而提升网络代理在新网站环境中的适应能力。

Comments Accepted to ACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15640 2026-04-14 cs.LG cs.AI cs.CL

Data Mixing Agent: Learning to Re-weight Domains for Continual Pre-training

数据混合代理:学习重新加权领域以实现持续预训练

Kailai Yang, Xiao Liu, Lei Ji, Hao Li, Xiao Liang, Zhiwei Liu, Yeyun Gong, Peng Cheng, Mao Yang

机构 * The University of Manchester(曼彻斯特大学) Microsoft Research(微软研究院) Imperial College London(伦敦帝国学院) University of California, Los Angeles(加利福尼亚大学洛杉矶分校)

AI总结 本文提出数据混合代理,通过强化学习学习重新加权领域,实现持续预训练中的平衡性能,优于现有基线方法,并在未见过的领域中表现良好。

Comments Accepted by the ACL 2026 main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04842 2026-04-14 cs.LG cs.AI

Putting the Value Back in RL: Better Test-Time Scaling by Unifying LLM Reasoners With Verifiers

为RL重新注入价值:通过统一LLM推理器与验证器实现更好的测试时间扩展

Kusha Sareen, Morgane M Moss, Alessandro Sordoni, Rishabh Agarwal, Arian Hosseini

机构 * Mila, McGill University(Mila,麦吉尔大学) Mila, Université de Montréal(Mila,蒙特利尔大学) Microsoft Research, Mila(微软研究院,Mila) Google DeepMind, Mila(谷歌DeepMind,Mila)

AI总结 本文提出RL$^V$方法,通过联合训练LLM作为推理器和生成验证器,提升测试时间计算效率和任务准确性,实现20%以上的MATH准确率提升和8-32倍的计算效率提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.16771 2026-04-14 cs.SE cs.LG

Enabling Global, Human-Centered Explanations for LLMs:From Tokens to Interpretable Code and Test Generation

使大语言模型具备全球、以人为本的解释能力:从token到可解释的代码和测试生成

Dipin Khati, Daniel Rodriguez-Cardenas, David N. Palacio, Alejandro Velasco, Michele Tufano, Denys Poshyvanyk

机构 * Microsoft(微软) Google(谷歌)

AI总结 本文提出code rationales框架,通过将token级解释映射到高层编程类别,实现大语言模型代码生成的全局可解释性,验证了其在减少解释不确定性方面的有效性。

Comments Accepted to ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09862 2026-04-14 cs.CV

FF3R: Feedforward Feature 3D Reconstruction from Unconstrained views

FF3R:从无约束视角实现前馈特征三维重建

Chaoyi Zhou, Run Wang, Feng Luo, Mert D. Pesé, Zhiwen Fan, Yiqi Zhong, Siyu Huang

机构 * Microsoft(微软) Clemson University(克莱姆森大学) Texas A&M University(德克萨斯A&M大学)

AI总结 FF3R提出一种无需标注的前馈框架,统一处理几何与语义推理,解决全局语义不一致和局部结构不一致问题,实验显示其在视图合成、语义分割和深度估计中表现优异。

Comments CVPR 2026 Findings. Project Page: https://chaoyizh.github.io/ff3r_project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09852 2026-04-14 cs.AI cs.LG

MEMENTO: Teaching LLMs to Manage Their Own Context

MEMENTO:教大模型管理自身上下文

Vasilis Kontonis, Yuchen Zeng, Shivam Garg, Lingjiao Chen, Hao Tang, Ziyan Wang, Ahmed Awadallah, Eric Horvitz, John Langford, Dimitris Papailiopoulos

机构 * Microsoft Research(微软研究院)

AI总结 MEMENTO通过将推理分块并压缩为密集状态摘要,减少上下文、KV缓存和计算开销,提升模型效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.09564 2026-04-14 cs.DC cs.AI cs.SE

ACE-Bench: A Lightweight Benchmark for Evaluating Azure SDK Usage Correctness

ACE-Bench:一个轻量级的评估 Azure SDK 使用正确性的基准测试

Wenxing Zhu, Simeng Qi, Junkui Chen, Yan Xie, Min Huang, Jingkan He, Xiao Wang, Cheng Chen, Sijing Meng, Tianqi Zhang

机构 * Microsoft(微软)

AI总结 ACE-Bench通过将官方文档示例转化为自包含编码任务,提供快速可重复的通过或失败信号,评估基于LLM的编码代理是否正确使用Azure SDK,同时减少评估成本并提高可重复性。

Comments 5 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03944 2026-04-14 eess.SP cs.SD

ASVspoof 5: Evaluation of Spoofing, Deepfake, and Adversarial Attack Detection Using Crowdsourced Speech

ASVspoof 5:利用众包语音评估欺骗、深度伪造和对抗攻击检测

Xin Wang, Héctor Delgado, Nicholas Evans, Xuechen Liu, Tomi Kinnunen, Hemlata Tak, Kong Aik Lee, Ivan Kukanov, Md Sahidullah, Massimiliano Todisco, Junichi Yamagishi

机构 * Microsoft(微软) EURECOM University of Eastern Finland(东芬兰大学) Pindrop The Hong Kong Polytechnic University(香港理工大学) KLASS Engineering and Solutions(KLASS工程与解决方案公司) TCG CREST

AI总结 本文评估了ASVspoof 5挑战中53支队伍的提交结果,发现许多解决方案在对抗攻击和神经编码压缩方案下性能下降,并探讨了校准和其他主要挑战。

Comments Accepted by IEEE TASLP. Appendix is included. DOI 10.1109/TASLPRO.2026.3682962 (Open Access)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06806 2026-04-14 cs.CL cs.AI

MachineLearningLM: Scaling Many-shot In-context Learning via Continued Pretraining

MachineLearningLM: 通过持续预训练扩展多示例上下文学习

Haoyu Dong, Pengkun Zhang, Mingzhe Lu, Yanzhen Shen, Guolin Ke

机构 * UCAS(中国科学院大学) Microsoft(微软) SCUT(华南理工大学) Stanford(斯坦福大学)

AI总结 MachineLearningLM通过持续预训练赋予大语言模型强大的上下文机器学习能力,同时保持其通用知识和推理能力,提升多示例任务表现。

详情

展开后加载摘要…

URL PDF HTML 收藏