arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-04-20 至 2026-04-20 共收录 9
2604.16220 2026-04-20 cs.LG

OT on the Map: Quantifying Domain Shifts in Geographic Space

在地图上进行最优传输:量化地理空间中的领域偏移

Haoran Zhang, Livia Betti, Konstantin Klemmer, Esther Rolf, David Alvarez-Melis

机构 * Harvard University(哈佛大学) Kempner Institute(Kempner研究所) Microsoft Research(微软研究院) University of Colorado Boulder(科罗拉多大学博尔德分校) LGND AI, Inc.(LGND AI公司) University College London(伦敦大学学院)

AI总结 本文提出GeoSpOT方法,利用地理信息与最优传输量化地理领域偏移,有效预测跨领域迁移难度,并指导数据选择与性能预判。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16060 2026-04-20 cs.CV cs.AI

Chain-of-Thought Degrades Visual Spatial Reasoning Capabilities of Multimodal LLMs

基于链式思维的多模态大语言模型视觉空间推理能力退化

Sai Srinivas Kancheti, Aditya Sanjiv Kanade, Vineeth N. Balasubramanian, Tanuja Ganu

机构 * Microsoft Research India(微软印度研究院)

AI总结 研究发现链式思维范式在视觉空间推理任务中导致性能下降,通过实验揭示多模态模型在空间基准测试中的关键缺陷,并指出需转向以视觉为中心的推理方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16054 2026-04-20 cs.CV cs.AI

Mind's Eye: A Benchmark of Visual Abstraction, Transformation and Composition for Multimodal LLMs

Mind's Eye:多模态大语言模型的视觉抽象、转换与组合基准

Rohit Sinha, Aditya Kanade, Sai Srinivas Kancheti, Vineeth N Balasubramanian, Tanuja Ganu

机构 * CSE Dept., IIT Hyderabad(IIT海得拉巴计算机科学与工程系) Microsoft Research(微软研究院) IIT Hyderabad(IIT海得拉巴)

AI总结 本文提出Mind's Eye基准,通过A-R-T分类评估多模态大语言模型的视觉认知能力,发现人类准确率达80%,而顶级模型低于50%,揭示模型在视觉空间推理上的不足。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16037 2026-04-20 cs.CL

Stochasticity in Tokenisation Improves Robustness

分词中的随机性提升了鲁棒性

Sophie Steger, Rui Li, Sofiane Ennadir, Anya Sims, Arno Solin, Franz Pernkopf, Martin Trapp

机构 * Institute of Signal Processing Speech Communication, Graz University of Technology, Graz, Austria ELLIS Institute Finland \& Aalto University, Espoo, Finland King AI Labs, Microsoft Gaming University of Oxford, Oxford, United Kingdom KTH Royal Institute of Technology, Stockholm, Sweden

AI总结 本文研究了随机分词对对抗攻击和随机扰动鲁棒性的影响,发现预训练和微调时使用均匀采样随机分词可提升模型鲁棒性,且不增加推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15549 2026-04-20 cs.CL

WildFeedback: Aligning LLMs With In-situ User Interactions And Feedback

WildFeedback: 对齐大语言模型与实时用户交互与反馈

Taiwei Shi, Zhuoer Wang, Longqi Yang, Ying-Chun Lin, Zexue He, Mengting Wan, Pei Zhou, Sujay Jauhar, Sihao Chen, Shan Xia, Hongfei Zhang, Jieyu Zhao, Xiaofeng Xu, Xia Song, Jennifer Neville

机构 * Microsoft Corporation(微软公司) Purdue University(普渡大学) Texas A&M University(德克萨斯农工大学) University of California San Diego(加州大学圣地亚哥分校) University of Southern California(南加州大学)

AI总结 本文提出WildFeedback框架,通过实时用户反馈自动创建偏好数据集,提升大语言模型对用户偏好的对齐能力,解决了现有方法的可扩展性、主观性和偏见问题。

Comments ACL 2026 Camera-ready. 25 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15597 2026-04-20 cs.CL cs.HC

LLMs Corrupt Your Documents When You Delegate

当您委托时,大型语言模型会破坏您的文档

Philippe Laban, Tobias Schnabel, Jennifer Neville

机构 * Microsoft Research(微软研究院)

AI总结 研究发现,当前LLM在委托工作中会破坏文档,即使前沿模型也平均破坏25%的内容,文档大小和交互长度加剧了这一问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.15331 2026-04-20 cs.HC cs.AI cs.CY

How people use Copilot for Health

人们如何使用Copilot进行健康咨询

Beatriz Costa-Gomes, Pavel Tolmachev, Eloise Taysom, Viknesh Sounderajah, Hannah Richardson, Philipp Schoenegger, Xiaoxuan Liu, Matthew M Nour, Seth Spielman, Samuel F. Way, Yash Shah, Michael Bhaskar, Harsha Nori, Christopher Kelly, Peter Hames, Bay Gross, Mustafa Suleyman, Dominic King

机构 * Microsoft AI(微软人工智能)

AI总结 研究通过分析50万条健康对话,构建了12类意图分类体系,揭示了健康查询的意图分布、主题演变及使用差异,发现健康咨询多涉及个人症状、他人健康及医疗系统导航问题。

Comments 12 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13220 2026-04-20 cs.AI cs.CL

EvoTest: Evolutionary Test-Time Learning for Self-Improving Agentic Systems

EvoTest: 为自改进智能体系统设计的进化测试时学习

Yufei He, Juncheng Liu, Yue Liu, Yibo Li, Tri Cao, Zhiyuan Hu, Xinxing Xu, Bryan Hooi

机构 * National University of Singapore(国立新加坡大学) Microsoft Research(微软研究院)

AI总结 本文提出EvoTest框架,通过进化方法在无需微调或梯度的情况下提升智能体性能,在J-TTL基准中超越传统方法,能赢得两局游戏。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08125 2026-04-20 cs.LG cs.CL

Not All Tokens Matter: Towards Efficient LLM Reasoning via Token Significance in Reinforcement Learning

并非所有标记都重要:通过强化学习中的标记重要性实现高效的LLM推理

Hanbing Liu, Lang Cao, Yuanyi Ren, Mengyu Zhou, Haoyu Dong, Xiaojun Ma, Shi Han, Dongmei Zhang

机构 * Tsinghua University(清华大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Peking University(北京大学) Qwen Large Model Application Team, Alibaba(阿里云文大模型应用团队) Microsoft(微软) Shenzhen Key Laboratory of Ubiquitous Data Enabling, Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院 ubiquitous 数据赋能重点实验室)

AI总结 本文提出通过标记重要性优化强化学习,减少冗余并提升LLM推理效率和准确性,实验显示响应长度显著缩短且正确性保持或提升。

详情

展开后加载摘要…

URL PDF HTML 收藏