arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

大厂专区

Microsoft(微软)

2026-05-14 至 2026-05-14 共收录 10
2605.13595 2026-05-14 cs.CL

Inducing Artificial Uncertainty in Language Models

在语言模型中诱导人工不确定性

Sophia Hager, Simon Zeng, Nicholas Andrews

机构 * Johns Hopkins University(约翰霍普金斯大学) Microsoft(微软)

AI总结 本文研究了在缺乏挑战性数据时如何通过诱导人工不确定性来提升语言模型的不确定性量化能力,通过训练探测器识别人工不确定性,实现了在困难数据上的高校准性,且对简单数据的性能影响较小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13467 2026-05-14 cs.CL

PDCR: Perception-Decomposed Confidence Reward for Vision-Language Reasoning

PDCR:感知分解置信度奖励用于视觉-语言推理

Hee Suk Yoon, Eunseop Yoon, Ji Woo Hong, SooHwan Eom, Gwanhyeong Koo, Mark Hasegawa-Johnson, Qi Dai, Chong Luo, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research Asia (MSRA)(微软亚洲研究院)

AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13424 2026-05-14 cs.LG cs.CL

LIFT: Last-Mile Fine-Tuning for Table Explicitation

LIFT:表格显式化的最后一公里微调

Divij Khaitan, Ashish Tiwari

机构 * Microsoft Corporation(微软公司)

AI总结 本文提出LIFT方法,通过预训练大语言模型提取表格并由微调的小语言模型修复错误,仅需1000个训练样本即可在TEDS指标上超越端到端微调,且更鲁棒于输入格式变化。

Comments 9 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.10547 2026-05-14 cs.AI

Agent^2 RL-Bench: Can LLM Agents Engineer Agentic RL Post-Training?

Agent^2 RL-Bench: 能否让LLM代理在训练后设计自主强化学习?

Wanyi Chen, Xiao Yang, Xu Yang, Tianming Sha, Qizheng Li, Zhuo Wang, Bowen Xian, Fang Kong, Weiqing Liu, Jiang Bian

机构 * Soochow University(苏州大学) Microsoft Research Asia(微软亚洲研究院) Peking University(北京大学) Stony Brook University(石溪大学) The University of Chicago(芝加哥大学)

AI总结 Agent2 RL-Bench评估LLM代理在训练后自主设计、实现、调试和执行提升基础模型的管道能力,展示代理在强化学习中的智能行为与局限性。

Comments 37 pages, 7 figures, 20 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.18917 2026-05-14 cs.AI cs.PL cs.SE

ClassInvGen: Class Invariant Synthesis using Large Language Models

ClassInvGen:利用大语言模型进行类不变式合成

Chuyue Sun, Viraj Agashe, Saikat Chakraborty, Jubi Taneja, Clark Barrett, David Dill, Xiaokang Qiu, Shuvendu K. Lahiri

机构 * Stanford University(斯坦福大学) Microsoft Research(微软研究院) Purdue University(普渡大学)

AI总结 本文提出ClassInvGen,利用大语言模型生成C++等主流语言的可执行类不变式及测试输入,优于纯LLM方法和Daikon等传统技术,提供基准测试和案例研究验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13330 2026-05-14 cs.CL

FIND: Toward Multimodal Financial Reasoning and Question Answering for Indic Languages

FIND:迈向印度语言多模态金融推理与问答

Sarmistha Das, Vaibhav Vishal, Syed Ibrahim Ahmad, Manish Gupta, Sriparna Saha

机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) Microsoft(微软)

AI总结 本文提出FinVQA基准和FIND框架,针对多语言印度语言金融推理挑战,通过多模态和数值推理提升金融决策准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.13105 2026-05-14 cs.RO

What to Ignore, What to React: Visually Robust RL Fine-Tuning of VLA Models

忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调

Yuanfang Peng, Jingjing Fu, Chuheng Zhang, Li Zhao, Jiang Bian, Mingyu Liu, Ling Zhang, Jun Zhang, Rui Wang

机构 * Hong Kong University of Science and Technology(香港理工大学) Microsoft Research Asia(微软亚洲研究院) Zhejiang University(浙江大学)

AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12702 2026-05-14 cs.AI cs.HC

DisaBench: A Participatory Evaluation Framework for Disability Harms in Language Models

DisaBench:一种评估语言模型残疾危害的参与性评估框架

Eugenia Kim, Ioana Tanase, Christina Mallon

机构 * Microsoft(微软)

AI总结 DisaBench通过与残障人士和红队专家共同制定的十二类残疾危害分类,评估语言模型对残疾相关的危害,揭示了残疾类型对危害率的影响、术语驱动的危害具有文化及时间绑定性以及标准安全评估无法识别细微危害的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11202 2026-05-14 cs.LO cs.AI

interwhen: A Generalizable Framework for Steering Reasoning Models with Test-time Verification

interwhen:一种可泛化的引导推理模型进行测试时验证的框架

Vishak K Bhat, Prateek Chanda, Vijval Ekbote, Ashmit Khandelwal, Maitreyi Swaroop, Vineeth N. Balasubramanian, Subbarao Kambhampati, Nagarajan Natarajan, Amit Sharma

机构 * Microsoft Research(微软研究院) IIT Bombay(印度理工学院班加罗尔分校) Carnegie Mellon University(卡内基梅隆大学) Arizona State University(亚利桑那州立大学)

AI总结 interwhen提出一种单轨迹验证框架,通过反馈中间推理轨迹引导模型行为,解决验证状态获取和 verifier 缺乏的问题,提升推理代理的任务完成和政策合规性。

Comments 56 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19304 2026-05-14 cs.LG

Loopholing Discrete Diffusion: Deterministic Bypass of the Sampling Wall

突破离散扩散:确定性绕过采样壁垒

Mingyu Jo, Jaesik Yoon, Justin Deschenaux, Caglar Gulcehre, Sungjin Ahn

机构 * KAIST(韩国科学技术院) EPFL(苏黎世联邦理工学院) Microsoft(微软) SAP NYU(纽约大学)

AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏