Inducing Artificial Uncertainty in Language Models
在语言模型中诱导人工不确定性
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Microsoft(微软)
AI总结 本文研究了在缺乏挑战性数据时如何通过诱导人工不确定性来提升语言模型的不确定性量化能力,通过训练探测器识别人工不确定性,实现了在困难数据上的高校准性,且对简单数据的性能影响较小。
大厂专区
在语言模型中诱导人工不确定性
机构 * Johns Hopkins University(约翰霍普金斯大学) ; Microsoft(微软)
AI总结 本文研究了在缺乏挑战性数据时如何通过诱导人工不确定性来提升语言模型的不确定性量化能力,通过训练探测器识别人工不确定性,实现了在困难数据上的高校准性,且对简单数据的性能影响较小。
PDCR:感知分解置信度奖励用于视觉-语言推理
机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国高级科学技术研究院) ; University of Illinois at Urbana-Champaign (UIUC)(伊利诺伊大学厄巴纳-香槟分校) ; Microsoft Research Asia (MSRA)(微软亚洲研究院)
AI总结 PDCR通过分解任务中的感知与推理步骤,提升视觉-语言推理的训练效果,解决全局奖励导致的信号退化问题。
Comments CVPR 2026
LIFT:表格显式化的最后一公里微调
机构 * Microsoft Corporation(微软公司)
AI总结 本文提出LIFT方法,通过预训练大语言模型提取表格并由微调的小语言模型修复错误,仅需1000个训练样本即可在TEDS指标上超越端到端微调,且更鲁棒于输入格式变化。
Comments 9 pages, 1 figure, 3 tables
Agent^2 RL-Bench: 能否让LLM代理在训练后设计自主强化学习?
机构 * Soochow University(苏州大学) ; Microsoft Research Asia(微软亚洲研究院) ; Peking University(北京大学) ; Stony Brook University(石溪大学) ; The University of Chicago(芝加哥大学)
AI总结 Agent2 RL-Bench评估LLM代理在训练后自主设计、实现、调试和执行提升基础模型的管道能力,展示代理在强化学习中的智能行为与局限性。
Comments 37 pages, 7 figures, 20 tables
ClassInvGen:利用大语言模型进行类不变式合成
机构 * Stanford University(斯坦福大学) ; Microsoft Research(微软研究院) ; Purdue University(普渡大学)
AI总结 本文提出ClassInvGen,利用大语言模型生成C++等主流语言的可执行类不变式及测试输入,优于纯LLM方法和Daikon等传统技术,提供基准测试和案例研究验证其有效性。
FIND:迈向印度语言多模态金融推理与问答
机构 * Indian Institute of Technology Patna(印度理工学院帕纳分校) ; Microsoft(微软)
AI总结 本文提出FinVQA基准和FIND框架,针对多语言印度语言金融推理挑战,通过多模态和数值推理提升金融决策准确性。
忽略什么,反应什么:视觉鲁棒的VLA模型强化学习微调
机构 * Hong Kong University of Science and Technology(香港理工大学) ; Microsoft Research Asia(微软亚洲研究院) ; Zhejiang University(浙江大学)
AI总结 本文提出PAIR-VLA框架,通过在PPO优化中加入两个辅助目标,提升VLA模型在视觉变化下的鲁棒性,实验表明其在不同视觉扰动下均优于标准PPO。
DisaBench:一种评估语言模型残疾危害的参与性评估框架
机构 * Microsoft(微软)
AI总结 DisaBench通过与残障人士和红队专家共同制定的十二类残疾危害分类,评估语言模型对残疾相关的危害,揭示了残疾类型对危害率的影响、术语驱动的危害具有文化及时间绑定性以及标准安全评估无法识别细微危害的问题。
interwhen:一种可泛化的引导推理模型进行测试时验证的框架
机构 * Microsoft Research(微软研究院) ; IIT Bombay(印度理工学院班加罗尔分校) ; Carnegie Mellon University(卡内基梅隆大学) ; Arizona State University(亚利桑那州立大学)
AI总结 interwhen提出一种单轨迹验证框架,通过反馈中间推理轨迹引导模型行为,解决验证状态获取和 verifier 缺乏的问题,提升推理代理的任务完成和政策合规性。
Comments 56 pages, 6 figures
突破离散扩散:确定性绕过采样壁垒
机构 * KAIST(韩国科学技术院) ; EPFL(苏黎世联邦理工学院) ; Microsoft(微软) ; SAP ; NYU(纽约大学)
AI总结 本文提出Loopholing机制,通过确定性潜在路径解决离散扩散模型采样瓶颈问题,显著降低生成困惑度,提升文本连贯性,并在推理任务中表现优异。
Comments Accepted at ICLR 2026