Tracing Agentic Failure from the Flow of Success
从成功流中追溯智能体失败
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。
大厂专区
从成功流中追溯智能体失败
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。
评估低资源语言中的健康错误信息:将小语言模型与文化敏感的负责任自然语言处理框架相结合(以孟加拉语为例)
机构 * Western Sydney University(西悉尼大学) ; Microsoft(微软公司) ; Excelsia College(埃克塞尔西亚学院) ; Faulconbridge Health Centre(福尔康布里奇健康中心)
AI总结 研究针对低资源语言中健康错误信息难检测问题,提出结合小语言模型与文化敏感的负责任自然语言处理框架,以孟加拉语为例进行实验,证明Phi-4表现优,还设计新框架,为评估低资源语言错误信息提供整体视角。
Comments 39 pages
时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况
机构 * Microsoft(微软) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。
Comments 9 pages, 11 pages supplemental
从提示风险到响应风险:大型语言模型安全行为的配对分析
机构 * Microsoft(微软)
AI总结 本研究通过配对分析人类标注的提示和响应记录,探讨了大型语言模型在四个危害类别(性、自残、仇恨和暴力)和有序严重性级别上的安全行为,发现61%的响应比提示减少了危害,3%的响应升级了危害,并揭示了安全行为与无害性之间的权衡。
重新思考多领域测试时扩展的奖励模型
机构 * KAIST(韩国科学技术院) ; Microsoft Research Asia(微软亚洲研究院) ; TH Nürnberg
AI总结 研究多领域测试时扩展的奖励模型,对四种奖励模型变体进行统一评估,发现dORM与dPRM相当,gPRM无竞争力,gORM最稳健,挑战细粒度监督更好的假设,支持生成式结果验证并公开代码。