Tracing Agentic Failure from the Flow of Success
从成功流中追溯智能体失败
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。
大厂专区
从成功流中追溯智能体失败
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Microsoft Research(微软研究院)
AI总结 研究基于大语言模型的智能体系统失败归因问题,提出OAT方法将其转化为单类学习,用神经控制微分方程建模成功轨迹动态模式,实验表明该方法比基线快且F1分数更高,是诊断智能体系统失败的有效方向。
评估低资源语言中的健康错误信息:将小语言模型与文化敏感的负责任自然语言处理框架相结合(以孟加拉语为例)
机构 * Western Sydney University(西悉尼大学) ; Microsoft(微软公司) ; Excelsia College(埃克塞尔西亚学院) ; Faulconbridge Health Centre(福尔康布里奇健康中心)
AI总结 研究针对低资源语言中健康错误信息难检测问题,提出结合小语言模型与文化敏感的负责任自然语言处理框架,以孟加拉语为例进行实验,证明Phi-4表现优,还设计新框架,为评估低资源语言错误信息提供整体视角。
Comments 39 pages
时间基准分数衡量的是什么?分解视频视觉语言模型评估中的通道使用情况
机构 * Microsoft(微软) ; Georgia Institute of Technology(佐治亚理工学院)
AI总结 研究视频视觉语言模型评估中时间基准分数衡量问题,提出无标签筛选方法“反转下降”区分模型通道使用情况,如Molmo2和Qwen3-VL,指出综合分数不能反映潜在失败模式,此区分在多基准和任务中成立。
Comments 9 pages, 11 pages supplemental