Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
你能信任置信度吗?面向文档提取的视觉语言模型ConfBench
机构 * Amazon Web Services(亚马逊网络服务)
AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。
大厂专区
你能信任置信度吗?面向文档提取的视觉语言模型ConfBench
机构 * Amazon Web Services(亚马逊网络服务)
AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。
逃离置信陷阱:扩散大语言模型数学推理的进化解码
机构 * Australian National University(澳大利亚国立大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊) ; University of Technology Sydney(悉尼科技大学)
AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。