Can You Trust the Confidence? ConfBench for Vision-Language Models on Document Extraction
你能信任置信度吗?面向文档提取的视觉语言模型ConfBench
机构 * Amazon Web Services(亚马逊网络服务)
AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。
大厂专区
你能信任置信度吗?面向文档提取的视觉语言模型ConfBench
机构 * Amazon Web Services(亚马逊网络服务)
AI总结 该研究针对视觉语言模型的文档提取任务推出校准专用基准ConfBench,评估多类VLM的置信度估计方法,揭示模态、模型能力等对置信度的影响,发布相关指标以助力可信IDP部署。
逃离置信陷阱:扩散大语言模型数学推理的进化解码
机构 * Australian National University(澳大利亚国立大学) ; Nanyang Technological University(南洋理工大学) ; National University of Singapore(新加坡国立大学) ; Amazon(亚马逊) ; University of Technology Sydney(悉尼科技大学)
AI总结 针对扩散大语言模型数学推理的置信陷阱,提出无训练的进化解码框架,通过逐步选择与分块变异提升LLaDA 2.0的数学推理可靠性。
量子影院:通过生成世界模型对量子计算硬件进行交互式电影探索
机构 * Amazon Web Services(亚马逊网络服务) ; Duke Kunshan University(杜克昆山大学)
AI总结 本文提出量子影院,一个基于生成世界模型的开源交互式应用,通过四幕叙事将不可见的量子硬件转化为可探索的电影体验,旨在弥合量子计算与公众之间的想象鸿沟。
QSignAI: 量子随机性种子身份签名——AI for Science 与 Science for AI 的交汇
机构 * Amazon Web Services(亚马逊网络服务) ; Duke Kunshan University(杜克昆山大学)
AI总结 提出 QSignAI 平台,通过云端量子电路生成量子随机性种子,为社交平台用户提供唯一身份签名,并借助 AI 机器人使量子现象对普通用户可感知。