MortarBench: Evaluating Mortgage Loan Origination Agents
MortarBench: 评估抵押贷款发起代理
机构 * Columbia University(哥伦比亚大学) ; Tidalwave
AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。
高校专区
MortarBench: 评估抵押贷款发起代理
机构 * Columbia University(哥伦比亚大学) ; Tidalwave
AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。
PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现
机构 * Columbia University(哥伦比亚大学) ; Georgia Institute of Technology(佐治亚理工学院) ; IBM, New York(IBM,纽约)
AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。
Comments 23 pages, 3 figures