arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Columbia University(哥伦比亚大学)

2026-08-26 至 2026-08-26 共收录 3
2608.24842 2026-08-26 cs.CL cs.AI 新提交

Reading Is Not Using: Retrieval, Judgment, and the Design of AI Financial Research Workflows

阅读并非使用:检索、判断与AI金融研究工作流的设计

Miao Liu, Zhizhe Liu

机构 * Carroll School of Management, Boston College(波士顿学院卡罗尔管理学院) Columbia Business School, Columbia University(哥伦比亚大学哥伦比亚商学院)

AI总结 该研究针对长上下文金融分析中存在的检索-整合缺口,通过实验发现工作流架构会影响LLMs将检索到的风险披露信息整合至投资判断的效果,指出AI分析师表现由模型能力与工作流架构共同决定。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19416 2026-08-26 cs.LG 版本更新

MortarBench: Evaluating Mortgage Loan Origination Agents

MortarBench: 评估抵押贷款发起代理

Matthew Toles, Yunan Lu, Manav Munjal, Bojun Liu, Yuanhao Deng, Stephanie Selig, Derek Rindner, Cheng Li, Zhou Yu

机构 * Columbia University(哥伦比亚大学) Tidalwave

AI总结 提出MortarBench基准,通过金融数据合成与变异管道生成覆盖边缘案例的示例,评估大语言模型在贷款发起任务中的表现,发现模型准确率低且存在偏见,并引入CRIT校准框架提升准确率至80.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01532 2026-08-26 cs.AI 版本更新

PHMForge: Evaluating LLM Agents on Industrial Prognostics through MCP-Native, Algorithm-Grounded Tools

PHMForge:通过MCP原生、算法基础的工具评估LLM代理在工业预测维护中的表现

Yusheng Li, Tianjun Feng, Yunfeng Chen, Chun-Yi Tsai, Yihan Sun, Ayan Das, Kaoutar El Maghraoui, Shuxin Lin, Dhaval Patel

机构 * Columbia University(哥伦比亚大学) Georgia Institute of Technology(佐治亚理工学院) IBM, New York(IBM,纽约)

AI总结 PHMForge通过MCP原生工具评估LLM代理在工业预测维护中的可靠性,揭示了静态检索在预测计算中的局限性,展示了不同框架和模型的表现差异。

Comments 23 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏