BigFinanceBench: A Workflow-Grounded Benchmark for Financial-Research Agents
BigFinanceBench: 一个基于工作流的金融研究智能体基准
机构 * Rogo ; OpenAI
AI总结 针对金融研究答案可审计推导过程未被充分评估的问题,提出包含928个专家编写任务、每个任务附带点权评分标准的BigFinanceBench基准,用于评估完整推导过程而非仅最终答案,实验表明最佳系统仅达58.8%评分,存在显著提升空间。