HiEviDR-Bench: A Benchmark for Hierarchical Evidence Aggregation in Deep Research
HiEviDR-Bench:深度研究中分层证据聚合的基准测试
专题命中 视觉推理 :multimodal large language model(abstract)
AI总结 针对深度研究中证据聚合评估不足问题,HiEviDR-Bench构建基准测试,涵盖多领域多模态设置,用证据图表示实例,开发评估框架及机制。含2000个问题,实验显示多模型虽报告质量好,但在引用准确性等方面欠佳,瓶颈在证据识别和中间主张构建。
Comments Code and data are available at https://ai9stars.github.io/HiEviDR-Bench.github.io