Not Search, But Scan: Benchmarking MLLMs on Scan-Oriented Academic Paper Reasoning
不是搜索,而是扫描:在面向学术论文推理的扫描任务上基准测试大语言模型
机构 * Beijing University of Posts and Telecommunications(北京邮电大学)
专题命中 规划推理 :reasoning(title,abstract);分类 cs.AI
AI总结 本文提出ScholScan基准,通过扫描式任务评估大语言模型在学术论文推理中的能力,发现检索增强生成方法在扫描任务上无显著提升,揭示了当前模型在该任务上的系统性缺陷。
Comments Accepted to ICLR 2026