2512.23565
2026-01-29
cs.CV
cs.AI
62%
RxnBench: A Multimodal Benchmark for Evaluating Large Language Models on Chemical Reaction Understanding from Scientific Literature
RxnBench: 一个用于评估大语言模型在科学文献中理解化学反应的多模态基准
Hanzheng Li, Xi Fang, Yixuan Li, Chaozheng Huang, Junjie Wang, Xi Wang, Hongzhe Bai, Bojun Hao, Shenyu Lin, Huiqi Liang, Linfeng Zhang, Guolin Ke
机构
*
DP Technology(DP技术公司)
;
Shanghai Jiao Tong University(上海交通大学)
;
Tsinghua University(清华大学)
;
Peking University(北京大学)
;
New York University(纽约大学)
;
Fudan University(复旦大学)
;
Xiamen University(厦门大学)
;
ShanghaiTech University(上海科技大学)
专题命中
视觉问答
:multimodal large language model(abstract);分类 cs.CV、cs.AI
AI总结
RxnBench通过两个任务评估大语言模型在化学反应理解上的能力,揭示模型在深度化学逻辑和结构识别上的不足,强调需改进视觉编码和推理能力以推动AI化学发展。