SC-Arena: A Natural Language Benchmark for Single-Cell Reasoning with Knowledge-Augmented Evaluation
SC-Arena: 一种用于具有知识增强评估的单细胞推理的自然语言基准
Jiahao Zhao, Feng Jiang, Shaowei Qin, Zhonghui Zhang, Junhao Liu, Guibing Guo, Hamid Alinejad-Rokny, Min Yang
机构
*
Software College, Northeastern University(东北大学软件学院)
;
Shenzhen University of Advanced Technology(深圳大学先进技术学院)
;
Shenzhen Key Laboratory for High Performance Data Mining(深圳高性能数据挖掘重点实验室)
;
Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究所,中国科学院)
;
University of California, Irvine(加州大学 Irvine 分校)
;
School of Biomedical Engineering, UNSW Sydney(悉尼大学生物医学工程学院)
MM-NeuroOnco: A Multimodal Benchmark and Instruction Dataset for MRI-Based Brain Tumor Diagnosis
MM-NeuroOnco: 一种多模态基准和指令数据集用于基于MRI的脑肿瘤诊断
Feng Guo, Jiaxiang Liu, Yang Li, Qianqian Shi, Mingkun Xu
机构
*
Guangdong Institute of Intelligence Science and Technology(广东智能科学与技术研究院)
;
Center for Brain-Inspired Computing Research (CBICR), Department of Precision Instrument, Tsinghua University(脑启发计算研究中心(CBICR)、精密仪器系,清华大学)
Comments11 pages. 6 figures. Introduces a DAG-based state management system for LLM agents. Evaluation on 76 coding sessions shows up to 86% token reduction (mean 20%) while remaining economically viable under prompt caching. Includes reference implementation for Claude Code