arXivDaily arXiv每日学术速递 周一至周五更新

高校专区

Fudan University(复旦大学)

2026-01-08 至 2026-01-08 共收录 3
2601.03986 2026-01-08 cs.CL

Benchmark^2: Systematic Evaluation of LLM Benchmarks

Benchmark^2: 大语言模型评估基准的系统性评估

Qi Qian, Chengsong Huang, Jingwen Xu, Changze Lv, Muling Wu, Wenhao Liu, Xiaohua Wang, Zhenghua Wang, Zisu Huang, Muzhao Tian, Jianhan Xu, Kun Hu, He-Da Wang, Yao Hu, Xuanjing Huang, Xiaoqing Zheng

机构 * College of Computer Science and Artificial Intelligence, Fudan University(复旦大学计算机科学与人工智能学院) Washington University in St. Louis(华盛顿大学圣路易斯分校) Xiaohongshu Inc.(小红书公司)

AI总结 Benchmark^2 提出了一种系统性评估大语言模型评估基准的方法,通过三个互补指标分析基准质量,揭示现有基准的差异并展示选择性构建的高效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03689 2026-01-08 cs.LG cs.AI physics.chem-ph

A Pre-trained Reaction Embedding Descriptor Capturing Bond Transformation Patterns

基于反应嵌入描述符的预训练模型捕捉键转变模式

Weiqi Liu, Fenglei Cao, Yuan Qi, Li-Cheng Xu

机构 * Artificial Intelligence Innovation and Incubation Institute, Fudan University, Shanghai, China(复旦大学人工智能创新与孵化院) Shanghai Academy of Artificial Intelligence for Science, Shanghai, China(上海人工智能科学研究院) Zhongshan Hospital, Shanghai, China(中山医院)

AI总结 本研究提出RXNEmb,一种基于预训练模型的反应嵌入描述符,用于捕捉键转变模式,通过数据驱动的方法改进反应分类和可视化分析。

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03543 2026-01-08 cs.CL

EvolMem: A Cognitive-Driven Benchmark for Multi-Session Dialogue Memory

EvolMem:一种基于认知的多会话对话记忆基准

Ye Shen, Dun Pei, Yiqiu Guo, Junying Wang, Yijin Guo, Zicheng Zhang, Qi Jia, Jun Zhou, Guangtao Zhai

机构 * Shanghai Jiao Tong University(上海交通大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Fudan University(复旦大学)

AI总结 EvolMem提出了一种基于认知的多会话对话记忆基准,用于评估LLMs和智能体系统的多会话记忆能力,揭示了不同模型在多维记忆任务中的表现差异。

Comments 14 pages, 7 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏