Position: Let's Develop Data Probes to Fundamentally Understand How Data Affects LLM Performance
位置:让我们开发数据探针,以根本理解数据如何影响大语言模型性能
Shiqiang Wang, Herbert Woisetschläger, Hans Arno Jacobsen, Mingyue Ji
机构
*
Department of Computer Science, University of Exeter, UK(埃克塞特大学计算机科学系)
;
Technical University of Munich, Germany(慕尼黑技术大学)
;
Department of Electrical and Computer Engineering, University of Toronto, Canada(多伦多大学电气与计算机工程系)
;
Department of Electrical and Computer Engineering, University of Florida, FL, USA(佛罗里达大学电气与计算机工程系)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
DynamicNER: A Dynamic, Multilingual, and Fine-Grained Dataset for LLM-based Named Entity Recognition
DynamicNER: 一种动态、多语言和细粒度的用于基于大语言模型的命名实体识别的数据集
Hanjun Luo, Yingbin Jin, Xinfeng Li, Xuecheng Liu, Ruizhe Chen, Tong Shang, Kun Wang, Qingsong Wen, Zuozhu Liu
机构
*
New York University Abu Dhabi(纽约大学阿布扎赫德分校)
;
Zhejiang University(浙江大学)
;
The Hong Kong Polytechnic University(香港理工大学)
;
Nanyang Technology University(南阳技术大学)
;
University of Electronic Science and Technology of China(电子科技大学)
;
Texas A&M University(德克萨斯大学)
;
Squirrel AI
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
MedHopQA: A Disease-Centered Multi-Hop Reasoning Benchmark and Evaluation Framework for LLM-Based Biomedical Question Answering
MedHopQA: 一种以疾病为中心的多跳推理基准和评估框架,用于基于大语言模型的生物医学问答
Rezarta Islamaj, Robert Leaman, Joey Chan, Nicholas Wan, Qiao Jin, Natalie Xie, John Wilbur, Shubo Tian, Lana Yeganova, Po-Ting Lai, Chih-Hsuan Wei, Yifan Yang, Yao Ge, Qingqing Zhu, Zhizheng Wang, Zhiyong Lu
机构
*
National Library of Medicine, Division of Intramural Research(国家医学图书馆,院内研究部)
;
University of Illinois at Urbana-Champaign, Department of Computer Science(伊利诺伊大学厄巴纳-香槟分校计算机科学系)
;
University of Michigan Medical School(密歇根大学医学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Department of Computer Science, University of Texas at El Paso(德克萨斯大学埃尔帕索分校计算机科学系)
;
School of Computing, Southern Illinois University Carbondale(南方伊利诺伊大学卡罗尔丹分校计算学院)
;
University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
Do Benchmarks Underestimate LLM Performance? Evaluating Hallucination Detection With LLM-First Human-Adjudicated Assessment
基准是否低估了大语言模型的性能?通过大语言模型优先的人类仲裁评估来评估幻觉检测
I. F. Atasoy, B. Mutlu, E. A. Sezer, A. Wahdan
机构
*
Department of Computer Engineering, Hacettepe University(哈切塔佩大学计算机工程系)
;
Department of Computer Engineering, Ankara University(安卡拉大学计算机工程系)
;
Zephlen AI and Information Technologies Inc.(泽夫伦人工智能与信息技术公司)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Alibaba Group(阿里巴巴集团)
;
Guangdong Laboratory of Artificial Intelligence and Digital Economy (Shenzhen)(广东人工智能与数字经济实验室(深圳))
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
A comprehensive study of LLM-based argument classification: from Llama through DeepSeek to GPT-5.2
基于大语言模型的论证分类全面研究:从Llama到DeepSeek到GPT-5.2
Marcin Pietroń, Filip Gampel, Jakub Gomułka, Andrzej Tomski, Rafał Olszowski
机构
*
Faculty of Computer Science, Faculty of Humanities(计算机科学系,人文科学系)
;
Institute of Mathematics Faculty of Humanities(人文科学学院数学研究所)
;
University of Silesia(斯蒂利亚大学)
;
AGH University of Krakow(克拉科夫AGH大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Raising Bars, Not Parameters: LilMoo Compact Language Model for Hindi
提升标准,而非参数:Hindi语言的LilMoo紧凑语言模型
Shiza Fatimah, Aniket Sen, Sophia Falk, Florian Mai, Lucie Flek, Nicholas Kluge Corrêa
机构
*
Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室)
;
Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔人工智能与机器学习研究所)
;
Bonn Sustainable AI Lab(波恩可持续AI实验室)
;
Helmholtz-Institut für Strahlen- und Kernphysik(海德堡辐射与核物理研究所)
German General Social Survey Personas: A Survey-Derived Persona Prompt Collection for Population-Aligned LLM Studies
德国通用社会调查人设:一种基于德国通用社会调查的人员提示集合,用于与人口一致的LLM研究
Jens Rupprecht, Leon Fröhling, Claudia Wagner, Markus Strohmaier
机构
*
University of Mannheim(曼海姆大学)
;
GESIS -- Leibniz Institute for the Social Sciences(莱布尼茨社会科学研究所)
;
RWTH Aachen University(亚琛工业大学)
;
Complexity Science Hub(复杂性科学中心)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Cognitive Models and AI Algorithms Provide Templates for Designing Language Agents
认知模型和AI算法为设计语言代理提供模板
Ryan Liu, Dilip Arumugam, Cedegao E. Zhang, Sean Escola, Xaq Pitkow, Thomas L. Griffiths
机构
*
Department of Computer Science, Princeton University(普林斯顿大学计算机科学系)
;
Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系)
;
Zuckerman Mind Brain Behavior Institute(祖克曼心智大脑行为研究所)
;
Department of Psychiatry, Columbia University(哥伦比亚大学精神医学系)
;
Neuroscience Institute(神经科学研究所)
;
Department of Machine Learning, Carnegie Mellon University(卡内基梅隆大学机器学习系)
;
Department of Psychology, Princeton University(普林斯顿大学心理学系)
专题命中
评测与基准
:language agent(title,abstract);LLM(abstract);large language model(abstract);language model(abstract)
How Well Can LLM Agents Simulate End-User Security and Privacy Attitudes and Behaviors?
LLM代理能多好地模拟终端用户的安全和隐私态度和行为?
Yuxuan Li, Leyang Li, Hao-Ping Lee, Sauvik Das
机构
*
School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院)
;
Department of Computer Science and Engineering, University of Notre Dame(诺特难大学计算机科学与工程系)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)
Intra-Fairness Dynamics: The Bias Spillover Effect in Targeted LLM Alignment
内在公平动态:定向大语言模型对齐中的偏见溢出效应
Eva Paraschou, Line Harder Clemmensen, Sneha Das
机构
*
Department of Applied Mathematics and Computer Science, Technical University of Denmark(应用数学与计算机科学系,丹麦技术大学)
;
Department of Mathematical Sciences, University of Copenhagen(数学科学系,哥本哈根大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
Rubrics as an Attack Surface: Stealthy Preference Drift in LLM Judges
评分标准作为攻击面:LLM裁判中的隐蔽偏好漂移
Ruomeng Ding, Yifei Pang, He Sun, Yizhong Wang, Zhiwei Steven Wu, Zhun Deng
机构
*
University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)
;
Carnegie Mellon University(卡内基梅隆大学)
;
Yale University(耶鲁大学)
;
The University of Texas at Austin(德克萨斯大学奥斯汀分校)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
University of Wisconsin-Madison(威斯康星大学麦迪逊分校)
;
The University of New South Wales(新南威尔士大学)
;
Southwest Jiaotong University(西南交通大学)
;
Institute for Infocomm Research (I$^2$R), A*STAR(信息通信研究院(I$^2$R),A*STAR)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)
机构
*
Naver Labs Europe(纳维尔实验室欧洲分公司)
;
Insight Research Ireland Centre for Data Analytics, Data Science Institute, University of Galway(爱尔兰洞察研究数据分析中心、数据科学研究所、Galway大学)
;
University of Amsterdam(阿姆斯特丹大学)
;
University of Copenhagen(哥本哈根大学)
;
STMicroelectronics(STMicroelectronics公司)
;
Télécom Paris(巴黎电信学院)
;
Deutsches Forschungszentrum für Künstliche Intelligenz GmbH (DFKI)(德国人工智能研究中心有限公司)
;
Technische Universität Berlin(柏林技术大学)
;
Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、CNRS、格勒诺布尔INP、LIG)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);prompting(abstract)