Truth or Twist? Optimal Model Selection for Reliable Label Flipping Evaluation in LLM-based Counterfactuals
Qianli Wang, Van Bach Nguyen, Nils Feldhus, Luis Felipe Villa-Arenas, Christin Seifert, Sebastian Möller, Vera Schmitt
机构
*
Quality and Usability Lab, Technische Universität Berlin(柏林技术大学质量与可用性实验室)
;
University of Marburg(马尔堡大学)
;
German Research Center for Artificial Intelligence (DFKI)(德国人工智能研究中心)
;
Deutsche Telekom(德国电信)
;
BIFOLD – Berlin Institute for the Foundations of Learning and Data(柏林学习与数据基础研究院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
CommentsAccepted at INLG 2025, camera-ready version
机构
*
Shandong University, School of Control Science
;
Rutgers University, Department of Computer Science 110 Frelinghuysen Road Piscataway New Brunswick NJ USA 08854
;
University of California, Santa Barbara 1210 Cheadle Hall Santa Barbara California USA 93106
;
University of Michigan, School of Information 500 S State St Ann Arbor Michigan USA 48109
;
The Chinese University of Hong Kong, Department of Computer Science
;
The College of William \& Mary, School of Computing, Data Sciences \& Physics 200 Stadium Dr Williamsburg Virginia USA 23185
;
The Chinese University of Hong Kong, Department of Psychiatry 9 Chuen On Rd Tai Po New Territories Hong Kong SAR, China 999077
;
Rutgers University, Department of Computer Science
;
University of California, Santa Barbara
;
University of Michigan, School of Information
;
The College of William \& Mary, School of Computing, Data Sciences \& Physics
;
The Chinese University of Hong Kong, Department of Psychiatry
GENIE-ASI: Generative Instruction and Executable Code for Analog Subcircuit Identification
Phuoc Pham, Arun Venkitaraman, Chia-Yu Hsieh, Andrea Bonetti, Stefan Uhlich, Markus Leibl, Simon Hofmann, Eisaku Ohbuchi, Lorenzo Servadei, Ulf Schlichtmann, Robert Wille
机构
*
Chair for Design Automation, Technical University of Munich(自动化设计研究所,慕尼黑技术大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
Rule Synergy Analysis using LLMs: State of the Art and Implications
Bahar Bateni, Benjamin Pratt, Jim Whitehead
专题命中
评测与基准
:large language model(abstract,comments);language model(abstract,comments);分类 cs.CL
CommentsSubmitted for publication at the IEEE Transactions on Games 2024, Special Issue on Large Language Models and Games (10 pages excluding appendix, 3 figures)
PediatricsMQA: a Multi-modal Pediatrics Question Answering Benchmark
Adil Bahaj, Oumaima Fadi, Mohamed Chetouani, Mounir Ghogho
机构
*
Mohammed 6 Polytechnic University(摩洛哥6号理工学院)
;
International University of Rabat(拉巴特国际大学)
;
Institut des Systèmes Intelligents et de Robotique(智能系统与机器人研究所)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
School of Computer Science and Engineering, Northeastern University(计算机科学与工程学院,东北大学)
;
NiuTrans Research(NiuTrans研究院)
;
CAS Key Laboratory of Behavioral Science, Institute of Psychology, CAS(行为科学重点实验室,心理学研究所)