BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law
BenGER:德国法律中基于归入的法律推理的LLM系统基准测试
Sebastian Nagl, Ann-Kristin Mayrhofer, Martin Heidebach, Aleyna Koçak, Anne Zettelmeier, Elly Breu, Angelina Greiner, Sofija Milijas, Matthias Grabmair
机构
*
Technical University of Munich (TUM)(慕尼黑技术大学)
;
Ludwig Maximilian University of Munich (LMU)(慕尼黑路德维希-马克西米利安大学)
;
University of Konstanz(康斯坦茨大学)
;
University of Saarbrücken(萨尔布吕肯大学)
机构
*
The Hong Kong University of Science and Technology(香港科技大学)
;
Zhongguancun Academy(中关村学院)
;
Xi’an Jiaotong University(西安交通大学)
;
The Chinese University of Hong Kong(香港中文大学)
;
The University of Hong Kong(香港大学)
;
Hong Kong Baptist University(香港浸会大学)
;
Hunyuan Tencent(腾讯混元)
;
National University of Singapore(新加坡国立大学)
;
Xiamen University(厦门大学)
机构
*
AAII, University of Technology Sydney(悉尼科技大学AAII(先进人工智能研究所))
;
Northeastern University(东北大学)
;
Fudan University(复旦大学)
;
University of Liverpool(利物浦大学)
Perceive Before Reasoning: A Pre-Reasoning Perception Framework for Efficient and Reliable Proactive Mobile Agents
先感知后推理:一种用于高效可靠主动移动代理的预推理感知框架
Zhijie Ding, Weinan Hong, Zicheng Zhu, Lei Li, Dezhi Kong, Hao Wang, Peng Zhou, Xuchu Jiang, Jiaming Xu
机构
*
HyperAI Team, Xiaomi Corporation(HyperAI团队,小米公司)
;
Zhongnan University of Economics and Law(中南财经政法大学)
;
Jilin University(吉林大学)
;
The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))
CARE: Privacy-Compliant Agentic Reasoning with Evidence Discordance
CARE:具有证据不一致性的隐私合规代理推理
Haochen Liu, Weien Li, Rui Song, Zeyu Li, Chun Jason Xue, Xiao-Yang Liu, Sam Nallaperuma-Herzberg, Xue Liu, Ye Yuan
机构
*
University of Cambridge(剑桥大学)
;
McGill University(麦吉尔大学)
;
MBZUAI - Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
;
Columbia University(哥伦比亚大学)
;
Mila - Quebec AI Institute(米拉-魁北克人工智能研究所)
An evidence-guided reinforcement learning method to improve psychiatric reasoning in small language models
评估一种证据引导的强化学习框架在对齐光参数大语言模型与精神科临床推理决策认知中的作用
Xinxin Lin, Guangxin Dai, Yi Zhong, Xiang Li, Xue Xiao, Jian Liu, Yixin Zhang, Lingming Hu, Zhengdong Wu, Yongbo Zheng, Runchuan Zhu, Ming Zhao, Huizi Yu, Yi Zhang, Fangting Lu, Shuo Wu, Jun Zhao, Ping Yin, Joey W. Y. Chan, Ngan Yin Chan, Yumei Wang, Lejin Yang, Yanqiu Xing, Sijing Chen, Yun Kwok Wing, Lin Lu, Xin Ma, Lizhou Fan
机构
*
The Chinese University of Hong Kong, Shatin, N.T., Hong Kong SAR, China(香港中文大学)
;
Shandong University, Jinan, China(山东大学)
;
Peking University Sixth Hospital, Beijing, China(北京大学第六医院)
;
Inspur Cloud Information Technology Co., Ltd., Jinan, China(Inspur 云技术有限公司)
;
Fudan University, Shanghai, China(复旦大学)
;
Shandong Provincial Hospital Affiliated to Shandong First Medical University, Jinan, China(山东第一医科大学附属山东省人民医院)
;
Jilin University, Changchun, China(吉林大学)
;
Hong Kong ICI Cloud Service Limited, Hong Kong SAR, China(香港ICI云服务有限公司)
;
Shandong First Medical University, Jinan, China(山东第一医科大学)
Aishik Mandal, Hiba Arnaout, Clarissa W. Ong, Juliet Bockhorst, Kate Sheehan, Rachael Moldow, Tanmoy Chakraborty, Iryna Gurevych
机构
*
UKP Lab, Department of Computer Science and Hessian Center for AI (hessian.AI), Technische Universität Darmstadt(德国达姆施塔特技术大学UKP实验室、计算机科学系和海森人工智能中心(hessian.AI))
;
Zuse School ELIZA(Zuse学院ELIZA)
;
National Research Center for Applied Cybersecurity ATHENE(应用网络安全国家研究中心ATHENE)
;
Indian Institute of Technology Delhi(印度德里理工学院)
;
Yardi School of Artificial Intelligence(Yardi人工智能学院)
;
University of Louisville(路易斯维尔大学)
;
University of Toledo(托莱多大学)
Comments20 pages, 4 figures, and 43 appendix tables. Research paper on language-model interpretability, reasoning evaluation, output-scoring bottlenecks, and label-free calibration. The paper evaluates controlled three-way logical reasoning tasks, ProofWriter, ANLI, and FOLIO using Qwen3.5, OLMo-2-1B, Llama-3.1-8B, and Pythia checkpoints