PsyScore: A Psychometrically-Aware Framework for Trait-Adaptive Essay Scoring and ZPD-Scaffolded Feedback
PsyScore: 一种心理测量感知的特质自适应作文评分与最近发展区支架反馈框架
Wei Xia, Jin Wu, Haoran Shi, Xiangyu Wang, Chanjin Zheng
机构
*
Department of Educational Psychology, East China Normal University(华东师范大学教育心理学系)
;
Shanghai Institute of Artificial Intelligence for Education, East China Normal University(华东师范大学上海智能教育研究院)
;
School of Computer Science and Technology, East China Normal University(华东师范大学计算机科学与技术学院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
RadSEM: A Finding-by-Finding Metric for Clinical Consistency in Radiology Reports
RadSEM:放射学报告中临床一致性的逐发现指标
Zhenhong Yang, Zhuoyun Liu, Jintao Fei, Wen Tang, Shichao Quan, Jun Zhao, Jun Xu
机构
*
JDH Algo, JD Health International Inc., China
;
Department of Big Data in Health Science, The First Affiliated Hospital of Wenzhou Medical University, China
;
Zhejiang Engineering Research Center for Hospital Emergency
;
Department of Intensive Care Unit, The First Affiliated Hospital of Wenzhou Medical University, Wenzhou, Zhejiang, China
Evaluating Second-Order Bias of LLMs Through Epistemic Entitlement
通过认知权利评估大语言模型的二阶偏见
Ramaravind Kommiya Mothilal, Terry Jingchen Zhang, Raiyan Ahmed, Zhijing Jin, Shion Guha, Syed Ishtiaque Ahmed
机构
*
University of Toronto(多伦多大学)
;
Vector Institute(向量研究所)
;
EuroSafeAI
;
Max Planck Institute for Intelligent Systems, Tübingen, Germany(马克斯·普朗克智能系统研究所(德国图宾根))
Building Customer Support AI Agents at 100M-User Scale: An Evaluation-Driven Framework
构建面向1亿用户规模的客户支持AI代理:一种评估驱动的框架
Aman Gupta, Kevin Rossell, Edesio Alcobaça, Jose Chrystian Lima Pacheco, Carolina Baptista de Lima, Shao Tang, Luiz Paulo Rabachini, Luis Moneda, Herbert Fei, Daniel Silva, Rohan Ramanath
机构
*
School of Computer Science, Wuhan University(武汉大学计算机学院)
;
School of Computer Science, Central China Normal University(中央师范大学计算机学院)
;
School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院)
专题命中
评测与基准
:LLM(abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)
One Jailbreak, Many Tongues: Learning Language-Insensitive Intention Representations for Multilingual Jailbreak Detection
一次越狱,多种语言:学习语言无关的意图表示用于多语言越狱检测
Shuyu Jiang, Kaiyu Xu, Xingshu Chen, Hao Ren, Rui Tang, Yi Zhang, Tianwei Zhang, Hongwei Li
机构
*
School of Cyber Science and Engineering, Sichuan University(四川大学网络空间安全学院)
;
School of Computer Science and Engineering, Nanyang Technological University(南洋理工大学计算机科学与工程学院)
;
School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院)
专题命中
评测与基准
:LLM(summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
Testing the Black Box: Structural Barriers to Independent Evaluation of Consumer-Facing Health LLMs
测试黑箱:面向消费者的健康大语言模型独立评估的结构性障碍
Rahul Gorijavolu, Kaushik Madapati, Pritika Vig, Rawan Abulibdeh, Nikhil Jaiswal, Mahri Kadyrova, Zeamanuel Hailu Tesfaye, Charles Senteio, Paula Maurutto, Leo Anthony Celi
机构
*
Massachusetts Institute of Technology(麻省理工学院)
;
Johns Hopkins University(约翰霍普金斯大学)
;
University of California, Berkeley(加州大学伯克利分校)
;
Toronto General Hospital, University Health Network(多伦多综合医院,大学健康网络)
;
McGill University(麦吉尔大学)
;
University of Toronto(多伦多大学)
;
Independent Researcher(独立研究者)
;
Rutgers University(罗格斯大学)
;
Beth Israel Deaconess Medical Center(贝斯以色列女执事医疗中心)
;
Harvard T.H. Chan School of Public Health(哈佛大学陈曾熙公共卫生学院)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
Support Vector Rubrics: Closing the Gap Between Self-Generated and Human Rubrics
支持向量评分准则:弥合自生成与人工评分准则之间的差距
Mengyuan Sun, Yu Li, Zhuohao Yu, Shikun Zhang, Wei Ye
机构
*
National Engineering Research Center for Software Engineering, Peking University(北京大学软件工程国家工程研究中心)
;
University of Science and Technology of China(中国科学技术大学)
专题命中
评测与基准
:LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL