QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri
机构
*
AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室)
;
Department of Computer Engineering and Information Technology(计算机工程与信息科技系)
;
Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系)
;
University of Genoa(热那亚大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Employing Vision-Language Models for Face Image Quality Assessment
利用视觉-语言模型进行人脸图像质量评估
Erdi Sarıtaş, Eren Onaran, Vitomir Štruc, Hazım Kemal Ekenel
机构
*
Department of Computer Engineering, Istanbul Technical University(伊斯坦布尔技术大学计算机工程系)
;
Faculty of Electrical Engineering, University of Ljubljana(卢布尔雅那大学电气工程系)
;
Division of Engineering, NYU Abu Dhabi(纽约大学阿布扎克分校工程系)
EPIC-Bench: A Perception-Centric Benchmark for Fine-Grained Embodied Visual Grounding in Vision-Language Models
EPIC-Bench: 一种以感知为中心的细粒度具身视觉 grounding 的基准
Haozhe Shan, Xiancong Ren, Han Dong, Haoyuan Shi, Yingji Zhang, Jiayu Hu, Yi Zhang, Yong Dai, Bin Shen, Lizhen Qu, Zenglin Xu, Xiaozhu Ju
机构
*
X-Humanoid
;
Fudan University(复旦大学)
;
University of Science and Technology of China(中国科学技术大学)
;
University of Manchester(曼彻斯特大学)
;
Monash University(墨尔本大学)
;
Celonis AI
;
University of New South Wales(新南威尔士大学)
VISOR: A Vision-Language Model-based Test Oracle for Testing Robots
VISOR:基于视觉-语言模型的机器人测试 oracle
Prasun Saurabh, Pablo Valle, Aitor Arrieta, Shaukat Ali, Paolo Arcaini
机构
*
Simula Research Laboratory(Simula研究实验室)
;
Oslo Metropolitan University(奥斯陆理工大学)
;
Mondragon University(蒙dragon大学)
;
National Institute of Informatics(国立信息研究所)
Unlearning Isn't Deletion: Investigating Reversibility of Machine Unlearning in LLMs
反学习不是删除:调查机器反学习在大语言模型中的可逆性
Xiaoyu Xu, Xiang Yue, Yang Liu, Qingqing Ye, Huadi Zheng, Peizhao Hu, Minxin Du, Haibo Hu
机构
*
The Hong Kong Polytechnic University(香港理工大学)
;
Carnegie Mellon University(卡内基梅隆大学)
;
University of California, Santa Cruz(加州大学圣克ruz分校)
;
Huawei Technologies(华为技术有限公司)
;
Research Centre for Privacy and Security Technologies in Future Smart Systems, PolyU(未来智能系统中的隐私与安全技术研究中心,PolyU)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
机构
*
Department of Mechanical Engineering, Stanford University(斯坦福大学机械工程系)
;
Department of Aeronautics and Astronautics, Stanford University(斯坦福大学航空航天工程系)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
STT-Arena:一种更现实的工具使用环境,包含时空动态
Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao
机构
*
Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
;
Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Li Auto Inc.(李汽有限公司)
;
Independent Researcher(独立研究者)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
MediQAl: A French Medical Question Answering Dataset for Knowledge and Reasoning Evaluation
MediQAl: 一个用于知识和推理评估的法语医学问答数据集
Adrien Bazoge
机构
*
Data Clinic, University Hospital of Nantes, France(南特大学医院数据诊所,法国)
;
Nantes Université, École Centrale Nantes, CNRS, LS2N, France(南特大学,中央理工学院南特分校,国家科学研究中心,LS2N,法国)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI