Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
利用Concordia评估基于LLM的智能体在混合动机场景中的泛化能力
Chandler Smith, Marwa Abdulhai, Manfred Diaz, Marko Tesic, Rakshit S. Trivedi, Alexander Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar A. Duéñez-Guzmán, John P. Agapiou, Jayd Matyas, Danny Karmon, Akash Kundu, Aliaksei Korshuk, Ananya Ananya, Arrasy Rahman, Avinaash Anand Kulandaivel, Bain McHale, Beining Zhang, Buyantuev Alexander, Carlos Saith Rodriguez Rojas, Caroline Wang, Chetan Talele, Chenao Liu, Chichen Lin, Diana Riazi, Di Yang Shi, Emanuel Tewolde, Elizaveta Tennant, Fangwei Zhong, Fuyang Cui, Gang Zhao, Gema Parreño Piqueras, Hyeonggeun Yun, Ilya Makarov, Jiaxun Cui, Jebish Purbey, Jim Dilkes, Jord Nguyen, Lingyun Xiao, Luis Felipe Giraldo, Manuela Chacon-Chamorro, Manuel Sebastian Rios Beltran, Marta Emili García Segura, Mengmeng Wang, Mogtaba Alim, Nicanor Quijano, Nico Schiavone, Olivia Macmillan-Scott, Oswaldo Peña, Peter Stone, Ram Mohan Rao Kadiyala, Rolando Fernandez, Ruben Manrique, Sunjia Lu, Sheila A. McIlraith, Shamika Dhuri, Shuqing Shi, Siddhant Gupta, Sneheel Sarangi, Sriram Ganapathi Subramanian, Taehun Cha, Toryn Q. Klassen, Wenming Tu, Weijian Fan, Wu Ruiyang, Xue Feng, Yali Du, Yang Liu, Yiding Wang, Yipeng Kang, Yoonchang Sung, Yuxuan Chen, Zhaowei Zhang, Zhihan Wang, Zhiqiang Wu, Ziang Chen, Zilong Zheng, Zixia Jia, Ziyan Wang, Dylan Hadfield-Menell, Natasha Jaques, Tim Baarslag, Jose Hernandez-Orallo, Joel Z. Leibo
机构
*
Cooperative AI Foundation(合作人工智能基金会)
;
University of Oxford(牛津大学)
;
UC Berkeley(伯克利大学)
;
Quebec Artificial Intelligence Institute(魁北克人工智能研究所)
;
Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心,剑桥大学)
;
MIT(麻省理工学院)
;
Google DeepMind(谷歌DeepMind)
;
Center on Long-Term Risk(长期风险中心)
;
Google Research(谷歌研究)
;
University of Washington(华盛顿大学)
;
Centrum Wiskunde & Informatica(数学与信息研究所)
;
Utrecht University(乌得勒支大学)
;
Universitat Politècnica de València(瓦伦西亚理工大学)
;
Concordia Contest Participants with Notable Contributions(康科德比赛有显著贡献的参与者)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)
;
Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所)
专题命中
评测与基准
:large language model(title);language model(title);分类 cs.CL
SafeGenes: Evaluating the Adversarial Robustness of Genomic Foundation Models
SafeGenes: 评估基因组基础模型的对抗鲁棒性
Huixin Zhan, Clovis Barbour, Jason H. Moore
机构
*
Department of Computer Science & Engineering, New Mexico Tech(计算机科学与工程系,新墨西哥技术学院)
;
Computational Biomedicine, Cedars-Sinai Medical Center(计算生物医学,西德斯-辛内斯医疗中心)
机构
*
Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳))
;
Harbin Institute of Technology(哈尔滨工业大学)
;
Great Bay University(大贝大学)
;
Zhejiang University(浙江大学)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
机构
*
Pritzker School of Molecular Engineering, University of Chicago(芝加哥大学普利兹克分子工程学院)
;
Chemical Sciences and Engineering Division, Argonne National Laboratory(阿贡国家实验室化学科学与工程 division)
;
Department of Computer Science, University of Chicago(芝加哥大学计算机科学系)
专题命中
评测与基准
:LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AlignCheck: a Semantic Open-Domain Metric for Factual Consistency Assessment
AlignCheck: 一个语义开放域的度量标准用于事实一致性评估
Ahmad Aghaebrahimian
机构
*
Institute of Computational Life Sciences, Department of Life Sciences and Facility Management, Zurich University of Applied Sciences(计算生命科学研究所,生命科学与设施管理系,苏黎世应用科学大学)
;
Swiss Institute of Bioinformatics(瑞士生物信息学研究所)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Department of Computer Science, University of Illinois, Chicago, IL, 60607, USA(伊利诺伊大学芝加哥分校计算机科学系)
;
Indian Institute of Technology, Varanasi, India(印度班加罗尔理工学院)
;
Department of Computer Science & Engineering, Indraprastha Institute of Information Technology, Delhi, New Delhi, 110020, India(印度德里印度信息技术研究所计算机科学与工程系)
专题命中
评测与基准
:large language model(abstract);language model(abstract);分类 cs.CL
机构
*
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
DeepWisdom
;
Peking University(北京大学)
;
Singapore University of Technology and Design(新加坡科技设计大学)
;
Sydney University(悉尼大学)
;
Yale University(耶鲁大学)
;
Université de Montréal & Mila(蒙特利尔大学及Mila)
VLSU: Mapping the Limits of Joint Multimodal Understanding for AI Safety
VLSU:联合多模态理解在AI安全中的极限映射
Shruti Palaskar, Leon Gatys, Mona Abdelrahman, Mar Jacobo, Larry Lindsey, Rutika Moharir, Gunnar Lund, Yang Xu, Navid Shiee, Jeffrey Bigham, Charles Maalouf, Joseph Yitan Cheng
Guard Me If You Know Me: Protecting Specific Face-Identity from Deepfakes
Kaiqing Lin, Zhiyuan Yan, Ke-Yue Zhang, Li Hao, Yue Zhou, Yuzhen Lin, Weixiang Li, Taiping Yao, Shouhong Ding, Bin Li
机构
*
Guangdong Provincial Key Laboratory of Intelligent Information Processing(广东省智能信息处理重点实验室)
;
Shenzhen Key Laboratory of Media Security(深圳媒体安全重点实验室)
;
SZU-AFS Joint Innovation Center for AI Technology(深圳大学-腾讯优图联合创新中心)
;
Shenzhen University(深圳大学)
;
School of Electronic and Computer Engineering(电子与计算机工程学院)
;
Peking Univerisity(北京大学)
;
Tencent Youtu Lab(腾讯优图实验室)
专题命中
评测与基准
:large language model(abstract);language model(abstract)
机构
*
Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
;
Ant Group(蚂蚁集团)
;
Tsinghua University(清华大学)
;
Shandong University(山东大学)
;
Wuhan University(武汉大学)