Evaluating Generalization Capabilities of LLM-Based Agents in Mixed-Motive Scenarios Using Concordia
利用Concordia评估基于LLM的智能体在混合动机场景中的泛化能力
Chandler Smith, Marwa Abdulhai, Manfred Diaz, Marko Tesic, Rakshit S. Trivedi, Alexander Sasha Vezhnevets, Lewis Hammond, Jesse Clifton, Minsuk Chang, Edgar A. Duéñez-Guzmán, John P. Agapiou, Jayd Matyas, Danny Karmon, Akash Kundu, Aliaksei Korshuk, Ananya Ananya, Arrasy Rahman, Avinaash Anand Kulandaivel, Bain McHale, Beining Zhang, Buyantuev Alexander, Carlos Saith Rodriguez Rojas, Caroline Wang, Chetan Talele, Chenao Liu, Chichen Lin, Diana Riazi, Di Yang Shi, Emanuel Tewolde, Elizaveta Tennant, Fangwei Zhong, Fuyang Cui, Gang Zhao, Gema Parreño Piqueras, Hyeonggeun Yun, Ilya Makarov, Jiaxun Cui, Jebish Purbey, Jim Dilkes, Jord Nguyen, Lingyun Xiao, Luis Felipe Giraldo, Manuela Chacon-Chamorro, Manuel Sebastian Rios Beltran, Marta Emili García Segura, Mengmeng Wang, Mogtaba Alim, Nicanor Quijano, Nico Schiavone, Olivia Macmillan-Scott, Oswaldo Peña, Peter Stone, Ram Mohan Rao Kadiyala, Rolando Fernandez, Ruben Manrique, Sunjia Lu, Sheila A. McIlraith, Shamika Dhuri, Shuqing Shi, Siddhant Gupta, Sneheel Sarangi, Sriram Ganapathi Subramanian, Taehun Cha, Toryn Q. Klassen, Wenming Tu, Weijian Fan, Wu Ruiyang, Xue Feng, Yali Du, Yang Liu, Yiding Wang, Yipeng Kang, Yoonchang Sung, Yuxuan Chen, Zhaowei Zhang, Zhihan Wang, Zhiqiang Wu, Ziang Chen, Zilong Zheng, Zixia Jia, Ziyan Wang, Dylan Hadfield-Menell, Natasha Jaques, Tim Baarslag, Jose Hernandez-Orallo, Joel Z. Leibo
机构
*
Cooperative AI Foundation(合作人工智能基金会)
;
University of Oxford(牛津大学)
;
UC Berkeley(伯克利大学)
;
Quebec Artificial Intelligence Institute(魁北克人工智能研究所)
;
Leverhulme Centre for the Future of Intelligence, University of Cambridge(未来智能研究中心,剑桥大学)
;
MIT(麻省理工学院)
;
Google DeepMind(谷歌DeepMind)
;
Center on Long-Term Risk(长期风险中心)
;
Google Research(谷歌研究)
;
University of Washington(华盛顿大学)
;
Centrum Wiskunde & Informatica(数学与信息研究所)
;
Utrecht University(乌得勒支大学)
;
Universitat Politècnica de València(瓦伦西亚理工大学)
;
Concordia Contest Participants with Notable Contributions(康科德比赛有显著贡献的参与者)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
DialogGuard: Multi-Agent Psychosocial Safety Evaluation of Sensitive LLM Responses
DialogGuard: 多智能体心理社会安全评估框架用于敏感LLM响应
Han Luo, Guy Laban
机构
*
University of Leeds(利兹大学)
;
Southwest Jiaotong University(西南交通大学)
;
Department of Industrial Engineering and Management(工业工程与管理系)
;
Ben-Gurion University of the Negev(贝内尔·加隆大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
The Hidden DNA of LLM-Generated JavaScript: Structural Patterns Enable High-Accuracy Authorship Attribution
LLM生成JavaScript的隐藏DNA:结构模式实现高精度作者归属
Norbert Tihanyi, Bilel Cherif, Richard A. Dubniczky, Mohamed Amine Ferrag, Tamás Bisztray
机构
*
Technology Innovation Institute(技术创新研究所)
;
Eötvös Loránd University(欧多芬·洛尔兰大学)
;
United Arab Emirates University(联合阿拉伯酋长国大学)
;
University of Oslo(奥斯陆大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
LLM-based Automated Grading with Human-in-the-Loop
基于大型语言模型的自动评分与人类在循环中
Yucheng Chu, Hang Li, Kaiqi Yang, Yasemin Copur-Gencturk, Jiliang Tang
机构
*
Computer Science and Engineering(计算机科学与工程)
;
Michigan State University(密歇根州立大学)
;
Rossier School of Education(罗塞尔教育学院)
;
University of Southern California(南加州大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
机构
*
Department of EECS, Embry-Riddle Aeronautical University, Daytona Beach, FL, USA(电子工程与科学系,埃姆布里-里德尔航空大学,日落海滩,佛罗里达州,美国)
;
NLP Engineering Team, Hishab Singapore Pte. Ltd, Singapore(自然语言处理工程团队,Hishab新加坡私人有限公司,新加坡)
;
Department of Computer Information Systems, Texas A&M University - Central Texas, Texas, USA(计算机信息系统系,德克萨斯A&M大学-中央德克萨斯分校,德克萨斯州,美国)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结
本文提出了一种新的转写数据集和定制多语言模型,用于提高罗马化印地语和孟加拉语的转写效果。
CommentsProceedings of the 8th Workshop on Big Data for Cybersecurity (BigCyber)
AskDB: An LLM Agent for Natural Language Interaction with Relational Databases
AskDB: 一种用于关系数据库自然语言交互的大型语言模型代理
Xuan-Quang Phan, Tan-Ha Mai, Thai-Duy Dinh, Minh-Thuan Nguyen, Lam-Son Lê
机构
*
IT Operations, Mantu Group(Mantu集团信息技术部)
;
Faculty of Engineering, Vietnamese-German University(越南-德国大学工程学院)
;
Computer Science and Information Engineering, National Taiwan University(国立台湾大学计算机科学与工程系)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);prompting(abstract)
Cost-Aware Prediction (CAP): An LLM-Enhanced Machine Learning Pipeline and Decision Support System for Heart Failure Mortality Prediction
Yinan Yu, Falk Dippel, Christina E. Lundberg, Martin Lindgren, Annika Rosengren, Martin Adiels, Helen Sjöland
机构
*
Department of Computer Science and Engineering, Chalmers University of Technology and University of Gothenburg(计算机科学与工程系,查尔姆斯理工大学和哥德堡大学)
;
Sahlgrenska University Hospital(萨尔姆斯卡大学医院)
;
Department of Molecular and Clinical Medicine, Sahlgrenska Academy, University of Gothenburg(分子与临床医学系,萨尔姆斯卡学院,哥德堡大学)
;
Department of Medicine, Geriatrics and Emergency Medicine, Sahlgrenska University Hospital(医学、老年医学和急诊医学系,萨尔姆斯卡大学医院)
;
Department of Food and Nutrition, and Sport Science, Faculty of Education, University of Gothenburg(营养学与体育科学系,教育学院,哥德堡大学)
;
School of Public Health and Community Medicine, Institute of Medicine, University of Gothenburg(公共卫生与社区医学学院,医学院,哥德堡大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG
Taxonomy, Evaluation and Exploitation of IPI-Centric LLM Agent Defense Frameworks
Zimo Ji, Xunguang Wang, Zongjie Li, Pingchuan Ma, Yudong Gao, Daoyuan Wu, Xincheng Yan, Tian Tian, Shuai Wang
机构
*
The Hong Kong University of Science and Technology(香港科技大学)
;
Zhejiang University of Technology(浙江工业大学)
;
Lingnan University(岭南大学)
;
School of Cyber Science and Engineering, Southeast University(东南大学计算机科学与工程学院)
;
ZTE Corporation(中兴通讯有限公司)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
Enhancing Regional Airbnb Trend Forecasting Using LLM-Based Embeddings of Accessibility and Human Mobility
Hongju Lee, Youngjun Park, Jisun An, Dongman Lee
机构
*
Graduate School of Data Science, KAIST(韩国科学技术院数据科学研究生院)
;
School of Computing, KAIST(韩国科学技术院计算机科学学院)
;
Luddy School of Informatics, Computing, and Engineering, Indiana University Bloomington(印第安纳大学布卢明顿分校信息学、计算与工程学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
LLM-based Agents Suffer from Hallucinations: A Survey of Taxonomy, Methods, and Directions
Xixun Lin, Yucheng Ning, Jingwen Zhang, Yan Dong, Yilong Liu, Yongxuan Wu, Xiaohua Qi, Nan Sun, Yanmin Shang, Kun Wang, Pengfei Cao, Qingyue Wang, Lixin Zou, Xu Chen, Chuan Zhou, Jia Wu, Peng Zhang, Qingsong Wen, Shirui Pan, Bin Wang, Yanan Cao, Kai Chen, Songlin Hu, Li Guo
机构
*
Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所)
;
School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络安全学院)
;
Nanyang Technological University(南洋理工大学)
;
Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)
;
Hong Kong University of Science and Technology(香港科技大学)
;
School of Cyber Science and Engineering, Wuhan University(武汉大学网络安全科学与工程学院)
;
Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学中关村人工智能学院)
;
Academy of Mathematics and Systems Science, Chinese Academy of Sciences(中国科学院数学与系统科学研究院)
;
School of Computing, Faculty of Science and Engineering, Macquarie University(麦考瑞大学计算机学院)
;
Cyberspace Institute of Advanced Technology, Guangzhou University(广州大学高级技术网络研究所)
;
Squirrel Ai Learning
;
Xiaomi Company(小米公司)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
TCM-5CEval: Extended Deep Evaluation Benchmark for LLM's Comprehensive Clinical Research Competence in Traditional Chinese Medicine
Tianai Huang, Jiayuan Chen, Lu Lu, Pengcheng Chen, Tianbin Li, Bing Han, Wenchao Tang, Jie Xu, Ming Li
机构
*
School of Artificial Intelligence in Traditional Chinese Medicine, Shanghai University of Traditional Chinese Medicine, Shanghai, China(上海中医药大学人工智能学院)
;
Shanghai Artificial Intelligence Laboratory, Shanghai, China(上海人工智能实验室)
;
University of Washington, Seattle, Washington, US(华盛顿大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL