机构
*
Department of Computer Science, Rensselaer Polytechnic Institute(伦斯勒理工学院计算机科学系)
;
IBM Research(IBM研究院)
;
Department of Mechanical, Aerospace, and Nuclear Engineering, Rensselaer Polytechnic Institute(伦斯勒理工学院机械、航空航天与核工程系)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
DialectalArabicMMLU: Benchmarking Dialectal Capabilities in Arabic and Multilingual Language Models
阿拉伯方言MMLU:评估阿拉伯语和多语言模型在阿拉伯方言上的能力
Malik H. Altakrori, Nizar Habash, Abed Alhakim Freihat, Younes Samih, Kirill Chirkunov, Muhammed AbuOdeh, Radu Florian, Teresa Lynn, Preslav Nakov, Alham Fikri Aji
机构
*
IBM Research AI(IBM人工智能研究院)
;
New York University Abu Dhabi(纽约大学迪拜分校)
;
Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学)
专题命中
评测与基准
:language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI
机构
*
School of Mathematics and Sciences, Fudan University, Shanghai, China(复旦大学数学科学学院,上海,中国)
;
Shanghai Center for Mathematical Sciences, Fudan University, Shanghai, China(复旦大学上海数学中心,上海,中国)
;
Alibaba Group, Hangzhou, China(阿里巴巴集团,杭州,中国)
;
Institute of Science and Technology for Brain-Inspired Intelligence, Fudan University, Shanghai, China(脑启发式智能科学技术研究院,复旦大学,上海,中国)
;
Center for Applied Mathematics & Shanghai Key Laboratory of Contemporary Applied Mathematics, Fudan University, Shanghai, China(应用数学中心及上海当代应用数学重点实验室,复旦大学,上海,中国)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
HarmMetric Eval: Benchmarking Metrics and Judges for LLM Harmfulness Assessment
HarmMetric Eval: 对LLM有害性评估的度量和裁判进行基准测试
Langqi Yang, Tianhang Zheng, Yixuan Chen, Kedong Xiu, Hao Zhou, Wangze Ni, Lei Chen, Zhan Qin, Kui Ren
机构
*
The State Key Laboratory of Blockchain and Data Security(区块链与数据安全国家重点实验室)
;
Zhejiang University(浙江大学)
;
Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新技术区(滨江)区块链与数据安全研究院)
;
Pretraining Team, xAI(预训练团队,xAI)
;
Hong Kong University of Science and Technology (GuangZhou)(香港科技大学(广州))
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
机构
*
Salesforce AI Research(Salesforce AI研究)
;
National University of Singapore(国立新加坡大学)
;
Nanyang Technological University(南洋理工大学)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州))
;
A*STAR, Singapore(新加坡A*STAR)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
Integrating Personality into Digital Humans: A Review of LLM-Driven Approaches for Virtual Reality
将人格融入数字人类:一种基于大语言模型的虚拟现实方法综述
Iago Alves Brito, Julia Soares Dollis, Fernanda Bufon Färber, Pedro Schindler Freire Brasil Ribeiro, Rafael Teixeira Sousa, Arlindo Rodrigues Galvão Filho
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
LLM Novice Uplift on Dual-Use, In Silico Biology Tasks
大语言模型在双用途生物任务中的新手提升
Chen Bo Calvin Zhang, Christina Q. Knight, Nicholas Kruus, Jason Hausenloy, Pedro Medeiros, Nathaniel Li, Aiden Kim, Yury Orlovskiy, Coleman Breen, Bryce Cai, Jasper Götting, Andrew Bo Liu, Samira Nedungadi, Paula Rodriguez, Yannis Yiming He, Mohamed Shaaban, Zifan Wang, Seth Donoughe, Julian Michael
机构
*
Scale AI
;
SecureBio
;
University of Oxford(牛津大学)
;
UC Berkeley(加州大学伯克利分校)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsAAAI 2026 Alignment track. Authors 1 and 2 contributed equally, 3 and 4 contributed equally, 6 and 7 and 8 contributed equally (ordered by last name)
MOSAIC: A Unified Platform for Cross-Paradigm Comparison and Evaluation of Homogeneous and Heterogeneous Multi-Agent RL, LLM, VLM, and Human Decision-Makers
MOSAIC:一个用于跨范式比较和评估同质和异质多智能体RL、LLM、VLM和人类决策者的统一平台
Abdulhamid M. Mousa, Yu Fu, Rakhmonberdi Khajiev, Jalaledin M. Azzabi, Abdulkarim M. Mousa, Peng Yang, Yunusa Haruna, Ming Liu
机构
*
School of Optics and Photonics, Beijing Institute of Technology, Beijing 100081, China(北京理工大学光学工程学院)
;
School of Automation Science and Electrical Engineering, Beihang University, Beijing 100191, China(北京航空航天大学自动化科学与电气工程学院)
;
Faculty of Science, Ain Shams University, Cairo, Egypt(爱思唯命大学科学学院)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
When Agents "Misremember" Collectively: Exploring the Mandela Effect in LLM-based Multi-Agent Systems
当智能体“误忆”时:探索基于大语言模型的多智能体系统中的曼德拉效应
Naen Xu, Hengyu An, Shuo Shi, Jinghuai Zhang, Chunyi Zhou, Changjiang Li, Tianyu Du, Zhihui Fu, Jun Wang, Shouling Ji
机构
*
Zhejiang University(浙江大学)
;
University of California, Los Angeles(加州大学洛杉矶分校)
;
Palo Alto Networks(帕洛阿尔托网络公司)
;
OPPO Research Institute(OPPO研究院)
;
Zhejiang Key Laboratory of Decision Intelligence(浙江决策智能重点实验室)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI