MoralityGym: A Benchmark for Evaluating Hierarchical Moral Alignment in Sequential Decision-Making Agents
MoralityGym:用于评估序列决策代理中分层道德对齐的基准
Simon Rosen, Siddarth Singh, Ebenezer Gelo, Helen Sarah Robertson, Ibrahim Suder, Victoria Williams, Benjamin Rosman, Geraud Nangue Tasse, Steven James
Journal refProc of the 25th International Conference on Autonomous Agents and Multiagent Systems AAMAS 2026, Paphos, Cyprus, May 25 to 29, 2026, IFAAMAS
Fengfei Yu, Ruijia Niu, Dongxia Wu, Yian Ma, Rose Yu
机构
*
Department of Computer Science and Engineering, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校计算机科学与工程系,拉贾尔,加利福尼亚州,美国)
;
Halıcıoğlu Data Science Institute, University of California San Diego, La Jolla, California, USA(加州大学圣地亚哥分校Halıcıoğlu数据科学研究所,拉贾尔,加利福尼亚州,美国)
;
Department of Statistics, Stanford University, Stanford, California, USA(斯坦福大学统计学系,斯坦福,加利福尼亚州,美国)
Nico Pelleriti, Sree Harsha Nelaturu, Zhanke Zhou, Zongze Li, Max Zimmer, Bo Han, Sebastian Pokutta
机构
*
Zuse Institute Berlin(柏林Zuse研究所)
;
Technical University of Berlin(柏林技术大学)
;
Hong Kong Baptist University(香港 Baptist大学)
;
RIKEN Center for Advanced Intelligence Project(RIKEN高级智能项目中心)
Forecasting Downstream Performance of LLMs With Proxy Metrics
通过代理指标预测大语言模型的下游性能
Arkil Patel, Siva Reddy, Marius Mosbach, Dzmitry Bahdanau
机构
*
Mila – Quebec AI Institute & McGill University(魁北克AI研究院与麦吉尔大学)
;
CIFAR AI Chair(CIFAR人工智能主席)
;
ServiceNow Research Periodic Labs(ServiceNow研究周期实验室)
STT-Arena: A More Realistic Environment for Tool-Using with Spatio-Temporal Dynamics
STT-Arena:一种更现实的工具使用环境,包含时空动态
Tingfeng Hui, Hao Xu, Pengyu Zhu, Hongsheng Xin, Kun Zhan, Sen Su, Chunxiao Liu, Ning Miao
机构
*
Hong Kong Institute of AI for Science, City University of Hong Kong(香港人工智能科学研究院,香港城市大学)
;
Department of Data Science, City University of Hong Kong(数据科学系,香港城市大学)
;
Beijing University of Posts and Telecommunications(北京邮电大学)
;
Li Auto Inc.(李汽有限公司)
;
Independent Researcher(独立研究者)
Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification
验证你的权威:在多标签先例处理分类上对LLM进行基准测试
M. Mikail Demir, M. Abdullah Canbaz
机构
*
Department of Information Science and Technology(信息科学与技术系)
;
College of Emergency Preparedness, Homeland Security, and Cybersecurity(应急准备、国土安全与网络安全学院)
;
University at Albany, SUNY(萨利纳大学)
QQJ: Quantifying Qualitative Judgment for Scalable and Human-Aligned Evaluation of Generative AI
QQJ: 量化定性判断以实现可扩展且与人类对齐的生成AI评估
Marjan Veysi, Pirooz Shamsinejadbabaki, Mohammad Zare, Mohammad Sabouri
机构
*
AI Lab, Arioobarzan Engineering Team(艾伊罗巴赞工程团队人工智能实验室)
;
Department of Computer Engineering and Information Technology(计算机工程与信息科技系)
;
Department of Informatics, Bioengineering, Robotics and Systems Engineering(信息学、生物工程、机器人与系统工程系)
;
University of Genoa(热那亚大学)
ADR: An Agentic Detection System for Enterprise Agentic AI Security
ADR:一种用于企业代理AI安全的代理检测系统
Chenning Li, Pan Hu, Justin Xu, Baris Ozbas, Olivia Liu, Caroline Van, Manxue Li, Wei Zhou, Mohammad Alizadeh, Pengyu Zhang, KK Sriramadhesikan, Ming Zhang
机构
*
Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系)
;
Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团)
;
School of Software, Tsinghua University, Beijing, China(清华大学软件学院)
PluRule: A Benchmark for Moderating Pluralistic Communities on Social Media
PluRule:一种用于社交媒体上多元社区调节的基准测试
Zoher Kachwala, Bao Tran Truong, Rasika Muralidharan, Haewoon Kwak, Jisun An, Filippo Menczer
机构
*
Observatory on Social Media, Indiana University, USA(社交媒体观察站,印第安纳大学,美国)
;
Center Synergy of Systems, TUD Dresden University of Technology, Germany(系统协同中心,德累斯顿技术大学,德国)
CoCoReviewBench: A Completeness- and Correctness-Oriented Benchmark for AI Reviewers
CoCoReviewBench:面向AI审稿人完整性和正确性的基准测试
Hexuan Deng, Xiaopeng Ke, Yichen Li, Ruina Hu, Dehao Huang, Derek F. Wong, Yue Wang, Xuebo Liu, Min Zhang
机构
*
Institute of Computing and Intelligence, Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳研究院)
;
Zhongguancun Academy, Beijing, China(中关村学院)
;
Faculty of Computing, Harbin Institute of Technology, Harbin, China(哈尔滨工业大学计算机学院)
;
Department of Computer Science and Engineering, Southern University of Science and Technology, Shenzhen, China(南方科技大学计算机科学与工程系)
;
NLP²CT Lab, Department of Computer and Information Science, University of Macau, China(澳门大学自然语言处理实验室)
Helping Customers in Distress: An LLM-powered Agent that Converses, Probes, and Routes
帮助陷入困境的客户:一个基于LLM的代理,能够对话、探测和分流
Alankar Atreya, Stefan Sylvius Wanger, Devesh Batra, Robert Hankache, Cristovao Iglesias, Patrick Sinclair, Giulio Pelosio, Michael McMillan, Greig A. Cowan, Raad Khraishi