Margin-Adaptive Confidence Ranking for Reliable LLM Judgement
基于边际的置信度排名用于可靠的LLM判断
Gaojie Jin, Yong Tao, Lijia Yu, Tianjin Huang
机构
*
Department of Computer Science, University of Exeter(埃克塞特大学计算机科学系)
;
Institute of AI for Industries, Chinese Academy of Sciences(中国科学院工业人工智能研究所)
;
Department of Mathematics and Computer Science, Eindhoven University of Technology(埃因霍温理工大学数学与计算机科学系)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
ReplicatorBench: Benchmarking LLM Agents for Replicability in Social and Behavioral Sciences
ReplicatorBench:用于社会科学和行为科学中可复制性评估的LLM代理基准测试
Bang Nguyen, Dominik Soós, Qian Ma, Rochana R. Obadage, Zack Ranjan, Sai Koneru, Timothy M. Errington, Shakhlo Nematova, Sarah Rajtmajer, Jian Wu, Meng Jiang
机构
*
University of Notre Dame(圣母大学)
;
Old Dominion University(老道明大学)
;
Pennsylvania State University(宾夕法尼亚州立大学)
;
Independent Researcher(独立研究员)
;
Uppsala University(乌普萨拉大学)
;
Center for Open Science(开放科学中心)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
LLM-ReSum: A Framework for LLM Reflective Summarization through Self-Evaluation
LLM-ReSum: 一个通过自我评估实现LLM反思性总结的框架
Huyen Nguyen, Haoxuan Zhang, Yang Zhang, Haihua Chen, Junhua Ding
机构
*
dept. of Information Science University of North Texas Denton, Texas, USA(信息科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国)
;
dept. of Data Science University of North Texas Denton, Texas, USA(数据科学系 俄克拉荷马州立大学 丹顿 俄克拉荷马州 美国)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
CommentsThis paper has been accepted as an invited paper for publication in Proceedings of The 12th IEEE International Conference on Big Data Computing Service and Machine Learning Applications. This is the accepted manuscript. The final authenticated version will be available via IEEE Xplore
GrowthHacker: Automated Off-Policy Evaluation Optimization Using Code-Modifying LLM Agents
GrowthHacker: 使用代码修改型LLM代理的自动离线策略评估优化
Jie JW Wu, Ayanda Patrick Herlihy, Ahmad Saleem Mirza, Ali Afoud, Fatemeh Fard
机构
*
Michigan Technological University, Houghton(密歇根技术大学)
;
Birmingham City University(伯明翰城市大学)
;
University of British Columbia, Kelowna(不列颠哥伦比亚大学, 肯洛纳)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG
A Survey on Evaluating Quality and Trustworthiness in LLM-Generated Data
评估LLM生成数据的质量与可信度综述
Kaituo Zhang, Mingzhi Hu, Hoang Anh Duy Le, Fariha Kabir Torsha, Zhimeng Jiang, Minh Khai Bui, Chia-Yuan Chang, Yu-Neng Chuang, Zhen Xiong, Ying Lin, Guanchu Wang, Na Zou
机构
*
University of Houston(德克萨斯大学休斯敦分校)
;
Worcester Polytechnic Institute(沃思利理工学院)
;
Rice University(里德大学)
;
Texas A&M University(德克萨斯农工大学)
;
University of Wisconsin - Madison(威斯康星大学麦迪逊分校)
;
University of Southern California(南加州大学)
;
University of North Carolina at Charlotte(北卡罗来纳州立大学夏洛特分校)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG
Analysing Differences in Persuasive Language in LLM-Generated Text: Uncovering Stereotypical Gender Patterns
分析LLM生成文本中说服性语言的差异:揭示刻板的性别模式
Amalie Brogaard Pauli, Maria Barrett, Max Müller-Eberstein, Isabelle Augenstein, Ira Assent
机构
*
Department of Computer Science, Aarhus University(阿arhus大学计算机科学系)
;
AMD Silo AI
;
University of Tokyo(东京大学)
;
IT University of Copenhagen(哥本哈根IT大学)
;
Department of Computer Science, University of Copenhagen(哥本哈根大学计算机科学系)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
PortBench: A Correlation-Aware, Full-Pipeline Benchmark for LLM-Driven Portfolio Management
PortBench: 一种相关性感知的、全流水线的LLM驱动投资组合管理基准
Yuxuan Zhao, Sijia Chen, Ningxin Su
机构
*
Yantai Research Institute of Harbin Engineering University(哈尔滨工程大学烟台研究院)
;
The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);pretraining(abstract)
ForesightSafety-SAGE:A Fully Automated Scenario Generation and Safety Evaluation Framework for LLM Agents
VESTA: 一种全自动的LLM智能体场景生成与安全评估框架
Lu Jia, Haibo Tong, Feifei Zhao, Jindong Li, Dongqi Liang, Ping Wu, Qian Zhang, Yi Zeng
机构
*
BrainCog AI Lab, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所类脑人工智能实验室)
;
Beijing Institute of AI Safety and Governance (Beijing-AISI)(北京人工智能安全与治理研究院)
;
Beijing Key Laboratory of Safe AI and Superalignment(北京市安全人工智能与超级对齐重点实验室)
;
School of Artificial Intelligence, UCAS(中国科学院大学人工智能学院)
;
Long-term AI(长期人工智能)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
How Many Iterations to Jailbreak? Dynamic Budget Allocation for Multi-Turn LLM Evaluation
需要多少次迭代才能突破限制?多轮LLM评估中的动态预算分配
Shai Feldman, Yaniv Romano
机构
*
Department of Computer Science(计算机科学系)
;
Technion, Israel(技术ion, 以色列)
;
Departments of Electrical and Computer Engineering and of Computer Science(电气与计算机工程系和计算机科学系)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
CommentsAccepted at the Second Workshop on Agents in the Wild: Safety, Security, and Beyond (AIWILD), ICML 2026. Revised to match the camera-ready version. OpenReview: https://openreview.net/forum?id=aUSUvS4dPL
Clotho: Measuring Task-Specific Pre-Generation Test Adequacy for LLM Inputs
Clotho:用于LLM输入的任务特定预生成测试充分性度量
Juyeon Yoon, Somin Kim, Robert Feldt, Shin Yoo
机构
*
Korea Advanced Institute of Science and Technology(韩国科学技术院)
;
Chalmers University of Technology Gothenburg Sweden(楚德大学哥德堡瑞典)
;
Chalmers University of Technology(楚德大学)
专题命中
评测与基准
:LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG