NEXUS: Network Exploration for eXploiting Unsafe Sequences in Multi-Turn LLM Jailbreaks
Javad Rafiei Asl, Sidhant Narula, Mohammad Ghasemigol, Eduardo Blanco, Daniel Takabi
机构
*
Old Dominion University(旧 Dominion 大学)
;
University of Arizona(亚利桑那大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
CommentsThis paper has been accepted in the main conference proceedings of the 2025 Conference on Empirical Methods in Natural Language Processing (EMNLP 2025). Javad Rafiei Asl and Sidhant Narula are co-first authors
Facts are Harder Than Opinions -- A Multilingual, Comparative Analysis of LLM-Based Fact-Checking Reliability
Lorraine Saju, Arnim Bleier, Jana Lasser, Claudia Wagner
机构
*
GESIS – Leibniz Institute for the Social Sciences(GESIS社会科学院研究所)
;
RWTH Aachen University(亚琛RWTH大学)
;
University of Graz(格拉茨大学)
;
Complexity Science Hub(复杂性科学中心)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
机构
*
School of Computer Science and Technology, Harbin Institute of Technology, Shenzhen, China(计算机科学与技术学院,哈尔滨工业大学,深圳,中国)
;
Huawei Technologies Co., Ltd.(华为技术有限公司)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
BixBench: a Comprehensive Benchmark for LLM-based Agents in Computational Biology
Ludovico Mitchener, Jon M Laurent, Alex Andonian, Benjamin Tenmann, Siddharth Narayanan, Geemi P Wellawatte, Andrew White, Lorenzo Sani, Samuel G Rodriques
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
CML-Bench: A Framework for Evaluating and Enhancing LLM-Powered Movie Scripts Generation
Mingzhe Zheng, Dingjie Song, Guanyu Zhou, Jun You, Jiahao Zhan, Xuran Ma, Xinyuan Song, Ser-Nam Lim, Qifeng Chen, Harry Yang
机构
*
The Hong Kong University of Science and Technology(香港科学与技术大学)
;
Lehigh University(莱斯大学)
;
Fudan University(复旦大学)
;
Emory University(埃默里大学)
;
University of Central Florida(中央佛罗里达大学)
专题命中
评测与基准
:LLM(title);large language model(abstract);language model(abstract);prompting(abstract)
Are BabyLMs Deaf to Gricean Maxims? A Pragmatic Evaluation of Sample-efficient Language Models
Raha Askari, Sina Zarrieß, Özge Alacam, Judith Sieker
机构
*
Department of Humanities, University of Turin(都灵大学人文学科系)
;
Computational Linguistics, Department of Linguistics, Bielefeld University(比勒菲尔德大学语言学系计算语言学)
专题命中
评测与基准
:language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL
CommentsAccepted for the BabyLM workshop in EMNLP 2025
Investigating LLM Variability in Personalized Conversational Information Retrieval
Simon Lupart, Daniël van Dijk, Eric Langezaal, Ian van Dort, Mohammad Aliannejadi
机构
*
University of Amsterdam(阿姆斯特丹大学)
专题命中
评测与基准
:LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
Comments11 pages, 5 figures, SIGIR-AP'25 Proceedings of the 2025 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP 2025), December 7--10, 2025, Xi'an, China