Leveraging Reference Documents for Zero-Shot Ranking via Large Language Models
通过大型语言模型利用参考文档实现零样本排序
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 RefRank 通过利用固定参考文档实现零样本排序,以线性时间复杂度提升排序准确性并降低计算成本。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
通过大型语言模型利用参考文档实现零样本排序
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 RefRank 通过利用固定参考文档实现零样本排序,以线性时间复杂度提升排序准确性并降低计算成本。
评估大型语言模型安全防护措施对对抗攻击的鲁棒性
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本研究评估了大型语言模型安全防护措施对对抗攻击的鲁棒性,发现模型在未见过的提示上表现显著下降,且存在新的失败模式,强调泛化能力的重要性。
Comments 21 pages, 9 figures, 6 tables
AfriStereo:一种基于文化背景的数据集,用于评估大型语言模型中的刻板印象偏见
专题命中 评测与基准 :language model(title,abstract);large language model(title);prompting(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 AfriStereo通过构建基于非洲文化的数据集,评估大型语言模型中的刻板印象偏见,揭示了模型在性别、年龄、职业等维度上的系统性偏见。
如何有效利用大语言模型进行钓鱼检测?:评估基于大语言模型的钓鱼检测模型的有效性
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文评估了基于大语言模型的钓鱼检测有效性,发现商业模型在检测中表现更优,截图输入在品牌识别中效果最佳,但需注意温度设置和多模态输入的影响。
保障大语言模型:应对偏见、虚假信息和提示攻击
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
AI总结 本文探讨了大语言模型在偏见、虚假信息和提示攻击方面的安全问题,分析了偏见缓解策略、内容检测机制及防御措施,强调了对LLM安全领域进一步研究的重要性。
Comments 17 pages, 1 figure
机构 * South China Normal University(华南师范大学) ; Nanyang Technological University(南洋理工大学) ; City University of Hong Kong(香港城市大学) ; Shenzhen Academy of Inspection and Quarantine(深圳检验检疫局) ; Shenzhen University(深圳大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
机构 * College of Engineering and Technology, American University of the Middle East(工程与技术学院,中东大学) ; Faculty of Applied Science and Engineering, University of Toronto(应用科学与工程学院,多伦多大学) ; Department of Electrical and Computer Engineering, University of Manitoba(电气与计算机工程系,曼尼托巴大学) ; KITE Research Institute, Toronto Rehabilitation Institute, University Health Network(KITE研究机构,多伦多康复研究所,大学健康网络)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 8 pages, 5 figures, 4 tables
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
机构 * School of Computer Sciences(计算机科学学院) ; National Institute of Science Education and Research(国家科学教育与研究 institute) ; An OCC of Homi Bhabha National Institute, India(霍米·巴布国家研究所办公室,印度)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted at TMLR
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
机构 * University of Cagliari(卡利亚里大学) ; Centre for AI Governance(人工智能治理中心) ; Foundation AI – Cisco Systems Inc.(AI基金会——思科系统公司)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments Version accepted for publication
Journal ref ACM Journal on Responsible Computing, Volume 2, Issue 4, Article 16 (2025)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Journal ref Proceedings of the 2025 CHI Conference on Human Factors in Computing Systems
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 17 pages, 5 figures, 8tables
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments This work has been submitted to the IEEE for possible publication
机构 * Chandar Research Lab(昌达尔研究实验室) ; Mila – Quebec AI Institute(魁北克人工智能研究所) ; Université de Montréal(蒙特利尔大学) ; Meta FAIR ; Polytechnique Montréal(蒙特利尔理工学院) ; Canada CIFAR AI Chair(加拿大CIFAR人工智能主席)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published as a long paper at the 2024 Conference on Empirical Methods in Natural Language Processing (EMNLP). Official version of paper within conference proceedings is available at https://aclanthology.org/2024.emnlp-main.348/
机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) ; School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; Tencent Youtu Lab(腾讯优图实验室) ; Xiamen University(厦门大学) ; CASIA(中国科学院自动化研究所)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments NeurIPS DB 2025 Spotlight, Project Page: https://github.com/BradyFU/Awesome-Multimodal-Large-Language-Models/tree/Evaluation
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
机构 * University of Oxford(牛津大学) ; King Abdullah University of Science and Technology(国王 Abdullah 科学与技术大学) ; Technical University of Munich(慕尼黑技术大学) ; Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) ; Simon Fraser University(西蒙·弗雷泽大学) ; ETH Zurich(苏黎世联邦理工学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Comments 2nd version update to Jun.2025
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)
Journal ref 2025: Proceedings of the XXXIX Brazilian Symposium on Software Engineering
机构 * Department of Electrical Engineering and Computer Science(电气工程与计算机科学系) ; Massachusetts Institute of Technology(麻省理工学院)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments Preprint. Under review at ICLR 2026. 11 pages, 2 figures
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract)