arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32208 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32208 篇

2404.02456 2024-04-08 cs.CL cs.AI cs.LG cs.SD eess.AS 90%

PhonologyBench: Evaluating Phonological Skills of Large Language Models

Ashima Suvarna, Harshita Khandelwal, Nanyun Peng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 17 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.00942 2024-04-02 cs.CL cs.AI cs.LG 90%

Evaluating the Factuality of Large Language Models using Large-Scale Knowledge Graphs

Xiaoze Liu, Feijie Wu, Tianyang Xu, Zhuo Chen, Yichi Zhang, Xiaoqian Wang, Jing Gao

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15852 2024-03-19 cs.CL cs.AI cs.LG 90%

Self-contradictory Hallucinations of Large Language Models: Evaluation, Detection and Mitigation

Niels Mündler, Jingxuan He, Slobodan Jenko, Martin Vechev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.08018 2024-03-05 q-bio.QM cs.AI cs.CE cs.CL cs.IR cs.LG 90%

Mol-Instructions: A Large-Scale Biomolecular Instruction Dataset for Large Language Models

Yin Fang, Xiaozhuan Liang, Ningyu Zhang, Kangwei Liu, Rui Huang, Zhuo Chen, Xiaohui Fan, Huajun Chen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2024. Project homepage: https://github.com/zjunlp/Mol-Instructions

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.04668 2024-02-27 cs.LG cs.AI cs.CL 90%

Label-free Node Classification on Graphs with Large Language Models (LLMS)

Zhikai Chen, Haitao Mao, Hongzhi Wen, Haoyu Han, Wei Jin, Haiyang Zhang, Hui Liu, Jiliang Tang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The code is available via https://github.com/CurryTang/LLMGNN; ICLR 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.08493 2024-02-23 cs.CL cs.AI cs.CR cs.LG 90%

Time Travel in LLMs: Tracing Data Contamination in Large Language Models

Shahriar Golchin, Mihai Surdeanu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published at ICLR 2024 as a Spotlight paper (notable top 5%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10245 2024-01-23 cs.HC 90%

Natural Language Dataset Generation Framework for Visualizations Powered by Large Language Models

Hyung-Kwon Ko, Hyeon Jeon, Gwanmo Park, Dae Hyun Kim, Nam Wook Kim, Juho Kim, Jinwook Seo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments 22 pages, 5 figures

Journal ref In Proceedings of the CHI Conference on Human Factors in Computing Systems (CHI '24), May 11-16, 2024, Honolulu, HI, USA

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.02567 2024-01-11 cs.CV cs.AI cs.CL cs.LG 90%

Improving Automatic VQA Evaluation Using Large Language Models

Oscar Mañas, Benno Krojer, Aishwarya Agrawal

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at AAAI 2024 (main track)

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.09300 2023-12-18 cs.CL cs.AI cs.LG 90%

Self-Evaluation Improves Selective Generation in Large Language Models

Jie Ren, Yao Zhao, Tu Vu, Peter J. Liu, Balaji Lakshminarayanan

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.14126 2023-11-27 cs.CL cs.AI cs.CY cs.LG 90%

Towards Auditing Large Language Models: Improving Text-based Stereotype Detection

Wu Zekun, Sahan Bulathwela, Adriano Soares Koshiyama

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 2023 NeurIPS SoLaR Workshop Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.07911 2023-11-15 cs.CL cs.AI cs.LG 90%

Instruction-Following Evaluation for Large Language Models

Jeffrey Zhou, Tianjian Lu, Swaroop Mishra, Siddhartha Brahma, Sujoy Basu, Yi Luan, Denny Zhou, Le Hou

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05720 2023-11-13 cs.CL cs.AI cs.LG 90%

Long-Horizon Dialogue Understanding for Role Identification in the Game of Avalon with Large Language Models

Simon Stepputtis, Joseph Campbell, Yaqi Xie, Zhengyang Qi, Wenxin Sharon Zhang, Ruiyi Wang, Sanketh Rangreji, Michael Lewis, Katia Sycara

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP, Findings of the Association for Computational Linguistics)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04532 2023-11-10 cs.SE 90%

Evaluating Diverse Large Language Models for Automatic and General Bug Reproduction

Sungmin Kang, Juyeon Yoon, Nargiz Askarbekkyzy, Shin Yoo

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

Comments This work is an extension of our prior work, available at arXiv:2209.11515

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.00457 2023-10-13 cs.CL cs.AI cs.GR cs.LG 90%

LLMMaps -- A Visual Metaphor for Stratified Evaluation of Large Language Models

Patrik Puchert, Poonam Poonam, Christian van Onzenoodt, Timo Ropinski

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.10917 2023-09-21 eess.AS cs.AI cs.CL cs.LG cs.SD 90%

End-to-End Speech Recognition Contextualization with Large Language Models

Egor Lakomkin, Chunyang Wu, Yassir Fathullah, Ozlem Kalinli, Michael L. Seltzer, Christian Fuegen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.07623 2023-09-15 cs.CV 90%

SwitchGPT: Adapting Large Language Models for Non-Text Outputs

Xinyu Wang, Bohan Zhuang, Qi Wu

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.01415 2023-08-04 cs.CL cs.AI cs.LG 90%

An Effective Data Creation Pipeline to Generate High-quality Financial Instruction Data for Large Language Model

Ziao Wang, Jianning Wang, Junda Wu, Xiaofeng Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments (FinLLM 2023)@IJCAI 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.04251 2023-07-18 cs.CL cs.AI cs.LG 90%

ChatGPT in the Age of Generative AI and Large Language Models: A Concise Survey

Salman Mohamadi, Ghulam Mujtaba, Ngan Le, Gianfranco Doretto, Donald A. Adjeroh

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments The paper was uploaded in error, before it was ready for submission. The paper requires a deep revision, and significant changes and modifications before uploading to the archive

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.03875 2023-07-14 cs.AI cs.CL cs.DM cs.LG 90%

Large Language Models for Supply Chain Optimization

Beibin Li, Konstantina Mellou, Bo Zhang, Jeevan Pathuri, Ishai Menache

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.04926 2023-06-09 cs.CL cs.AI cs.LG 90%

covLLM: Large Language Models for COVID-19 Biomedical Literature

Yousuf A. Khan, Clarisse Hokia, Jennifer Xu, Ben Ehlert

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.16504 2023-05-29 cs.CL cs.AI cs.LG 90%

On the Tool Manipulation Capability of Open-source Large Language Models

Qiantong Xu, Fenglu Hong, Bo Li, Changran Hu, Zhengyu Chen, Jian Zhang

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.29245 2026-06-23 cs.CR cs.CL cs.LG 版本更新 90%

Implicit Identity Technologies for LLMs: Fingerprinting and Watermarking across Datasets, Models, and Generated Content

LLM的隐式身份技术:跨数据集、模型和生成内容的指纹识别与水印

Bing Liu, Shunping Wang, Yufan Zhu, Xinyi Yu, Jing Huang, Linkang Du, Hongbin Pei, Wei Luo

机构 * School of Cyber Science and Engineering, Xi’an Jiaotong University, Xi’an, China(西安交通大学计算机科学与工程学院) State Grid Henan Marketing Service Center, Henan, China(国网河南营销服务中心) Institute of Information Engineering, Chinese Academy of Sciences, Beijing, China(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences, Beijing, China(中国科学院大学网络安全学院) School of Information Technology, Deakin University, Geelong, Australia(迪金大学信息技术学院)

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文综述了LLM指纹识别和水印技术,提出隐式身份统一抽象,并基于生命周期分类法组织数据集、模型和生成内容的技术,建立评估框架。

Comments Accepted by IJCAI-ECAI 2026. 11 pages, 1 figure. Survey and taxonomy of LLM fingerprinting and watermarking for identity, provenance, generated-content attribution, and asset protection

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03265 2026-01-08 cs.CL cs.CR cs.LG 90%

Jailbreak-Zero: A Path to Pareto Optimal Red Teaming for Large Language Models

Jailbreak-Zero:大型语言模型安全评估的帕累托最优渗透测试路径

Kai Hu, Abhinav Aggarwal, Mehran Khodabandeh, David Zhang, Eric Hsin, Li Chen, Ankit Jain, Matt Fredrikson, Akash Bharadwaj

机构 * Meta Superintelligence Labs(Meta超智能实验室) Carnegie Mellon University(卡内基梅隆大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 Jailbreak-Zero通过生成多样化对抗性提示并微调攻击模型,实现了LLM安全评估的帕累托最优,提高了攻击成功率并减少了人工干预需求。

Comments Socially Responsible and Trustworthy Foundation Models at NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10661 2025-11-17 cs.CL cs.LG stat.AP stat.ML 90%

Bayesian Evaluation of Large Language Model Behavior

Rachel Longjohn, Shang Wu, Saatvik Kher, Catarina Belém, Padhraic Smyth

机构 * Department of Statistics, University of California, Irvine(统计系,加州大学伊文斯分校) Department of Computer Science, University of California, Irvine(计算机科学系,加州大学伊文斯分校)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09165 2025-10-22 cs.CL cs.AI cs.IR 90%

When Text Embedding Meets Large Language Model: A Comprehensive Survey

Zhijie Nie, Zhangchi Feng, Mingxin Li, Cunwang Zhang, Yanzhao Zhang, Dingkun Long, Richong Zhang

机构 * School of Computer Science and Engineering, Beihang University(计算机科学与工程学院,北京航空航天大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

Comments Version 4: We added the latest works of LLM-based Embedders

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24235 2025-05-06 cs.CL cs.AI 90%

A Survey on Test-Time Scaling in Large Language Models: What, How, Where, and How Well?

Qiyuan Zhang, Fuyuan Lyu, Zexu Sun, Lei Wang, Weixu Zhang, Wenyue Hua, Haolun Wu, Zhihan Guo, Yufei Wang, Niklas Muennighoff, Irwin King, Xue Liu, Chen Ma

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments v3: Expand Agentic and SFT Chapters. Build Website for better visualization

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.09201 2025-01-17 cs.CL cs.AI 90%

Contextual Evaluation of Large Language Models for Classifying Tropical and Infectious Diseases

Mercy Asiedu, Nenad Tomasev, Chintan Ghate, Tiya Tiyasirichokchai, Awa Dieng, Oluwatosin Akande, Geoffrey Siwo, Steve Adudans, Sylvanus Aitkins, Odianosen Ehiakhamen, Eric Ndombi, Katherine Heller

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI

Comments Accepted at 2 NeurIPS 2024 workshops: Generative AI for Health Workshop and Workshop on Advancements In Medical Foundation Models: Explainability, Robustness, Security, and Beyond

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.00868 2024-12-03 cs.LG cs.CL math.ST stat.ML stat.TH 90%

Quantifying perturbation impacts for large language models

Paulius Rauba, Qiyao Wei, Mihaela van der Schaar

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

Comments Statistical Foundations of LLMs and Foundation Models Workshop at NeurIPS 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.09720 2024-08-20 cs.CV cs.AI cs.CL 90%

Pedestrian Attribute Recognition: A New Benchmark Dataset and A Large Language Model Augmented Framework

Jiandong Jin, Xiao Wang, Qian Zhu, Haiyang Wang, Chenglong Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.CL、cs.AI

Comments MSP60K PAR Benchmark Dataset, LLM based PAR model, In Peer Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08583 2024-08-06 cs.AI cs.CV cs.LG 90%

The Synergy between Data and Multi-Modal Large Language Models: A Survey from Co-Development Perspective

Zhen Qin, Daoyuan Chen, Wenhao Zhang, Liuyi Yao, Yilun Huang, Bolin Ding, Yaliang Li, Shuiguang Deng

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments);分类 cs.AI、cs.LG

Comments Ongoing work. 21 pages. Related materials are continually maintained and available at https://github.com/modelscope/data-juicer/blob/main/docs/awesome_llm_data.md

详情

展开后加载摘要…

URL PDF HTML 收藏