arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 32096 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 32096 篇

2301.01820 2023-05-30 cs.IR cs.AI 89%

InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval

Vitor Jeronymo, Luiz Bonifacio, Hugo Abonizio, Marzieh Fadaee, Roberto Lotufo, Jakub Zavrel, Rodrigo Nogueira

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.14857 2023-05-25 cs.CL 89%

BUFFET: Benchmarking Large Language Models for Few-shot Cross-lingual Transfer

Akari Asai, Sneha Kudugunta, Xinyan Velocity Yu, Terra Blevins, Hila Gonen, Machel Reid, Yulia Tsvetkov, Sebastian Ruder, Hannaneh Hajishirzi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL

Comments The data and code is available at https://buffetfs.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.03245 2023-05-24 cs.CL 89%

Large language models effectively leverage document-level context for literary translation, but critical errors persist

Marzena Karpinska, Mohit Iyyer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments preprint (31 pages)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.12586 2023-05-23 cs.CL 89%

Enhancing Few-shot Text-to-SQL Capabilities of Large Language Models: A Study on Prompt Design Strategies

Linyong Nan, Yilun Zhao, Weijin Zou, Narutatsu Ri, Jaesung Tae, Ellen Zhang, Arman Cohan, Dragomir Radev

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.01937 2023-05-04 cs.CL cs.HC 89%

Can Large Language Models Be an Alternative to Human Evaluations?

Cheng-Han Chiang, Hung-yi Lee

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

Comments ACL 2023 main conference paper. Main content: 10 pages (including limitations). Appendix: 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.10423 2023-04-21 cs.SE cs.AI cs.NE 89%

Fully Autonomous Programming with Large Language Models

Vadim Liventsev, Anastasiia Grishina, Aki Härmä, Leon Moonen

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

Comments Accepted for publication in the Genetic and Evolutionary Computation Conference (GECCO 2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.18116 2023-04-03 cs.CL stat.CO 89%

Pair Programming with Large Language Models for Sampling and Estimation of Copulas

Jan Górecki

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14742 2023-03-28 cs.CL 89%

Exploring the Impact of Instruction Data Scaling on Large Language Models: An Empirical Study on Real-World Use Cases

Yunjie Ji, Yong Deng, Yan Gong, Yiping Peng, Qiang Niu, Lei Zhang, Baochang Ma, Xiangang Li

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.08037 2023-02-14 cs.CL 89%

Attributed Question Answering: Evaluation and Modeling for Attributed Large Language Models

Bernd Bohnet, Vinh Q. Tran, Pat Verga, Roee Aharoni, Daniel Andor, Livio Baldini Soares, Massimiliano Ciaramita, Jacob Eisenstein, Kuzman Ganchev, Jonathan Herzig, Kai Hui, Tom Kwiatkowski, Ji Ma, Jianmo Ni, Lierni Sestorain Saralegui, Tal Schuster, William W. Cohen, Michael Collins, Dipanjan Das, Donald Metzler, Slav Petrov, Kellie Webster

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.12004 2023-01-31 cs.CL 89%

Understanding the Effectiveness of Very Large Language Models on Dialog Evaluation

Jessica Huynh, Cathy Jiao, Prakhar Gupta, Shikib Mehri, Payal Bajaj, Vishrav Chaudhary, Maxine Eskenazi

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

Comments Accepted for publication at IWSDS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.10815 2022-12-22 cs.CL 89%

ZEROTOP: Zero-Shot Task-Oriented Semantic Parsing using Large Language Models

Dheeraj Mekala, Jason Wolfe, Subhro Roy

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.02506 2022-10-07 cs.CL cs.SE 89%

Large Language Models are Pretty Good Zero-Shot Video Game Bug Detectors

Mohammad Reza Taesiri, Finlay Macklon, Yihe Wang, Hengshuo Shen, Cor-Paul Bezemer

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2209.15093 2022-10-03 cs.CL 89%

Unpacking Large Language Models with Conceptual Consistency

Pritish Sahu, Michael Cogswell, Yunye Gong, Ajay Divakaran

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.14157 2022-07-29 cs.SE cs.AI 89%

A Hazard Analysis Framework for Code Synthesis Large Language Models

Heidy Khlaaf, Pamela Mishkin, Joshua Achiam, Gretchen Krueger, Miles Brundage

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08946 2026-05-27 cs.CY 89%

Authorship Attribution in the Era of LLMs: Problems, Methodologies, and Challenges

LLM时代的作者身份归属:问题、方法与挑战

Baixiang Huang, Canyu Chen, Kai Shu

专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文系统综述了LLM时代作者身份归属的四个代表性问题和挑战,包括人类文本归属、LLM生成文本检测、LLM生成文本归属以及人机合著文本归属,并探讨了泛化性和可解释性等关键问题。

Comments ACM SIGKDD Exploration. 12 pages. Additional resources, including a regularly updated list of related papers, and LLM-generated text detectors, are available at https://llm-authorship.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13166 2026-04-14 quant-ph cs.AI cs.CL cs.LG 89%

Large Language Models Can Help Mitigate Barren Plateaus in Quantum Neural Networks

大型语言模型有助于缓解量子神经网络中的 barren plateaus

Jun Zhuang, Chaowen Guan

机构 * Boise State University(博伊西州立大学) University of Cincinnati(辛辛那提大学)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

AI总结 本文提出AdaInit框架,利用具有亚鞅性质的大语言模型迭代合成量子神经网络的初始参数,以维持梯度方差,缓解 barren plateaus 问题。

Comments [ACL'26 Findings] TL;DR: We propose a new LLM-driven submartingale-based framework that adaptively generates effective initial parameters for quantum neural networks to mitigate barren plateaus by leveraging LLMs with the submartingale property

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.04024 2025-06-03 eess.IV cs.CV 89%

Enhancing chest X-ray datasets with privacy-preserving large language models and multi-type annotations: a data-driven approach for improved classification

Ricardo Bigolin Lanfredi, Pritam Mukherjee, Ronald Summers

机构 * Imaging Biomarkers and Computer-Aided Diagnosis Laboratory, Department of Radiology and Imaging Sciences, National Institutes of Health Clinical Center(影像生物标志物与计算机辅助诊断实验室,放射学与成像科学系,国家卫生研究院临床中心)

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments)

Comments Code and data: https://github.com/rsummers11/CADLab/tree/master/MAPLEZ_LLM_report_labeler/

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.05297 2024-06-06 cs.CL cs.AI cs.LG 89%

Challenging the Validity of Personality Tests for Large Language Models

Tom Sühr, Florian E. Dorner, Samira Samadi, Augustin Kelava

专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

Comments A less extensive and shorter version of this work has been accepted at Socially Responsible Language Modelling Research (SoLaR) 2023 Workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15159 2024-05-31 cs.CL cs.AI cs.CR cs.LG 89%

Machine Unlearning of Pre-trained Large Language Models

Jin Yao, Eli Chien, Minxin Du, Xinyao Niu, Tianhao Wang, Zezhou Cheng, Xiang Yue

专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)

Comments ACL 2024 main. Code and data at https://github.com/yaojin17/Unlearning_LLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11816 2026-08-13 cs.CR cs.AI cs.CL 新提交 89%

How China-Origin Vision-Language Models Move from Refusal to Reframing in State Alignment

中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构

Guang Yang, Fengchen Liu, Alex Wang, Homa Hosseinmardi, Amir Ghasemian

专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)

AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。

Comments 41 pages, 31 figures, 9 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08160 2026-08-11 cs.CL cs.AI 新提交 89%

Can LLM Agents Stick to the Script? A Benchmark for Long-Horizon Consistency in Interactive Narratives

大语言模型智能体能坚持剧本吗?交互式叙事中长期一致性的基准测试

Yingpeng Ma, Jianhao Yan, Bei Shi, Ka Hou Kam, Runnan Wang, Xuebo Liu, Yulong Chen, Yue Zhang, Derek F. Wong

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM智能体在交互式叙事中难以维持长期一致性的问题,构建了NCP-Bench基准测试,发现现有顶尖LLM的承诺保持率较低,存在显著的逻辑冲突问题。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.07650 2026-08-11 cs.AI cs.CL 版本更新 89%

A Statistical Framework for Auditing Behavioral Dependence and Induced Bias in LLM Judges

大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架

Chenchen Kuai, Jiwan Jiang, Zihao Zhu, Hao Wang, Keshu Wu, Zihao Li, Yunlong Zhang, Chenxi Liu, Zhengzhong Tu, Zhiwen Fan, Yang Zhou

机构 * Texas A&M University(德克萨斯农工大学)

专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03328 2026-07-31 cs.LG cs.AI 版本更新 89%

Averaged Evaluation Masks Capability Trade-Offs: Multi-Source Calibration for High-Sparsity LLM Pruning

校准数据在能力维度上的权衡:为什么多源混合对高稀疏LLM剪枝至关重要

Hu Xu, Zhaolong Xing, Congcong Liu, Jiaxing Wang, Zhida Jiang, Junshi Huang, Zhen Chen, Jianfeng Xu

机构 * Shanghai Jiao Tong University(上海交通大学) JD.com(京东公司)

专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 通过分解后剪枝能力维度并分析15个校准源,发现校准困惑度与通用能力保留正相关但与数学和代码能力保留负相关,提出多源混合校准方法IGSP以平衡各维度性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18110 2026-07-21 cs.LG cs.CL 新提交 89%

LLM-as-a-Coach: Experiential Learning for Non-Verifiable Tasks

大语言模型作为教练:不可验证任务的体验式学习

Tianzhu Ye, Li Dong, Guanheng Chen, He Zhu, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院) Tsinghua University(清华大学) Peking University(北京大学)

专题命中 评测与基准 :LLM(title,summary_cn);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究不可验证任务,提出体验式学习(EL),将LLM反馈模型从评判转为教练,通过提炼体验知识提供密集监督,在开放式任务上表现优于基于规则的RL,泛化性好且减轻奖励作弊。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05403 2026-07-09 cs.LG cs.AI 版本更新 89%

Trust, but Don't Verify: Epistemic Blind Spots in LLM Source Evaluation

信任,但不验证:LLM 源评估中的认知盲点

Rohan N. Pradhan, Steve Goley

机构 * Amazon(亚马逊)

专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);post-training(abstract);prompting(abstract)

AI总结 研究语言模型在多源综合中是否评估证据质量,发现模型虽能检测伪造统计但未在综合中启用,而是依赖方法论-语域门控,导致数值有效性被抑制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30062 2026-06-30 cs.CL cs.AI 89%

Little Brains, Big Feats: Exploring Compact Language Models

小脑袋,大成就:探索紧凑型语言模型

Dari Baturova, Elena Bruches, Ivan Chernov, Roman Derunets, Arsenii Fomin, Andrey Kostin

机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)

专题命中 评测与基准 :language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract);small language model(abstract)

AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。

Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21937 2026-06-23 cs.CY cs.AI cs.CL 新提交 89%

Latent Confidence Alignment for LLM Self-Assessment

潜在置信对齐用于大语言模型自我评估

Ting-Yu Chen, Tingting Yu, Pei-Cing Huang, Chan Hsu, Ming-Yen Lin, Yihuang Kang

机构 * Department of Information Management(信息管理系) National Sun Yat-Sen University(国立中山大学) Kaohsiung Medical University Hospital(高雄医学大学附设医院) Kaohsiung Medical University(高雄医学大学)

专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出基于Rasch模型的潜在置信对齐误差(LCAE)来评估LLM自我评估与潜在错误概率的一致性,并引入项目难度作为外部信号,实验表明该方法在不影响模型能力的情况下提升自我评估质量。

Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01252 2026-06-02 cs.CL cs.AI 89%

Understanding LLM Behavior in Multi-Target Cross-Lingual Summarization

理解多目标跨语言摘要中的LLM行为

Sangwon Ryu, Yihong Liu, Mingyang Wang, Yunsu Kim, Jungseul Ok, Gary Geunbae Lee, Hinrich Schuetze

机构 * GSAI, POSTECH(POSTECH认知科学研究院) CSE, POSTECH(POSTECH计算机科学与工程学院) LMU Munich(慕尼黑大学) MCML LILT(语言信息实验室)

专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI

AI总结 针对多目标跨语言摘要任务,提出MEA基准并分析LLM内部机制,发现翻译和摘要行为在后期层联合出现,并引入推理时激活引导方法提升生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.05913 2026-06-02 cs.CL cs.AI 89%

NILC: Discovering New Intents with LLM-assisted Clustering

NILC:利用LLM辅助聚类发现新意图

Hongtao Wang, Renchi Yang, Wenqing Lin

机构 * Hong Kong Baptist University(香港 Baptist 大学) JD.com(京东公司)

专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出NILC框架,通过迭代聚类结合大语言模型优化质心和文本嵌入,实现无监督和半监督新意图发现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28918 2026-06-01 cs.LG cs.AI cs.IR 89%

When LLM Reward Design Fails: Diagnostic-Driven Refinement for Sparse Structured RL

当LLM奖励设计失败时:面向诊断的稀疏结构化RL改进

Youting Wang, Yuan Tang, Bowen Liu, Xuan Liu, Dingyan Shang

专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG

AI总结 针对稀疏结构化强化学习任务,提出诊断驱动的迭代奖励函数改进方法,通过训练诊断和失败模式分类指导修正,显著提升MiniGrid任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏