InPars-v2: Large Language Models as Efficient Dataset Generators for Information Retrieval
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL
Comments The data and code is available at https://buffetfs.github.io/
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments preprint (31 pages)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
Comments ACL 2023 main conference paper. Main content: 10 pages (including limitations). Appendix: 13 pages
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
Comments Accepted for publication in the Genetic and Evolutionary Computation Conference (GECCO 2023)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
Comments Accepted for publication at IWSDS 2023
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);prompting(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI
LLM时代的作者身份归属:问题、方法与挑战
专题命中 评测与基准 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)
AI总结 本文系统综述了LLM时代作者身份归属的四个代表性问题和挑战,包括人类文本归属、LLM生成文本检测、LLM生成文本归属以及人机合著文本归属,并探讨了泛化性和可解释性等关键问题。
Comments ACM SIGKDD Exploration. 12 pages. Additional resources, including a regularly updated list of related papers, and LLM-generated text detectors, are available at https://llm-authorship.github.io
大型语言模型有助于缓解量子神经网络中的 barren plateaus
机构 * Boise State University(博伊西州立大学) ; University of Cincinnati(辛辛那提大学)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)
AI总结 本文提出AdaInit框架,利用具有亚鞅性质的大语言模型迭代合成量子神经网络的初始参数,以维持梯度方差,缓解 barren plateaus 问题。
Comments [ACL'26 Findings] TL;DR: We propose a new LLM-driven submartingale-based framework that adaptively generates effective initial parameters for quantum neural networks to mitigate barren plateaus by leveraging LLMs with the submartingale property
机构 * Imaging Biomarkers and Computer-Aided Diagnosis Laboratory, Department of Radiology and Imaging Sciences, National Institutes of Health Clinical Center(影像生物标志物与计算机辅助诊断实验室,放射学与成像科学系,国家卫生研究院临床中心)
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);LLM(abstract,comments)
Comments Code and data: https://github.com/rsummers11/CADLab/tree/master/MAPLEZ_LLM_report_labeler/
专题命中 评测与基准 :language model(title,abstract);large language model(title,abstract);分类 cs.CL、cs.AI、cs.LG
Comments A less extensive and shorter version of this work has been accepted at Socially Responsible Language Modelling Research (SoLaR) 2023 Workshop at NeurIPS 2023
专题命中 评测与基准 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;LLM(comments)
Comments ACL 2024 main. Code and data at https://github.com/yaojin17/Unlearning_LLM
中国起源的多模态视觉语言模型如何在状态对齐中从拒绝转向重构
专题命中 评测与基准 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);prompting(abstract)
AI总结 该研究构建基准测试9个视觉语言模型,发现中国起源模型更易进行状态对齐重构,且审查从可见的拒绝转向不可见的重构,这对人机交互存在影响。
Comments 41 pages, 31 figures, 9 tables. Preprint
大语言模型智能体能坚持剧本吗?交互式叙事中长期一致性的基准测试
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 该研究针对LLM智能体在交互式叙事中难以维持长期一致性的问题,构建了NCP-Bench基准测试,发现现有顶尖LLM的承诺保持率较低,存在显著的逻辑冲突问题。
Comments Accepted by ICML 2026
大型语言模型有多独立?一种用于审计行为纠缠和重加权验证者集合的统计框架
机构 * Texas A&M University(德克萨斯农工大学)
专题命中 评测与基准 :LLM(title,abstract);large language model(abstract);language model(abstract);pretraining(abstract)
AI总结 本文提出一种统计框架,用于审计大型语言模型之间的行为纠缠,通过多分辨率层次结构和信息理论度量,分析行为纠缠对验证性能的影响,并通过重加权验证者集合减少相关偏差。
校准数据在能力维度上的权衡:为什么多源混合对高稀疏LLM剪枝至关重要
机构 * Shanghai Jiao Tong University(上海交通大学) ; JD.com(京东公司)
专题命中 评测与基准 :LLM(title,title_cn);pretraining(abstract);post-training(abstract);分类 cs.AI、cs.LG
AI总结 通过分解后剪枝能力维度并分析15个校准源,发现校准困惑度与通用能力保留正相关但与数学和代码能力保留负相关,提出多源混合校准方法IGSP以平衡各维度性能。
大语言模型作为教练:不可验证任务的体验式学习
机构 * Microsoft Research(微软研究院) ; Tsinghua University(清华大学) ; Peking University(北京大学)
专题命中 评测与基准 :LLM(title,summary_cn);post-training(abstract);分类 cs.CL、cs.LG
AI总结 研究不可验证任务,提出体验式学习(EL),将LLM反馈模型从评判转为教练,通过提炼体验知识提供密集监督,在开放式任务上表现优于基于规则的RL,泛化性好且减轻奖励作弊。
信任,但不验证:LLM 源评估中的认知盲点
机构 * Amazon(亚马逊)
专题命中 评测与基准 :LLM(title,title_cn);language model(abstract);post-training(abstract);prompting(abstract)
AI总结 研究语言模型在多源综合中是否评估证据质量,发现模型虽能检测伪造统计但未在综合中启用,而是依赖方法论-语域门控,导致数值有效性被抑制。
小脑袋,大成就:探索紧凑型语言模型
机构 * Siberian Neuronets LLC(西伯利亚神经网络有限公司)
专题命中 评测与基准 :language model(title,abstract);SLM(abstract,abstract_cn);large language model(abstract);small language model(abstract)
AI总结 本研究探索小型语言模型在检索增强生成(RAG)系统中的生成性能,实验表明无需GPU即可在设备上运行,并提供了基准测试结果。
Comments Accepted to ECML PKDD 2026, Applied Data Science track. Author preprint; the definitive version will appear in the proceedings of ECML PKDD 2026, Springer LNCS
潜在置信对齐用于大语言模型自我评估
机构 * Department of Information Management(信息管理系) ; National Sun Yat-Sen University(国立中山大学) ; Kaohsiung Medical University Hospital(高雄医学大学附设医院) ; Kaohsiung Medical University(高雄医学大学)
专题命中 评测与基准 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出基于Rasch模型的潜在置信对齐误差(LCAE)来评估LLM自我评估与潜在错误概率的一致性,并引入项目难度作为外部信号,实验表明该方法在不影响模型能力的情况下提升自我评估质量。
Comments 2026 IEEE 27th International Conference on Information Reuse and Integration for Data Science
理解多目标跨语言摘要中的LLM行为
机构 * GSAI, POSTECH(POSTECH认知科学研究院) ; CSE, POSTECH(POSTECH计算机科学与工程学院) ; LMU Munich(慕尼黑大学) ; MCML ; LILT(语言信息实验室)
专题命中 评测与基准 :LLM(title,title_cn);分类 cs.CL、cs.AI
AI总结 针对多目标跨语言摘要任务,提出MEA基准并分析LLM内部机制,发现翻译和摘要行为在后期层联合出现,并引入推理时激活引导方法提升生成质量。
NILC:利用LLM辅助聚类发现新意图
机构 * Hong Kong Baptist University(香港 Baptist 大学) ; JD.com(京东公司)
专题命中 评测与基准 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI
AI总结 提出NILC框架,通过迭代聚类结合大语言模型优化质心和文本嵌入,实现无监督和半监督新意图发现。
当LLM奖励设计失败时:面向诊断的稀疏结构化RL改进
专题命中 评测与基准 :LLM(title,title_cn);prompting(abstract);分类 cs.AI、cs.LG
AI总结 针对稀疏结构化强化学习任务,提出诊断驱动的迭代奖励函数改进方法,通过训练诊断和失败模式分类指导修正,显著提升MiniGrid任务成功率。