arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2303.04132 2023-10-31 cs.CL cs.AI cs.LG 80%

Exploiting Asymmetry for Synthetic Training Data Generation: SynthIE and the Case of Information Extraction

Martin Josifoski, Marija Sakota, Maxime Peyrard, Robert West

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.03495 2023-10-20 cs.CL cs.AI cs.LG 80%

Automatic Prompt Optimization with "Gradient Descent" and Beam Search

Reid Pryzant, Dan Iter, Jerry Li, Yin Tat Lee, Chenguang Zhu, Michael Zeng

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments EMNLP 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.11392 2023-09-29 cs.IR 80%

Retrieving Supporting Evidence for Generative Question Answering

Siqing Huo, Negar Arabzadeh, Charles L. A. Clarke

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments arXiv admin note: text overlap with arXiv:2306.13781

Journal ref Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region (SIGIR-AP '23), November 26--28, 2023, Beijing, China

详情

展开后加载摘要…

URL PDF HTML 收藏
2309.03876 2023-09-08 cs.CL cs.AI cs.CY cs.LG 80%

OpinionGPT: Modelling Explicit Biases in Instruction-Tuned LLMs

Patrick Haller, Ansar Aynetdinov, Alan Akbik

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 6 pages, 1 figure, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.13781 2023-06-27 cs.IR 80%

Retrieving Supporting Evidence for LLMs Generated Answers

Siqing Huo, Negar Arabzadeh, Charles L. A. Clarke

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.01786 2023-05-30 cs.CL cs.AI cs.LG 80%

Crosslingual Generalization through Multitask Finetuning

Niklas Muennighoff, Thomas Wang, Lintang Sutawika, Adam Roberts, Stella Biderman, Teven Le Scao, M Saiful Bari, Sheng Shen, Zheng-Xin Yong, Hailey Schoelkopf, Xiangru Tang, Dragomir Radev, Alham Fikri Aji, Khalid Almubarak, Samuel Albanie, Zaid Alyafeai, Albert Webson, Edward Raff, Colin Raffel

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 main pages (119 with appendix), 16 figures and 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17651 2023-05-29 cs.CL cs.AI cs.LG 80%

Self-Refine: Iterative Refinement with Self-Feedback

Aman Madaan, Niket Tandon, Prakhar Gupta, Skyler Hallinan, Luyu Gao, Sarah Wiegreffe, Uri Alon, Nouha Dziri, Shrimai Prabhumoye, Yiming Yang, Shashank Gupta, Bodhisattwa Prasad Majumder, Katherine Hermann, Sean Welleck, Amir Yazdanbakhsh, Peter Clark

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Code, data, and demo at https://selfrefine.info/

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.04360 2023-04-12 cs.CL cs.AI cs.LG 80%

Does Synthetic Data Generation of LLMs Help Clinical Text Mining?

Ruixiang Tang, Xiaotian Han, Xiaoqian Jiang, Xia Hu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages, 8 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.07705 2021-09-10 cs.CL cs.AI cs.LG 80%

How to Train BERT with an Academic Budget

Peter Izsak, Moshe Berchansky, Omer Levy

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04200 2026-01-09 cs.CL cs.AI 80%

Attribute-Aware Controlled Product Generation with LLMs for E-commerce

基于属性意识的LLM电商产品生成控制

Virginia Negri, Víctor Martínez Gómez, Sergio A. Balanya, Subburam Rajaram

机构 * Amazon Spain(亚马逊西班牙分公司) Amazon Germany(亚马逊德国分公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM的属性意识电商产品生成方法,通过三种策略生成高质量合成数据,提升电商数据集的准确率与实用性。

Comments AAAI'26 Workshop on Shaping Responsible Synthetic Data in the Era of Foundation Models (RSD)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05525 2025-08-08 cs.CL cs.AI 80%

The World According to LLMs: How Geographic Origin Influences LLMs' Entity Deduction Capabilities

Harsh Nishant Lalai, Raj Sanjay Shah, Jiaxin Pei, Sashank Varma, Yi-Chia Wang, Ali Emami

机构 * BITS, Pilani(比哈尔理工学院) Georgia Institute of Technology(佐治亚理工学院) Stanford University(斯坦福大学) Emory University(埃默里大学)

专题命中 预训练与数据 :language model(abstract,comments);large language model(abstract);prompting(abstract);分类 cs.CL、cs.AI

Comments Conference on Language Modeling 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13760 2024-11-22 cs.LG cs.CL cs.HC 80%

A Framework for Evaluating LLMs Under Task Indeterminacy

Luke Guerdan, Hanna Wallach, Solon Barocas, Alexandra Chouldechova

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments To Appear in NeurIPS 2024 Workshops on Evaluating Evaluations (EvalEval) and Statistical Foundations of LLMs and Foundation Models (SFLLM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.07188 2024-07-16 cs.CL cs.AI 80%

Merging Improves Self-Critique Against Jailbreak Attacks

Victor Gallego

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Published at ICML 2024 Workshop on Foundation Models in the Wild

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20873 2026-08-25 cs.LG 版本更新 79%

In-Cell Learning: Deployed Language Models Can Learn New Knowledge Without Changing a Single Stored Bit

除模型外一切未变:CellFill——针对量化大语言模型的比特一致、可撤销更新的单元内受限学习

Zifeng Liu, Yaxin Lu, Xuanhan Wu, Zhiyong Du, Yiming Mao, Zhenhe Wang, Wenqi Shi, Zhengkun Jing, Linwei Liu

机构 * Institute for Frontier Interdisciplinary Research in Health Sciences and Technology, Sun Yat-sen University(中山大学健康科学与技术前沿交叉研究院) Guangdong Engineering Research Center of Medical Artificial Intelligence Multimodal System(广东省医学人工智能多模态系统工程研究中心) Sun Yat-sen University(中山大学) School of Business, Sun Yat-sen University(中山大学商学院) School of Computer Science, China University of Geosciences (Wuhan)(中国地质大学(武汉)计算机学院) School of Public Health, Sun Yat-sen University(中山大学公共卫生学院) Hospital of Stomatology, Sun Yat-sen University(中山大学口腔医院) Big Data and Artificial Intelligence Center, The Third Affiliated Hospital of Sun Yat-sen University(中山大学附属第三医院大数据与人工智能中心)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 CellFill方法通过在量化决策单元内写入残差实现量化大语言模型的比特一致、可撤销更新,实验显示其在召回率接近基准的同时降低跨域遗忘,且可迁移至27B混合线性注意力模型。

Comments 35 pages, 3 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16469 2026-08-25 cs.CL 版本更新 79%

Dialects of Translationese Shape Language Model Learning

在翻译语中训练模型显示了词汇多样性与源-目标句法相似性如何塑造学习

Jenny Kunz

机构 * Department of Computer and Information Science(计算机与信息科学系) Linköping University(林雪平大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 本文研究了在不同源语言翻译的机器翻译数据上训练模型,探讨词汇多样性和源-目标句法相似性如何影响模型学习与语言建模。

Comments To appear at the Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21489 2026-08-21 cs.LG 版本更新 79%

GraphPFN: A Prior-Data Fitted Graph Foundation Model

GraphPFN:一种先验数据拟合的图基础模型

Dmitry Eremeev, Oleg Platonov, Gleb Bazhenov, Artem Babenko, Liudmila Prokhorenkova

机构 * HSE University(莫斯科国立高等经济学院) Yandex Research(Yandex研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对图基础模型的可迁移性和数据稀缺问题,提出GraphPFN,基于先验数据拟合网络框架,设计多级随机块模型和优先连接过程生成合成图,结合图感知结构化因果模型生成属性,并扩展LimiX模型以融合图邻域聚合层,在节点级任务上实现上下文学习和微调的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17722 2026-08-19 cs.CR cs.LG 新提交 79%

MemCatalyst: Amplifying Data Auditing on Vision-Language Models via Data Poisoning

MemCatalyst:通过数据投毒增强视觉-语言模型的数据审计

Xukun Luan, Jinyan Liu, Yuhui Gong, Yuanguo Bi, Bing Hu, Xuesong Li, Di Wang

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 本研究提出MemCatalyst数据投毒工具,通过文本与图像投毒策略增强视觉-语言模型的成员推断审计性能,在黑盒设置下投毒样本可跨架构迁移,仅需少量投毒样本即可提升审计效果且不影响模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17120 2026-08-19 cs.CL 新提交 79%

Children, but not language models, show accelerating returns in word learning

儿童在词汇学习中表现出加速回报,而语言模型则不然

Michael C. Frank

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究对比儿童与语言模型的词汇学习,发现儿童词汇学习呈加速积累特征,而语言模型则呈现恒定比例回报,且儿童学习所需训练数据远少于语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16900 2026-08-19 physics.soc-ph cs.AI cs.CY quant-ph 新提交 79%

QuantumNovelty: A Skill-Orchestrating Language Agent for Referee-Style Review and Patentability Screening of Quantum Papers and Patents

QuantumNovelty:用于量子论文与专利的评审式审查及可专利性筛选的技能编排语言智能体

Shlomo Kashani

专题命中 预训练与数据 :language agent(title,abstract);分类 cs.AI

AI总结 QuantumNovelty是一款开源技能编排语言智能体,可生成量子计算产物并通过含确定性门的审计层审查,在对抗语料库及真实手稿、专利的测试中表现出审查保守性,属于量子论文与专利审查的决策支持工具。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15798 2026-08-18 cs.LG stat.ML 新提交 79%

Cross-Entropy Risk Estimation for Language Models: Inconsistency Must Be Dense, and the Holdout Method Is No Exception

语言模型的交叉熵风险估计:不一致性必然是稠密的,留出法也不例外

Hanti Lin

机构 * University of California, Davis(加利福尼亚大学戴维斯分校)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.LG

AI总结 该研究指出语言模型的每词交叉熵风险无法被一致估计,即使采用留出法也存在稠密的不一致状态,提出两种需付出代价的解决途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14414 2026-08-17 cs.LG 新提交 79%

CytoBERT: A Foundation Model for Cytometry Data

CytoBERT:用于细胞计数数据的基础模型

Syed Abdul Haseeb Qadri, Bjarne C. Hiller, Felix Blanke, Vanja Sophie Cangalovic, Kutalmış Coşkun, Amin Mirzaei, Tom Siegl, Sebastian Bader, Thomas Kirste, Martin Becker

机构 * University of Rostock(罗斯托克大学) Marburg University(马尔堡大学) Hessian Center for Artificial Intelligence(黑森人工智能中心)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 针对细胞计数数据异质性与非标准化导致机器学习难以应用的问题,推出开源基础模型CytoBERT,经5000万细胞数据预训练后可实现跨数据集迁移学习,为通用细胞计数分析提供新方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10295 2026-08-12 cs.CV cs.AI 新提交 79%

Frozen Brain-MRI Foundation Models Are Site Fingerprints

冻结的脑MRI基础模型是站点指纹

Saman Rahbar

机构 * University of British Columbia(不列颠哥伦比亚大学)

专题命中 预训练与数据 :foundation model(title);pretraining(abstract);分类 cs.AI

AI总结 该研究发现冻结脑MRI基础模型的嵌入包含采集站点的指纹,该指纹可线性解码且与预训练无关,可通过特定方法移除,同时指出其对共享嵌入的影响及密集分割的代价,并发布了审计工具包。

Comments 15 pages, 5 figures, 7 tables. Code: https://github.com/saman-rahbar/scanner-fingerprints

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19040 2026-08-11 cs.LG 版本更新 79%

OATS: Online Data Augmentation for Time Series Foundation Models

OATS: 用于时间序列基础模型的在线数据增强

Junwei Deng, Chang Xu, Jiaqi W. Ma, Ming Jin, Chenghao Liu, Xu Zhang, Li Zhao, Jiang Bian

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Microsoft Research(微软研究院) Griffith University(格里菲斯大学) Datadog AI Research(Datadog AI研究院)

专题命中 预训练与数据 :foundation model(title,abstract);分类 cs.LG

AI总结 OATS通过动态生成合成数据提升时间序列基础模型的性能,采用探索-利用机制和扩散框架,在多个数据集上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00633 2026-08-11 cs.CV cs.AI 版本更新 79%

From Alignment to Synthesis Contrastive Volumetric Grounding for Text-to-CT Generation

从对齐到合成:用于文本到CT生成的对比体 grounding

Daniele Molino, Camillo Maria Caruso, Filippo Ruffini, Paolo Soda, Valerio Guarrasi

机构 * Unit of Artificial Intelligence and Computer Systems, Department of Engineering, Università Campus Bio-Medico di Roma(人工智能与计算机系统单位,工程系,罗马生物医学大学) Department of Diagnostics and Intervention, Biomedical Engineering and Radiation Physics, Umeå University(诊断与干预部门,生物医学工程与放射物理学,乌梅拉大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.AI

AI总结 该研究针对文本到CT生成的视觉-语言对齐瓶颈,提出带结构化难负样本的3D-CLIP编码器,结合端到端潜在扩散模型,在CT-RATE数据集上实现了优于现有方法的性能。

Comments Accepted at BMVC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06506 2026-08-10 cs.CL 新提交 79%

Measuring the Cross-Lingual Comprehension Gap: How the language of the evidence shapes what language models understand

测量跨语言理解差距:证据语言如何影响语言模型的理解能力

Rafael da Silva, Jeff Eicher

机构 * Eastern University(东方大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究定义跨语言理解差距(CLCG),通过ParallelQA-18评估5种模型,发现英语能力无法同等迁移,低资源语言用户的模型质量可能被英语中心评估高估。

Comments 55 pages, 17 figures. Submitted to Computational Linguistics (MIT Press / ACL). Supplementary Material: 55 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15557 2026-08-07 cs.CL 版本更新 79%

SkillCorpus: Consolidating and Evaluating the Open Skill Ecosystem for Real-World LLM Agents

SkillCorpus:整合与评估面向现实世界大语言模型智能体的开放技能生态系统

Yanze Wang, Pengfei Yao, Tianyi Sun, Chuanrui Hu, Yan Xiao, Xiaotian Luo, Yunyun Han, Yifan Chen, Jun Sun, Yafeng Deng

专题命中 预训练与数据 :LLM(title,abstract);分类 cs.CL

AI总结 研究针对大语言模型智能体技能文件碎片化等问题,提出SkillCorpus框架,通过多阶段管道过滤技能并与检索选择堆栈配对,经多基准端到端评估,整合该框架能带来一致收益,明确了其对实际智能体任务的作用边界。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03999 2026-08-05 cs.SD cs.CL 新提交 79%

Agogic: Performance-Timed Music Tokens for LLM-Native Text-to-Symbolic-Music Generation

Agogic:适用于大语言模型原生文本到符号音乐生成的性能计时音乐 token

Junhao Chen, Mingjin Chen, Jingjia Mao, Lin Chen, Saining Zhang, Minglin Chen, Ruocheng Wu, Liaoyuan Fan, Wenyi Li, Mingju Gao, Henghaofan Zhang, Zhihao Li, Hao Zhao, Yufei Wang, Ruqi Huang

专题命中 预训练与数据 :LLM(title);language model(abstract);分类 cs.CL

AI总结 该研究固定模型规模、数据等变量,发现音乐 token 化的表示形式而非模型规模是影响文本到符号音乐生成分布保真度的关键,发布了相关工具链、模型及语料库,为该领域提供了可测量的表示形式研究基础。

Comments Project Page: https://yisuanwang.github.io/Agogic

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03599 2026-08-05 cs.CL 新提交 79%

Disentangling Language Modeling and Boundaries

解耦语言建模与边界

Mykola Haltiuk

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 该研究提出字节级语言模型可解耦下一字节分布与边界位置分布,设计实验验证该假设,主张采用字节级接口作为共享标准以实现模型间低成本的能力传递与边界重塑。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03260 2026-08-05 cs.LG 新提交 79%

ED-DiT: Physics-Guided Diffusion Pretraining for Transferable Molecular Representations from Electron Density

ED-DiT:用于从电子密度学习可迁移分子表示的物理引导扩散预训练

Liang Shuang, Haocheng Wang, Jiayi Song, Shuquan Ye, Ben Fei

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 本研究提出ED-DiT,一种物理引导的扩散Transformer,通过电子密度点云自监督预训练学习可迁移分子表示,在6项EDBench任务及低监督场景下均优于基线,展现出良好效果。

Comments 16 pages, 9 figures, 7 tables, including supplementary material

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00135 2026-08-04 cs.LG cs.CV 新提交 79%

Rethinking Pretraining for Specialized Design Data: Evidence from the JONES-19 Cultural Design Dataset

重新思考针对专业设计数据的预训练:来自JONES-19文化设计数据集的证据

Alexandros Haridis, Charles Zhou

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

AI总结 该研究以JONES-19文化设计数据集为对象,对比两种CNN训练策略,发现小型高质量设计数据集结合多裁剪采样,可替代大规模通用预训练,为专业设计领域的ML研究提供新思路。

Comments 2026 Design Computing and Cognition Conference

详情

展开后加载摘要…

URL PDF HTML 收藏