arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12486 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2306.05432 2023-06-12 cs.CL cs.AI cs.LG eess.AS 75%

Towards End-to-end Speech-to-text Summarization

Raul Monteiro, Diogo Pernes

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the 26th International Conference of Text, Speech and Dialogue (TSD2023)

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.14293 2023-06-09 cs.CL cs.AI cs.LG 75%

Controlled Text Generation with Natural Language Instructions

Wangchunshu Zhou, Yuchen Eleanor Jiang, Ethan Wilcox, Ryan Cotterell, Mrinmaya Sachan

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICML 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.01761 2023-06-06 cs.CL cs.AI cs.LG 75%

Distinguishing Human Generated Text From ChatGPT Generated Text Using Machine Learning

Niful Islam, Debopom Sutradhar, Humaira Noor, Jarin Tasnim Raya, Monowara Tabassum Maisha, Dewan Md Farid

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.09434 2023-05-17 cs.SE 75%

Chatting with GPT-3 for Zero-Shot Human-Like Mobile Automated GUI Testing

Zhe Liu, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Xing Che, Dandan Wang, Qing Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02320 2023-05-04 cs.IR 75%

Generating Synthetic Documents for Cross-Encoder Re-Rankers: A Comparative Study of ChatGPT and Human Experts

Arian Askari, Mohammad Aliannejadi, Evangelos Kanoulas, Suzan Verberne

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17276 2023-03-31 cs.AI cs.CL cs.HC cs.LG 75%

Humans in Humans Out: On GPT Converging Toward Common Sense in both Success and Failure

Philipp Koralus, Vincent Wang-Maścianica

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00779 2022-12-21 cs.CL cs.AI cs.LG 75%

FRAME: Evaluating Rationale-Label Consistency Metrics for Free-Text Rationales

Aaron Chan, Shaoliang Nie, Liang Tan, Xiaochang Peng, Hamed Firooz, Maziar Sanjabi, Xiang Ren

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments BlackboxNLP Workshop at EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05055 2022-11-18 cs.LG cs.AI cs.CL 75%

Data Distributional Properties Drive Emergent In-Context Learning in Transformers

Stephanie C. Y. Chan, Adam Santoro, Andrew K. Lampinen, Jane X. Wang, Aaditya Singh, Pierre H. Richemond, Jay McClelland, Felix Hill

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2022 (Oral). Code is available at: https://github.com/deepmind/emergent_in_context_learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11399 2022-11-17 cs.CL cs.AI cs.LG 75%

Transcending Scaling Laws with 0.1% Extra Compute

Yi Tay, Jason Wei, Hyung Won Chung, Vinh Q. Tran, David R. So, Siamak Shakeri, Xavier Garcia, Huaixiu Steven Zheng, Jinfeng Rao, Aakanksha Chowdhery, Denny Zhou, Donald Metzler, Slav Petrov, Neil Houlsby, Quoc V. Le, Mostafa Dehghani

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments V2 has updated references/related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07074 2022-10-17 cs.CL cs.AI cs.LG 75%

CLASP: Few-Shot Cross-Lingual Data Augmentation for Semantic Parsing

Andy Rosenbaum, Saleh Soltan, Wael Hamza, Amir Saffari, Marco Damonte, Isabel Groves

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to AACL-IJCNLP 2022: The 2nd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 12th International Joint Conference on Natural Language Processing, November 20-23, 2022. See https://www.aacl2022.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04024 2022-08-09 cs.HC 75%

Social Simulacra: Creating Populated Prototypes for Social Computing Systems

Joon Sung Park, Lindsay Popowski, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)

Comments This work will appear in the 35th Annual ACM Symposium on User Interface Software and Technology (UIST '22)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08896 2022-06-20 cs.NE 75%

Evolution through Large Models

Joel Lehman, Jonathan Gordon, Shawn Jain, Kamal Ndousse, Cathy Yeh, Kenneth O. Stanley

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.13344 2022-03-28 cs.CL cs.AI cs.LG 75%

Linking Emergent and Natural Languages via Corpus Transfer

Shunyu Yao, Mo Yu, Yang Zhang, Karthik R Narasimhan, Joshua B. Tenenbaum, Chuang Gan

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2022 Spotlight. Github repo: https://github.com/ysymyth/ec-nl

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.10684 2021-08-10 cs.CL cs.AI cs.LG 75%

Let's Stop Incorrect Comparisons in End-to-end Relation Extraction!

Bruno Taillé, Vincent Guigue, Geoffrey Scoutheeten, Patrick Gallinari

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11842 2025-10-15 cs.LG cs.CL 74%

Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities

Urs Spiegelhalter, Jörg K. H. Franke, Frank Hutter

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Open-Sci Collective(开放科学集体) LAION Prior Labs(Prior实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG;foundation model(comments)

Comments Presented at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Continual and Compatible Foundation Model Updates (CCFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02268 2023-11-07 cs.LG cs.AI 74%

LLMs-augmented Contextual Bandit

Ali Baheri, Cecilia O. Alm

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG;foundation model(comments)

Comments Accepted by the Foundation Models for Decision Making workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04704 2023-10-10 cs.CV cs.AI cs.CL 74%

Prompt Pre-Training with Twenty-Thousand Classes for Open-Vocabulary Visual Recognition

Shuhuai Ren, Aston Zhang, Yi Zhu, Shuai Zhang, Shuai Zheng, Mu Li, Alex Smola, Xu Sun

专题命中 预训练与数据 :pretraining(abstract,comments);language model(abstract);分类 cs.CL、cs.AI

Comments Code is available at https://github.com/amazon-science/prompt-pretraining

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26576 2026-08-28 cs.CL 新提交 74%

Double Trouble: Bilingual Pretraining Leaves Language-Conditioned Effects in Shared-Language Representations

双重麻烦:双语预训练会在共享语言表征中留下语言条件效应

Anjishnu Mukherjee, Ziwei Zhu, Antonios Anastasopoulos

机构 * George Mason University(乔治梅森大学)

专题命中 预训练与数据 :pretraining(title);分类 cs.CL

AI总结 该研究发现仅解码器多语言模型中,双语预训练会使共享语言的深层隐藏状态表征存在差异,嵌入对齐无法掩盖该差异,这对依赖对齐模型的下游研究有重要影响。

Comments Published as a conference paper at EMNLP 2026 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04553 2026-08-11 cs.CV cs.LG 版本更新 74%

From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition

从假到真:基于平衡合成图像的预训练以防止图像识别中的虚假相关性

Maan Qraitem, Kate Saenko, Bryan A. Plummer

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对图像识别模型易受虚假相关性影响的问题,提出从假到真(FFR)两步训练流程,先在平衡合成数据预训练,再用真实数据微调,在三个数据集上使最差组准确率较SOTA提升最高20%

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04213 2026-08-06 cs.LG 新提交 74%

Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

基于LeJEPA自监督预训练的仅注意力白盒Transformer

Yang Bai, Linyuan Wang, Haoyang Jiang, Nuolin Sun, Libin Hou, Bin Yan

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究提出基于LeJEPA自监督预训练的仅注意力白盒Transformer,减少约31%参数,在CIFAR-10、CIFAR-100上实现与原模型相当的准确率,还发现标准ViT中MLP模块存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02084 2026-08-04 cs.SE cs.CR cs.LG 新提交 74%

Pretraining on Call Graphs: When Binary Analysis Tasks Profit From Context

在调用图上进行预训练:当二进制分析任务从上下文获益时

Samuel Valenzuela, Johannes Kinder

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究探究调用图对二进制分析任务的影响,发现结合过程间上下文可提升嵌入鲁棒性但未必泛化到下游任务,且对命名空间相关函数更有益。

Comments 12 pages, 5 figures. Accepted at ICPC '26

Journal ref Proceedings of the 34th IEEE/ACM International Conference on Program Comprehension, pp. 14-25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 74%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01153 2026-08-04 cs.CL 新提交 74%

Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models

面向泰米尔语语言模型的形态学感知可逆语义分词与分层词组合

Anand Murugan

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 该研究针对泰米尔语,提出结合ThamizhiMorph的形态系统与分层词组合方法,在固定小模型预算下提升翻译性能,同时大幅降低序列长度与推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18445 2026-07-22 cs.CR cs.AI 新提交 74%

ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration

ChainMark:具有闭式校准的无模型大语言模型水印

Chengheng Li-Chen, Kyuhee Kim

专题命中 预训练与数据 :LLM(title);分类 cs.AI

AI总结 研究针对合成文本标记需求,提出ChainMark无模型大语言模型水印方法,通过特定方式划分词汇表状态并强制马尔可夫转移,检测器无需访问语言模型,推导相关闭式,证明鲁棒性阈值,在多模型和领域中优于其他方法,可恢复目标误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14051 2026-07-16 cs.CL 新提交 74%

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

回溯:重放预测市场以评估大语言模型预测器

Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL

AI总结 研究针对大语言模型预测器评估中答案泄露问题,提出Hindcast方法,通过设定特定过去日期评分,重放预测市场与Reddit快照,让模型读取特定时间前帖子并评分,解决泄露问题,且能随模型改进在新市场重新评估,明确检索在不同情况的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08077 2026-07-10 cs.LG 新提交 74%

Modular Pretraining Enables Access Control

模块化预训练实现访问控制

Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04941 2026-07-07 cs.CL cs.SD eess.AS 新提交 74%

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

DuplexChat:大规模构建用于口语对话语言建模的分离说话者全双工对话语音

Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学,日本) National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 针对现有大规模公共语音语料库不适用于全双工口语对话模型训练的问题,提出DuplexChat及DuplexChat-Pipe,通过特定流程构建分离说话者全双工对话语音,产出多语言语料库。

Comments 4 pages, 1 figures, submitted to SLT demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21271 2026-06-23 cs.LG 新提交 74%

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

通过占据覆盖最大化进行强化学习的无奖励预训练

Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13161 2026-06-23 cs.CL 74%

Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training

Nemotron-CLIMB: 基于聚类的迭代数据混合自助法用于语言模型预训练

Shizhe Diao, Yu Yang, Yonggan Fu, Xin Dong, Dan Su, Markus Kliegl, Zijia Chen, Peter Belcak, Yoshi Suhara, Hongxu Yin, Mostofa Patwary, Yingyan Lin, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 本文提出Nemotron-CLIMB方法,通过聚类和迭代优化提升预训练数据混合效果,实验显示其在预训练性能上优于现有模型,同时提供了一个大规模数据集用于研究。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17445 2026-06-17 cs.LG cond-mat.mtrl-sci physics.chem-ph 新提交 74%

Toward Controllable Catalyst Inverse Design via Large-Scale Autoregressive Pretraining

面向可控催化剂逆向设计的大规模自回归预训练

Dong Hyeon Mok, Jonggeol Na, Seoin Back

机构 * Department of Chemical and Biomolecular Engineering, Institute of Emergent Materials, Sogang University(化学与生物分子工程系,新兴材料研究所,首尔大学) Department of Chemical Engineering and Materials Science, Ewha Womans University(化学工程与材料科学系,成实女子大学) Department of Chemical Engineering, Graduate Program in System Health Science and Engineering, Ewha Womans University(化学工程系,系统健康科学与工程研究生院,成实女子大学) Institute for Multiscale Matter and Systems (IMMS), Ewha Womans University(多尺度物质与系统研究所(IMMS),成实女子大学) KU-KIST Graduate School of Converging Science and Technology, Korea University(KU-KIST融合科学与技术研究生院,韩国大学) Department of Integrated Energy Engineering, Korea University(整合能源工程系,韩国大学) Center for Hydrogen and Fuel Cells, Korea Institute of Science and Technology(KIST)(氢气与燃料电池中心,韩国科学技术院(KIST))

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出基于生成式预训练Transformer的条件催化剂生成模型,通过大规模预训练和微调实现高结构有效性和条件匹配率,显著提升筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏