arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 139420 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2305.09434 2023-05-17 cs.SE 75%

Chatting with GPT-3 for Zero-Shot Human-Like Mobile Automated GUI Testing

Zhe Liu, Chunyang Chen, Junjie Wang, Mengzhuo Chen, Boyu Wu, Xing Che, Dandan Wang, Qing Wang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.02320 2023-05-04 cs.IR 75%

Generating Synthetic Documents for Cross-Encoder Re-Rankers: A Comparative Study of ChatGPT and Human Experts

Arian Askari, Mohammad Aliannejadi, Evangelos Kanoulas, Suzan Verberne

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.17276 2023-03-31 cs.AI cs.CL cs.HC cs.LG 75%

Humans in Humans Out: On GPT Converging Toward Common Sense in both Success and Failure

Philipp Koralus, Vincent Wang-Maścianica

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.00779 2022-12-21 cs.CL cs.AI cs.LG 75%

FRAME: Evaluating Rationale-Label Consistency Metrics for Free-Text Rationales

Aaron Chan, Shaoliang Nie, Liang Tan, Xiaochang Peng, Hamed Firooz, Maziar Sanjabi, Xiang Ren

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments BlackboxNLP Workshop at EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.05055 2022-11-18 cs.LG cs.AI cs.CL 75%

Data Distributional Properties Drive Emergent In-Context Learning in Transformers

Stephanie C. Y. Chan, Adam Santoro, Andrew K. Lampinen, Jane X. Wang, Aaditya Singh, Pierre H. Richemond, Jay McClelland, Felix Hill

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at NeurIPS 2022 (Oral). Code is available at: https://github.com/deepmind/emergent_in_context_learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.11399 2022-11-17 cs.CL cs.AI cs.LG 75%

Transcending Scaling Laws with 0.1% Extra Compute

Yi Tay, Jason Wei, Hyung Won Chung, Vinh Q. Tran, David R. So, Siamak Shakeri, Xavier Garcia, Huaixiu Steven Zheng, Jinfeng Rao, Aakanksha Chowdhery, Denny Zhou, Donald Metzler, Slav Petrov, Neil Houlsby, Quoc V. Le, Mostafa Dehghani

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments V2 has updated references/related work

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.07074 2022-10-17 cs.CL cs.AI cs.LG 75%

CLASP: Few-Shot Cross-Lingual Data Augmentation for Semantic Parsing

Andy Rosenbaum, Saleh Soltan, Wael Hamza, Amir Saffari, Marco Damonte, Isabel Groves

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to AACL-IJCNLP 2022: The 2nd Conference of the Asia-Pacific Chapter of the Association for Computational Linguistics and the 12th International Joint Conference on Natural Language Processing, November 20-23, 2022. See https://www.aacl2022.org/

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.04024 2022-08-09 cs.HC 75%

Social Simulacra: Creating Populated Prototypes for Social Computing Systems

Joon Sung Park, Lindsay Popowski, Carrie J. Cai, Meredith Ringel Morris, Percy Liang, Michael S. Bernstein

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract)

Comments This work will appear in the 35th Annual ACM Symposium on User Interface Software and Technology (UIST '22)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08896 2022-06-20 cs.NE 75%

Evolution through Large Models

Joel Lehman, Jonathan Gordon, Shawn Jain, Kamal Ndousse, Cathy Yeh, Kenneth O. Stanley

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.13344 2022-03-28 cs.CL cs.AI cs.LG 75%

Linking Emergent and Natural Languages via Corpus Transfer

Shunyu Yao, Mo Yu, Yang Zhang, Karthik R Narasimhan, Joshua B. Tenenbaum, Chuang Gan

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments ICLR 2022 Spotlight. Github repo: https://github.com/ysymyth/ec-nl

详情

展开后加载摘要…

URL PDF HTML 收藏
2009.10684 2021-08-10 cs.CL cs.AI cs.LG 75%

Let's Stop Incorrect Comparisons in End-to-end Relation Extraction!

Bruno Taillé, Vincent Guigue, Geoffrey Scoutheeten, Patrick Gallinari

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted at EMNLP 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11842 2025-10-15 cs.LG cs.CL 74%

Balancing Synthetic Data and Replay for Enhancing Task-Specific Capabilities

Urs Spiegelhalter, Jörg K. H. Franke, Frank Hutter

机构 * University of Freiburg(弗赖堡大学) ELLIS Institute Tübingen(图宾根ELLIS研究所) Open-Sci Collective(开放科学集体) LAION Prior Labs(Prior实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG;foundation model(comments)

Comments Presented at 39th Conference on Neural Information Processing Systems (NeurIPS 2025) Workshop on Continual and Compatible Foundation Model Updates (CCFM)

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02268 2023-11-07 cs.LG cs.AI 74%

LLMs-augmented Contextual Bandit

Ali Baheri, Cecilia O. Alm

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG;foundation model(comments)

Comments Accepted by the Foundation Models for Decision Making workshop at NeurIPS 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2304.04704 2023-10-10 cs.CV cs.AI cs.CL 74%

Prompt Pre-Training with Twenty-Thousand Classes for Open-Vocabulary Visual Recognition

Shuhuai Ren, Aston Zhang, Yi Zhu, Shuai Zhang, Shuai Zheng, Mu Li, Alex Smola, Xu Sun

专题命中 预训练与数据 :pretraining(abstract,comments);language model(abstract);分类 cs.CL、cs.AI

Comments Code is available at https://github.com/amazon-science/prompt-pretraining

详情

展开后加载摘要…

URL PDF HTML 收藏
2308.04553 2026-08-11 cs.CV cs.LG 版本更新 74%

From Fake to Real: Pretraining on Balanced Synthetic Images to Prevent Spurious Correlations in Image Recognition

从假到真:基于平衡合成图像的预训练以防止图像识别中的虚假相关性

Maan Qraitem, Kate Saenko, Bryan A. Plummer

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对图像识别模型易受虚假相关性影响的问题,提出从假到真(FFR)两步训练流程,先在平衡合成数据预训练,再用真实数据微调,在三个数据集上使最差组准确率较SOTA提升最高20%

Comments Accepted at ECCV 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04213 2026-08-06 cs.LG 新提交 74%

Attention-Only White-Box Transformer via LeJEPA-Based Self-Supervised Pretraining

基于LeJEPA自监督预训练的仅注意力白盒Transformer

Yang Bai, Linyuan Wang, Haoyang Jiang, Nuolin Sun, Libin Hou, Bin Yan

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究提出基于LeJEPA自监督预训练的仅注意力白盒Transformer,减少约31%参数,在CIFAR-10、CIFAR-100上实现与原模型相当的准确率,还发现标准ViT中MLP模块存在冗余。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.02084 2026-08-04 cs.SE cs.CR cs.LG 新提交 74%

Pretraining on Call Graphs: When Binary Analysis Tasks Profit From Context

在调用图上进行预训练:当二进制分析任务从上下文获益时

Samuel Valenzuela, Johannes Kinder

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本研究探究调用图对二进制分析任务的影响,发现结合过程间上下文可提升嵌入鲁棒性但未必泛化到下游任务,且对命名空间相关函数更有益。

Comments 12 pages, 5 figures. Accepted at ICPC '26

Journal ref Proceedings of the 34th IEEE/ACM International Conference on Program Comprehension, pp. 14-25, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01881 2026-08-04 cs.MM cs.AI 新提交 74%

Hear, Invoke, and Understand: A Skill-Calling Multimodal Agent for Large Audio Language Models

聆听、调用与理解:面向大型音频语言模型的技能调用多模态智能体

Yuwen Wang, Tian-Hao Zhang, Minghao Cai, Yilin Ren, Ziyang Jiang, Xin Wang, Zhichao Wang, Pan Zhou, Kun Zhan, Xinyuan Qian

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本研究针对工具交互型音频推理问题,开发了SpeechAgent-R智能体,构建了HIU-Corpus与HIU-Bench,经实验验证其在分布内外任务上均较基础模型有显著性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01153 2026-08-04 cs.CL 新提交 74%

Morphology Aware Reversible Semantic Tokenization and Hierarchical Word Composition for Tamil Language Models

面向泰米尔语语言模型的形态学感知可逆语义分词与分层词组合

Anand Murugan

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 该研究针对泰米尔语,提出结合ThamizhiMorph的形态系统与分层词组合方法,在固定小模型预算下提升翻译性能,同时大幅降低序列长度与推理成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18445 2026-07-22 cs.CR cs.AI 新提交 74%

ChainMark: Model-Free LLM Watermarking with Closed-Form Calibration

ChainMark:具有闭式校准的无模型大语言模型水印

Chengheng Li-Chen, Kyuhee Kim

专题命中 预训练与数据 :LLM(title);分类 cs.AI

AI总结 研究针对合成文本标记需求,提出ChainMark无模型大语言模型水印方法,通过特定方式划分词汇表状态并强制马尔可夫转移,检测器无需访问语言模型,推导相关闭式,证明鲁棒性阈值,在多模型和领域中优于其他方法,可恢复目标误报率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14051 2026-07-16 cs.CL 新提交 74%

Hindcast: Replaying Prediction Markets to Evaluate LLM Forecasters

回溯:重放预测市场以评估大语言模型预测器

Xiao Ye, Jacob Dineen, Evan Zhu, Shijie Lu, Kevin Song, Ben Zhou

机构 * School of Computing and Augmented Intelligence, Arizona State University(亚利桑那州立大学计算与增强智能学院)

专题命中 预训练与数据 :LLM(title);分类 cs.CL

AI总结 研究针对大语言模型预测器评估中答案泄露问题,提出Hindcast方法,通过设定特定过去日期评分,重放预测市场与Reddit快照,让模型读取特定时间前帖子并评分,解决泄露问题,且能随模型改进在新市场重新评估,明确检索在不同情况的作用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08077 2026-07-10 cs.LG 新提交 74%

Modular Pretraining Enables Access Control

模块化预训练实现访问控制

Ethan Roland, Murat Cubuktepe, Erick Martinez, Stijn Servaes, Keenan Pepper, Mike Vaiana, Diogo Schwerz de Lucena, Judd Rosenblatt, Addie Foote, Cem Anil, Alex Cloud

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对人工智能两用困境及多模型部署成本高问题,提出梯度路由辅助模块(GRAM)预训练方法,能在推理时消融模块功能。实验显示其可有效禁用目标功能且抗微调恢复,训练成本低,紧密跟踪数据过滤。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04941 2026-07-07 cs.CL cs.SD eess.AS 新提交 74%

DuplexChat: Constructing Speaker-Separated Full-Duplex Dialogue Speech at Scale for Spoken Dialogue Language Modeling

DuplexChat:大规模构建用于口语对话语言建模的分离说话者全双工对话语音

Wataru Nakata, Yuki Saito, Hiroshi Saruwatari

机构 * The University of Tokyo, Japan(东京大学,日本) National Institute of Advanced Industrial Science and Technology, Japan(日本国家先进工业科学与技术研究院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 针对现有大规模公共语音语料库不适用于全双工口语对话模型训练的问题,提出DuplexChat及DuplexChat-Pipe,通过特定流程构建分离说话者全双工对话语音,产出多语言语料库。

Comments 4 pages, 1 figures, submitted to SLT demo track

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21271 2026-06-23 cs.LG 新提交 74%

Reward-free Pretraining for Reinforcement Learning via Occupancy Coverage Maximization

通过占据覆盖最大化进行强化学习的无奖励预训练

Marco Pratticò, Pietro Novelli, Massimiliano Pontil, Carlo Ciliberto

机构 * Computational Statistics and Machine Learning - Istituto Italiano di Tecnologia(计算统计与机器学习 - 意大利技术研究院) AI Centre, Computer Science Department, University College London(人工智能中心,计算机科学系,伦敦大学学院)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出一种无奖励预训练方法ROVER,通过最大化状态占据测度的覆盖来学习可迁移探索策略,在稀疏奖励下游任务中快速适应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13161 2026-06-23 cs.CL 74%

Nemotron-CLIMB: CLustering-based Iterative Data Mixture Bootstrapping for Language Model Pre-training

Nemotron-CLIMB: 基于聚类的迭代数据混合自助法用于语言模型预训练

Shizhe Diao, Yu Yang, Yonggan Fu, Xin Dong, Dan Su, Markus Kliegl, Zijia Chen, Peter Belcak, Yoshi Suhara, Hongxu Yin, Mostofa Patwary, Yingyan Lin, Jan Kautz, Pavlo Molchanov

机构 * NVIDIA Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 本文提出Nemotron-CLIMB方法,通过聚类和迭代优化提升预训练数据混合效果,实验显示其在预训练性能上优于现有模型,同时提供了一个大规模数据集用于研究。

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17445 2026-06-17 cs.LG cond-mat.mtrl-sci physics.chem-ph 新提交 74%

Toward Controllable Catalyst Inverse Design via Large-Scale Autoregressive Pretraining

面向可控催化剂逆向设计的大规模自回归预训练

Dong Hyeon Mok, Jonggeol Na, Seoin Back

机构 * Department of Chemical and Biomolecular Engineering, Institute of Emergent Materials, Sogang University(化学与生物分子工程系,新兴材料研究所,首尔大学) Department of Chemical Engineering and Materials Science, Ewha Womans University(化学工程与材料科学系,成实女子大学) Department of Chemical Engineering, Graduate Program in System Health Science and Engineering, Ewha Womans University(化学工程系,系统健康科学与工程研究生院,成实女子大学) Institute for Multiscale Matter and Systems (IMMS), Ewha Womans University(多尺度物质与系统研究所(IMMS),成实女子大学) KU-KIST Graduate School of Converging Science and Technology, Korea University(KU-KIST融合科学与技术研究生院,韩国大学) Department of Integrated Energy Engineering, Korea University(整合能源工程系,韩国大学) Center for Hydrogen and Fuel Cells, Korea Institute of Science and Technology(KIST)(氢气与燃料电池中心,韩国科学技术院(KIST))

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 提出基于生成式预训练Transformer的条件催化剂生成模型,通过大规模预训练和微调实现高结构有效性和条件匹配率,显著提升筛选效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12927 2026-06-08 cs.LG cs.IT math.IT 版本更新 74%

Trace Reconstruction with Language Models

基于语言模型的迹重建

Franziska Weindel, Michael Girsch, Reinhard Heckel

机构 * School of Computation, Information and Technology, Technical University of Munich(计算、信息与技术学院,慕尼黑技术大学) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 预训练与数据 :language model(title);分类 cs.LG

AI总结 提出TReconLM解码器仅变换器,将迹重建视为下一个标记预测任务,在合成和真实数据上预训练和微调,显著优于现有算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.19842 2026-05-25 eess.SP cs.LG 74%

A comprehensive evaluation of pretraining strategies for channel-agnostic contrastive self-supervision of biosignals

生物信号通道无关对比自监督预训练策略的综合评估

Thea Brüsch, Mikkel N. Schmidt, Tommy S. Alstrøm

机构 * Department of Applied Mathematics and Computer Science(应用数学和计算机科学系)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 针对生物信号通道可变性问题,提出对比随机导联编码(CRLC)方法,通过随机选择输入通道子集创建正对,在EEG和ECG数据上预训练并微调,在通道无关设置下优于现有策略,并达到与最先进参考模型相当的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.19714 2026-05-20 cs.CL 74%

LLM-Based Financial Sentiment Analysis in Arabic: Evidence from Saudi Markets

基于大型语言模型的阿拉伯语金融情绪分析:来自沙特市场的证据

Mona H. Albaqawi, Eman M. Albalkhi, Joud A. Albaiti, Enrico Lopedoto

机构 * George Mason University(乔治·马歇尔大学) Damascus University(大马士革大学) University of Jeddah(朱德赫大学) City, St George's, University of London(伦敦城市大学)

专题命中 预训练与数据 :LLM(title);分类 cs.CL

AI总结 本文提出了一种针对沙特市场的阿拉伯语NLP框架,用于大规模金融情绪分析,结合官方财务新闻和社会媒体数据,通过多阶段流程构建阿拉伯语财务语料库,并利用Transformer-based NER和定制公司词典进行情绪标注,最终实现了对公司层面的情绪聚合和情绪动态分析。

Comments Accepted at the 7th Workshop on Open-Source Arabic Corpora and Processing Tools (OSACT7), co-located with LREC 2026, Palma de Mallorca, Spain, May 2026. ISBN: 978-2-493814-52-4

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18774 2026-05-20 cs.IR cs.AI 74%

M3DocDep: Multi-modal, Multi-page, Multi-document Dependency Chunking with Large Vision-Language Models

M3DocDep: 多模态、多页、多文档依赖分块方法基于大视觉-语言模型

Joongmin Shin, Jeongbae Park, Jaehyung Seo, Heuiseok Lim

机构 * Human-inspired AI Research, Korea University(韩国大学人智AI研究所) Computer Science and Engineering, Konkuk University(konkuk大学计算机科学与工程系) Department of Computer Science and Engineering, Korea University(韩国大学计算机科学与工程系)

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本文提出M3DocDep,一种基于大视觉-语言模型的多模态、多页、多文档依赖分块方法,通过恢复块级依赖并构建分块,提高了长多页多模态文档的检索和问答质量。

Comments Accepted to CVPR2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏