arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12460 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12460 篇

2306.02153 2023-06-06 cs.CL cs.LG cs.SD eess.AS 76%

Acoustic Word Embeddings for Untranscribed Target Languages with Continued Pretraining and Learned Pooling

Ramon Sanabria, Ondrej Klejch, Hao Tang, Sharon Goldwater

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG

Comments Accepted to Interspeech 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.08356 2023-06-01 cs.CV cs.AI cs.LG stat.ML 76%

OmniMAE: Single Model Masked Pretraining on Images and Videos

Rohit Girdhar, Alaaeldin El-Nouby, Mannat Singh, Kalyan Vasudev Alwala, Armand Joulin, Ishan Misra

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

Comments CVPR 2023. Code/models: https://github.com/facebookresearch/omnivore

详情

展开后加载摘要…

URL PDF HTML 收藏
2303.14396 2023-03-28 cs.CV cs.AI cs.LG 76%

IFSeg: Image-free Semantic Segmentation via Vision-Language Model

Sukmin Yun, Seong Hyeon Park, Paul Hongsuck Seo, Jinwoo Shin

专题命中 预训练与数据 :language model(title);分类 cs.AI、cs.LG

Comments Accepted to CVPR 2023

详情

展开后加载摘要…

URL PDF HTML 收藏
2301.01893 2023-01-06 cs.CV cs.AI cs.CL 76%

GIVL: Improving Geographical Inclusivity of Vision-Language Models with Pre-Training Methods

Da Yin, Feng Gao, Govind Thattai, Michael Johnston, Kai-Wei Chang

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.07036 2022-11-29 cs.CL cs.AI cs.CV cs.SD eess.AS eess.IV 76%

u-HuBERT: Unified Mixed-Modal Speech Pretraining And Zero-Shot Transfer to Unlabeled Modality

Wei-Ning Hsu, Bowen Shi

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

Comments NeurIPS 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.07889 2022-11-16 cs.LG cs.AI eess.SP 76%

Pretraining ECG Data with Adversarial Masking Improves Model Generalizability for Data-Scarce Tasks

Jessica Y. Bo, Hen-Wei Huang, Alvin Chan, Giovanni Traverso

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

Comments Extended Abstract presented at Machine Learning for Health (ML4H) symposium 2022, November 28th, 2022, New Orleans, United States & Virtual, http://www.ml4h.cc, 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10913 2022-10-25 cs.LG cs.AI 76%

Palm up: Playing in the Latent Manifold for Unsupervised Pretraining

Hao Liu, Tom Zahavy, Volodymyr Mnih, Satinder Singh

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

Comments Thirty-sixth Conference on Neural Information Processing Systems (NeurIPS 2022)

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.10049 2022-07-21 cs.CV cs.AI cs.LG 76%

Pretraining a Neural Network before Knowing Its Architecture

Boris Knyazev

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

Comments Accepted at ICML 2022 Workshop on Pre-training: Perspectives, Pitfalls, and Paths Forward, source code is available at https://github.com/facebookresearch/ppuda

详情

展开后加载摘要…

URL PDF HTML 收藏
2207.02272 2022-07-07 cs.CL cs.AI 76%

Pretraining on Interactions for Learning Grounded Affordance Representations

Jack Merullo, Dylan Ebert, Carsten Eickhoff, Ellie Pavlick

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

Comments *SEM 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.15868 2022-06-01 cs.CV cs.CL cs.LG 76%

CogVideo: Large-scale Pretraining for Text-to-Video Generation via Transformers

Wenyi Hong, Ming Ding, Wendi Zheng, Xinghan Liu, Jie Tang

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2203.07911 2022-04-21 cs.CL cs.LG 76%

Signal in Noise: Exploring Meaning Encoded in Random Character Sequences with Character-Aware Language Models

Mark Chu, Bhargav Srinivasa Desikan, Ethan O. Nadler, D. Ruggiero Lo Sardo, Elise Darragh-Ford, Douglas Guilbeault

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.07464 2022-04-18 cs.CL cs.AI 76%

Improving Pre-trained Language Models with Syntactic Dependency Prediction Task for Chinese Semantic Error Recognition

Bo Sun, Baoxin Wang, Wanxiang Che, Dayong Wu, Zhigang Chen, Ting Liu

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI

Comments 12 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.03542 2022-04-08 cs.CL cs.AI 76%

Leveraging pre-trained language models for conversational information seeking from text

Patrizio Bellan, Mauro Dragoni, Chiara Ghidini

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2104.05848 2021-10-19 cs.CL cs.AI 76%

Family of Origin and Family of Choice: Massively Parallel Lexiconized Iterative Pretraining for Severely Low Resource Machine Translation

Zhong Zhou, Alex Waibel

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.AI

Journal ref In Proceedings of the 3rd Workshop on Research in Computational Typology and Multilingual NLP of the 20th Conference of the North American Chapter of the Association for Computational Linguistics on Human Language Technologies in 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2103.06758 2021-04-13 cs.CL cs.AI 76%

ENTRUST: Argument Reframing with Language Models and Entailment

Tuhin Chakrabarty, Christopher Hidey, Smaranda Muresan

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI

Comments NAACL 2021

详情

展开后加载摘要…

URL PDF HTML 收藏
2101.11363 2021-01-28 cs.CL cs.LG 76%

KoreALBERT: Pretraining a Lite BERT Model for Korean Language Understanding

Hyunjae Lee, Jaewoong Yoon, Bonggyu Hwang, Seongho Joe, Seungjai Min, Youngjune Gwon

专题命中 预训练与数据 :pretraining(title);分类 cs.CL、cs.LG

Comments 7 pages, 1 figure, to be published in 25th International Conference on Pattern Recognition, ICPR 2020

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.06838 2019-07-17 cs.LG cs.AI cs.CV eess.IV 76%

Improved Reinforcement Learning through Imitation Learning Pretraining Towards Image-based Autonomous Driving

Tianqi Wang, Dong Eui Chang

专题命中 预训练与数据 :pretraining(title);分类 cs.AI、cs.LG

Comments 5 pages, 2019 19th International Conference on Control, Automation and Systems (ICCAS 2019)

详情

展开后加载摘要…

URL PDF HTML 收藏
1805.06503 2018-05-18 cs.CL cs.AI 76%

Weight Initialization in Neural Language Models

Ameet Deshpande, Vedant Somani

专题命中 预训练与数据 :language model(title);分类 cs.CL、cs.AI

Comments 17 pages, 20 figures and/or tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10465 2026-08-11 cs.LG cs.AI cs.CL 75%

Superposition Yields Robust Neural Scaling

叠加产生稳健的神经扩展

Yizhou Liu, Ziming Liu, Jeff Gore

机构 * Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究发现表示叠加是神经扩展定律的核心驱动因素,揭示了损失与模型规模之间的反比关系。

Comments Best Paper Runner-up at NeurIPS 2025

Journal ref Advances in Neural Information Processing Systems 38 (2025) 159269--159305

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00417 2026-07-29 cs.LG cs.AI cs.CL cs.CV 版本更新 75%

Deep Delta Learning

深度delta学习

Yifan Zhang, Yifeng Liu, Mengdi Wang, Quanquan Gu

机构 * Princeton University(普林斯顿大学) University of California Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出深度delta学习,通过选择性重写残差内容提升语言模型性能,改进了Transformer残差流的更新机制。

Comments Project Page: https://github.com/yifanzhang-pro/deep-delta-learning

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24276 2026-07-28 cs.CL cs.AI cs.LG 新提交 75%

The Tokenizer Tax: Quantifying and Explaining the Cross-Lingual Cost of Subword Tokenization for Indian Languages

分词器代价:量化并解释印度语言子词分词的跨语言成本

Priyansh Srivastava

机构 * Sirena Ai India(印度Sirena人工智能公司)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究量化印度语言子词分词跨语言成本,测量六种分词器在十四种语言上的分词丰富度,揭示字节对合并失败是高代价主因,多语言分词器可降低代价,还发现分词与阅读理解性能关联受语言资源可用性影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20310 2026-07-23 q-bio.NC 新提交 75%

Capturing Inner Experience At Scale: An AI Interviewer Co-Developed with the Founder of a Landmark Phenomenological Method

大规模捕捉内心体验:与一种具有里程碑意义的现象学方法的创始人共同开发的人工智能访谈者

Jona Carmon, Clara Bersch, Charles Fernyhough, Russell T. Hurlburt, Simone Kühn

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究聚焦于主观体验研究中深度与规模的权衡问题,核心方法是将描述性经验抽样法转化为人工智能访谈者的推理架构,主要贡献是开发出首个基于既定方法研究内心体验的人工智能访谈者及相关平台。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02776 2026-07-14 cs.RO 版本更新 75%

XR-1: Towards Versatile Vision-Language-Action Models via Learning Unified Vision-Motion Representations

XR-1:通过学习统一的视觉-运动表示实现多功能的视觉-语言-动作模型

Shichao Fan, Kun Wu, Zhengping Che, Xinhua Wang, Di Wu, Fei Liao, Ning Liu, Yixue Zhang, Zhen Zhao, Zhiyuan Xu, Meng Li, Qingjie Liu, Shanghang Zhang, Min Wan, Jian Tang

机构 * Beijing Innovation Center of Humanoid Robotics, Beijing, China(北京人形机器人创新中心,北京,中国) School of Mechanical Engineering and Automation, Beihang University, Beijing, China(北京航空航天大学机械工程及自动化学院,北京,中国) State Key Laboratory of Virtual Reality Technology and Systems, SCSE, Beihang University, Beijing, China(虚拟现实技术与系统国家重点实验室,SCSE,北京航空航天大学,北京,中国) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University, Beijing, China(多媒体信息处理国家重点实验室,计算机科学学院,北京大学,北京,中国)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 XR-1通过学习统一的视觉-运动表示,解决视觉-语言-动作模型在低级动作生成和跨数据源领域差距的挑战,提出三阶段训练方法并验证了其在多种机器人和任务上的优越性能。

Comments Accepted to ICML2026 as Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04939 2026-07-07 cs.SE 新提交 75%

Teaching LLMs a Low-Resource Language: Enhancing Code Completion in Pharo

教大语言模型一种低资源语言:增强Pharo中的代码补全

Kilian Kier, Alessandro Giagnorio, Omar AbedelKader, Oleksandr Zaitsev, Robert Peharz, Romain Robbes, Gabriele Bavota, Stéphane Ducasse

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究将基于大语言模型的代码补全引入低资源语言Pharo,介绍结合特定数据处理、预训练与微调的端到端流程,引入基准测试,实证表明专用模型性能超越原模型及更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01218 2026-07-02 cs.CL cs.AI cs.LG 新提交 75%

The State-Prediction Separation Hypothesis

状态-预测分离假说

Giovanni Monea, Nathan Godey, Kianté Brantley, Yoav Artzi

机构 * Cornell University(康奈尔大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出状态-预测分离假说,通过双流Transformer解耦状态存储与下一词预测,在预训练中提升数据与计算效率,下游任务平均提升2-3个百分点。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.26122 2026-06-26 cs.CV 新提交 75%

DocArena: Turning Raw Documents into Controllable Training Environments for Document Search Agents

DocArena:将原始文档转化为可控的训练环境用于文档搜索代理

Jiamian Wang, Ruiyi Zhang, Tong Yu, Jing Shi, Samyadeep Basu, Rajiv Jain, Zhiqiang Tao, Tong Sun

机构 * Rochester Institute of Technology(罗切斯特理工学院) Adobe Research(Adobe研究院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn)

AI总结 提出DocArena自动化流程,通过多模态文档结构化、推理型QA对构建和质量控制,生成可控训练环境,使基于文本LLM的搜索代理在多模态文档检索和问答中取得最佳性能。

Comments search agent for documents

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20173 2026-06-19 cs.SE 新提交 75%

Qiskit Code Migration with LLMs

使用大语言模型进行Qiskit代码迁移

Jose Manuel Suarez, Luis Mariano Bibbo, Joaquin Bogado, Alenandro Fernandez

专题命中 预训练与数据 :LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 针对量子软件开发套件版本演进导致的代码维护问题,提出结合大语言模型与检索增强生成(RAG)的混合方法,利用自动生成的迁移场景分类体系引导模型,实现Qiskit代码跨版本自动迁移,有效减少幻觉并提升迁移建议质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15551 2026-06-18 cs.CL cs.AI cs.LG 版本更新 75%

Rethinking Cross-lingual Gaps from a Statistical Viewpoint

从统计视角重新思考跨语言差距

Vihari Piratla, Purvam Jain, Darshan Singh, Trevor Cohn, Preethi Jyothi, Partha Talukdar

机构 * Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出跨语言差距源于目标语言响应方差,通过形式化偏差和无偏误差,并采用推理时集成方法降低方差,使跨语言迁移得分提升8%-50%以上。

Comments 30 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18237 2026-06-17 cs.CL cs.AI cs.LG 新提交 75%

ReproRepo: Scaling Reproducibility Audits with GitHub Repository Issues

ReproRepo: 利用 GitHub 仓库问题扩展可重复性审计

Shanda Li, Qiuhong Anna Wei, Jingwu Tang, Valerie Chen, Nihar B Shah, Tim Dettmers, Yiming Yang, Ameet Talwalkar

机构 * School of Computer Science, Carnegie Mellon University(卡内基梅隆大学计算机科学学院) Datadog

专题命中 预训练与数据 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 提出 ReproRepo 框架,利用 GitHub issues 作为监督信号,对 1149 篇论文进行可重复性评估,发现 Codex with GPT-5.5 能识别约 90% 论文的语义相关复现问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08289 2026-06-16 cs.CR 版本更新 75%

MIRAGE: Misleading Retrieval-Augmented Generation via Black-box and Query-agnostic Poisoning Attacks

MIRAGE: 通过黑盒与查询无关的投毒攻击误导检索增强生成

Tailun Chen, Yu He, Yan Wang, Shuo Shao, Haolun Zheng, Zhihao Liu, Jinfeng Li, Zhizhen Qin, Yuefeng Chen, Zhixuan Chu, Zhan Qin, Kui Ren

专题命中 预训练与数据 :LLM(abstract,abstract_cn);preference optimization(abstract)

AI总结 提出MIRAGE,一种在黑盒和查询无关场景下通过多阶段投毒管道攻击RAG系统的方法,利用代理模型反馈、人物驱动查询合成、语义锚定和对抗性TPO优化,显著提升攻击效果和隐蔽性。

详情

展开后加载摘要…

URL PDF HTML 收藏