arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2212.05058 2022-12-13 cs.CY cs.AI 85%

Structured Like a Language Model: Analysing AI as an Automated Subject

Liam Magee, Vanicka Arora, Luke Munn

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2212.04092 2022-12-09 cs.CL 85%

Successive Prompting for Decomposing Complex Questions

Dheeru Dua, Shivanshu Gupta, Sameer Singh, Matt Gardner

专题命中 预训练与数据 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.10258 2022-10-24 cs.CL 85%

Continued Pretraining for Better Zero- and Few-Shot Promptability

Zhaofeng Wu, Robert L. Logan, Pete Walsh, Akshita Bhagia, Dirk Groeneveld, Sameer Singh, Iz Beltagy

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL

Comments EMNLP 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2205.10747 2022-10-14 cs.CV cs.AI 85%

Language Models with Image Descriptors are Strong Few-Shot Video-Language Learners

Zhenhailong Wang, Manling Li, Ruochen Xu, Luowei Zhou, Jie Lei, Xudong Lin, Shuohang Wang, Ziyi Yang, Chenguang Zhu, Derek Hoiem, Shih-Fu Chang, Mohit Bansal, Heng Ji

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract);prompting(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2208.05446 2022-09-15 cs.SE cs.LG 85%

CoditT5: Pretraining for Source Code and Natural Language Editing

Jiyang Zhang, Sheena Panthaplackel, Pengyu Nie, Junyi Jessy Li, Milos Gligoric

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

Comments ASE 2022 (camera ready)

详情

展开后加载摘要…

URL PDF HTML 收藏
2206.01127 2022-09-07 cs.CV cs.CL 85%

VL-BEiT: Generative Vision-Language Pretraining

Hangbo Bao, Wenhui Wang, Li Dong, Furu Wei

专题命中 预训练与数据 :pretraining(title,abstract);language model(abstract);foundation model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2204.00212 2022-08-19 cs.CL cs.SD eess.AS 85%

Effect and Analysis of Large-scale Language Model Rescoring on Competitive ASR Systems

Takuma Udagawa, Masayuki Suzuki, Gakuto Kurata, Nobuyasu Itoh, George Saon

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted to Interspeech 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07669 2026-08-25 cs.CL cs.AI 版本更新 85%

DiaLLM: An Investigation into the Robustness-Generation Gap in English Dialect Adaptation

DiaLLM:英语方言适应中稳健性-生成差距的研究

Jordan Painter, Dipankar Srirag, Adarsh Kappiyath, Diptesh Kanojia, Aditya Joshi, Lu Yin

机构 * Institute for People-Centered AI, University of Surrey(萨里大学以人为本人工智能研究所) University of New South Wales(新南威尔士大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 研究英语方言适应中稳健性与生成的差距,通过DiaLLM持续预训练并结合多种策略对比不同英语变体。发现二者分离,特定变体适应产出受青睐但优化奖励方法未获评估者偏爱,缩小差距需丰富奖励设计和投入方言资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11167 2026-08-12 cs.CV cs.CL cs.LG 新提交 85%

MultiModal Code-Switching: Interleaving Visual Objects into Language for Explicit Object-Level Alignment

多模态代码切换:将视觉对象交织入语言以实现显式对象级对齐

Changhao Xiang, Shangyu Xing, Zhen Wu, Jianbing Zhang, Xinyu Dai

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 针对现有多模态大语言模型的图像级对齐存在指称歧义的问题,提出多模态代码切换(MMCS)范式,构建含77.3万样本的数据集,仅用5万样本即可匹配或超越60万图像-文本对训练的模型,提升了视觉基础与感知能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09717 2026-08-10 cs.LG cs.AI 版本更新 85%

Provable Training Data Identification for Large Language Models

大语言模型训练数据的可证明识别

Zhenlong Liu, Hao Zeng, Weiran Huang, Hongxin Wei

机构 * Department of Statistics and Data Science, Southern University of Science and Technology(统计与数据科学系,南方科技大学) Shanghai Innovation Institute(上海创新研究院) School of Computer Science, Shanghai Jiao Tong University(计算机科学学院,上海交通大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.AI、cs.LG

AI总结 本文提出PTDI方法,通过集级推断实现大语言模型训练数据识别的可证明误差控制。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03711 2026-08-05 cs.CV cs.CL cs.LG 新提交 85%

Attention is Case-Sensitive

注意力对字母大小写敏感

Maximilian Dillitzer, Tin Stribor Sohn, Jason J. Corso, Michael Auerbach

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 该研究发现LLMs和VLMs存在大小写效应,即文本中目标信息采用特定大小写格式会调节注意力分配,但该效应不一定提升任务准确率,推理模型的思考阶段可缓解此效应,且该效应可部分迁移至VLMs。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01061 2026-07-14 cs.AI cs.CL 版本更新 85%

Agentic generation of verifiable rules for deterministic, self-expanding reaction classification

用于确定性、自扩展反应分类的可验证规则的智能体生成

Daniel Armstrong, Maarten Dobbelaere, Valentas Olikauskas, Helena Avila, Octavian Susanu, Jérôme Waser, Philippe Schwaller

机构 * École Polytechnique Fédérale de Lausanne (EPFL)(洛桑联邦理工学院) Laboratory for Chemical Technology, Ghent University(根特大学化学技术实验室) NCCR Catalysis(瑞士国家研究能力中心催化项目)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出多智能体LLM框架,通过验证循环自动生成反应规则,将标准分类从68类扩展到14,073类,并实现97.7%的未知反应分类准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03160 2026-07-07 cs.CL cs.AI 新提交 85%

The Role of Prompt Language and Translation-Theory-Driven Prompts in Large Language Models: A Case Study on Spanish-Chinese Journalistic Translation

提示语言和翻译理论驱动的提示在大语言模型中的作用:以西班牙语-中文新闻翻译为例

Haohong Lai, Weijia Li

机构 * Faculty of Translation and Interpreting(翻译与口译学院) Autonomous University of Barcelona(巴塞罗那自治大学) Barcelona, Spain(西班牙巴塞罗那)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究提示语言和翻译理论驱动的提示设计对GPT-5.2生成的西中新闻翻译质量的影响。通过48种实验条件翻译平行语料库,用自动评估指标和人工评估,发现理论驱动提示能减少特定错误,提示语言影响小。

Comments Published in the Proceedings of the 27th Annual Conference of the European Association for Machine Translation (EAMT 2026), pp. 927-945. ACL Anthology entry forthcoming

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29315 2026-06-30 cs.AI cs.LG 85%

Hierarchical Experimentalist Agents

分层实验者智能体

Abhranil Chandra, Sankaran Vaidyanathan, Utsav Dhanuka, Varun Gandhi, Scott Niekum

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 提出HExA框架,通过主动实验迭代设计实验、学习可复用技能,无需训练或外部监督,在Interphyre基准上将Claude Sonnet成功率从2%提升至77%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.15465 2026-06-19 cs.CL cs.AI 85%

RadEx: A Framework for Structured Information Extraction from Radiology Reports based on Large Language Models

RadEx:基于大型语言模型的结构化信息提取框架

Daniel Reichenpfader, Jonas Knupp, André Sander, Kerstin Denecke

机构 * Institute for Patient-centered Digital Health, Bern University of Applied Sciences, Biel, Switzerland(以患者为中心的数字健康研究所,伯恩应用科学大学,比尔,瑞士) ID Suisse AG, St. Gallen, Switzerland(ID瑞士股份有限公司,圣加尔,瑞士)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 RadEx框架通过15个软件组件和10个工具,实现从放射科报告中自动提取结构化信息,支持生成式和编码器模型,提升临床应用中的信息处理效率与系统互操作性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03415 2026-06-01 cs.PL cs.AI cs.CL cs.SE 85%

LLMs Lean on Priors, Not Programming Language Semantics

LLMs 依赖先验而非编程语言语义

Aditya Thimmaiah, Jiyang Zhang, Jayanth Srinivasa, Junyi Jessy Li, Milos Gligoric

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校) Cisco Research(思科研究)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过 PLSemanticsBench 基准测试,发现前沿大语言模型在程序执行任务中依赖预训练统计规律而非形式语义规则,语义变异和结构复杂度导致准确率大幅下降。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.16026 2026-05-18 cs.CL cs.AI 85%

From Flat Language Labels to Typological Priors: Structured Language Conditioning for Multilingual Speech-to-Speech Translation

从平铺语言标签到类型学先验:面向多语言语音到语音翻译的结构化语言条件化

Yu Pan, Yang Hou, Xiongfei Wu, Liang Zhang, Yves Le Traon, Lei Ma, Jianjun Zhao

机构 * School of Information Science and Electrical Engineering, Kyushu University(九州大学信息科学与电子工程学院) Recho Inc.(Recho公司) National Institute of Informatics(国家信息研究所) Interdisciplinary Research Centre on Security, Reliability and Trust (SnT), University of Luxembourg(卢森堡大学安全、可靠性与信任跨学科研究中心) Donghua University(东华大学) Department of Computer Science, The University of Tokyo(东京大学计算机科学系) Department of Electrical and Computer Engineering, University of Alberta(阿尔伯塔大学电子与计算机工程系)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出S2ST-Omni 2框架,通过结构化类型学先验改进多语言语音到语音翻译,实验显示其在多个评估指标上表现优异,且在数据受限条件下仍能提升翻译效率。

Comments Submitted to IEEE/ACM TASLP. This work extends S2ST-Omni, accepted to Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07425 2026-05-11 cs.LG cs.CL math.OC 85%

Sign-Based Optimizers Are Effective Under Heavy-Tailed Noise

基于符号的优化器在重尾噪声下表现有效

Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) School of Software Technology, Zhejiang University(浙江大学软件学院) School of Data Science, Fudan University(复旦大学数据科学学院)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了在重尾梯度噪声下,基于符号的优化器如SignSGD和Lion相较于传统自适应方法的优越性,通过理论分析和实验验证,证明其在处理重尾噪声时的高效性。

Comments Code is available at https://github.com/Dingzhen230/Heavy-tailed-Noise-in-LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08750 2026-05-08 cs.LG cs.CL 85%

Exploring Cross-Client Memorization of Training Data in Large Language Models for Federated Learning

探索联邦学习中大语言模型训练数据的跨客户端记忆化

Tinnakit Udsa, Can Udomcharoenchaikit, Patomporn Payoungkhamdee, Sarana Nutanong, Norrathep Rattanavipanon

机构 * School of Information Science and Technology, VISTEC(信息科学与技术学院,VISTEC) College of Computing, Prince of Songkla University(颂克拉大学计算机学院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG

AI总结 本文研究联邦学习中大语言模型训练数据的记忆化问题,提出跨客户端记忆化测量框架,分析客户端间与客户端内记忆化差异及影响因素。

Comments Accepted to The 64th Annual Meeting of the Association for Computational Linguistics (ACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25015 2026-03-27 cs.CL cs.AI cs.SE 85%

Imperative Interference: Social Register Shapes Instruction Topology in Large Language Models

命令干扰:社会语体影响大语言模型中的指令拓扑

Tony Mason

机构 * the University of British Columbia(不列颠哥伦比亚大学) the Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 研究探讨了社会语体如何影响大语言模型中指令拓扑,通过多语言实验发现指令拓扑反转由社会语体调解,改写指令可减少跨语言差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13900 2026-03-06 cs.CL cs.AI 85%

Narrow Finetuning Leaves Clearly Readable Traces in Activation Differences

细粒度微调在激活差异中留下明显可读的痕迹

Julian Minder, Clément Dumas, Stewart Slocum, Helena Casademunt, Cameron Holmes, Robert West, Neel Nanda

机构 * EPFL(苏黎世联邦理工学院) Ecole Normale Supérieure Paris-Saclay(巴黎-萨克雷高等师范学校) Université Paris-Saclay(巴黎-萨克雷大学) Harvard University(哈佛大学) MATS

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究发现狭窄微调会在激活中留下明显痕迹,揭示了微调领域偏见,并警告了使用此类模型进行广泛微调研究的局限性。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03543 2026-03-05 cs.CL cs.AI 85%

Tucano 2 Cool: Better Open Source LLMs for Portuguese

Tucano 2 Cool: 更好的开源葡萄牙语大语言模型

Nicholas Kluge Corrêa, Aniket Sen, Shiza Fatimah, Sophia Falk, Lennard Landgraf, Julia Kastner, Lucie Flek

机构 * Bonn-Aachen International Center for Information Technology (b-it) / CAISA Lab(波恩-亚琛国际信息科技中心(b-it)/ CAISA实验室) Lamarr Institute for Machine Learning and Artificial Intelligence(拉马尔机器学习与人工智能研究所) Center for Science and Thought(科学与思想研究中心) Helmholtz-Institut für Strahlen- und Kernphysik(亥姆霍兹辐射与核物理研究所) Bonn Sustainable AI Lab(波恩可持续AI实验室)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

AI总结 Tucano 2推出了一系列开源葡萄牙语大语言模型,通过扩展数据集和改进训练方法,实现了在多种语言任务上的最佳性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.05578 2025-12-15 cs.LG cs.CL cs.CR 85%

The Landscape of Memorization in LLMs: Mechanisms, Measurement, and Mitigation

LLM记忆景观:机制、测量与缓解

Alexander Xiong, Xuandong Zhao, Aneesh Pappu, Dawn Song

机构 * UC Berkeley(伯克利大学) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文研究了LLM记忆现象的机制、测量方法及缓解策略,探讨了影响记忆的因素和检测技术,并分析了其法律伦理影响及缓解措施。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03307 2025-12-04 cs.LG cs.AI 85%

Robust Tabular Foundation Models

鲁棒表格基础模型

Matthew Peroni, Franck Le, Vadim Sheinin

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出鲁棒表格基础模型(RTFM),通过参数化生成器分布实现对抗鲁棒性,提升表格基础模型的基准性能。

Comments Shaping Responsible Synthetic Data in the Era of Foundation Models, AAAI 2026

Journal ref Shaping Responsible Synthetic Data in the Era of Foundation Models, AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21864 2025-10-28 cs.CL cs.AI 85%

DeepOmni: Towards Seamless and Smart Speech Interaction with Adaptive Modality-Specific MoE

Hang Shao, Heting Gao, Yunhang Shen, Jiawei Chen, Zuwei Long, Dong Yang, Ke Li, Xing Sun

机构 * Tencent(腾讯) Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);SLM(abstract)

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.04482 2025-09-09 cs.CL cs.AI 85%

Energy Landscapes Enable Reliable Abstention in Retrieval-Augmented Large Language Models for Healthcare

Ravi Shankar, Sheng Wong, Lin Li, Magdalena Bachmann, Alex Silverthorne, Beth Albert, Gabriel Davis Jones

机构 * Oxford Digital Health Labs(牛津数字健康实验室) Nuffield Department of Women’s and Reproductive Health(妇女与生殖健康尼富尔德部门) University of Oxford(牛津大学) OATML Department of Computer Science(计算机科学系)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18499 2025-08-20 cs.LG cs.AI stat.ML 85%

G1: Teaching LLMs to Reason on Graphs with Reinforcement Learning

Xiaojun Guo, Ang Li, Yifei Wang, Stefanie Jegelka, Yisen Wang

机构 * Peking University(北京大学) MIT(麻省理工学院) TUM(慕尼黑工业大学) School of CIT, MCML, MDSIEECS and CSAIL(计算机学院、MCML、MDSIEECS和CSAIL)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.21676 2025-07-25 cs.CL cs.LG 85%

How do language models learn facts? Dynamics, curricula and hallucinations

Nicolas Zucchet, Jörg Bornschein, Stephanie Chan, Andrew Lampinen, Razvan Pascanu, Soham De

机构 * ETH Zürich(苏黎世联邦理工学院) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.LG

Comments Accepted at the 2nd Conference on Language Modeling (2025)

Journal ref Conference on Language Modeling (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16900 2025-06-10 cs.CL cs.LG 85%

Power-Law Decay Loss for Large Language Model Finetuning: A Theory Perspective

Jintian Shao

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL、cs.LG

Comments Short of sufficient experiments and references

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02924 2025-06-04 cs.CL cs.IR cs.LG 85%

INESC-ID @ eRisk 2025: Exploring Fine-Tuned, Similarity-Based, and Prompt-Based Approaches to Depression Symptom Identification

Diogo A. P. Nunes, Eugénio Ribeiro

机构 * INESC-ID Instituto Superior Técnico, Universidade de Lisboa(里斯本大学技术学院) Instituto Universitário de Lisboa (ISCTE-IUL)(里斯本大学学院(ISCTE-IUL))

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 12 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏