arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2506.03056 2025-06-04 cs.AI cs.CY cs.LG 84%

Corrigibility as a Singular Target: A Vision for Inherently Reliable Foundation Models

Ram Potham, Max Harms

机构 * Independent Researcher(独立研究者) Machine Intelligence Research Institute(机器智能研究院)

专题命中 预训练与数据 :foundation model(title,abstract);SFT(abstract);分类 cs.AI、cs.LG

Comments Preprint. This work has been submitted to the Reliable and Responsible Foundation Models Workshop at ICML 2025 for review

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.03608 2024-04-05 cs.CL cs.AI 84%

Sailor: Open Language Models for South-East Asia

Longxu Dou, Qian Liu, Guangtao Zeng, Jia Guo, Jiahui Zhou, Wei Lu, Min Lin

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI;LLM(comments)

Comments Code is available at https://github.com/sail-sg/sailor-llm

详情

展开后加载摘要…

URL PDF HTML 收藏
2211.04878 2022-11-10 cs.LG cs.AI 84%

Foundation Models for Semantic Novelty in Reinforcement Learning

Tarun Gupta, Peter Karkus, Tong Che, Danfei Xu, Marco Pavone

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments Foundation Models for Decision Making Workshop at Neural Information Processing Systems, 2022

详情

展开后加载摘要…

URL PDF HTML 收藏
2108.07435 2021-12-08 cs.LG cs.CL q-bio.BM 84%

Modeling Protein Using Large-scale Pretrain Language Model

Yijia Xiao, Jiezhong Qiu, Ziang Li, Chang-Yu Hsieh, Jie Tang

专题命中 预训练与数据 :language model(title,abstract);pretraining(abstract,comments);分类 cs.CL、cs.LG

Comments Accepted paper in Pretrain@KDD 2021 (The International Workshop on Pretraining: Algorithms, Architectures, and Applications)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23358 2026-08-25 cs.CL 新提交 84%

The Geometry of Low-Resource Language Representations

低资源语言表示的几何特性

Francois Meyer, Jan Buys

机构 * University of Cape Town(开普敦大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.CL

AI总结 本研究从表示几何角度探究LLM中低资源与高资源语言的性能差异,发现低资源语言存在表示退化,提出几何正则化方法,实验表明该方法可降低退化并提升性能,为低资源语言CPT提供可行策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21712 2026-08-25 cs.AI cs.MA 新提交 84%

ATHENA: Knowledge-guided agentic neural architecture search for AutoFormer-based electronic health record modeling

ATHENA:面向基于AutoFormer的电子健康记录建模的知识引导型智能体神经架构搜索

Deyi Li, Qi Xu, Lingyao Li, Tiansheng Wang, Muxuan Liang, Mei Liu

机构 * University of Florida(佛罗里达大学) University of Arizona(亚利桑那大学) University of Houston(休斯顿大学) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校) University of Texas MD Anderson Cancer Center(德克萨斯大学MD安德森癌症中心)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出知识引导型智能体NAS框架ATHENA,通过跨医院复用架构知识,在6项临床预测任务的12项评估中9项优于或匹配基线方法,可减少Transformer型EHR建模的手动架构调整。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06398 2026-08-10 cs.AI 新提交 84%

EntropyMoE: Entropy-Aware Sparse Expert Routing for Tokenizer-Free LLMs

EntropyMoE:面向无分词器大语言模型的熵感知稀疏专家路由

Bo Liu, Muxuab Yu, Yu Zhang, Pengfei Gao, Yongping Zhang

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 EntropyMoE针对无分词器字节级LLM的块计算局限性,提出基于块熵的稀疏专家路由MoE架构,在降低位每字节的同时保持下游准确率,扩展了MoE建模的应用范围。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.06283 2026-08-07 cs.LG math.OC math.PR stat.ML 新提交 84%

The Tamed Subgradient Unadjusted Langevin Algorithm beyond Convexity

超越凸性的驯服次梯度未校正朗之万算法

Iosif Lytras, Nikolaos Makras, Sotirios Sabanis

机构 * University of Edinburgh(爱丁堡大学) National Technical University of Athens(雅典国立技术大学) Athena/Archimedes Research Centre(雅典娜/阿基米德研究中心)

专题命中 预训练与数据 :LLM(summary_cn,abstract);pretraining(abstract);分类 cs.LG

AI总结 本文针对非光滑、超线性梯度增长且非凸的目标分布采样问题,提出SG-TULA算法,推导其非渐近收敛界,验证假设并用于GPT-2系列LLM预训练,效果优于AdamW等。

Comments 53 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11671 2026-08-04 cs.CR cs.AI cs.SE 版本更新 84%

Cochise: A Reference Harness for Autonomous Penetration Testing

Cochise:自主渗透测试的参考框架

Andreas Happe, Jürgen Cito

机构 * TU Wien(维也纳技术大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.AI

AI总结 Cochise提供了一个简洁的自主渗透测试框架,支持通过SSH连接LLM代理与Linux主机,并通过分离的规划-执行架构实现可控环境,同时提供重放和分析工具以支持研究。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26178 2026-07-30 cs.CL 新提交 84%

DuplexGen: Adaptive Synthesis of Human-AI Turn-Taking Dialogues

DuplexGen:人机交替对话的自适应合成

Takyoung Kim, Kang-wook Kim, Sang Hoon Woo, Julia Hirschberg, Gunhee Kim, Dilek Hakkani-Tür

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Seoul National University(首尔大学) Columbia University(哥伦比亚大学) University of California, Berkeley(加州大学伯克利分校) Georgia Institute of Technology(佐治亚理工学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract);prompting(abstract);分类 cs.CL

AI总结 DuplexGen框架通过将LLM预测与少量槽级人类偏好标注校准,生成场景自适应交替发言对话,契合人类偏好的效果优于未校准方法,证明人类校准对交替发言合成场景特定性的关键作用。

Comments Manuscript under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12712 2026-07-16 cs.SE cs.LG 版本更新 84%

Design-Specification Tiling for ICL-based CAD Code Generation

基于ICL的CAD代码生成的Design-Specification Tiling设计

Yali Du, San-Zhuo Xi, Hui Sun, Ming Li

机构 * National Key Laboratory for Novel Software Technology, School of Artificial Intelligence, Nanjing University(新型软件技术国家实验室,人工智能学院,南京大学)

专题命中 预训练与数据 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本文提出DST方法,通过量化知识充分性提升CAD代码生成质量,优于现有ICL示例选择策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25198 2026-07-02 cs.AI 新提交 84%

Heuresis: Search Strategies for Autonomous AI Research Agents Across Quality, Diversity and Novelty

Heuresis: 自主AI研究智能体在质量、多样性和新颖性上的搜索策略

Antonis Antoniades, Deepak Nathani, Ritam Saha, Alfonso Amayuelas, Ivan Bercovich, Zhaotian Weng, Vignesh Baskaran, Kunal Bhatia, William Yang Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Hexo AI

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出Heuresis框架,将研究流程抽象为通用原语,实现开放科学探索;在三个领域评估六种搜索策略,发现完全新颖的想法罕见且无法达到最高性能,揭示了当前策略无法扩展质量-新颖性前沿的挑战。

Comments 14 pages main text, 82 pages total including appendix; 38 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17526 2026-06-17 cs.LG 新提交 84%

MGUP: A Momentum-Gradient Alignment Update Policy for Stochastic Optimization

MGUP:一种用于随机优化的动量-梯度对齐更新策略

Da Chang, Ganzhao Yuan

机构 * Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究院) Shenzhen University of Advanced Technology(深圳理工大学) Pengcheng Laboratory(鹏城实验室) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出MGUP机制,通过按固定比例选择参数施加大步长、其余参数用小步长,增强动量优化器,理论保证收敛,实验表明提升训练效率与稳定性。

Comments Published in NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.06184 2026-06-16 cs.SE cs.LG cs.LO cs.PL 84%

Teaching LLMs Program Semantics via Symbolic Execution Traces

通过符号执行轨迹教学LLM程序语义

Jonas Bayer, Stefan Zetzsche, Olivier Bouissou, Remi Delmas, Michael Tautschnig, Soonho Kong

机构 * University of Cambridge(剑桥大学) Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);pretraining(abstract);分类 cs.LG

AI总结 本文通过符号执行轨迹训练提升LLM对程序语义的理解,发现结合推理的训练显著提升了漏洞检测能力,且在不同属性类型上均有效。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03785 2026-06-05 cs.CL 84%

Backdoor Unlearning Generalization: A Path Toward the Removal of Unknown Triggers in LLMs

后门遗忘泛化:走向移除大语言模型中未知触发器的路径

Lisa Bouger, Théo Lasnier, Philippe Loubet Moundi, Yannick Teglia, Djamé Seddah

机构 * Inria Paris(法国巴黎国家信息与自动化研究所) Sorbonne Université(索邦大学) Thales CDI(泰雷兹CDI)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过实验证明,针对单个后门的遗忘训练可以泛化抑制其他未明确针对的后门,并引入交叉激活偏移距离量化不同训练引起的模型变化,为利用可控后门移除未知后门提供新方向。

Comments 22 pages, 28 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03899 2026-06-04 cs.LG 84%

Denoise First, Orthogonalize Later: Understanding Momentum in Muon via Spectral Filtering

先降噪,后正交:通过谱滤波理解Muon中的动量

Xianliang Li, Zihan Zhang, Weiyang Liu, Han Bao

机构 * The Institute of Statistical Mathematics(统计数学研究所) The Graduate Institute for Advanced Studies, SOKENDAI(SOKENDAI高级研究院) National Institute of Informatics(国家信息研究所) The Chinese University of Hong Kong(香港中文大学) Tohoku University(东北大学) RIKEN AIP(理化学研究所AIP)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文通过谱滤波理论证明Muon优化器中的动量能抑制梯度扰动、扩大谱间隙,从而稳定正交化步骤,并证明先动量后正交化比相反顺序或去除动量更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01504 2026-06-02 cs.IR cs.LG 84%

Semantic Retrieval for Product Search in E-Commerce

电子商务产品搜索中的语义检索

Nikhil Kothari, Saksham Samdani, Ritam Mallick, Praveen Gupta, Ankit Vijay, Surender Kumar

机构 * Flipkart, India(印度Flipkart)

专题命中 预训练与数据 :LLM(summary_cn,abstract);preference optimization(abstract);分类 cs.LG

AI总结 针对电商搜索中短、嘈杂、口语化查询和细粒度属性区分问题,提出一种基于Siamese LLM双编码器的两阶段训练方法,通过对比学习和偏好优化实现精确匹配与排序。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04828 2026-06-02 cs.CL 84%

From Unfamiliar to Familiar: Detecting Pre-training Data via Gradient Deviations in Large Language Models

从陌生到熟悉:通过梯度偏差检测大型语言模型中的预训练数据

Ruiqi Zhang, Lingxiang Wang, Hainan Zhang, Zhiming Zheng, Yanyan Lan

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(北京未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(北京航空航天大学人工智能学院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 提出GDS方法,通过分析目标样本的梯度偏差分数(包括更新幅度、位置和神经元激活集中度)来区分预训练成员与非成员数据,实现高效且跨数据集迁移的预训练数据检测。

Comments 17 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05813 2026-05-19 cs.LG math.OC 84%

Where Does Warm-Up Come From? Adaptive Scheduling for Norm-Constrained Optimizers

自适应调度机制:规范约束优化器中的暖启动来源

Artem Riabinin, Andrey Veprikov, Arman Bolatov, Martin Takáč, Aleksandr Beznosikov

机构 * Basic Research of Artificial Intelligence Laboratory(人工智能基础研究实验室) Federated Learning Problems Laboratory(联邦学习问题实验室) Mohamed bin Zayed University of Artificial Intelligence(穆罕默德·本·扎耶德人工智能大学) Innopolis University(因诺普里斯大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文研究了规范约束优化器的自适应学习率调度,提出了一种通用平滑性假设,证明了在优化轨迹中局部曲率随次优间隙减小,从而自然产生暖启动而非人工设定。

Comments 30 pages, 8 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21954 2026-05-12 cs.CL 84%

Model-Aware Tokenizer Transfer

模型感知的分词迁移

Mykola Haltiuk, Aleksander Smywinski-Pohl

机构 * Faculty of Computer Science AGH University of Krakow(克拉科夫AGH大学计算机科学学院)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出MATT方法,通过整合模型内部信息提升分词迁移效果,实验表明其在多语言LLM中能有效恢复模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03820 2026-05-05 cs.CL 84%

Automatic Correction of Writing Anomalies in Hausa Texts

Hausa 文本中书写异常的自动纠正

Ahmad Mustapha Wali, Sergiu Nisioi

机构 * Human Language Technologies Research Center(人类语言技术研究中心) Faculty of Mathematics and Computer Science(数学与计算机科学学院) University of Bucharest(布加勒斯特大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);language model(abstract);pretraining(abstract);prompting(abstract)

AI总结 本文提出通过微调变压器模型自动纠正 Hausa 文本中的书写异常,构建了大规模噪声-清洁句子对数据集,并展示了 M2M100 等模型在提升下游任务中的效果。

Comments Accepted at ACL2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12036 2026-04-23 cs.CL 84%

Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models

Composition-RL:为大型语言模型的强化学习编纂可验证提示

Xin Xu, Clive Bai, Kai Yang, Tianhao Chen, Yangkun Chen, Weijie Liu, Hao Chen, Yang Wang, Saiyong Yang, Can Yang

机构 * The Hong Kong University of Science(香港科学与技术大学) HY, Tencent(HY,腾讯) The University of Hong Kong(香港大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 Composition-RL通过自动组合多个问题生成新可验证问题,提升有限提示的利用效率,实验表明其能提升推理能力并支持跨领域强化学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17398 2026-04-21 cs.CL 84%

Contrastive Analysis of Linguistic Representations in Large Language Model Outputs through Structured Synthetic Data Generation and Abstracted N-gram Associations

通过结构化合成数据生成和抽象n-gram关联对大规模语言模型输出中的语言表示进行对比分析

S. A. Desimone, L. Alonso Alemany

机构 * Universidad Nacional de Córdoba(国家科罗纳大学) CONICET

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出一种通过对比合成文本生成和统计分析发现不同社会群体关联语言和论述模式的方法,重点在于识别细微的偏见表达而非预定义词汇列表诊断偏见,利用上下文数据进行分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05302 2026-04-17 cs.CL 84%

Right at My Level: A Unified Multilingual Framework for Proficiency-Aware Text Simplification

就在我的水平上:一种统一的多语言框架,用于面向能力的文本简化

Jinhong Jeong, Junghun Park, Youngjae Yu

机构 * Yonsei University(延世大学) Seoul National University(首尔国立大学)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文提出Re-RIGHT框架,通过强化学习实现无需平行语料的多语言文本简化,提升目标水平的词汇覆盖和语义保持。

Comments Accepted to ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01220 2026-03-03 cs.CL 84%

Generative AI & Fictionality: How Novels Power Large Language Models

生成AI与虚构性:小说如何赋能大语言模型

Edwin Roland, Richard Jean So

机构 * School of Information Science University of Illinois Urbana-Champaign(信息科学学院伊利诺伊大学厄巴纳-香槟分校) Department of English Duke University(英语系杜克大学)

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 研究探讨小说如何影响生成AI,发现LLMs利用小说属性并产生新社交回应,强调计算训练数据的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.15793 2026-01-23 cs.CL 84%

HumanLLM: Towards Personalized Understanding and Simulation of Human Nature

HumanLLM: 向个性化理解与模拟人类本质迈进

Yuxuan Lei, Tianfu Wang, Jianxun Lian, Zhengyu Hu, Defu Lian, Xing Xie

机构 * University of Science and Technology of China(科学技术大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) Microsoft Research Asia(微软亚洲研究院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 HumanLLM通过构建大规模用户数据集和多阶段训练流程,实现了对个体认知与行为的个性化模拟,提升了社会智能和个性化应用的效果。

Comments 12 pages, 5 figures, 7 tables, to be published in KDD 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13860 2025-12-17 cs.SE cs.AI 84%

Verification-Guided Context Optimization for Tool Calling via Hierarchical LLMs-as-Editors

通过分层大语言模型作为编辑器进行工具调用的验证引导上下文优化

Henger Li, Shuangjie You, Flavio Di Palo, Yiyue Qian, Ayush Jain

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 通过分层LLM作为编辑器,验证引导上下文优化提升工具调用的准确性和泛化能力。

Comments Accepted by AAAI 2026 Workshop on Agentic AI Benchmarks and Applications for Enterprise Tasks

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00469 2025-12-05 cs.CL 84%

Massively Multilingual Adaptation of Large Language Models Using Bilingual Translation Data

利用双语翻译数据进行大规模多语言大语言模型适应

Shaoxiong Ji, Zihao Li, Jaakko Paavola, Hengyu Luo, Jörg Tiedemann

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

AI总结 本文提出利用双语翻译数据提升大规模多语言大语言模型在500种语言上的适应性能,通过构建MaLA语料库和开发EMMA-500模型,验证了双语数据对语言迁移和低资源语言性能的积极影响。

Comments EMMA-500 Gen 2; refer to Gen 1 in arXiv:2409.17892

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.01074 2025-10-31 cs.LG 84%

Omni-Mol: Multitask Molecular Model for Any-to-any Modalities

Chengxin Hu, Hao Li, Yihe Yuan, Zezheng Song, Chenyang Zhao, Haixin Wang

机构 * National University of Singapore(新加坡国立大学) University of Maryland, College Park(马里兰大学 College Park 分校) University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

Comments 44 pages, 9 figures, 13 tables, paper accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22356 2025-10-28 cs.CL 84%

Irony Detection in Urdu Text: A Comparative Study Using Machine Learning Models and Large Language Models

Fiaz Ahmad, Nisar Hussain, Amna Qasim, Momina Hafeez, Muhammad Usman Grigori Sidorov, Alexander Gelbukh

专题命中 预训练与数据 :large language model(title);language model(title);分类 cs.CL

Comments 5 pages, 3 figuers

详情

展开后加载摘要…

URL PDF HTML 收藏