arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2410.18164 2026-01-21 cs.LG cs.AI stat.ML 86%

TabDPT: Scaling Tabular Foundation Models on Real Data

TabDPT:在真实数据上扩展表格基础模型

Junwei Ma, Valentin Thomas, Rasa Hosseinzadeh, Alex Labach, Hamidreza Kamkari, Jesse C. Cresswell, Keyvan Golestan, Guangwei Yu, Anthony L. Caterini, Maksims Volkovs

机构 * Layer 6 AI

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 TabDPT通过结合上下文学习与自监督学习,提升表格基础模型在真实数据上的泛化能力,实现模型和数据规模的缩放优化。

Comments Inference repo: github.com/layer6ai-labs/TabDPT-inference; Training repo: github.com/layer6ai-labs/TabDPT-training

Journal ref NeurIPS 2025 Proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.12537 2026-01-19 cs.CL cs.AI eess.AS 86%

What Makes a Good Speech Tokenizer for LLM-Centric Speech Generation? A Systematic Study

什么使LLM为中心的语音生成中的良好语音分词器?系统研究

Xiaoran Fan, Zhichao Sun, Yangfan Gao, Jingfei Xiong, Hang Yan, Yifei Cao, Jiajun Sun, Shuo Li, Zhihao Zhang, Zhiheng Xi, Yuhao Zhou, Senjie Jin, Changhao Jiang, Junjie Ye, Ming Zhang, Rui Zheng, Zhenhua Han, Yunke Zhang, Demei Yan, Shaokang Dong, Tao Ji, Tao Gui

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);SLM(abstract);分类 cs.CL、cs.AI

AI总结 本文研究了LLM为中心的语音生成中语音分词器设计的影响,通过引入多令牌预测和说话人感知生成,提升了语音生成的质量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21621 2026-01-16 cs.CL cs.AI 86%

The Open Proof Corpus: A Large-Scale Study of LLM-Generated Mathematical Proofs

开放证明语料库:大规模研究LLM生成的数学证明

Jasper Dekoninck, Ivo Petrov, Kristian Minchev, Mislav Balunovic, Martin Vechev, Miroslav Marinov, Maria Drencheva, Lyuba Konova, Milen Shumanov, Kaloyan Tsvetkov, Nikolay Drenchev, Lazar Todorov, Kalina Nikolova, Nikolay Georgiev, Vanesa Kalinkova, Margulan Ismoldayev

机构 * ETH Zurich(苏黎世联邦理工学院) INSAIT, Sofia University "St. Kliment Ohridski"(INSAIT,索菲亚大学"圣克莱门特·欧赫里德斯基") Institute of Mathematics and Informatics, Bulgarian Academy of Sciences(保加利亚科学院数学与信息学研究所) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 开放证明语料库通过大规模研究LLM生成的数学证明,探索自动化证明生成中的关键问题,包括自然语言与形式证明的性能差距、最终答案准确性与完整证明有效性之间的差异,以及最佳n选择对证明质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09066 2026-01-15 cs.CL cs.AI 86%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12611 2026-01-09 cs.AI cs.CL 86%

An LLM + ASP Workflow for Joint Entity-Relation Extraction

基于LLM与ASP的工作流联合实体-关系抽取

Trang Tran, Trung Hoang Le, Huiping Cao, Tran Cao Son

机构 * New Mexico State University(新墨西哥州立大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于LLM与ASP的工作流,利用其优势在有限数据下提升JERE任务性能,尤其在SciERC基准上表现突出。

Comments In Proceedings ICLP 2025, arXiv:2601.00047

Journal ref EPTCS 439, 2026, pp. 63-75

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14368 2025-12-25 cs.CV cs.CL cs.LG 86%

O3SLM: Open Weight, Open Data, and Open Vocabulary Sketch-Language Model

O3SLM:开放权重、开放数据和开放词汇草图-语言模型

Rishi Gupta, Mukilan Karuppasamy, Shyam Marjit, Aditay Tripathi, Anirban Chakraborty

机构 * IISc(印度理工学院)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);pretraining(abstract);分类 cs.CL、cs.LG

AI总结 O3SLM通过构建大规模图像-草图-指令三元组数据集和训练模型,实现了对草图理解和推理的突破性进展。

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.00964 2025-12-19 cs.CL cs.LG 86%

MALTO at SemEval-2024 Task 6: Leveraging Synthetic Data for LLM Hallucination Detection

MALTO在SemEval-2024任务6:利用合成数据进行LLM幻觉检测

Federico Borra, Claudio Savelli, Giacomo Rosso, Alkis Koudounas, Flavio Giobergia

机构 * Politecnico di Torino(托尼诺理工学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 MALTO通过合成数据增强和投票集成方法,提升LLM幻觉检测的准确性与鲁棒性。

Comments Under revision at SemEval 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15081 2025-12-18 cs.CR cs.AI cs.CL 86%

Quantifying Return on Security Controls in LLM Systems

对LLM系统中安全控制的回报进行量化

Richard Helder Moulton, Austin O'Brien, John D. Hastings

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种量化LLM系统安全控制回报的方法,通过模拟攻击和风险评估,比较了ABAC、NER删除和NeMo Guardrails三种安全措施的效果,发现ABAC显著降低风险,RoC达到9.83。

Comments 13 pages, 9 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13298 2025-12-16 cs.CL cs.AI 86%

MiniLingua: A Small Open-Source LLM for European Languages

MiniLingua:一种用于欧洲语言的小型开源大语言模型

Anna Aksenova, Boris Zverkov, Nicola Dainese, Alexander Nikitin, Pekka Marttinen

机构 * Aalto University(阿alto大学)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 MiniLingua是一种基于十亿参数的多语言开源大语言模型,针对13种欧洲语言训练,能够在指令遵循任务中超越同类模型,同时保持高效的计算性能。

Comments 9+6 pages, 6 figures and 3 tables in the main text. Code at https://github.com/MiniLingua-ai/training_artifacts

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06351 2025-12-09 cs.LG cs.CL 86%

LLM-Upgraded Graph Reinforcement Learning for Carbon-Aware Job Scheduling in Smart Manufacturing

用于智能制造碳感知作业调度的LLM升级图强化学习

Zhiying Yang, Fang Liu, Wei Zhang, Xin Lou, Malcolm Yoke Hean Low, Boon Ping Gan

机构 * Singapore Institute of Technology(新加坡理工学院) Singapore University of Social Sciences(新加坡社会科学研究大学) D-SIMLAB Technologies(D-SIMLAB技术公司)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);prompting(abstract);分类 cs.CL、cs.LG

AI总结 Luca通过结合LLM和图神经网络,实现碳感知作业调度的高效优化,实验显示其在完成时间和排放方面均优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.05464 2025-12-08 cs.CL cs.AI 86%

Dynamic Alignment for Collective Agency: Toward a Scalable Self-Improving Framework for Open-Ended LLM Alignment

动态对齐与集体代理:迈向一个可扩展的自我改进框架以实现开放式的LLM对齐

Panatchakorn Anantaprayoon, Nataliia Babina, Jad Tarifi, Nima Asgharbeygi

机构 * Integral AI

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出动态对齐框架,通过集体代理价值实现LLM的自我改进和可扩展对齐。

Comments 8 pages, 4 figures, to appear in AAAI 2026 AIGOV Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.06540 2025-12-03 cs.LG cs.AI stat.ML 86%

Sloth: scaling laws for LLM skills to predict multi-benchmark performance across families

Sloth: LLM技能的缩放定律用于跨家族预测多基准性能

Felipe Maia Polo, Seamus Somerstep, Leshem Choshen, Yuekai Sun, Mikhail Yurochkin

机构 * Department of Statistics, University of Michigan(密歇根大学统计学系) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM Watson AI实验室,IBM研究) Computer Science and Artificial Intelligence Laboratory, MIT(MIT计算机科学与人工智能实验室) Institute of Foundation Models, MBZUAI(基础模型研究所,MBZUAI)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Sloth提出一种基于低维潜在技能的LLM缩放定律,通过跨基准相关性提升预测准确性,减少多家族训练需求。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.08896 2025-11-26 cs.LG cs.AI 86%

Position: Beyond Euclidean -- Foundation Models Should Embrace Non-Euclidean Geometries

位置:超越欧几里得——基础模型应拥抱非欧几里得几何

Neil He, Jiahong Liu, Buze Zhang, Ngoc Bui, Ali Maatouk, Menglin Yang, Irwin King, Melanie Weber, Rex Ying

机构 * Yale University(耶鲁大学) Chinese University of Hong Kong(香港中文大学) Xi’an Jiaotong University(西安交通大学) Hong Kong University of Science and Technology(香港科学大学) Harvard University(哈佛大学)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文主张基础模型应超越欧几里得几何,以更高效地利用非欧几里得结构,提升模型性能与适应性。

Comments 27 pages, 6 figures, LoG Conference 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15375 2025-11-20 cs.LG cs.AI 86%

Parameter Importance-Driven Continual Learning for Foundation Models

Lingxiang Wang, Hainan Zhang, Zhiming Zheng

机构 * Beijing Advanced Innovation Center for Future Blockchain and Privacy Computing, Beihang University(未来区块链与隐私计算先进创新中心,北京航空航天大学) School of Artificial Intelligence, Beihang University(人工智能学院,北京航空航天大学)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13640 2025-11-18 cs.LG cs.AI 86%

Data Value in the Age of Scaling: Understanding LLM Scaling Dynamics Under Real-Synthetic Data Mixtures

Haohui Wang, Jingyuan Qi, Jianpeng Chen, Jun Wu, Lifu Huang, Lecheng Zheng, Kevin Choi, Balaji Veeramani, Edward Bowen, Alison Hu, Tyler Cody, Dawei Zhou

机构 * Virginia Tech(弗吉尼亚理工大学) Michigan State University(密歇根州立大学) University of California, Davis(加州大学戴维斯分校) Deloitte(德勤)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10338 2025-11-18 cs.CL cs.AI 86%

BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages

Guduru Manoj, Neel Prabhanjan Rachamalla, Ashish Kulkarni, Gautam Rajeev, Jay Piplodiya, Arul Menezes, Shaharukh Khan, Souvik Rana, Manya Sah, Chandra Khatri, Shubham Agarwal

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.10027 2025-11-14 cs.CL cs.AI 86%

LLMCARE: early detection of cognitive impairment via transformer models enhanced by LLM-generated synthetic data

Ali Zolnour, Hossein Azadmaleki, Yasaman Haghbin, Fatemeh Taherinezhad, Mohamad Javad Momeni Nezhad, Sina Rashidi, Masoud Khani, AmirSajjad Taleban, Samin Mahdizadeh Sani, Maryam Dadkhah, James M. Noble, Suzanne Bakken, Yadollah Yaghoobzadeh, Abdol-Hossein Vahabie, Masoud Rouhizadeh, Maryam Zolnoori

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20354 2025-11-11 cs.CL cs.AI 86%

Rethinking Text-based Protein Understanding: Retrieval or LLM?

Juntong Wu, Zijing Liu, He Cao, Hao Li, Bin Feng, Zishan Shu, Ke Yu, Li Yuan, Yu Li

机构 * Peking University, Shenzhen Graduate School(北京大学深圳研究生院) International Digital Economy Academy (IDEA)(国际数字经济学院)

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted by Empirical Methods in Natural Language Processing 2025 (EMNLP 2025) Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22996 2025-11-11 cs.CL cs.AI 86%

AI Brown and AI Koditex: LLM-Generated Corpora Comparable to Traditional Corpora of English and Czech Texts

Jiří Milička, Anna Marklová, Václav Cvrček

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09597 2025-11-11 cs.AI cs.IT cs.LG math.IT 86%

Understanding LLM Behaviors via Compression: Data Generation, Knowledge Acquisition and Scaling Laws

Zhixuan Pan, Shaowen Wang, Jian Li

机构 * Institute for Interdisciplinary Information Sciences, Tsinghua University(清华大学交叉信息研究院) School of Computer Science and Engineering, Beihang University(北航计算机科学与工程学院)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.07236 2025-11-07 eess.SP cs.AI cs.LG q-bio.NC 86%

CBraMod: A Criss-Cross Brain Foundation Model for EEG Decoding

Jiquan Wang, Sha Zhao, Zhiling Luo, Yangxuan Zhou, Haiteng Jiang, Shijian Li, Tao Li, Gang Pan

机构 * State Key Laboratory of Brain-machine Intelligence(脑机智能国家重点实验室) College of Computer Science and Technology(计算机科学与技术学院) Alibaba Group(阿里巴巴集团) Department of Neurobiology, Affiliated Mental Health Center & Hangzhou Seventh People’s Hospital, Zhejiang University School of Medicine(神经生物学系、附属心理健康中心及杭州第七人民医院,浙江大学医学院) MOE Frontier Science Center for Brain Science and Brain-machine Integration(教育部脑科学与脑机集成前沿科学中心)

专题命中 预训练与数据 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by The Thirteenth International Conference on Learning Representations (ICLR 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00318 2025-11-04 cs.LG cs.AI stat.ML 86%

A Technical Exploration of Causal Inference with Hybrid LLM Synthetic Data

Dana Kim, Yichen Xu, Tiffany Lin

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18125 2025-10-31 cs.LG cs.CL 86%

TabSTAR: A Tabular Foundation Model for Tabular Data with Text Fields

Alan Arazi, Eilam Shapira, Roi Reichart

机构 * Technion - IIT(技术学院-理工学院)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.LG

Comments Accepted to NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03145 2025-10-28 cs.CL cs.AI 86%

Entity-Augmented Neuroscience Knowledge Retrieval Using Ontology and Semantic Understanding Capability of LLM

Pralaypati Ta, Sriram Venkatesaperumal, Keerthi Ram, Mohanasankar Sivaprakasam

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20377 2025-10-24 cs.AI cs.CL 86%

IKnow: Instruction-Knowledge-Aware Continual Pretraining for Effective Domain Adaptation

Tianyi Zhang, Florian Mai, Lucie Flek

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18046 2025-10-22 cs.CL cs.AI 86%

Language Models as Semantic Augmenters for Sequential Recommenders

Mahsa Valizadeh, Xiangjue Dong, Rui Tuo, James Caverlee

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11734 2025-10-15 cs.CY cs.AI cs.CL 86%

Scaling Law in LLM Simulated Personality: More Detailed and Realistic Persona Profile Is All You Need

Yuqi Bai, Tianyu Huang, Kun Sun, Yuting Chen

机构 * Department of Computer Information Engineering, Hebei Petroleum University of Technology, Chengde, China (e-mail School of Computer Science \& Technology, Beijing Institute of Technology, Beijing, China (e-mail

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07000 2025-10-09 cs.CL cs.AI 86%

Pragyaan: Designing and Curating High-Quality Cultural Post-Training Datasets for Indian Languages

Neel Prabhanjan Rachamalla, Aravind Konakalla, Gautam Rajeev, Ashish Kulkarni, Chandra Khatri, Shubham Agarwal

机构 * Krutrim AI

专题命中 预训练与数据 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01229 2025-10-03 cs.CL cs.AI 86%

Enhancing Transformer-Based Rerankers with Synthetic Data and LLM-Based Supervision

Dimitar Peshevski, Kiril Blazhevski, Martin Popovski, Gjorgji Madjarov

机构 * Faculty of Computer Science and Engineering(计算机科学与工程学院) Machine Learning Department(机器学习系)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by RANLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24356 2025-09-30 cs.CL cs.AI 86%

Beyond Repetition: Text Simplification and Curriculum Learning for Data-Constrained Pretraining

Matthew Theodore Roque, Dan John Velasco

机构 * Samsung R&D Institute Philippines(三星菲律宾研发中心)

专题命中 预训练与数据 :pretraining(title,abstract);LLM(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments To be published in BabyLM Workshop at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏