arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2603.17220 2026-03-19 cs.CL cs.AI cs.LG 90%

TharuChat: Bootstrapping Large Language Models for a Low-Resource Language via Synthetic Data and Human Validation

TharuChat:通过合成数据和人类验证提升低资源语言的大型语言模型

Prajwal Panth, Agniva Maiti

机构 * School of Computer Engineering KIIT Deemed to be University(计算机工程学院 KIIT 研究生大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Tharu-LLaMA(3B)模型,通过合成数据和人类验证构建TharuChat数据集,解决低资源语言在AI中的代表性问题,提升模型性能并证明生成式AI在保护濒危语言中的可行性。

Comments 6 pages, 1 figure, 2 tables. Preprint. Code and dataset available on Hugging Face

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14757 2026-03-09 astro-ph.CO astro-ph.IM hep-ph physics.data-an 90%

Large Language Models -- the Future of Fundamental Physics?

大语言模型——基础物理学的未来?

Caroline Heneka, Florian Nieser, Ayodele Ore, Tilman Plehn, Daniel Schiller

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);pretraining(abstract)

AI总结 本文探讨了大语言模型在基础物理学中的应用,展示了Qwen2.5 LLM结合连接网络在宇宙参数回归和光锥生成中的优越性能。

Comments 35 pages, 10 figures, 6 tables. v2: matched published version

Journal ref SciPost Phys. 20, 070 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10735 2026-03-09 cs.AI cs.CL cs.CY cs.LG 90%

Transforming Agency. On the mode of existence of Large Language Models

代理的转变。大型语言模型的存在模式

Xabier E. Barandiaran, Lola S. Almendros

机构 * IAS-Research Centre for Life, Mind, and Society, Dept. Philosophy UPV/EHU, University of the Basque Country(生命、心灵与社会研究所,哲学系,巴斯克大学) Institute for Science and Technology Studies, University of Salamanca (Spain)(科学与技术研究所,萨拉曼卡大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文探讨了大型语言模型作为代理的本体特征,指出其缺乏自主代理的必要条件,但能通过文本和计算躯体影响人类代理形式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04066 2026-02-16 cs.SE 90%

Exploring the Potential of Large Language Models in Simulink-Stateflow Mutant Generation

探索大型语言模型在Simulink-Stateflow变异体生成中的潜力

Pablo Valle, Shaukat Ali, Aitor Arrieta

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

AI总结 本文利用大型语言模型生成高质量的Simulink-Stateflow变异体,显著提高了生成效率和变异体质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.06876 2026-02-03 cs.CL cs.AI cs.LG 90%

Mix Data or Merge Models? Balancing the Helpfulness, Honesty, and Harmlessness of Large Language Model via Model Merging

混合数据还是融合模型?通过模型融合平衡大型语言模型的有用性、诚实性和无害性

Jinluan Yang, Dingnan Jin, Anke Tang, Li Shen, Didi Zhu, Zhengyu Chen, Ziyu Zhao, Daixin Wang, Qing Cui, Zhiqiang Zhang, Jun Zhou, Fei Wu, Kun Kuang

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出RESM方法,通过改进的参数融合策略提升大型语言模型在有用性、诚实性和无害性方面的平衡对齐效果。

Comments arxiv version of NeurIPS2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08924 2025-12-02 cs.LG cs.AI cs.CL 90%

Escaping Collapse: The Strength of Weak Data for Large Language Model Training

摆脱崩溃:弱数据在大语言模型训练中的力量

Kareem Amin, Sara Babakniya, Alex Bie, Weiwei Kong, Umar Syed, Sergei Vassilvitskii

机构 * Google Research(谷歌研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了合成数据在大语言模型训练中的作用,提出通过动态聚焦标注资源提升模型性能,并揭示了提升方法在其中的应用与改进机会。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01252 2025-11-14 cs.CL cs.AI cs.LG 90%

GPT and Prejudice: A Sparse Approach to Understanding Learned Representations in Large Language Models

Mariam Mahran, Katharina Simbeck

机构 * HTW Berlin University of Applied Sciences(柏林应用科学大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Preprint. Draft version, subject to revision

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25947 2025-10-31 cs.CL cs.AI cs.LG 90%

Revisiting Multilingual Data Mixtures in Language Model Pretraining

Negar Foroutan, Paul Teiletche, Ayush Kumar Tarun, Antoine Bosselut

机构 * EPFL(瑞士联邦理工学院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23811 2025-10-27 cs.CL cs.AI cs.LG 90%

LayerIF: Estimating Layer Quality for Large Language Models using Influence Functions

Hadi Askari, Shivanshu Gupta, Fei Wang, Anshuman Chhabra, Muhao Chen

机构 * University of California, Davis(加州大学戴维斯分校) University of California, Irvine(加州大学伊市分校) University of Southern California(南加州大学) University of South Florida(佛罗里达州立大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10946 2025-10-23 cs.LG cs.AI cs.CL 90%

GUARD: Guided Unlearning and Retention via Data Attribution for Large Language Models

Peizhi Niu, Evelyn Ma, Huiting Zhou, Duo Zhou, Huan Zhang, S. Rasoul Etesami, Olgica Milenkovic

机构 * Department of Electrical & Computer Engineering(电气与计算机工程系) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.20149 2025-10-21 cs.SE 90%

Synergistic Enhancement of Requirement-to-Code Traceability: A Framework Combining Large Language Model based Data Augmentation and an Advanced Encoder

Jianzhang Zhang, Jialong Zhou, Nan Niu, Jinping Hua, Chuang Liu

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09051 2025-10-13 cs.CL cs.AI cs.LG 90%

Alif: Advancing Urdu Large Language Models via Multilingual Synthetic Data Distillation

Muhammad Ali Shafique, Kanwal Mehreen, Muhammad Arham, Maaz Amjad, Sabur Butt, Hamza Farooq

机构 * University of British Columbia(不列颠哥伦比亚大学) Texas Tech University(德克萨斯技术大学) Institute for the Future of Education, Tecnológico de Monterrey(教育未来研究所,墨西哥蒙特雷技术学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to the EMNLP 2025 Workshop on Multilingual Representation Learning (MRL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.02441 2025-10-07 stat.ML cs.AI cs.CL cs.CR cs.LG math.ST stat.TH 90%

A Statistical Hypothesis Testing Framework for Data Misappropriation Detection in Large Language Models

Yinpeng Cai, Lexin Li, Linjun Zhang

机构 * Peking University(北京大学) University of California at Berkeley(加州大学伯克利分校) Rutgers University(罗格斯大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 29 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.13442 2025-09-03 cs.LG cs.AI cs.CL stat.ML 90%

A Law of Next-Token Prediction in Large Language Models

Hangfeng He, Weijie J. Su

机构 * University of Rochester(罗切斯特大学) University of Pennsylvania(宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Transferred for publication to Physical Review E from Physical Review Research (to waive publication charges)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01908 2025-08-05 cs.LG cs.AI cs.CL 90%

Revisiting Replay and Gradient Alignment for Continual Pre-Training of Large Language Models

Istabrak Abbes, Gopeshh Subbaraj, Matthew Riemer, Nizar Islah, Benjamin Therien, Tsuguchika Tabaru, Hiroaki Kingetsu, Sarath Chandar, Irina Rish

机构 * Université de Montréal(蒙特利尔大学) Mila – Quebec AI Institute(魁北克人工智能研究院) Chandar Research Lab(Chandar研究实验室) IBM Research(IBM研究院) Fujitsu Research(富士通研究院) Polytechnique Montréal(蒙特利尔理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22187 2025-07-31 cs.CL cs.AI cs.LG 90%

A Scalable Pipeline for Estimating Verb Frame Frequencies Using Large Language Models

Adam M. Morgan, Adeen Flinker

机构 * NYU Grossman School of Medicine(纽约大学格罗斯曼医学院) NYU Tandon School of Engineering(纽约大学坦顿工程学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.20520 2025-07-29 cs.CL cs.AI cs.CE cs.LG cs.RO 90%

AQUA: A Large Language Model for Aquaculture & Fisheries

Praneeth Narisetty, Uday Kumar Reddy Kattamanchi, Lohit Akshant Nimma, Sri Ram Kaushik Karnati, Shiva Nagendra Babu Kore, Mounika Golamari, Tejashree Nageshreddy

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17311 2025-06-24 cs.CY 90%

Can Large Language Models Be Trusted Paper Reviewers? A Feasibility Study

Chuanlei Li, Xu Hu, Minghui Xu, Kun Li, Yue Zhang, Xiuzhen Cheng

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07796 2025-06-23 cs.CL cs.AI cs.LG 90%

Learning Dynamics in Continual Pre-Training for Large Language Models

Xingjin Wang, Howe Tissue, Lu Wang, Linjing Li, Daniel Dajun Zeng

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences, Beijing, China(人工智能学院,中国科学院大学,北京) State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences, Beijing, China(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院,北京)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);foundation model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to ICML2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22232 2025-06-03 cs.CL cs.AI cs.LG 90%

Judging Quality Across Languages: A Multilingual Approach to Pretraining Data Filtering with Language Models

Mehdi Ali, Manuel Brack, Max Lübbering, Elias Wendt, Abbas Goher Khan, Richard Rutmann, Alex Jude, Maurice Kraus, Alexander Arno Weber, David Kaczér, Florian Mai, Lucie Flek, Rafet Sifa, Nicolas Flores-Herr, Joachim Köhler, Patrick Schramowski, Michael Fromm, Kristian Kersting

机构 * Lamarr Institute(拉马尔研究所) Fraunhofer IAIS(弗劳恩霍夫iais研究所) DFKI SAINT(DFKI SAINT研究所) Hessian AI(黑森人工智能研究所) TU Darmstadt(图宾根技术大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Project page available at https://huggingface.co/spaces/Jackal-AI/JQL

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.11045 2025-05-29 cs.CL cs.AI cs.LG 90%

Offset Unlearning for Large Language Models

James Y. Huang, Wenxuan Zhou, Fei Wang, Fred Morstatter, Sheng Zhang, Hoifung Poon, Muhao Chen

机构 * University of Southern California(南加州大学) Microsoft Research(微软研究院) University of California, Davis(加州大学戴维斯分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Published in TMLR. https://openreview.net/pdf?id=A4RLpHPXCu

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15784 2025-05-22 cs.LG cs.AI cs.CL 90%

Large Language Models as Computable Approximations to Solomonoff Induction

Jun Wan, Lingrui Mei

机构 * UBS AG(UBS集团) State Key Lab of AI Safety(人工智能安全国家重点实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Both authors contributed equally

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11496 2025-05-20 cs.CL cs.AI cs.LG 90%

Generative AI and Large Language Models in Language Preservation: Opportunities and Challenges

Vincent Koc

机构 * Hyperthink Labs(Hyperthink实验室) University of Queensland(昆士兰大学) University of New South Wales(新南威尔士大学) Comet ML Inc.(Comet ML公司)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 3 figures, 2 tables, submitted for IEEE publication. Pre-print updated as part of review process

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04016 2025-05-08 cs.CL cs.AI cs.LG 90%

SLOT: Structuring the Output of Large Language Models

Darren Yow-Bang Wang, Zhengyuan Shen, Soumya Smruti Mishra, Zhichao Xu, Yifei Teng, Haibo Ding

机构 * Amazon Web Services(亚马逊网络服务)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02639 2025-05-06 cs.LG cs.AI cs.CL 90%

Enhancing Chemical Reaction and Retrosynthesis Prediction with Large Language Model and Dual-task Learning

Xuan Lin, Qingrui Liu, Hongxin Xiang, Daojian Zeng, Xiangxiang Zeng

机构 * School of Computer Science, Xiangtan University(湘潭大学计算机科学学院) College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机科学与电子工程学院) Institute of AI and Targeted International Communication, Hunan Normal University(湖南师范大学人工智能与定向国际传播研究院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted for publication at IJCAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.06233 2025-04-29 cs.CL cs.AI cs.LG 90%

Data Contamination Quiz: A Tool to Detect and Estimate Contamination in Large Language Models

Shahriar Golchin, Mihai Surdeanu

机构 * Department of Computer Science, University of Arizona(计算机科学系,亚利桑那大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Final version; accepted at TACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10000 2025-04-15 cs.CR cs.AI cs.CL cs.CV cs.LG 90%

Do We Really Need Curated Malicious Data for Safety Alignment in Multi-modal Large Language Models?

Yanbo Wang, Jiyang Guan, Jian Liang, Ran He

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted to CVPR 2025, codes in process

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13360 2025-03-31 cs.CV cs.AI cs.CL cs.LG cs.MM 90%

RAP: Retrieval-Augmented Personalization for Multimodal Large Language Models

Haoran Hao, Jiaming Han, Changsheng Li, Yu-Feng Li, Xiangyu Yue

机构 * The Chinese University of Hong Kong(香港中文大学) Nanjing University(南京大学) Beijing Institute of Technology(北京理工大学) CUHK(香港中文大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Accepted by CVPR 2025. Code: https://github.com/Hoar012/RAP-MLLM

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.13485 2025-03-11 cs.CL cs.AI cs.LG 90%

Utilizing Large Language Models to Synthesize Product Desirability Datasets

John D. Hastings, Sherri Weitl-Harms, Joseph Doty, Zachary J. Myers, Warren Thompson

机构 * Creighton University(克赖顿大学) Dakota State University(达科他州立大学) The Beacom College of Computer & Cyber Sciences(比科姆计算机与网络学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

Comments 9 pages, 2 figures, 6 tables, updated author list

Journal ref 2024 IEEE International Conference on Big Data (IEEE BigData 2024)

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.07818 2025-03-11 cs.LG cs.AI cs.CL 90%

Differentially Private Zeroth-Order Methods for Scalable Large Language Model Finetuning

Z Liu, J Lou, W Bao, Y Hu, B Li, Z Qin, K Ren

机构 * Zhejiang University(浙江大学) Hangzhou High-Tech Zone (Binjiang) Institute of Blockchain and Data Security(杭州高新区(滨江)区块链与数据安全研究院) University of Chicago(芝加哥大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏