arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12429 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12429 篇

2507.14987 2025-07-22 cs.AI cs.CR cs.LG 79%

AlphaAlign: Incentivizing Safety Alignment with Extremely Simplified Reinforcement Learning

Yi Zhang, An Zhang, XiuYu Zhang, Leheng Sheng, Yuxin Chen, Zhenkai Liang, Xiang Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.13859 2025-07-21 cs.IR cs.AI cs.CL 79%

SPARQL Query Generation with LLMs: Measuring the Impact of Training Data Memorization and Knowledge Injection

Aleksandr Gashkov, Aleksandr Perevalov, Maria Eltsova, Andreas Both

机构 * img/wse-cube-no-shadow.png Web \& Software Engineering (WSE) Research Group, Leipzig University of Applied Sciences (HTWK Leipzig), Leipzig, Germany CBZ München GmbH, Heilbronn, Germany

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Winner of Best Paper Award at the 25th International Conference on Web Engineering (ICWE 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03572 2025-07-21 cs.HC cs.AI cs.CL 79%

From Code to Compliance: Assessing ChatGPT's Utility in Designing an Accessible Webpage -- A Case Study

Ammar Ahmed, Margarida Fresco, Fredrik Forsberg, Hallvard Grotli

机构 * Department of Computer Science, Norwegian University of Science and Technology(计算机科学系,挪威科学技术大学) Department of Design, Norwegian University of Science and Technology(设计系,挪威科学技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.07009 2025-07-17 cs.CL cs.IT cs.LG math.IT 79%

A Mathematical Theory for Learning Semantic Languages by Abstract Learners

Kuo-Yu Liao, Cheng-Shang Chang, Y. -W. Peter Hong

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL、cs.LG

Comments V1 was submitted to ISIT 2024 on Jan. 28, 2024. V2 was uploaded to ArXiv on April 13, 2024. V3 was uploaded to ArXiv on May 16, 2024

Journal ref in IEEE Journal on Selected Areas in Communications, vol. 43, no. 7, pp. 2700-2713, July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.10618 2025-07-16 cs.LG cs.AI 79%

Compute Requirements for Algorithmic Innovation in Frontier AI Models

Peter Barnett

机构 * Machine Intelligence Research Institute, CA, USA(机器智能研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.10657 2025-07-14 cs.CL cs.AI 79%

An Empirical Study of Validating Synthetic Data for Formula Generation

Usneek Singh, José Cambronero, Sumit Gulwani, Aditya Kanade, Anirudh Khatry, Vu Le, Mukul Singh, Gust Verbruggen

机构 * Microsoft Bangalore, India(微软印度班加罗尔) Google Atlanta, USA(谷歌美国亚特兰大) Microsoft Redmond, USA(微软美国雷德蒙德) University of Texas at Austin(德克萨斯大学奥斯汀) Microsoft Keerbergen, Belgium(微软比利时基尔伯根)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at Findings of NAACL

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07217 2025-07-11 cs.AI cs.LG cs.LO 79%

Neurosymbolic Feature Extraction for Identifying Forced Labor in Supply Chains

Zili Wang, Frank Montabon, Kristin Yvonne Rozier

机构 * Iowa State University(爱荷华州立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03253 2025-07-10 cs.CL cs.AI 79%

RefineX: Learning to Refine Pre-training Data at Scale from Expert-Guided Programs

Baolong Bi, Shenghua Liu, Xingzhang Ren, Dayiheng Liu, Junyang Lin, Yiwei Wang, Lingrui Mei, Junfeng Fang, Jiafeng Guo, Xueqi Cheng

机构 * Institute of Computing Technology(计算技术研究所) Key Laboratory of Network Data Science and Technology, ICT, CAS(网络数据科学与技术重点实验室) State Key Laboratory of AI Safety(人工智能安全国家重点实验室) University of Chinese Academy of Sciences(中国科学院大学) Alibaba Group(阿里巴巴集团) University of California Merced(加州大学默塞德分校) National University of Singapore(新加坡国立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.04480 2025-07-08 cs.LG cs.AI 79%

Source Attribution in Retrieval-Augmented Generation

Ikhtiyor Nematov, Tarik Kalai, Elizaveta Kuzmenko, Gabriele Fugagnoli, Dimitris Sacharidis, Katja Hose, Tomer Sagi

机构 * Université Libre de Bruxelles, Belgium(布鲁塞尔自由大学) Aalborg University, Denmark(奥尔堡大学) University of Padova, Italy(帕多瓦大学) TU Wien, Austria(维也纳技术大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22491 2025-07-01 cs.CL cs.AI cs.CY 79%

PromptAug: Fine-grained Conflict Classification Using Data Augmentation

Oliver Warke, Joemon M. Jose, Faegheh Hasibi, Jan Breitsohl

机构 * University of Glasgow(格拉斯哥大学) Radboud University(拉德堡德大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22343 2025-06-30 stat.ML cs.CL cs.LG stat.ME 79%

Optimal Estimation of Watermark Proportions in Hybrid AI-Human Texts

Xiang Li, Garrett Wen, Weiqing He, Jiayuan Wu, Qi Long, Weijie J. Su

机构 * University of Pennsylvania(宾夕法尼亚大学) Yale University(耶鲁大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.19399 2025-06-25 cs.CL cs.AI 79%

Automated Detection of Pre-training Text in Black-box LLMs

Ruihan Hu, Yu-Ming Shang, Jiankun Peng, Wei Luo, Yazhe Wang, Xi Zhang

机构 * Key Laboratory of Trustworthy Distributed Computing and Service (MoE), Beijing University of Posts and Telecommunications, China(可信分布式计算与服务重点实验室,北京邮电大学,中国) Zhongguancun Laboratory, China(中关村实验室,中国)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18898 2025-06-24 cs.CV cs.AI cs.CL cs.MM 79%

Vision as a Dialect: Unifying Visual Understanding and Generation via Text-Aligned Representations

Jiaming Han, Hao Chen, Yang Zhao, Hanyu Wang, Qi Zhao, Ziyan Yang, Hao He, Xiangyu Yue, Lu Jiang

机构 * CUHK MMLab(香港中文大学MML实验室) ByteDance Seed(字节跳动种子)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Project page: https://tar.csuhan.com

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.15712 2025-06-23 cs.LG cs.AI 79%

BatteryBERT for Realistic Battery Fault Detection Using Point-Masked Signal Modeling

Songqi Zhou, Ruixue Liu, Yixing Wang, Jia Lu, Benben Jiang

机构 * Department of Automation Tsinghua University Beijing, China(自动化系 清华大学 北京中国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11702 2025-06-16 cs.CL cs.AI 79%

Configurable Preference Tuning with Rubric-Guided Synthetic Data

Víctor Gallego

机构 * Komorebi AI Technologies, Madrid, Spain(Komorebi人工智能技术公司)

专题命中 预训练与数据 :LLM(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

Comments Accepted to ICML 2025 Workshop on Models of Human Feedback for AI Alignment

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14021 2025-06-09 cs.CL cs.LG q-bio.QM 79%

HIGHT: Hierarchical Graph Tokenization for Molecule-Language Alignment

Yongqiang Chen, Quanming Yao, Juzheng Zhang, James Cheng, Yatao Bian

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.LG

Comments ICML2025, 27 pages, 7 figures, 23 tables; project page: https://higraphllm.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.08541 2025-06-09 cs.CL cs.LG 79%

Where is the signal in tokenization space?

Renato Lui Geh, Honghua Zhang, Kareem Ahmed, Benjie Wang, Guy Van den Broeck

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 2024 Conference on Empirical Methods in Natural Language Processing, EMNLP 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.03198 2025-06-06 cs.CL cs.HC cs.LG stat.AP stat.ML 79%

The Impossibility of Fair LLMs

Jacy Anthis, Kristian Lum, Michael Ekstrand, Avi Feller, Chenhao Tan

机构 * University of Chicago(芝加哥大学) Stanford University(斯坦福大学) Drexel University(德雷塞尔大学) University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Published in ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06474 2025-06-05 cs.IR cs.AI cs.CL 79%

ROGRAG: A Robustly Optimized GraphRAG Framework

Zhefan Wang, Huanjun Kong, Jie Ying, Wanli Ouyang, Nanqing Dong

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments ACL2025 demo track, 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.07045 2025-06-05 cs.CR cs.AI cs.CL cs.CY 79%

Scalable and Ethical Insider Threat Detection through Data Synthesis and Analysis by LLMs

Haywood Gelman, John D. Hastings

机构 * The Beacom College of Computer and Cyber Sciences(贝科姆计算机与网络科学学院) Dakota State University(达科他州立大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 6 pages, 0 figures, 8 tables

Journal ref 2025 IEEE 13th International Symposium on Digital Forensics and Security (ISDFS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10495 2025-05-26 cs.LG cs.CL 79%

RouteNator: A Router-Based Multi-Modal Architecture for Generating Synthetic Training Data for Function Calling LLMs

Vibha Belavadi, Tushar Vatsa, Dewang Sultania, Suhas Suresha, Ishita Verma, Cheng Chen, Tracy Holloway King, Michael Friedrich

机构 * Adobe Inc.(Adobe公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Proceedings of the 4th International Workshop on Knowledge-Augmented Methods for Natural Language Processing

Journal ref https://aclanthology.org/2025.knowledgenlp-1.10/ KnowledgeNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12100 2025-05-20 cs.CL cs.AI 79%

Improving Fairness in LLMs Through Testing-Time Adversaries

Isabela Pereira Gregio, Ian Pons, Anna Helena Reali Costa, Artur Jordão

机构 * Escola Politécnica, Universidade de São Paulo(圣保罗大学理工大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.20094 2025-05-09 cs.CL cs.LG 79%

Scaling Synthetic Data Creation with 1,000,000,000 Personas

Tao Ge, Xin Chan, Xiaoyang Wang, Dian Yu, Haitao Mi, Dong Yu

机构 * Tencent AI Lab(腾讯AI实验室)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04284 2025-05-08 cs.CL cs.AI 79%

GASCADE: Grouped Summarization of Adverse Drug Event for Enhanced Cancer Pharmacovigilance

Sofia Jamil, Aryan Dabad, Bollampalli Areen Reddy, Sriparna Saha, Rajiv Misra, Adil A. Shakur

机构 * Department of Computer Science & Engineering, Indian Institute of Technology Patna(印度理工学院帕纳布分校计算机科学与工程系) Indira Gandhi Institute of Medical Sciences, Patna(英伽丁医学科学学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.14397 2025-05-05 cs.CL cs.CY cs.LG 79%

RTP-LX: Can LLMs Evaluate Toxicity in Multilingual Scenarios?

Adrian de Wynter, Ishaan Watts, Tua Wongsangaroonsri, Minghui Zhang, Noura Farra, Nektar Ege Altıntoprak, Lena Baur, Samantha Claudet, Pavel Gajdusek, Can Gören, Qilong Gu, Anna Kaminska, Tomasz Kaminski, Ruby Kuo, Akiko Kyuba, Jongho Lee, Kartik Mathur, Petter Merok, Ivana Milovanović, Nani Paananen, Vesa-Matti Paananen, Anna Pavlenko, Bruno Pereira Vidal, Luciano Strika, Yueh Tsao, Davide Turcato, Oleksandr Vakhno, Judit Velcsov, Anna Vickers, Stéphanie Visser, Herdyan Widarmanto, Andrey Zaikin, Si-Qing Chen

机构 * Microsoft Research India(微软印度研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

Comments AAAI 2025--camera ready + extended abstract

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.18762 2025-05-01 cs.CL cs.LG 79%

SynLexLM: Scaling Legal LLMs with Synthetic Data and Curriculum Learning

Ojasw Upadhyay, Abishek Saravanakumar, Ayman Ismail

机构 * Georgia Institue of Technology(佐治亚理工学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments 9 pages, 4 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.15208 2025-04-22 cs.LG cs.AI 79%

Compute-Optimal LLMs Provably Generalize Better With Scale

Marc Finzi, Sanyam Kapoor, Diego Granziol, Anming Gu, Christopher De Sa, J. Zico Kolter, Andrew Gordon Wilson

机构 * Carnegie Mellon University(卡内基梅隆大学) New York University(纽约大学) PureStrength AI Boston University(波士顿大学) Cornell University(康奈尔大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10397 2025-04-15 cs.AI cs.LG 79%

Can LLMs Assist Expert Elicitation for Probabilistic Causal Modeling?

Olha Shaposhnyk, Daria Zahorska, Svetlana Yanushkevich

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10281 2025-04-15 cond-mat.mtrl-sci cond-mat.mes-hall cs.AI cs.CV cs.LG 79%

Zero-shot Autonomous Microscopy for Scalable and Intelligent Characterization of 2D Materials

Jingyun Yang, Ruoyan Avery Yin, Chi Jiang, Yuepeng Hu, Xiaokai Zhu, Xingjian Hu, Sutharsika Kumar, Xiao Wang, Xiaohua Zhai, Keran Rong, Yunyue Zhu, Tianyi Zhang, Zongyou Yin, Jing Kong, Neil Zhenqiang Gong, Zhichu Ren, Haozhe Wang

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI、cs.LG

Comments 13 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03598 2025-04-07 cs.CL cs.AI cs.IR 79%

EnrichIndex: Using LLMs to Enrich Retrieval Indices Offline

Peter Baile Chen, Tomer Wolfson, Michael Cafarella, Dan Roth

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Dataset and code are available at https://peterbaile.github.io/enrichindex/

详情

展开后加载摘要…

URL PDF HTML 收藏