arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 140189 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12486 篇

2412.20984 2025-10-24 cs.LG 70%

Pareto-Optimal Energy Alignment for Designing Nature-Like Antibodies

Yibo Wen, Chenwei Xu, Jerry Yao-Chieh Hu, Kaize Ding, Han Liu

机构 * Northwestern University(西北大学)

专题命中 预训练与数据 :language model(abstract);preference optimization(abstract);分类 cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19493 2025-10-23 cs.CL 70%

What is the Best Sequence Length for BABYLM?

Suchir Salhan, Richard Diehl Martinez, Zébulon Goriely, Paula Buttery

机构 * Department of Computer Science & Technology, University of Cambridge, U.K.(计算机科学与技术系,剑桥大学,英国) ALTA Institute, University of Cambridge, U.K.(ALTA研究所,剑桥大学,英国)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments Paper Accepted at the 2025 BabyLM Workshop @ EMNLP (Suzhou, China)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16987 2025-10-21 cs.CL 70%

Back to Bytes: Revisiting Tokenization Through UTF-8

Amit Moryossef, Clara Meister, Pavel Stepachev, Desmond Elliott

专题命中 预训练与数据 :language model(abstract);post-training(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15162 2025-10-20 cs.CV cs.CL 70%

Train a Unified Multimodal Data Quality Classifier with Synthetic Data

Weizhi Wang, Rongmei Lin, Shiyang Li, Colin Lockard, Ritesh Sarkhel, Sanket Lokegaonkar, Jingbo Shang, Xifeng Yan, Nasser Zalmout, Xian Li

机构 * UC Santa Barbara(加州大学圣芭芭拉分校) Amazon Stores Foundational AI(亚马逊商店基础人工智能) UC San Diego(加州大学圣地亚哥分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14915 2025-10-17 cs.CL 70%

Harmonizing Diverse Models: A Layer-wise Merging Strategy for Consistent Generation

Xujun Peng, Anoop Kumar, Jingyu Wu, Parker Glenn, Daben Liu

机构 * AI Foundations, Capital One McLean, VA, USA(AI基础研究,Capital One麦莱恩,美国弗吉尼亚州)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments EMNLP 2025 Industry track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13992 2025-10-17 cs.SE cs.LG 70%

Signature in Code Backdoor Detection, how far are we?

Quoc Hung Le, Thanh Le-Cong, Bach Le, Bowen Xu

机构 * North Carolina State University(北卡罗来纳州立大学) The University of Melbourne(墨尔本大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 20 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.12931 2025-10-16 cs.CV cs.CL 70%

Unifying Vision-Language Latents for Zero-label Image Caption Enhancement

Sanghyun Byun, Jung Ick Guack, Mohanad Odema, Baisub Lee, Jacob Song, Woo Seong Chung

机构 * LG Electronics USA(LG电子美国公司)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL

Comments Accepted to PMLR and NeurIPS 2025 UniReps

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13211 2025-10-16 cs.CV cs.AI 70%

MIRROR: Multimodal Cognitive Reframing Therapy for Rolling with Resistance

Subin Kim, Hoonrae Kim, Jihyun Lee, Yejin Jeon, Gary Geunbae Lee

机构 * KT Corporation, Republic of Korea(韩国KT公司) Graduate School of Artificial Intelligence, POSTECH, Republic of Korea(POSTECH人工智能研究生院) Computer Science and Engineering, POSTECH, Republic of Korea(POSTECH计算机科学与工程系)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17538 2025-10-15 stat.ML cs.LG math.ST stat.TH 70%

A Statistical Theory of Contrastive Learning via Approximate Sufficient Statistics

Licong Lin, Song Mei

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10990 2025-10-14 cs.CR cs.CL cs.NE 70%

Secret-Protected Evolution for Differentially Private Synthetic Text Generation

Tianze Wang, Zhaoyu Chen, Jian Du, Yingtai Xiao, Linjun Zhang, Qiang Yan

机构 * TikTok Department of Statistics, Rutgers University(统计学系,罗格斯大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18233 2025-10-14 cs.AI 70%

Beyond Parameters: Exploring Virtual Logic Depth for Scaling Laws

Ruike Zhu, Hanwen Zhang, Kevin Li, Tianyu Shi, Yiqun Duan, Chi Wang, Tianyi Zhou, Arindam Banerjee, Zengyi Qin

机构 * University of Illinois at Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) University of Toronto(多伦多大学) University of Technology Sydney(悉尼技术大学) Google DeepMind(谷歌DeepMind) University of Maryland, College Park(马里兰大学学院市分校) Massachusetts Institute of Technology(麻省理工学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.02502 2025-10-14 cs.CL 70%

LADM: Long-context Training Data Selection with Attention-based Dependency Measurement for LLMs

Jianghao Chen, Junhong Wu, Yangyifan Xu, Jiajun Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Zhongguancun Academy, Beijing, China(中关村学院,北京,中国) Wuhan AI Research(武汉人工智能研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments ACL 2025, our code is available at https://github.com/ZNLP/LADM

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.11411 2025-10-13 cs.LG 70%

Detecting and Filtering Unsafe Training Data via Data Attribution with Denoised Representation

Yijun Pan, Taiwei Shi, Jieyu Zhao, Jiaqi W. Ma

机构 * University of Michigan(密歇根大学) University of Southern California(南加州大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments 14 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07434 2025-10-10 cs.CL 70%

Lemma Dilemma: On Lemma Generation Without Domain- or Language-Specific Training Data

Olia Toporkov, Alan Akbik, Rodrigo Agerri

机构 * HiTZ Center - Ixa, University of the Basque Country UPV/EHU(巴斯克大学希茨中心 - Ixa,巴斯克国家大学UPV/EHU) Humboldt-Universität zu Berlin(柏林洪堡大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 14 pages, 2 figures, 5 tables. Accepted to EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05133 2025-10-08 cs.CL 70%

Characterizing Model Behavior Under Synthetic Data Training: An Empirical Study Across Scales and Mixing Ratios

Y. Du, G. Wu, G. Tang, W. Wang, Q. Fan

机构 * Independent Research Collaboration(独立研究者)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 17 pages. Technical report

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04145 2025-10-07 cs.CV cs.CL cs.IR 70%

Automating construction safety inspections using a multi-modal vision-language RAG framework

Chenxin Wang, Elyas Asadi Shamsabadi, Zhaohui Chen, Luming Shen, Alireza Ahmadian Fard Fini, Daniel Dias-da-Costa

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments 33 pages, 11 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.10301 2025-10-07 cs.IR cs.AI 70%

Towards Understanding Bias in Synthetic Data for Evaluation

Hossein A. Rahmani, Varsha Ramineni, Emine Yilmaz, Nick Craswell, Bhaskar Mitra

机构 * University College London(伦敦大学学院) Microsoft(微软)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

Comments CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10493 2025-10-07 cs.CL 70%

DACL-RAG: Data Augmentation Strategy with Curriculum Learning for Retrieval-Augmented Generation

Shaohan Wang, Licheng Zhang, Zheren Fu, Zhendong Mao, Yongdong Zhang

机构 * School of Information Science and Technology, University of Science and Technology of China(信息科学与技术学院,中国科学技术大学) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究院,合肥综合性国家科学中心)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03309 2025-10-07 cs.LG q-bio.BM 70%

Thin Bridges for Drug Text Alignment: Lightweight Contrastive Learning for Target Specific Drug Retrieval

Mallikarjuna Tupakula

机构 * Rochester Institute of Technology(罗切斯特技术研究所)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02241 2025-10-03 cs.IR cs.CL 70%

Study on LLMs for Promptagator-Style Dense Retriever Training

Daniel Gwon, Nour Jedidi, Jimmy Lin

机构 * Massachusetts Institute of Technology Lincoln Laboratory(麻省理工学院林肯实验室) University of Waterloo(滑铁卢大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments CIKM 2025 short research paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01989 2025-10-03 cs.CL 70%

Exploring Database Normalization Effects on SQL Generation

Ryosuke Kohita

机构 * CyberAgent

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01546 2025-10-03 cs.CV cs.LG 70%

Growing Visual Generative Capacity for Pre-Trained MLLMs

Hanyu Wang, Jiaming Han, Ziyan Yang, Qi Zhao, Shanchuan Lin, Xiangyu Yue, Abhinav Shrivastava, Zhenheng Yang, Hao Chen

机构 * University of Maryland, College Park(马里兰大学学院公园分校) CUHK MMLab(香港大学MMLab) ByteDance(字节跳动)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

Comments Project page: https://hywang66.github.io/bridge/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01141 2025-10-02 cs.AI 70%

Apriel-1.5-15b-Thinker

Shruthan Radhakrishna, Aman Tiwari, Aanjaneya Shukla, Masoud Hashemi, Rishabh Maheshwary, Shiva Krishna Reddy Malay, Jash Mehta, Pulkit Pattnaik, Saloni Mittal, Khalil Slimi, Kelechi Ogueji, Akintunde Oladipo, Soham Parikh, Oluwanifemi Bamgbose, Toby Liang, Ahmed Masry, Khyati Mahajan, Sai Rajeswar Mudumba, Vikas Yadav, Sathwik Tejaswi Madhusudhan, Torsten Scholak, Sagar Davasam, Srinivas Sunkara, Nicholas Chapados

专题命中 预训练与数据 :pretraining(abstract);preference optimization(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25649 2025-10-01 cs.CL 70%

The Media Bias Detector: A Framework for Annotating and Analyzing the News at Scale

Samar Haider, Amir Tohidi, Jenny S. Wang, Timothy Dörr, David M. Rothschild, Chris Callison-Burch, Duncan J. Watts

机构 * Department of Computer and Information Science, University of Pennsylvania(计算机与信息科学系,宾夕法尼亚大学) Harvard Business School(哈佛商学院) Microsoft Research(微软研究院) Annenberg School for Communication, University of Pennsylvania(传播学院,宾夕法尼亚大学) Department of Operations, Information, and Decisions, University of Pennsylvania(运营、信息与决策系,宾夕法尼亚大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22631 2025-09-29 cs.CV cs.CL 70%

LABELING COPILOT: A Deep Research Agent for Automated Data Curation in Computer Vision

Debargha Ganguly, Sumit Kumar, Ishwar Balappanawar, Weicong Chen, Shashank Kambhatla, Srinivasan Iyengar, Shivkumar Kalyanaraman, Ponnurangam Kumaraguru, Vipin Chaudhary

专题命中 预训练与数据 :language model(abstract);foundation model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22589 2025-09-29 cs.CL 70%

ArabJobs: A Multinational Corpus of Arabic Job Ads

Mo El-Haj

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22345 2025-09-29 cs.CL 70%

The InviTE Corpus: Annotating Invectives in Tudor English Texts for Computational Modeling

Sophie Spliethoff, Sanne Hoeken, Silke Schwandt, Sina Zarrieß, Özge Alaçam

机构 * Dept. of History, Faculty of History, Philosophy and Theology, Bielefeld University(历史系,历史、哲学与神学学院,比勒菲尔德大学) Computational Linguistics, Dept. of Linguistics, Bielefeld University(计算语言学,语言学系,比勒菲尔德大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08415 2025-09-26 cs.LG math.ST stat.ML stat.TH 70%

Improved Scaling Laws in Linear Regression via Data Reuse

Licong Lin, Jingfeng Wu, Peter L. Bartlett

机构 * University of California, Berkeley(加州大学伯克利分校) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11045 2025-09-25 cs.LG 70%

Procedural Environment Generation for Tool-Use Agents

Michael Sullivan, Mareike Hartmann, Alexander Koller

机构 * Department of Language Science and Technology(语言科学与技术系) Saarland Informatics Campus(萨尔兰信息学校区) Saarland University(萨尔兰大学)

专题命中 预训练与数据 :LLM(abstract);SFT(abstract);分类 cs.LG

Comments 16 pages, 3 figures; accepted at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.19770 2025-09-25 cs.CL 70%

EnAnchored-X2X: English-Anchored Optimization for Many-to-Many Translation

Sen Yang, Yu Bao, Yu Lu, Jiajun Chen, Shujian Huang, Shanbo Cheng

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

Comments Accepted to EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏