arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2601.02683 2026-01-07 cs.AI 81%

Learning from Prompt itself: the Hierarchical Attribution Prompt Optimization

从提示本身学习:层次归因提示优化

Dongyu Chen, Jian Ma, Xianpeng Zhang, Lei Zhang, Haonan Lu, Chen Chen, Chuangchuang Wang, Kai Tang

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 HAPO框架通过动态归因机制、语义单元优化和多模态支持,提升提示优化效率,适用于多任务场景。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02360 2026-01-06 cs.LG 81%

Heterogeneous Low-Bandwidth Pre-Training of LLMs

异构低带宽预训练大语言模型

Yazan Obeidi, Amir Sarfi, Joel Lidin, Paul Janson, Eugene Belilovsky

机构 * Covenant AI Mila, Concordia University(Mila,康科德ia大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出一种异构分布式训练框架,结合低带宽流水线并行与SparseLoCo方法,通过激活压缩优化LLM预训练的通信效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02910 2025-12-30 cs.HC cs.AI 81%

In Silico Development of Psychometric Scales: Feasibility of Representative Population Data Simulation with LLMs

基于LLM的psychometric量表开发:利用代表性人口数据模拟的可行性

Enrico Cipriani, Pavel Okopnyi, Danilo Menicucci, Simone Grassini

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本文探讨了利用LLM生成模拟数据在心理量表开发中的可行性,发现其在群体层面具有应用价值,但无法替代个体层面的验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15003 2025-12-18 cs.CR cs.LG cs.SE 81%

SeBERTis: A Framework for Producing Classifiers of Security-Related Issue Reports

SeBERTis:一个用于生成安全相关问题报告分类器的框架

Sogol Masoumzadeh, Yufei Li, Shane McIntosh, Dániel Varró, Lili Wei

机构 * Electrical \& Computer Engineering McGill University Montréal, Canada Cheriton School of Computer Science University of Waterloo Waterloo, Canada 2cm Computer \& Information Science 2cm Linköping University 2cm Linköping, Sweden 2cm 2cm Electrical \& Computer Engineering 2cm McGill University 2cm Montréal, Canada 2cm

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SEBERTIS通过训练深度神经网络分类器,有效提升安全相关问题的检测精度,显著优于现有方法。

Comments This is the author pre-print. The manuscript has been accepted for publication at SANER 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01107 2025-12-02 cs.AI econ.EM stat.ML 81%

Foundation Priors

基础先验

Sanjog Misra

机构 * Booth School of Business, University of Chicago(芝加哥大学商学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);prompting(abstract)

AI总结 本文提出基础先验概念,将生成模型输出视为主观先验,以避免合成数据与真实数据混淆,应用于实证研究和模型改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.02857 2025-12-02 cs.LG 81%

Measuring Fingerprints of Web-filtered Text Datasets and Fingerprint Propagation Through Training

测量Web过滤文本数据集的指纹及其通过训练传播

Youssef Mansour, Reinhard Heckel

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 研究发现预训练数据集的指纹可通过训练传播,揭示数据特征及预训练混合比例等信息。

Journal ref NeurIPS 2025 (Spotlight)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22674 2025-12-01 cs.LG 81%

Modèles de Fondation et Ajustement : Vers une Nouvelle Génération de Modèles pour la Prévision des Séries Temporelles

基础模型与调整:迈向新一代时间序列预测模型

Morad Laglil, Emilie Devijver, Eric Gaussier, Bertrand Pracca

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

AI总结 本文提出通过预训练后微调提升时间序列预测模型在长周期预测中的性能

Comments in French language

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.07296 2025-11-11 cs.CL 81%

Who Is the Story About? Protagonist Entity Recognition in News

Jorge Gabín, M. Eduardo Ares, Javier Parapar

机构 * Linknovate Science(Linknovate科学) IRLab CITIC Computer Science Department University of A Coruña(IRLab CITIC计算机科学系大学) University of A Coruña(阿拉斯卡大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.16713 2025-11-04 cs.CL 81%

so much depends / upon / a whitespace: Why Whitespace Matters for Poets and LLMs

Sriharsh Bhyravajjula, Melanie Walsh, Anna Preus, Maria Antoniak

机构 * University of Washington(华盛顿大学) University of Colorado Boulder(科罗拉多大学 Boulder分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Journal ref Text2Story Workshop @ ECIR 2022, CEUR Workshop Proceedings, Vol. 3117, pp. 67-74, 2022. Available at https://ceur-ws.org/Vol-3117/paper7.pdf

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21501 2025-10-27 cs.CV cs.AI 81%

GranViT: A Fine-Grained Vision Model With Autoregressive Perception For MLLMs

Guanghao Zheng, Bowen Shi, Mingxing Xu, Ruoyu Sun, Peisen Zhao, Zhibo Zhang, Wenrui Dai, Junni Zou, Hongkai Xiong, Xiaopeng Zhang, Qi Tian

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Inc.(华为公司)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 21 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18344 2025-10-22 cs.CL 81%

Combining Distantly Supervised Models with In Context Learning for Monolingual and Cross-Lingual Relation Extraction

Vipul Rathore, Malik Hammad Faisal, Parag Singla, Mausam

机构 * Indian Institute of Technology New Delhi(印度理工学院新德里)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10906 2025-10-21 cs.CL 81%

Understanding LLMs' Cross-Lingual Context Retrieval: How Good It Is And Where It Comes From

Changjiang Gao, Hankun Lin, Xin Huang, Xue Han, Junlan Feng, Chao Deng, Jiajun Chen, Shujian Huang

机构 * National Key Laboratory for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) China Mobile Research Beijing, China(中国移动北京研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22962 2025-10-07 cs.LG cond-mat.mtrl-sci physics.chem-ph 81%

Multimodal machine learning with large language embedding model for polymer property prediction

Tianren Zhang, Dai-Bei Yang

机构 * Department of Materials Science and Engineering, University of Delaware, Newark, Delaware 19716, United States(材料科学与工程系,德雷克塞尔大学) Department of Chemistry, University of Pennsylvania, Philadelphia, Pennsylvania 19104, United States(化学系,宾夕法尼亚大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Journal ref Chem. Mater. 2025, 37, 7002-7013

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01527 2025-10-03 cs.LG 81%

Round-trip Reinforcement Learning: Self-Consistent Training for Better Chemical LLMs

Lecheng Kong, Xiyuan Wang, Yixin Chen, Muhan Zhang

机构 * Washington University in St. Louis(圣路易斯华盛顿大学) Peking University(北京大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01030 2025-10-02 cs.AI 81%

Uncovering the Computational Ingredients of Human-Like Representations in LLMs

Zach Studdiford, Timothy T. Rogers, Kushin Mukherjee, Siddharth Suresh

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.14735 2025-09-19 cs.CL 81%

Decoupled Proxy Alignment: Mitigating Language Prior Conflict for Multimodal Alignment in MLLM

Chenkun Tan, Pengyu Wang, Shaojun Zhou, Botian Jiang, Zhaowei Li, Dong Zhang, Xinghao Wang, Yaqian Zhou, Xipeng Qiu

机构 * Fudan University(复旦大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments Accepted by Findings of EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13892 2025-09-18 cs.HC cs.AI 81%

Synthetic Data Generation for Screen Time and App Usage

Gustavo Kruger, Nikhil Sachdeva, Michael Sobolev

机构 * Universidade Lusófona(里斯本大学) Universitat de Barcelona(巴塞罗那大学) Université Paris Cité(巴黎城市大学) Cornell Tech(康奈尔科技)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 14 pages

Journal ref International Conference on Computer-Human Interaction Research and Applications (CHIRA) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13480 2025-09-18 cs.CL 81%

Gender-Neutral Rewriting in Italian: Models, Approaches, and Trade-offs

Andrea Piergentili, Beatrice Savoldi, Matteo Negri, Luisa Bentivogli

机构 * University of Trento(特伦托大学) Peoples' Friendship University of Russia (RUDN University)(俄罗斯人民友谊大学(RUDN大学)) Joint Institute for Nuclear Research(联合核子研究所) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学) University of Skövde(斯德哥尔摩大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at CLiC-it 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01213 2025-09-03 cs.CL 81%

Mitigating Catastrophic Forgetting in Continual Learning through Model Growth

Ege Süalp, Mina Rezaei

机构 * Department of Statistics Ludwig-Maximilian University(统计系路德维希-马克西米利安大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19069 2025-08-27 cs.AI 81%

Can Structured Templates Facilitate LLMs in Tackling Harder Tasks? : An Exploration of Scaling Laws by Difficulty

Zhichao Yang, Zhaoxin Fan, Gen Li, Yuanze Hu, Xinyu Wang, Ye Qiu, Xin Wang, Yifan Sun, Wenjun Wu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13930 2025-08-20 cs.IR cs.AI 81%

InPars+: Supercharging Synthetic Data Generation for Information Retrieval Systems

Matey Krastev, Miklos Hamar, Danilo Toapanta, Jesse Brouwers, Yibin Lei

机构 * University of Amsterdam(阿姆斯特丹大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);preference optimization(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06178 2025-08-11 cs.CL 81%

Comparing Knowledge Injection Methods for LLMs in a Low-Resource Regime

Hugo Abonizio, Thales Almeida, Roberto Lotufo, Rodrigo Nogueira

机构 * Faculdade de Engenharia Elétrica e de Computação (FEEC), University of Campinas (Unicamp)(电子工程与计算学院(FEEC),坎皮纳斯大学) Instituto de Computação (IC), University of Campinas (Unicamp)(计算研究所(IC),坎皮纳斯大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05179 2025-08-08 cs.CL 81%

ATLANTIS at SemEval-2025 Task 3: Detecting Hallucinated Text Spans in Question Answering

Catherine Kobus, François Lancelot, Marion-Cécile Martin, Nawal Ould Amer

机构 * Airbus AI Research(空客人工智能研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22062 2025-08-04 cs.CV cs.CL 81%

Meta CLIP 2: A Worldwide Scaling Recipe

Yung-Sung Chuang, Yang Li, Dong Wang, Ching-Feng Yeh, Kehan Lyu, Ramya Raghavendra, James Glass, Lifei Huang, Jason Weston, Luke Zettlemoyer, Xinlei Chen, Zhuang Liu, Saining Xie, Wen-tau Yih, Shang-Wen Li, Hu Xu

机构 * FAIR, Meta(FAIR与Meta公司) MIT(麻省理工学院) Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);foundation model(abstract);pretraining(abstract)

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23676 2025-08-01 cs.LG cs.CV 81%

DepMicroDiff: Diffusion-Based Dependency-Aware Multimodal Imputation for Microbiome Data

Rabeya Tus Sadia, Qiang Cheng

机构 * Department of Computer Science University of Kentucky(计算机科学系 哥伦比亚大学) Department of Computer Science, Institute for Biomedical Informatics University of Kentucky(计算机科学系 生物医学信息学研究所 哥伦比亚大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.07426 2025-08-01 cs.AI cs.CE 81%

DrugMCTS: a drug repurposing framework combining multi-agent, RAG and Monte Carlo Tree Search

Zerui Yang, Yuwei Wan, Siyu Yan, Yudai Matsuda, Tong Xie, Bram Hoex, Linqi Song

机构 * City University of Hong Kong, Hong Kong, PR China(香港城市大学) City University of Hong Kong Shenzhen Research Institute, Shenzhen, PR China(香港城市大学深圳研究院) The Hong Kong University of Science and Technology (Guangzhou), Guangzhou PR China(香港科学与技术大学(广州)) GreenDynamics, Sydney, NSW, Australia(GreenDynamics公司) University of New South Wales, Kensington, NSW, Australia(新南威尔士大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12591 2025-07-28 cs.CL 81%

LLMs are Also Effective Embedding Models: An In-depth Overview

Chongyang Tao, Tao Shen, Shen Gao, Junshuo Zhang, Zhen Li, Kai Hua, Wenpeng Hu, Zhengwei Tao, Shuai Ma

机构 * Beihang University(北航大学) SKLSDE Lab, Beihang University(北航SKLSDE实验室) University of Technology Sydney(悉尼大学) University of Electronic Science and Technology of China(电子科技大学) Peking University(北京大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 38 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.09948 2025-07-22 cs.LG cs.AR 81%

Iceberg: Enhancing HLS Modeling with Synthetic Data

Zijian Ding, Tung Nguyen, Weikai Li, Aditya Grover, Yizhou Sun, Jason Cong

机构 * Computer Science Department, UCLA(UCLA计算机科学系)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 9 pages. accepted to ICLAD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02139 2025-07-04 cs.IR cs.AI cs.DL 81%

When LLMs Disagree: Diagnosing Relevance Filtering Bias and Retrieval Divergence in SDG Search

William A. Ingram, Bipasha Banerjee, Edward A. Fox

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Presented at LLM4Eval Workshop, SIGIR 2025 Padova, Italy, July 17, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23605 2025-07-01 cs.CV cs.AI 81%

AI-Generated Lecture Slides for Improving Slide Element Detection and Retrieval

Suyash Maniyar, Vishvesh Trivedi, Ajoy Mondal, Anand Mishra, C. V. Jawahar

机构 * Indian Institute of Technology(印度理工学院) Sardar Vallabhbhai National Institute of Technology(萨达尔·瓦拉巴希国家理工学院) CVIT, International Institute of Information Technology(信息技术国际学院)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 40 pages including supplementary, accepted at ICDAR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏