arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-24 至 2025-10-24 共收录 194 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2510.10603 2025-10-24 cs.AI 89%

EA4LLM: A Gradient-Free Approach to Large Language Model Optimization via Evolutionary Algorithms

WenTao Liu, Siyu Song, Hao Hao, Aimin Zhou

机构 * Shanghai Institute of Artifical Intelligence Education, East China Normal University, Shanghai, China(上海人工智能教育研究院,东华大学,上海,中国) School of Computer Science and Technology, East China Normal University, Shanghai, China(计算机科学与技术学院,东华大学,上海,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.06795 2025-10-24 cs.CL cs.AI cs.LG 88%

ixi-GEN: Efficient Industrial sLLMs through Domain Adaptive Continual Pretraining

Seonwu Kim, Yohan Na, Kihun Kim, Hanhee Cho, Geun Lim, Mintae Kim, Seongik Park, Ki Hyun Kim, Youngsub Han, Byoung-Ki Jeon

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);foundation model(abstract)

Comments Accepted at EMNLP 2025 Industry Track

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20475 2025-10-24 cs.CL 86%

Mask and You Shall Receive: Optimizing Masked Language Modeling For Pretraining BabyLMs

Lukas Edman, Alexander Fraser

机构 * School of Computation, Information and Technology, TU Munich(计算、信息与技术学院,慕尼黑工业大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Munich Data Science Institute(慕尼黑数据科学研究所)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL

Comments Submission to the 2025 BabyLM Challenge

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20377 2025-10-24 cs.AI cs.CL 86%

IKnow: Instruction-Knowledge-Aware Continual Pretraining for Effective Domain Adaptation

Tianyi Zhang, Florian Mai, Lucie Flek

机构 * University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20387 2025-10-24 cs.LG cs.AI cs.CL 85%

Relative-Based Scaling Law for Neural Language Models

Baoqing Yue, Jinyuan Zhou, Zixi Wei, Jingtao Zhan, Qingyao Ai, Yiqun Liu

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20208 2025-10-24 cs.CL 83%

Decoding-Free Sampling Strategies for LLM Marginalization

David Pohl, Marco Cognetta, Junyoung Lee, Naoaki Okazaki

机构 * nlp.c.titech.ac.jp(东京技术大学自然语言处理研究所)

专题命中 预训练与数据 :LLM(title,abstract);language model(abstract);分类 cs.CL

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21785 2025-10-24 cs.LG cs.CL 81%

Born a Transformer -- Always a Transformer? On the Effect of Pretraining on Architectural Abilities

Mayank Jobanputra, Yana Veitsman, Yash Sarrof, Aleksandra Bakalova, Vera Demberg, Ellie Pavlick, Michael Hahn

机构 * Saarland University(萨尔兰大学) Brown University(布朗大学)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05064 2025-10-24 cs.LG 79%

Pretraining Decision Transformers with Reward Prediction for In-Context Multi-task Structured Bandit Learning

Subhojyoti Mukherjee, Josiah P. Hanna, Qiaomin Xie, Robert Nowak

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.LG

Comments Accepted in Reinforcement Learning Conference 2025

Journal ref Reinforcement Learning Journal,vol. 6, 2025, pp. 1681-1723

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20154 2025-10-24 cs.CL cs.AI 79%

Are Stereotypes Leading LLMs' Zero-Shot Stance Detection ?

Anthony Dubreuil, Antoine Gourru, Christine Largeron, Amine Trabelsi

机构 * Laboratoire Hubert Curien, UMR CNRS 5516(Hubert Curien实验室,CNRS UMR 5516) Department of Computer Science, Université de Sherbrooke(计算机科学系,Sherbrooke大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Accepted in EMNLP 2025 (Main)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17884 2025-10-24 cs.CR 78%

PhantomLint: Principled Detection of Hidden LLM Prompts in Structured Documents

Toby Murray

专题命中 预训练与数据 :LLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.15001 2025-10-24 cs.CR cs.AI 70%

VaultGemma: A Differentially Private Gemma Model

Amer Sinha, Thomas Mesnard, Ryan McKenna, Daogao Liu, Christopher A. Choquette-Choo, Yangsibo Huang, Da Yu, George Kaissis, Zachary Charles, Ruibo Liu, Lynn Chua, Pritish Kamath, Pasin Manurangsi, Steve He, Chiyuan Zhang, Badih Ghazi, Borja De Balle Pigem, Prem Eruvbetine, Tris Warkentin, Armand Joulin, Ravi Kumar

机构 * Google Research(谷歌研究) Google DeepMind(谷歌DeepMind)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20984 2025-10-24 cs.LG 70%

Pareto-Optimal Energy Alignment for Designing Nature-Like Antibodies

Yibo Wen, Chenwei Xu, Jerry Yao-Chieh Hu, Kaize Ding, Han Liu

机构 * Northwestern University(西北大学)

专题命中 预训练与数据 :language model(abstract);preference optimization(abstract);分类 cs.LG

Comments 21 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19952 2025-10-24 cs.CY 67%

Synthetic social data: trials and tribulations

Guido Ivetta, Laura Moradbakhti, Rafael A. Calvo

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20256 2025-10-24 cs.CV cs.CL cs.LG cs.MM 62%

Calibrating Multimodal Consensus for Emotion Recognition

Guowei Zhong, Junjie Li, Huaiyu Zhu, Ruohong Huan, Yun Pan

机构 * College of Information Science and Electronic Engineering, Zhejiang University(信息科学与电子工程学院,浙江大学) College of Computer Science and Technology, Zhejiang University of Technology(计算机科学与技术学院,浙江工业大学) Zhejiang University Jinhua Research Institute(浙江大学金华研究院)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16349 2025-10-24 cs.LG cs.AI cs.CR cs.CV 62%

Watermarking Autoregressive Image Generation

Nikola Jovanović, Ismail Labiad, Tomáš Souček, Martin Vechev, Pierre Fernandez

机构 * Meta FAIR ETH Zurich

专题命中 预训练与数据 :language model(abstract);分类 cs.AI、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.23883 2025-10-24 cs.CV cs.CL cs.LG 62%

BioCLIP 2: Emergent Properties from Scaling Hierarchical Contrastive Learning

Jianyang Gu, Samuel Stevens, Elizabeth G Campolongo, Matthew J Thompson, Net Zhang, Jiaman Wu, Andrei Kopanev, Zheda Mai, Alexander E. White, James Balhoff, Wasila Dahdul, Daniel Rubenstein, Hilmar Lapp, Tanya Berger-Wolf, Wei-Lun Chao, Yu Su

机构 * The Ohio State University(俄亥俄州立大学) Smithsonian Institution(史密森学会) UNC Chapel Hill(北卡罗来纳大学教堂山分校) University of California, Irvine(加州大学伊市分校) Princeton University(普林斯顿大学) Duke University(杜克大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025 Spotlight; Project page: https://imageomics.github.io/bioclip-2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20615 2025-10-24 cs.LG 57%

MS-BART: Unified Modeling of Mass Spectra and Molecules for Structure Elucidation

Yang Han, Pengyu Wang, Kai Yu, Xin Chen, Lu Chen

机构 * X-LANCE Lab, School of Computer Science MoE Key Lab of Artificial Intelligence, SJTU AI Institute Shanghai Jiao Tong University, Shanghai, China(X-LANCE实验室,计算机科学学院,人工智能教育部重点实验室,上海交通大学人工智能研究院,上海,中国) Suzhou Laboratory, Suzhou, China(苏州实验室,苏州,中国) Shanghai Innovation Institute, Shanghai, China(上海创新研究院,上海,中国) Jiangsu Key Lab of Language Computing, Suzhou, China(江苏省语言计算重点实验室,苏州,中国)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

Comments NeurIPS 2025, We provide the data and code at https://github.com/OpenDFM/MS-BART

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15299 2025-10-24 cs.CL cs.SD eess.AS 57%

LAMA-UT: Language Agnostic Multilingual ASR through Orthography Unification and Language-Specific Transliteration

Sangmin Lee, Woo-Jin Chung, Hong-Goo Kang

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

Comments Accepted to AAAI 2025 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11224 2025-10-24 cs.CV cs.GR 50%

GenLit: Reformulating Single-Image Relighting as Video Generation

Shrisha Bharadwaj, Haiwen Feng, Giorgio Becherini, Victoria Fernandez Abrevaya, Michael J. Black

机构 * Max Planck Institute for Intelligent Systems(马克斯·普朗克智能系统研究所)

专题命中 预训练与数据 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 19 篇

2508.19529 2025-10-24 cs.CL 88%

Blockwise SFT for Diffusion Language Models: Reconciling Bidirectional Attention and Autoregressive Decoding

Bowen Sun, Yujun Cai, Ming-Hsuan Yang, Yiwei Wang

机构 * University of California, Merced(加州大学默塞德分校) The University of Queensland(昆士兰大学) Google DeepMind(谷歌DeepMind)

专题命中 指令微调 :language model(title,abstract);SFT(title,abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19733 2025-10-24 cs.CL cs.LG 86%

Zhyper: Factorized Hypernetworks for Conditioned LLM Fine-Tuning

M. H. I. Abdalla, Zhipin Wang, Christian Frey, Steffen Eger, Josif Grabocka

机构 * Department of Computer Science University of Technology Nuremberg(计算机科学系图腾技术大学纽伦堡)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20033 2025-10-24 cs.CL 83%

Improving Transfer Learning for Sequence Labeling Tasks by Adapting Pre-trained Neural Language Models

David Dukić

机构 * FACULTY OF ELECTRICAL ENGINEERING AND COMPUTING(电气工程与计算学院) University of Zagreb, Faculty of Electrical Engineering and Computing(Zagreb大学电气工程与计算学院) Department of Electronics, Microelectronics, Computer and Intelligent systems(电子、微电子、计算机和智能系统系) Text Analysis and Knowledge Engineering Laboratory (TakeLab)(文本分析与知识工程实验室)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);分类 cs.CL

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.19844 2025-10-24 cs.CR cs.AI 81%

CourtGuard: A Local, Multiagent Prompt Injection Classifier

Isaac Wu, Michael Maslowski

机构 * Isaac Wu Research Fellow(Isaac Wu 研究员) Non-Trivial Ventures(非平凡企业)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20342 2025-10-24 cs.CL cs.AI 81%

Teaching Language Models to Reason with Tools

Chengpeng Li, Zhengyang Tang, Ziniu Li, Mingfeng Xue, Keqin Bao, Tian Ding, Ruoyu Sun, Benyou Wang, Xiang Wang, Junyang Lin, Dayiheng Liu

机构 * University of Science and Technology of China(中国科学技术大学) Alibaba Inc.(阿里巴巴公司) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen International Center for Industrial and Applied Mathematics(深圳国际工业与应用数学中心) Shenzhen Research Institute of Big Data(深圳大数据研究院)

专题命中 指令微调 :language model(title);post-training(abstract);分类 cs.CL、cs.AI

Comments NIPS2025 Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20222 2025-10-24 cs.LG cs.AI 81%

QKCV Attention: Enhancing Time Series Forecasting with Static Categorical Embeddings for Both Lightweight and Pre-trained Foundation Models

Hao Wang, Baojun Ma

机构 * Independent Researcher(独立研究者) Key Laboratory of Brain-Machine Intelligence for Information Behavior (Ministry of Education and Shanghai)(信息行为脑机智能关键实验室) School of Business and Management(商学院)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

Comments 10 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19271 2025-10-24 cs.SE cs.AI cs.PL 79%

Fine-Tuning Multilingual Language Models for Code Review: An Empirical Study on Industrial C# Projects

Igli Begolli, Meltem Aksoy, Daniel Neider

机构 * Technical University Dortmund, Lovion GmbH(图鲁尼大学,洛维昂公司) Security\ Alliance Ruhr, Technical University Dortmund(安全联盟鲁尔,图鲁尼大学)

专题命中 指令微调 :language model(title,abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.20637 2025-10-24 cs.LG 77%

Large Multimodal Models-Empowered Task-Oriented Autonomous Communications: Design Methodology and Implementation Challenges

Hyun Jong Yang, Hyunsoo Kim, Hyeonho Noh, Seungnyun Kim, Byonghyo Shim

机构 * Seoul National University(首尔国立大学) Hanbat National University(翰baum国立大学) Massachusetts Institute of Technology(麻省理工学院)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.03220 2025-10-24 cs.DC cs.AI cs.LG 73%

Symbiosis: Multi-Adapter Inference and Fine-Tuning

Saransh Gupta, Umesh Deshpande, Travis Janssen, Swami Sundararaman

机构 * IBM Research, USA(IBM研究院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.16722 2025-10-24 cs.CL cs.AI 73%

Breaking mBad! Supervised Fine-tuning for Cross-Lingual Detoxification

Himanshu Beniwal, Youngwoo Kim, Maarten Sap, Soham Dan, Thomas Hartvigsen

机构 * Indian Institute of Technology Gandhinagar(印度古吉拉特邦理工学院加尔文加尔)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted at MELT Workshop @ COLM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13251 2025-10-24 cs.CL cs.AI 73%

Neural Attention Search

Difan Deng, Marius Lindauer

机构 * Leibniz University Hannover(汉诺威莱布尼茨大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments 35 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏