arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-02 至 2025-10-02 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2510.00125 2025-10-02 cs.CL cs.AI cs.CR 88%

Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning

Hong kyu Lee, Ruixuan Liu, Li Xiong

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00537 2025-10-02 cs.LG cs.IT math.IT 85%

Spectral Scaling Laws in Language Models: How Effectively Do Feed-Forward Networks Use Their Latent Space?

Nandan Kumar Jha, Brandon Reagen

机构 * New York University(纽约大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.LG

Comments EMNLP 2025 Main Conference (Long paper)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01030 2025-10-02 cs.AI 81%

Uncovering the Computational Ingredients of Human-Like Representations in LLMs

Zach Studdiford, Timothy T. Rogers, Kushin Mukherjee, Siddharth Suresh

机构 * University of Wisconsin–Madison(威斯康星大学麦迪逊分校) Stanford University(斯坦福大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00347 2025-10-02 cs.LG cs.AI cs.MA 79%

In-Context Curiosity: Distilling Exploration for Decision-Pretrained Transformers on Bandit Tasks

Huitao Yang, Guanting Chen

机构 * University of California, Los Angeles(加州大学洛杉矶分校) University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00013 2025-10-02 physics.bio-ph 78%

ProTDyn: a foundation Protein language model for Thermodynamics and Dynamics generation

Yikai Liu, Haoyang Zheng, Lining Mao, Yanbin Wang, Ming Chen, Guang Lin

专题命中 预训练与数据 :language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.12310 2025-10-02 cs.CL 77%

Second Language (Arabic) Acquisition of LLMs via Progressive Vocabulary Expansion

Jianqing Zhu, Huang Huang, Zhihang Lin, Juhao Liang, Zhengyang Tang, Khalid Almubarak, Abdulmohsen Alharthik, Bang An, Juncai He, Xiangbo Wu, Fei Yu, Junying Chen, Zhuoheng Ma, Yuhao Du, He Zhang, Emad A. Alghamdi, Lian Zhang, Ruoyu Sun, Haizhou Li, Benyou Wang, Jinchao Xu

机构 * King Abdullah University of Science and Technology(国王阿卜杜勒阿齐兹大学科学与技术大学) Shenzhen International Center for Industrial and Applied Mathematics, Shenzhen Research Institute of Big Data(深圳国际工业与应用数学中心,深圳大数据研究院) Shenzhen Research Institute of Big Data(深圳大数据研究院) The Chinese University of Hong Kong(香港中文大学) King Abdulaziz University(国王阿卜杜勒阿齐兹大学) Prince Sattam bin Abdulaziz University(普林斯萨塔姆·本·阿卜杜勒阿齐兹大学) University of Bisha(比沙大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

Journal ref Proceedings of the 63rd Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04408 2025-10-02 cs.CL cs.AI 73%

Unpacking Let Alone: Human-Scale Models Generalize to a Rare Construction in Form but not Meaning

Wesley Scivetti, Tatsuya Aoyama, Ethan Wilcox, Nathan Schneider

机构 * Georgetown University(杰克逊维尔大学)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI

Comments Empirical Methods for Natural Language Processing (EMNLP) 2025, Camera-Ready Version

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01141 2025-10-02 cs.AI 70%

Apriel-1.5-15b-Thinker

Shruthan Radhakrishna, Aman Tiwari, Aanjaneya Shukla, Masoud Hashemi, Rishabh Maheshwary, Shiva Krishna Reddy Malay, Jash Mehta, Pulkit Pattnaik, Saloni Mittal, Khalil Slimi, Kelechi Ogueji, Akintunde Oladipo, Soham Parikh, Oluwanifemi Bamgbose, Toby Liang, Ahmed Masry, Khyati Mahajan, Sai Rajeswar Mudumba, Vikas Yadav, Sathwik Tejaswi Madhusudhan, Torsten Scholak, Sagar Davasam, Srinivas Sunkara, Nicholas Chapados

专题命中 预训练与数据 :pretraining(abstract);preference optimization(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00993 2025-10-02 cs.CV 67%

Visual Self-Refinement for Autoregressive Models

Jiamian Wang, Ziqi Zhou, Chaithanya Kumar Mummadi, Sohail Dianat, Majid Rabbani, Raghuveer Rao, Chen Qiu, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工大学) Bosch Research(博世研究) DEVCOM Army Research Laboratory(美国陆军研究实验室)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

Comments Accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00582 2025-10-02 cs.CL cs.AI cs.SD 62%

SAGE-LD: Towards Scalable and Generalizable End-to-End Language Diarization via Simulated Data Augmentation

Sangmin Lee, Woongjib Choi, Jihyun Kim, Hong-Goo Kang

机构 * Dept. of Electrical \& Electronic Engineering, Yonsei University, Seoul, South Korea

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏