arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-10-06 至 2025-10-06 共收录 7 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 7 篇

2510.02768 2025-10-06 cs.LG cs.CL 82%

A Granular Study of Safety Pretraining under Model Abliteration

Shashank Agnihotri, Jonas Jakubassa, Priyam Dey, Sachin Goyal, Bernt Schiele, Venkatesh Babu Radhakrishnan, Margret Keuper

机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) Vision and AI Lab, Indian Institute of Science(印度科学院视觉与人工智能实验室) Carnegie Mellon University(卡内基梅隆大学) Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰信息校园)

专题命中 预训练与数据 :pretraining(title,abstract);分类 cs.CL、cs.LG;LLM(comments)

Comments Accepted at NeurIPS 2025 bWorkshop Lock-LLM. *Equal Contribution

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01918 2025-10-06 cs.CL cs.AI 79%

Quantum-RAG and PunGPT2: Advancing Low-Resource Language Generation and Retrieval for the Punjabi Language

Jaskaranjeet Singh, Rakesh Thakur

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.07731 2025-10-06 cs.CL cs.LG eess.AS 73%

Spoken Language Understanding on Unseen Tasks With In-Context Learning

Neeraj Agrawal, Sriram Ganapathy

机构 * Indian Institute of Science(印度科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Journal ref Proc. Interspeech 2025, 4103-4107

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02084 2025-10-06 cs.LG cs.AI 62%

KAIROS: Unified Training for Universal Non-Autoregressive Time Series Forecasting

Kuiye Ding, Fanda Fan, Zheya Wang, Hongxiao Li, Yifan Wang, Lei Wang, Chunjie Luo, Jianfeng Zhan

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) Department of Mathematical Sciences, Durham University(杜伦大学数学科学系) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00186 2025-10-06 cs.AI cs.LG 62%

Thinkquel: A Model Dedicated to Text-to-dbt Using Synthetic Data and a Span-Aware Objective

Anni Li, Aria Attar, Paul Dong

机构 * TensorStax

专题命中 预训练与数据 :SFT(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.18389 2025-10-06 cs.LG 57%

Towards Provable Emergence of In-Context Reinforcement Learning

Jiuqi Wang, Rohan Chandra, Shangtong Zhang

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

Comments NeurIPS 2025, 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.11751 2025-10-06 stat.ML cond-mat.dis-nn cs.LG 57%

Asymptotic theory of in-context learning by linear attention

Yue M. Lu, Mary I. Letey, Jacob A. Zavatone-Veth, Anindita Maiti, Cengiz Pehlevan

机构 * The John A. Paulson School of Engineering and Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心) Society of Fellows, Harvard University(哈佛大学 fellows 会) Department of Physics, Harvard University(哈佛大学物理系) Perimeter Institute for Theoretical Physics, Waterloo, ON N2L 2Y5, Canada(理论物理研究所,滑铁卢,加拿大) The Kempner Institute for the Study of Natural and Artificial Intelligence, 150 Western Avenue, Alston, MA 02134(自然与人工智能研究 institute)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

Comments 15 pages (main doc), 6 figures, and supplementary information (22 pages)

Journal ref Proc. Natl. Acad. Sci. U.S.A. 122 (28) e2502599122 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏