arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-29 至 2025-12-29 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 8 篇

2410.23066 2025-12-29 cs.CL cs.LG 84%

Don't Pay Attention, PLANT It: Pretraining Attention via Learning-to-Rank

不要关注,PLANT它:通过学习排序进行预训练注意力

Debjyoti Saha Roy, Byron C. Wallace, Javed A. Aslam

机构 * Khoury College of Computer Sciences, Northeastern University(东北大学克劳利计算机科学学院)

专题命中 预训练与数据 :pretraining(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PLANT通过学习排序模型预训练注意力,提升多标签文本分类性能,尤其在少样本和稀有标签任务中表现突出。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21933 2025-12-29 cs.CL 77%

Broken Words, Broken Performance: Effect of Tokenization on Performance of LLMs

破碎的词,破碎的性能:分词对大语言模型性能的影响

Sachin Pawar, Manoj Apte, Kshitij Jadhav, Girish Keshav Palshikar, Nitin Ramrakhiyani

机构 * TCS Research(塔塔咨询服务研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了分词对大语言模型性能的影响,提出惩罚函数量化分词质量,并验证其在多个NLP任务上的统计显著性。

Comments International Joint Conference on Natural Language Processing & Asia-Pacific Chapter of the Association for Computational Linguistics (IJCNLP-AACL 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21440 2025-12-29 cs.SE cs.LG 77%

Fuzzwise: Intelligent Initial Corpus Generation for Fuzzing

Fuzzwise: 用于模糊测试的智能初始语料生成

Hridya Dhulipala, Xiaokai Rong, Aashish Yadavally, Tien N. Nguyen

机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 FuzzWise通过基于LLM的多代理框架,高效生成初始语料,提升模糊测试的代码覆盖和错误触发效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.03814 2025-12-29 cs.LG cs.AI cs.CL 75%

Recursive Training Loops in LLMs: How training data properties modulate distribution shift in generated data?

LLMs中的递归训练循环:训练数据属性如何调节生成数据中的分布偏移

Grgur Kovač, Jérémy Perez, Rémy Portelas, Peter Ford Dominey, Pierre-Yves Oudeyer

机构 * Flowers TEAM, INRIA(INRIA Flowers TEAM) Ubisoft La Forge INSERM UMR 1093-CAPS Robot Cognition Laboratory, Institute Marey(Institute Marey Robot Cognition Laboratory)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了LLMs中递归训练循环中训练数据属性对生成数据分布偏移的影响,发现词汇多样性放大偏移,而语义多样性和数据质量减轻偏移,并揭示了不同领域数据之间的模块化影响。

Comments Accepted to EMNLP 2025 (Oral), Source Code: https://github.com/flowersteam/ce_llms

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21515 2025-12-29 cs.LG cs.CL 73%

Perplexity-Aware Data Scaling Law: Perplexity Landscapes Predict Performance for Continual Pre-training

感知度意识的数据扩展定律:感知度景观预测持续预训练的表现

Lei Liu, Hao Zhu, Yue Shen, Zhixuan Chu, Jian Wang, Jinjie Gu, Kui Ren

机构 * Ant Group(蚂蚁集团) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出感知度意识的数据扩展定律,通过感知度景观预测持续预训练的表现,有效提升数据利用效率和训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21913 2025-12-29 cs.LG 57%

GQ-VAE: A gated quantized VAE for learning variable length tokens

GQ-VAE:一种门控量化变分自编码器,用于学习可变长度令牌

Theo Datta, Kayla Huang, Sham Kakade, David Brandfonbrener

机构 * Kempner Institute, Harvard University(哈佛大学凯姆纳研究所)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 GQ-VAE通过门控量化变分自编码器实现可变长度令牌学习,提升了压缩和语言建模性能,并在下游语言模型学习中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13030 2025-12-29 cs.CV cs.LG cs.RO 57%

Motus: A Unified Latent Action World Model

Motus:一个统一的潜在动作世界模型

Hongzhe Bi, Hengkai Tan, Shenghao Xie, Zeyuan Wang, Shuhe Huang, Haitian Liu, Ruowen Zhao, Yao Feng, Chendong Xiang, Yinze Rong, Hongyan Zhao, Hanyu Liu, Zhizhong Su, Lei Ma, Hang Su, Jun Zhu

机构 * Dept. of Comp. Sci. and Tech., Institute for AI, BNRist Center, THBI Lab, Tsinghua-Bosch Joint ML Center, Tsinghua University(计算机科学与技术系,人工智能研究院,BNRist中心,THBI实验室,清华-博世联合机器学习中心,清华大学) Peking University(北京大学) Horizon Robotics

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 Motus通过统一的潜在动作世界模型整合理解、视频生成和动作模块,利用光流和三阶段训练流程提升大规模动作预训练效果,实现模拟与现实场景中的性能突破。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.03606 2025-12-29 cs.RO cs.CV 50%

VTAO-BiManip: Masked Visual-Tactile-Action Pre-training with Object Understanding for Bimanual Dexterous Manipulation

VTAO-BiManip: 带物体理解的遮蔽视觉-触觉-动作预训练用于双臂灵巧操作

Zhengnan Sun, Zhaotai Shi, Jiayin Chen, Qingtao Liu, Yu Cui, Qi Ye, Jiming Chen

机构 * College of Control Science and Engineering, Zhejiang University, Hangzhou, 310027, China(浙江大学控制科学与工程学院)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 VTAO-BiManip通过结合视觉-触觉-动作预训练与物体理解,提升双臂灵巧操作的课程强化学习效果,实现超过现有方法20%的成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏