arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-29 至 2026-01-29 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 10 篇

2512.23340 2026-01-29 cs.LG cs.AI cs.MA 90%

The Law of Multi-Model Collaboration: Scaling Limits of Model Ensembling for Large Language Models

多模型协作定律:大型语言模型模型融合的扩展极限

Dakuan Lu, Jiaqi Zhang, Cheng Yuan, Jiawei Shao, Xuelong Li

机构 * Institute of Artificial Intelligence (TeleAI), China Telecom(人工智能研究院(TeleAI),中国电信)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出多模型协作定律,揭示多模型融合在参数预算下的扩展极限,证明模型多样性是提升LLM性能的关键因素。

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15370 2026-01-29 cs.LG cs.AI physics.chem-ph q-bio.BM 86%

Tokenization for Molecular Foundation Models

分子基础模型的标记化

Alexius Wadell, Anoushka Bhutani, Venkatasubramanian Viswanathan

机构 * Department of Mechanical Engineering, University of Michigan, Ann Arbor, Michigan 48109, United States(机械工程系,密歇根大学,安娜堡,密歇根州48109,美国)

专题命中 预训练与数据 :foundation model(title,abstract);language model(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Smirk和Smirk-GPE两种新的分子标记器,以全面覆盖OpenSMILES规范,提升分子属性预测的准确性。

Comments 26 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.09630 2026-01-29 cs.LG 85%

In-Context Bias Propagation in LLM-Based Tabular Data Generation

上下文偏见传播在基于LLM的表格数据生成中

Pol G. Recasens, Alberto Gutierrez, Jordi Torres, Josep. Ll Berral, Javier Carnerero-Cano, Anisa Halimi, Kieran Fraser

机构 * Barcelona Supercomputing Center (BSC), Spain(巴塞罗那超级计算中心(BSC)) IBM Research Ireland(IBM爱尔兰研究)

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文研究了基于LLM的表格数据生成中上下文偏见的传播问题,揭示了轻微偏见可能导致全局统计扭曲,并提出了缓解策略以提高公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20675 2026-01-29 cs.CV 78%

bi-modal textual prompt learning for vision-language models in remote sensing

双模文本提示学习用于遥感图像的视觉-语言模型

Pankhi Kashyap, Mainak Singha, Biplab Banerjee

机构 * Indian Institute of Technology Bombay(印度理工学院班加罗尔分校) University of Trento(特伦托大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 BiMoRS通过双模提示学习框架提升遥感图像视觉-语言模型的适应性与泛化能力。

Comments Accepted in ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20099 2026-01-29 cs.CY cs.AI 77%

Dynamics of Human-AI Collective Knowledge on the Web: A Scalable Model and Insights for Sustainable Growth

人类-人工智能集体知识在Web上的动态:一个可扩展的模型和可持续增长的见解

Buddhika Nettasinghe, Kang Zhao

机构 * University of Iowa(爱荷华大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种可扩展的动态模型,用于研究人类与人工智能共同知识在Web上的演变,通过分析不同增长模式和政策影响,为可持续增长提供见解。

Comments Accepted for ACM Web Conference 2026 (WWW26)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13055 2026-01-29 eess.SP cs.LG 74%

Simplicity is Key: An Unsupervised Pretraining Approach for Sparse Radio Channels

简洁是关键:一种用于稀疏无线信道的无监督预训练方法

Jonathan Ott, Maximilian Stahlke, Tobias Feigl, Bjoern M. Eskofier, Christopher Mutschler

机构 * Fraunhofer Institute for Integrated Circuits IIS(弗劳恩霍夫集成电路研究所)

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 SpaRTran通过捕捉无线传播的稀疏性作为无监督学习目标,提高了无线信道的定位精度和波束成形性能。

Comments 8 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.05739 2026-01-29 cs.CR cs.AI cs.SE 70%

Mitigating Sensitive Information Leakage in LLMs4Code through Machine Unlearning

通过机器遗忘减轻LLM4Code中的敏感信息泄露

Shanzhi Gu, Zhaoyang Qu, Ruotong Geng, Mingyang Geng, Shangwen Wang, Chuanfu Xu, Haotian Wang, Zhipeng Lin, Dezun Dong

机构 * College of Computer Science and Technology, National University of Defense Technology, Changsha, Hunan, 410073, China(计算机科学与技术学院,国防科技大学,长沙,湖南,410073,中国) Xichang Satellite Launch Center, Xichang, Sichuan, 615000, China(西昌卫星发射中心,西昌,四川,615000,中国) Academy of Military Sciences, Beijing, 100091, China(军事科学院,北京,100091,中国)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文通过机器遗忘技术有效减少LLMs4Code中的敏感信息泄露,同时保持代码生成性能,揭示了间接泄露的潜在风险。

Comments 13 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.15769 2026-01-29 cs.SE cs.AI 70%

GenCode: A Generic Data Augmentation Framework for Boosting Deep Learning-Based Code Understanding

GenCode:一种通用数据增强框架,用于提升基于深度学习的代码理解

Zeming Dong, Qiang Hu, Xiaofei Xie, Maxime Cordy, Mike Papadakis, Yves Le Traon, Jianjun Zhao

机构 * University of Luxembourg(卢森堡大学) Tianjin University(天津大学) Singapore Management University(新加坡管理学院) Kyushu University(九州大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GenCode通过生成与选择范式提升代码理解模型的训练效果,相比现有方法在准确率和鲁棒性上均有显著提升。

Comments Accepted by Empirical Software Engineering (EMSE) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20300 2026-01-29 cs.CL eess.AS 57%

MiLorE-SSL: Scaling Multilingual Capabilities in Self-Supervised Models without Forgetting

MiLorE-SSL: 在不遗忘的前提下扩展多语言能力的自监督模型

Jing Xu, Minglin Wu, Xueyuan Chen, Xixin Wu, Helen Meng

机构 * The Chinese University of Hong Kong(香港中文大学)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 MiLorE-SSL通过结合LoRA和软MoE机制,实现高效多语言自监督学习,有效缓解遗忘问题,仅用2.14%参数在新语言上取得优异表现。

Comments Accepted by ICASSP2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20142 2026-01-29 cs.CL cs.SD eess.AS 57%

Mind the Shift: Using Delta SSL Embeddings to Enhance Child ASR

注意偏移:使用Delta SSL嵌入来增强儿童ASR

Zilai Wang, Natarajan Balaji Shankar, Kaiyuan Zhang, Zihan Wang, Abeer Alwan

机构 * University of California, Los Angeles Department of Electrical

专题命中 预训练与数据 :pretraining(abstract);分类 cs.CL

AI总结 本文提出使用delta SSL嵌入融合提升儿童ASR性能,通过实验验证delta嵌入在提升WER方面的有效性。

Comments ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏