arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-06 至 2026-01-06 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2601.01091 2026-01-06 cs.CL cs.AI 92%

ks-lit-3m: A 3.1 million word kashmiri text dataset for large language model pretraining

ks-lit-3m:一个310万词的克什米尔语文本数据集用于大语言模型预训练

Haq Nawaz Malik

机构 * Independent Researcher(独立研究者)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出KS-LIT-3M数据集,通过开发InPage到Unicode转换器和严格预处理,解决克什米尔语预训练数据稀缺问题,为自然语言处理研究提供高质量资源。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00869 2026-01-06 cs.AI 88%

Cultural Encoding in Large Language Models: The Existence Gap in AI-Mediated Brand Discovery

大语言模型中的文化编码:AI介导的品牌发现中的存在缺口

Huang Junyao, Situ Ruimin, Ye Renqin

机构 * OmniEdge (Zhizibianjie) AI Consulting Co., Ltd.(OmniEdge(智比特)人工智能咨询有限公司)

专题命中 预训练与数据 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本研究揭示大语言模型中文化编码导致的品牌存在缺口,提出数据护城河框架,帮助品牌通过本地化提升AI可见性。

Comments 19 pages, 5 tables. Dataset and code available at https://github.com/zhizibianjie-omniedge/geo-cultural-encoding

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01153 2026-01-06 cs.CL 87%

SongSage: A Large Musical Language Model with Lyric Generative Pre-training

SongSage:一种具有歌词生成预训练的大型音乐语言模型

Jiani Guo, Jiajia Li, Jie Wu, Zuchao Li, Yujiu Yang, Ping Wang

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) School of Information Management, Wuhan University(武汉大学信息管理学院) Tsinghua University(清华大学) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);pretraining(abstract);SFT(abstract)

AI总结 SongSage是一种通过歌词生成预训练的大型音乐语言模型,专为提升歌词理解和播放列表推荐能力而设计,同时具备一般知识理解能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02360 2026-01-06 cs.LG 81%

Heterogeneous Low-Bandwidth Pre-Training of LLMs

异构低带宽预训练大语言模型

Yazan Obeidi, Amir Sarfi, Joel Lidin, Paul Janson, Eugene Belilovsky

机构 * Covenant AI Mila, Concordia University(Mila,康科德ia大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本研究提出一种异构分布式训练框架,结合低带宽流水线并行与SparseLoCo方法,通过激活压缩优化LLM预训练的通信效率与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01925 2026-01-06 cs.CV 75%

AR-MOT: Autoregressive Multi-object Tracking

AR-MOT:自回归多目标跟踪

Lianjie Jia, Yuhan Wu, Binghao Ran, Yifan Wang, Lijun Wang, Huchuan Lu

机构 * Dalian University of Technology(大连理工大学)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 AR-MOT通过自回归范式将多目标跟踪建模为序列生成任务,利用灵活的序列构建实现结构化输出,引入物体分词器和区域感知对齐模块,提升多模态和长期跟踪能力。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.18770 2026-01-06 cs.CV cs.AI cs.IR 74%

Multimodal Adversarial Defense for Vision-Language Models by Leveraging One-To-Many Relationships

通过利用一对一关系进行多模态对抗防御以提升视觉语言模型

Futa Waseda, Antonio Tejero-de-Pablos, Isao Echizen

机构 * The University of Tokyo(东京大学) CyberAgent National Institute of Informatics(信息处理研究所)

专题命中 预训练与数据 :language model(title);分类 cs.AI

AI总结 本文提出多模态对抗训练方法,通过利用图像与文本之间的一对多关系提升视觉语言模型的对抗鲁棒性。

Comments WACV 2026 Accepted. Code available at https://github.com/CyberAgentAILab/multimodal-adversarial-training

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01446 2026-01-06 cs.CL cs.LG 73%

iFlip: Iterative Feedback-driven Counterfactual Example Refinement

iFlip: 迭代反馈驱动的反事实示例精炼

Yilong Wang, Qianli Wang, Nils Feldhus

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 iFlip通过迭代反馈驱动的方法生成有效反事实示例,提升模型性能和鲁棒性。

Comments In submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20293 2026-01-06 cs.CL 70%

AprielGuard

AprielGuard:一个统一安全与对抗防御的8B参数模型

Jaykumar Kasundra, Anjaneya Praharaj, Sourabh Surana, Lakshmi Sirisha Chodisetty, Sourav Sharma, Abhigya Verma, Abhishek Bhardwaj, Debasish Kanhar, Aakash Bhagat, Khalil Slimi, Seganrasan Subramanian, Sathwik Tejaswi Madhusudhan, Ranga Prasad Chenna, Srinivas Sunkara

机构 * AprielGuard

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 AprielGuard是一个统一安全与对抗防御的8B参数模型,通过多任务训练在多步骤和推理场景中有效检测有害内容和对抗操纵。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.03104 2026-01-06 cs.AI 70%

ChatTS: Aligning Time Series with LLMs via Synthetic Data for Enhanced Understanding and Reasoning

通过合成数据对齐时间序列,利用大语言模型进行增强的理解与推理

Zhe Xie, Zeyan Li, Xiao He, Longlong Xu, Xidao Wen, Tieying Zhang, Jianjun Chen, Rui Shi, Dan Pei

机构 * Tsinghua University(清华大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ChatTS通过合成数据生成方法,首次实现了多变量时间序列的多模态大语言模型,显著提升了时间序列的理解与推理性能。

Comments accepted by VLDB' 25

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00891 2026-01-06 cs.IR cs.AI 70%

Enhancing Retrieval-Augmented Generation with Topic-Enriched Embeddings: A Hybrid Approach Integrating Traditional NLP Techniques

通过主题增强嵌入提升检索增强生成:一种整合传统NLP技术的混合方法

Rodrigo Kataishi

机构 * National University of Tierra del Fuego(泰德菲国立大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出一种整合传统NLP技术的混合方法,通过主题增强嵌入提升检索增强生成系统的检索精度和语义聚类效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01931 2026-01-06 cs.LG cs.AI 62%

DéjàQ: Open-Ended Evolution of Diverse, Learnable and Verifiable Problems

DéjàQ:开放性进化多样化、可学习且可验证的问题

Willem Röpke, Samuel Coward, Andrei Lupu, Thomas Foster, Tim Rocktäschel, Jakob Foerster

机构 * Willem Röpke AI Lab, Vrije Universiteit Brussel Belgium(维尔姆·罗普克人工智能实验室,布鲁塞尔自由大学) FLAIR, University of Oxford United Kingdom(FLAIR,牛津大学) University College London United Kingdom(伦敦大学学院)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 DéjàQ通过大语言模型驱动的突变策略动态进化多样化数学问题,提升模型的可学习性和推理能力,开源代码支持其应用潜力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07745 2026-01-06 cs.CR cs.AI cs.SE 57%

Chimera: Harnessing Multi-Agent LLMs for Automatic Insider Threat Simulation

Chimera: 利用多智能体大语言模型实现自动内部威胁模拟

Jiongchi Yu, Xiaofei Xie, Qiang Hu, Yuhan Ma, Ziming Zhao

机构 * Singapore Management University(新加坡管理大学) Tianjin University(天津大学) Zhejiang University(浙江大学)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI

AI总结 Chimera通过多智能体大语言模型生成真实企业环境中的内部威胁数据集,提升内部威胁检测的挑战性和实用性。

Comments Accepted by NDSS 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01535 2026-01-06 cs.CV 50%

Improving Flexible Image Tokenizers for Autoregressive Image Generation

改进灵活的图像标记器以用于自回归图像生成

Zixuan Fu, Lanqing Guo, Chong Wang, Binbin Song, Ding Liu, Bihan Wen

机构 * Nanyang Technological University(南洋理工大学) The University of Texas at Austin(德克萨斯大学奥斯汀分校) Harbin Institute of Technology(哈尔滨工业大学) Meta AI

专题命中 预训练与数据 :foundation model(abstract)

AI总结 ReToK通过冗余标记填充和层次语义正则化改进灵活图像标记器,提升自回归图像生成效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13251 2026-01-06 cs.SD 50%

DisCo-Speech: Controllable Zero-Shot Speech Generation with A Disentangled Speech Codec

DisCo-Speech: 基于解耦语音编解码器的可控零样本语音生成

Tao Li, Wenshuo Ge, Zhichao Wang, Zihao Cui, Yong Ma, Yingying Gao, Chao Deng, Shilei Zhang, Junlan Feng

机构 * China Mobile Nineverse Artificial Intelligence Technology (Beijing) Co., Ltd.(中国移动Nineverse人工智能技术(北京)有限公司) Nineverse Institute of Artificial Intelligence(Nineverse人工智能研究院) The State Key Laboratory of Multimedia Information Processing, Peking University, Beijing, China(多媒体信息处理国家重点实验室,北京大学,北京,中国)

专题命中 预训练与数据 :language model(abstract)

AI总结 DisCo-Speech通过解耦语音编解码器实现可控零样本语音生成,提升语音克隆与语调控制性能。

Comments Updated with 6,000 hours of additional training data and improved performance. Expanded appendix with ablation studies, training objectives, and hyperparameter settings for better reproducibility. Audio and code links included

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.00890 2026-01-06 cs.SD eess.AS 50%

Index-ASR Technical Report

索引ASR技术报告

Zheshu Song, Lu Wang, Wei Deng, Zhuo Yang, Yong Wu, Bin Xia

机构 * Artificial Intelligence Platform Department(人工智能平台部门) bilibili(哔哩哔哩)

专题命中 预训练与数据 :LLM(abstract)

AI总结 Index-ASR通过整合大语言模型与包含背景噪声和上下文信息的数据,提升语音识别的鲁棒性和定制化能力。

Comments Index-ASR technical report

详情

展开后加载摘要…

URL PDF HTML 收藏