arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-15 至 2026-01-15 共收录 19 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 19 篇

2601.09066 2026-01-15 cs.CL cs.AI 86%

Mi:dm 2.0 Korea-centric Bilingual Language Models

Mi:dm 2.0 韩国中心双语语言模型

Donghoon Shin, Sejung Lee, Soonmin Bae, Hwijung Ryu, Changwon Ok, Hoyoun Jung, Hyesung Ji, Jeehyun Lim, Jehoon Lee, Ji-Eun Han, Jisoo Baik, Mihyeon Kim, Riwoo Chung, Seongmin Lee, Wonjae Park, Yoonseok Heo, Youngkyung Seo, Seyoun Won, Boeun Kim, Cheolhun Heo, Eunkyeong Lee, Honghee Lee, Hyeongju Ju, Hyeontae Seo, Jeongyong Shim, Jisoo Lee, Junseok Koh, Junwoo Kim, Minho Lee, Minji Kang, Minju Kim, Sangha Nam, Seongheum Park, Taehyeong Kim, Euijai Ahn, Hong Seok Jeung, Jisu Shin, Jiyeon Kim, Seonyeong Song, Seung Hyun Kong, Sukjin Hong, Taeyang Yun, Yu-Seon Kim, A-Hyun Lee, Chae-Jeong Lee, Hye-Won Yu, Ji-Hyun Ahn, Song-Yeon Kim, Sun-Woo Jung, Eunju Kim, Eunji Ha, Jinwoo Baek, Yun-ji Lee, Wanjin Park, Jeong Yeop Kim, Eun Mi Kim, Hyoung Jun Park, Jung Won Yoon, Min Sung Noh, Myung Gyo Oh, Wongyoung Lee, Yun Jin Park, Young S. Kwon, Hyun Keun Kim, Jieun Lee, YeoJoo Park

机构 * Tech. Innovation Group(技术创新组)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 Mi:dm 2.0是一款专为韩国中心AI设计的双语大语言模型,通过整合韩国社会价值观和常识知识,提升文化适应性和生成能力,支持多任务和多场景应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09039 2026-01-15 cs.IT math.IT 85%

An Information-Theoretic Perspective on LLM Tokenizers

从信息论角度审视大语言模型分词器

Mete Erdogan, Abhiram Gorle, Shubham Chandak, Mert Pilanci, Tsachy Weissman

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 从信息论角度研究大语言模型分词器,揭示分词训练规模对熵分布的影响,提出压缩感知BPE变种,并分析分词器在不同领域下的鲁棒性与压缩效率的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13433 2026-01-15 cs.SD eess.AS 85%

MATS: An Audio Language Model under Text-only Supervision

MATS: 一种基于纯文本监督的音频语言模型

Wen Wang, Ruibing Hou, Hong Chang, Shiguang Shan, Xilin Chen

机构 * Key Laboratory of Intelligent Information Processing of Chinese Academy of Sciences (CAS), Institute of Computing Technology, CAS, China(中国科学院智能信息处理重点实验室(中国科学院)) University of Chinese Academy of Sciences, China(中国科学院大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);large language model(abstract)

AI总结 MATS通过纯文本监督训练,实现音频理解能力,无需依赖音频数据,展现出与大规模音频-语言对训练模型相当的性能。

Comments Accepted by ICML2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08840 2026-01-15 cs.CL cs.AI 84%

Consistency-Aware Editing for Entity-level Unlearning in Language Models

面向实体级去学习的一致性感知编辑

Xiaoqi Han, Víctor Gutiérrez-Basulto, Ru Li, Xiaoli Li, Jiye Liang, Jeff Z. Pan

机构 * Shanxi University, China(山西大学) Cardiff University, UK(卡地夫大学) Singapore University of Technology and Design, Singapore(新加坡科技设计大学) ILCC, School of Informatics, University of Edinburgh, Edinburgh, UK(爱丁堡大学信息学院ILCC)

专题命中 预训练与数据 :language model(title,abstract);large language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出一致性感知编辑框架,用于高效实体级去学习,通过聚合多样化提示并学习低秩更新,提升遗忘准确性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00040 2026-01-15 cs.CV cs.AI 83%

Uncovering Intrinsic Capabilities: A Paradigm for Data Curation in Vision-Language Models

揭示内在能力:一种用于视觉-语言模型数据整理的范式

Junjie Li, Ziao Wang, Jianghong Ma, Xiaofeng Zhang

机构 * Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学(深圳)) Hong Kong Baptist University, China(香港 Baptist大学) City University of Hong Kong, China(香港城市大学)

专题命中 预训练与数据 :language model(title,abstract);instruction tuning(abstract);分类 cs.AI

AI总结 CADC通过揭示视觉-语言模型的内在能力,提供了一种基于能力分析的数据整理范式,以提升指令微调的效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2402.03646 2026-01-15 cs.LG cs.NI 83%

Lens: A Knowledge-Guided Foundation Model for Network Traffic

Lens: 一种基于知识的网络流量基础模型

Xiaochang Li, Chen Qian, Qineng Wang, Jiangtao Kong, Yuchen Wang, Ziyu Yao, Bo Ji, Long Cheng, Gang Zhou, Huajie Shao

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 Lens提出了一种基于知识的网络流量基础模型,通过知识引导的预训练和上下文感知微调,在分类和生成任务中均取得优异性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.16148 2026-01-15 cs.CV 78%

Frequency Is What You Need: Considering Word Frequency When Text Masking Benefits Vision-Language Model Pre-training

频率才是关键:在文本遮蔽时考虑词频有助于视觉-语言模型预训练

Mingliang Liang, Martha Larson

机构 * Institute for Computing and Information Sciences(计算与信息科学研究所) Radboud University(拉德堡德大学)

专题命中 预训练与数据 :language model(title,abstract)

AI总结 本文提出CLIPF方法,通过考虑词频提升视觉-语言模型预训练效果,实验显示其在减少输入token时表现更优。

Comments Accepted by WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09119 2026-01-15 cs.CL econ.GN q-fin.EC 77%

Contrastive Bi-Encoder Models for Multi-Label Skill Extraction: Enhancing ESCO Ontology Matching with BERT and Attention Mechanisms

基于对比的双编码模型用于多标签技能提取:利用BERT和注意力机制增强ESCO本体匹配

Yongming Sun

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出基于BERT和注意力机制的对比双编码模型,用于多标签技能提取,提升ESCO本体匹配的零样本检索性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05699 2026-01-15 cs.CL 77%

Afri-MCQA: Multimodal Cultural Question Answering for African Languages

Afri-MCQA:面向非洲语言的多模态文化问答

Atnafu Lambebo Tonja, Srija Anand, Emilio Villa-Cueva, Israel Abebe Azime, Jesujoba Oluwadara Alabi, Muhidin A. Mohamed, Debela Desalegn Yadeta, Negasi Haile Abadi, Abigail Oppong, Nnaemeka Casmir Obiefuna, Idris Abdulmumin, Naome A Etori, Eric Peter Wairagala, Kanda Patrick Tshinu, Imanigirimbabazi Emmanuel, Gabofetswe Malema, Alham Fikri Aji, David Ifeoluwa Adelani, Thamar Solorio

机构 * MBZUAI AI4Bharat Indian Institute of Technology, Madras(印度理工学院马德拉斯分校) Saarland University(萨尔兰大学) Aston University(阿斯顿大学) Addis Ababa University(亚的斯亚贝巴大学) Lesan AI Friedrich-Alexander University(弗里德里希-亚历山大大学) University of Pretoria(比勒陀利亚大学) University of Minneosta -Twin Cities(明尼苏达大学-双城分校) Lelapa AI Tshwane University of Technology(茨瓦内技术大学) Digital Umuganda University of Botswana(博茨瓦纳大学) Mila, McGill University & Canada CIFAR AI Chair(Mila,麦吉尔大学及加拿大CIFAR人工智能主席)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 Afri-MCQA是首个针对非洲语言的多模态文化问答基准,揭示了本地语言在语音和文本任务中与英语的显著性能差距,强调了文化扎根预训练和跨语言文化转移的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21324 2026-01-15 cs.CL cs.AI cs.LG 75%

Mathematical Derivation Graphs: A Relation Extraction Task in STEM Manuscripts

数学推导图:STEM论文中的关系提取任务

Vishesh Prasad, Brian Kim, Nickvash Kani

机构 * Electrical and Computer Engineering University of Illinois at Urbana-Champaign(电气与计算机工程学院,伊利诺伊大学厄巴纳-香槟分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出数学推导图数据集,旨在通过关系提取任务分析STEM论文中数学表达式间的依赖关系,并评估不同模型的识别能力。

Comments 29 pages, 11 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09130 2026-01-15 eess.IV cs.AI cs.CV 70%

Equi-ViT: Rotational Equivariant Vision Transformer for Robust Histopathology Analysis

Equi-ViT:用于鲁棒病理学分析的旋转等变视觉变换器

Fuyao Chen, Yuexi Du, Elèonore V. Lieffrig, Nicha C. Dvornek, John A. Onofrey

机构 * Yale University(耶鲁大学)

专题命中 预训练与数据 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 Equi-ViT通过引入等变卷积核提升ViT在病理学图像中的旋转鲁棒性和数据效率。

Comments Accepted by IEEE ISBI 2026 4-page paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03727 2026-01-15 cs.CL 70%

Stuttering-Aware Automatic Speech Recognition for Indonesian Language

针对印尼语的 stuttering 意识自动语音识别

Fadhil Muhammad, Alwin Djuliansah, Adrian Aryaputra Hamzah, Kurniawati Azizah

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种针对印尼语口吃语音识别的数据增强方法,通过合成数据提升模型对不流畅语音的识别性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09661 2026-01-15 cs.CV 67%

LiteEmbed: Adapting CLIP to Rare Classes

LiteEmbed: 适应CLIP的稀有类别

Aishwarya Agarwal, Srikrishna Karanam, Vineet Gandhi

机构 * CVIT, Kohli Centre for Intelligent Systems, IIIT Hyderabad, India(印度海得拉巴IIIT大学计算机视觉研究所、Kohli智能系统中心) Adobe Research, Bengaluru, India(印度班加罗尔Adobe研究)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract)

AI总结 LiteEmbed通过子空间优化和双目标方法,实现CLIP在稀有类别上的少样本个性化,提升分类和检索任务的性能。

Comments 14 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.14037 2026-01-15 cs.CL cs.AI cs.LG 67%

DiffSampling: Enhancing Diversity and Accuracy in Neural Text Generation

DiffSampling:提升神经文本生成的多样性和准确性

Giorgio Franceschelli, Mirco Musolesi

机构 * Alma Mater Studiorum Università di Bologna(博洛尼亚大学) University College London(伦敦大学学院)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DiffSampling通过分析令牌概率分布,提升神经文本生成的多样性和准确性,实验表明其在质量上与现有方法相当。

Comments Published in Transactions on Machine Learning Research (2025), see https://tmlr.infinite-conf.org/paper_pages/kXjHbMvdIi.html

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.15801 2026-01-15 cs.CL cs.AI cs.HC cs.LG 67%

LingVarBench: Benchmarking LLMs on Entity Recognitions and Linguistic Verbalization Patterns in Phone-Call Transcripts

LingVarBench:在电话通话记录中对LLM进行实体识别和语言表达模式的基准测试

Seyedali Mohammadi, Manas Paldhe, Amit Chhabra, Youngseo Son, Vishal Seshagiri

机构 * Infinitus Systems, Inc.(Infinitus系统公司)

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 LingVarBench通过生成语言变化的训练数据,提升LLM在电话记录中提取结构化实体和主观问卷项目的能力,优化提示工程并提高鲁棒性。

Comments Accepted to EACL 2026 (Industry Track); to appear in the proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05966 2026-01-15 cs.CV cs.AI 57%

VideoAR: Autoregressive Video Generation via Next-Frame & Scale Prediction

VideoAR: 通过下一帧与尺度预测实现自回归视频生成

Longbin Ji, Xiaoxiong Liu, Junyuan Shang, Shuohuan Wang, Yu Sun, Hua Wu, Haifeng Wang

机构 * ERNIE Team, Baidu(百度ERNIE团队)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 VideoAR通过多尺度下一帧预测与自回归建模,实现高效、一致的视频生成,提升性能并减少计算成本。

Comments Project page: https://ernie-research.github.io/VideoAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16233 2026-01-15 astro-ph.GA cs.LG 57%

Can AI Dream of Unseen Galaxies? Conditional Diffusion Model for Galaxy Morphology Augmentation

AI能否梦见未见的星系?面向星系形态增强的条件扩散模型

Chenrui Ma, Zechang Sun, Tao Jing, Zheng Cai, Yuan-Sen Ting, Song Huang, Mingyu Li

机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University, Shenzhen China(清华大学深圳国际研究生院,清华大学,深圳中国) Department of Strategic and Advanced Interdisciplinary Research, Pengcheng Laboratory, Shenzhen China(战略与先进跨学科研究部,鹏城实验室,深圳中国) Department of Astronomy, Tsinghua University, Beijing China(天文学系,清华大学,北京中国) School of Mathematics and Physics, Qinghai University, Xining China(数学物理学院,青海大学,西宁中国) Department of Astronomy, The Ohio State University, Columbus, OH 43210, USA(天文学系,俄亥俄州立大学,哥伦布,OH 43210,美国) Center for Cosmology and AstroParticle Physics (CCAPP), The Ohio State University, Columbus, OH 43210, USA(宇宙学与天体粒子物理中心(CCAPP),俄亥俄州立大学,哥伦布,OH 43210,美国)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.LG

AI总结 本研究提出条件扩散模型GalaxySD,通过合成逼真的星系图像增强ML训练数据,提升标准形态分类性能,并有效提高罕见星系检测的实例数量。

Comments 29 pages, 17 figures, accepted version for ApJS. Comments welcome. See another independent work for further reference, Category-based Galaxy Image Generation via Diffusion Models (Fan, Tang et al.)

Journal ref The Astrophysical Journal Supplement Series, 282, 25 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09216 2026-01-15 cs.DB 50%

Honesty-Aware Multi-Agent Framework for High-Fidelity Synthetic Data Generation in Digital Psychiatric Intake Doctor-Patient Interactions

面向数字精神科问诊医生-患者交互的诚实意识多智能体框架:高保真合成数据生成

Xinyuan Zhang, Zijian Wang, Chang Dao, Juexiao Zhou

专题命中 预训练与数据 :LLM(abstract)

AI总结 本研究提出一种多智能体框架,通过建模患者欺骗行为生成高保真合成数据,用于研究精神科评估中的诚实意识及训练适应性对话代理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.08587 2026-01-15 cs.CV 50%

MoCha:End-to-End Video Character Replacement without Structural Guidance

MoCha:端到端视频人物替换无需结构引导

Zhengbo Xu, Jie Ma, Ziheng Wang, Zhan Peng, Jun Liang, Jing Li

专题命中 预训练与数据 :post-training(abstract)

AI总结 MoCha提出了一种无需结构引导的端到端视频人物替换方法,通过单帧掩码实现高效替换,并设计了三种数据集以克服数据稀缺问题。

Comments 10 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏