arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-13 至 2026-01-13 共收录 363 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 26 篇

2601.05635 2026-01-13 cs.CR cs.CL 85%

Continual Pretraining on Encrypted Synthetic Data for Privacy-Preserving LLMs

在加密合成数据上进行持续预训练以实现隐私保护的大语言模型

Honghao Liu, Xuhui Jiang, Chengjin Xu, Cehao Yang, Yiran Cheng, Lionel Ni, Jian Guo

机构 * The PII shown in the figure is synthetic and not real(合成的PII) International Digital Economy Academy(国际数字经济学院) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) The Hong Kong University of Science and Technology(香港科学与技术大学) DataArc Tech Ltd(DataArc科技有限公司)

专题命中 预训练与数据 :pretraining(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出了一种基于实体的加密合成数据预训练框架,通过加密保护PII,实现隐私保护的大语言模型预训练,同时保持模型的指令遵循能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.11210 2026-01-13 cs.HC cs.AI 85%

Role-Playing LLM-Based Multi-Agent Support Framework for Detecting and Addressing Family Communication Bias

基于角色扮演的LLM多智能体支持框架用于检测和解决家庭沟通偏见

Rushia Harada, Yuken Kimura, Keito Inoshita

专题命中 预训练与数据 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出基于角色扮演的LLM多智能体框架,用于检测家庭沟通中的理想父母偏见并生成改善反馈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25531 2026-01-13 cs.CL cs.AI cs.LG 85%

MixtureVitae: Open Web-Scale Pretraining Dataset With High Quality Instruction and Reasoning Data Built from Permissive-First Text Sources

MixtureVitae:基于宽容优先策略构建的开放网络级预训练数据集,包含高质量指令和推理数据

Huu Nguyen, Victor May, Harsh Raj, Marianna Nezhurina, Yishan Wang, Yanqi Luo, Minh Chien Vu, Taishi Nakamura, Ken Tsui, Van Khue Nguyen, David Salinas, Aleksandra Krasnodębska, Christoph Schuhmann, Mats Leon Richter, Xuan-Son, Vu, Jenia Jitsev

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 MixtureVitae通过宽容优先策略构建开放预训练数据集,提供高质量指令和推理数据,有效降低法律风险并提升模型性能。

Comments Code: \url{https://github.com/ontocord/mixturevitae}

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06827 2026-01-13 cs.CL 83%

PDR: A Plug-and-Play Positional Decay Framework for LLM Pre-training Data Detection

PDR: 一种用于LLM预训练数据检测的即插即用位置衰减框架

Jinhan Liu, Yibo Yang, Ruiying Lu, Piotr Piekos, Yimeng Chen, Peng Wang, Dandan Guo

专题命中 预训练与数据 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 PDR是一种无需训练的即插即用框架,通过位置衰减重加权提升LLM预训练数据检测的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06429 2026-01-13 cs.LG stat.ML 83%

A Unified Shape-Aware Foundation Model for Time Series Classification

面向时间序列分类的统一形状感知基础模型

Zhen Liu, Yucheng Wang, Boyuan Li, Junhao Zheng, Emadeldeen Eldele, Min Wu, Qianli Ma

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 UniShape是一种面向时间序列分类的统一形状感知基础模型,通过自适应聚合多尺度判别子序列提升模型可解释性,并在多个数据集上实现最先进的分类性能。

Comments Accepted in AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20876 2026-01-13 cs.RO 82%

Proprioception Enhances Vision Language Model in Generating Captions and Subtask Segmentations for Robot Task

本体感知增强视觉语言模型在为机器人任务生成描述和子任务分割中的应用

Kanata Suzuki, Shota Shimizu, Tetsuya Ogata

机构 * Faculty of Science and Engineering, Waseda University(工学部,早稻田大学) Artificial Intelligence Laboratory, Fujitsu Limited(Fujitsu 人工智能实验室) National Institute of Advanced Industrial Science and Technology(国家先进工业科学与技术研究院)

专题命中 预训练与数据 :language model(title,abstract);foundation model(abstract)

AI总结 本研究通过引入本体感知数据,提升视觉语言模型在机器人任务描述和子任务分割中的性能,以增强机器人模仿学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2401.14373 2026-01-13 cs.CL cs.AI cs.LG 82%

TURNA: A Turkish Encoder-Decoder Language Model for Enhanced Understanding and Generation

TURNA:一种用于增强理解和生成的土耳其编码器-解码器语言模型

Gökçe Uludoğan, Zeynep Yirmibeşoğlu Balal, Furkan Akkurt, Melikşah Türker, Onur Güngör, Susan Üsküdarlı

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 TURNA是一种专为土耳其语设计的编码器-解码器语言模型,通过预训练在低资源环境下实现了对自然语言理解和生成任务的提升。

Journal ref Findings of the Association for Computational Linguistics: ACL 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20166 2026-01-13 eess.AS cs.AI cs.CL cs.LG cs.SD 80%

From Alignment to Advancement: Bootstrapping Audio-Language Alignment with Synthetic Data

从对齐到提升:通过合成数据 bootstrap 音频-语言对齐

Chun-Yi Kuan, Hung-yi Lee

机构 * Graduate Institute of Communication Engineering, National Taiwan University(国立台湾大学通信工程研究所)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出BALSa框架,通过合成数据生成提升音频-语言对齐能力,缓解幻觉问题并增强模型理解与推理性能。

Comments Published in IEEE Transactions on Audio, Speech, and Language Processing (TASLP). Project Website: https://kuan2jiu99.github.io/Balsa

Journal ref IEEE Transactions on Audio, Speech and Language Processing, vol. 33, pp. 4604-4619, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.01400 2026-01-13 cs.CL cs.AI cs.LG 80%

ToolACE-R: Model-aware Iterative Training and Adaptive Refinement for Tool Learning

ToolACE-R: 基于模型的迭代训练与自适应细化用于工具学习

Xingshan Zeng, Weiwen Liu, Xu Huang, Zezhong Wang, Lingzhi Wang, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Ruiming Tang, Qun Liu

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 ToolACE-R通过基于模型的迭代训练和自适应细化,提升工具学习的效率和性能。

Comments Accepted by AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06400 2026-01-13 cs.CL 79%

MITRA: A Large-Scale Parallel Corpus and Multilingual Pretrained Language Model for Machine Translation and Semantic Retrieval for Pāli, Sanskrit, Buddhist Chinese, and Tibetan

MITRA:一种大规模并行语料库和多语言预训练语言模型,用于机器翻译和语义检索(巴利语、梵语、佛教汉语和藏语)

Sebastian Nehrdich, Kurt Keutzer

机构 * Center for Integrated Japanese Studies, Tohoku University(东京东京大学综合日语研究机构) University of California, Berkeley(加州大学伯克利分校) Berkeley Artificial Intelligence Research (BAIR)(伯克利人工智能研究(BAIR))

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 MITRA框架通过大规模并行语料库和预训练模型,实现了对梵语、巴利语、佛教汉语和藏语的机器翻译和语义检索,达到英语翻译的最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07271 2026-01-13 cs.CL 77%

Document-Level Zero-Shot Relation Extraction with Entity Side Information

文档级零 shot 关系抽取与实体侧信息

Mohan Raj Chanthran, Soon Lay Ki, Ong Huey Fang, Bhawani Selvaretnam

机构 * School of Information Technology, Monash University Malaysia(墨尔本大学马来西亚分校信息科技学院) Valiantlytix

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出DocZSRE-SI方法,通过利用实体侧信息提升低资源语言中零 shot 关系抽取的性能。

Comments Accepted to EACL 2026 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07033 2026-01-13 cs.CL 77%

Codified Foreshadowing-Payoff Text Generation

编码的预兆-回报文本生成

Longfei Yun, Kun Zhou, Yupeng Hou, Letian Peng, Jingbo Shang

机构 * University of California, San Diego(加州大学圣地亚哥分校)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出CFPG框架,通过编码预兆-回报机制,提升LLM的叙事生成能力,实现情节逻辑的准确兑现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06159 2026-01-13 cs.LG 74%

Can we Improve Prediction of Psychotherapy Outcomes Through Pretraining With Simulated Data?

能否通过预训练模拟数据来提高心理治疗效果的预测?

Niklas Jacobs, Manuel C. Voelkle, Norbert Kathmann, Kevin Hilbert

专题命中 预训练与数据 :pretraining(title);分类 cs.LG

AI总结 本文通过预训练模拟数据提升心理治疗效果预测,发现预训练方法在部分情况下表现不显著,而仅用真实数据训练的随机森林在第二项研究中表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17209 2026-01-13 cs.CL 74%

Prompt-Based Simplification for Plain Language using Spanish Language Models

基于提示的西班牙语模型用于普通语言简化

Lourdes Moreno, Jesus M. Sanchez-Gomez, Marco Antonio Sanchez-Escudero, Paloma Martínez

机构 * HULAT-UC3M

专题命中 预训练与数据 :language model(title);分类 cs.CL

AI总结 本文提出利用西班牙语模型和提示工程策略,实现文本到普通语言的转换,通过评估不同模型和提示组合,优化语义相似度和可读性。

Comments 11 pages, 7 tables,

Journal ref CEUR Workshop Proceedings, Vol. 4098 (IberLEF 2025), paper 6, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07192 2026-01-13 cs.CL cs.AI 73%

Relink: Constructing Query-Driven Evidence Graph On-the-Fly for GraphRAG

Relink:为GraphRAG构建查询驱动的证据图谱

Manzong Huang, Chenyang Bu, Yi He, Xingrui Zhuo, Xindong Wu

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Relink通过动态构建查询驱动的证据图谱,解决GraphRAG中知识图谱不完整和干扰事实的问题,提升问答性能。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18284 2026-01-13 cs.AI 70%

What Can We Actually Steer? A Multi-Behavior Study of Activation Control

我们实际上能控制什么?激活控制的多行为研究

Tetiana Bas, Krystian Novak

机构 * Department of Computer Science(计算机科学系) Minerva University(明维大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文研究了激活控制在不同行为类型中的有效性差异,发现行为类型显著影响控制效果,特征表达呈倒U型曲线,训练数据量影响控制强度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06113 2026-01-13 cs.AI 70%

Towards Infinite Length Extrapolation: A Unified Approach

迈向无限长度外推:一种统一方法

Nitin Vetcha

机构 * Department of Computer Science(计算机科学系) Indian Institute of Science(印度科学研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种统一框架,通过自适应位置编码方法解决长序列处理中的限制,实现了无限上下文外推。

Comments 14 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06857 2026-01-13 cs.LG cs.AI 62%

MoE-DisCo:Low Economy Cost Training Mixture-of-Experts Models

MoE-DisCo:低经济成本训练混合专家模型

Xin Ye, Daning Cheng, Boyang Zhang, Yunquan Zhang

机构 * Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所) University of Chinese Academy of Sciences(中国科学院大学) Peng Cheng Laboratory(鹏城实验室)

专题命中 预训练与数据 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 MoE-DisCo通过分阶段训练框架,利用低成本硬件降低混合专家模型训练成本,同时在多个任务上实现性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07765 2026-01-13 cs.CL 57%

Contrastive Learning with Narrative Twins for Modeling Story Salience

基于叙事双胞胎的对比学习用于建模故事显著性

Igor Sterner, Alex Lascarides, Frank Keller

机构 * School of Informatics University of Edinburgh(信息学院爱丁堡大学)

专题命中 预训练与数据 :prompting(abstract);分类 cs.CL

AI总结 本文提出基于叙事双胞胎的对比学习方法,用于建模故事显著性,通过对比学习生成故事嵌入,并验证总结操作在识别显著句子上的有效性。

Comments EACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06938 2026-01-13 cs.LG cs.CR 57%

Forgetting Similar Samples: Can Machine Unlearning Do it Better?

遗忘相似样本:机器去学习能否做得更好?

Heng Xu, Tianqing Zhu, Dayong Ye, Lefeng Zhang, Le Wang, Wanlei Zhou

机构 * City University of Macau(澳门城市大学) Guangzhou University(广州大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文研究了机器去学习在存在相似样本时的有效性,发现现有方法未能有效消除目标样本影响,并提出改进方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03973 2026-01-13 cs.SD cs.CL 57%

Muse: Towards Reproducible Long-Form Song Generation with Fine-Grained Style Control

Muse:迈向可重现的长篇歌曲生成与细粒度风格控制

Changhao Jiang, Jiahao Chen, Zhenghao Xiang, Zhixiong Yang, Hanchen Wang, Jiabao Zhuang, Xinmeng Che, Jiajun Sun, Hui Li, Yifei Cao, Shihan Dou, Ming Zhang, Junjie Ye, Tao Ji, Tao Gui, Qi Zhang, Xuanjing Huang

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 Muse通过开源系统实现可控长篇歌曲生成,利用合成数据集和微调模型,在有限数据下取得竞争性性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14523 2026-01-13 cs.AI 57%

Learning from Reasoning Failures via Synthetic Data Generation

通过合成数据生成学习推理失败

Gabriela Ben Melech Stan, Estelle Aflalo, Avinash Madasu, Vasudev Lal, Phillip Howard

专题命中 预训练与数据 :instruction tuning(abstract);分类 cs.AI

AI总结 通过分析LMM推理失败生成针对性合成数据,提升多模态模型在多个下游任务上的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06658 2026-01-13 cs.CL 57%

What makes for an enjoyable protagonist? An analysis of character warmth and competence

什么样的主角令人愉悦?对角色温暖和能力的分析

Hannes Rosenbusch

专题命中 预训练与数据 :LLM(abstract);分类 cs.CL

AI总结 本文研究了电影主角的温暖和能力对观众评分的影响,发现虽然观众偏好温暖和有能力的角色,但这些因素对电影评分的影响较小,且AI注释在大规模分析中表现良好但有时不如人工注释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09220 2026-01-13 cs.CV cs.AI 57%

Towards Scalable Training for Handwritten Mathematical Expression Recognition

迈向可扩展的手写数学表达式识别训练

Haoyang Li, Jiaqing Li, Jialun Cao, Zongyuan Yang, Yongping Xiong

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 本文提出TexTeller模型,通过大规模训练和生成Tex80M数据集,实现手写数学表达式识别的高性能和高可用性。

Comments The authors have decided to temporarily withdraw this paper to make substantial revisions

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03030 2026-01-13 cs.AI 57%

Collab-Solver: Collaborative Solving Policy Learning for Mixed-Integer Linear Programming

Collab-Solver: 混合整数线性规划的协同求解策略学习

Siyuan Li, Yifan Yu, Zhihao Zhang, Mengjing Chen, Fangzhou Zhu, Tao Zhong, Peng Liu, Jianye Hao

机构 * Harbin Institute of Technology(哈尔滨工业大学) Huawei Noah's Ark Lab(华为诺亚实验室)

专题命中 预训练与数据 :pretraining(abstract);分类 cs.AI

AI总结 Collab-Solver通过多智能体协同策略学习框架提升混合整数线性规划的求解效率和解质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06525 2026-01-13 cs.CV 50%

Toward Generalizable Deblurring: Leveraging Massive Blur Priors with Linear Attention for Real-World Scenarios

迈向可泛化的去模糊化:利用大规模模糊先验与线性注意力以应对现实场景

Yuanting Gao, Shuo Cao, Xiaohui Li, Yuandong Pu, Yihao Liu, Kai Zhang

机构 * Tsinghua University(清华大学) USTC, Shanghai AI Lab(USTC,上海人工智能实验室) SJTU, Shanghai AI Lab(上海交通大学,上海人工智能实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出BPP和MoSeG方法,通过大规模模糊先验与线性注意力提升图像去模糊化在现实场景中的泛化能力。

Comments 19 pages, 14 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 29 篇

2505.18497 2026-01-13 cs.CL 92%

The Pragmatic Mind of Machines: Tracing the Emergence of Pragmatic Competence in Large Language Models

机器的实用性思维:追踪大型语言模型中实用性能力的出现

Kefan Yu, Qingcheng Zeng, Weihao Xuan, Wanxin Li, Jingyi Wu, Rob Voigt

机构 * Northwestern University(西北大学) The University of Tokyo(东京大学) RIKEN AIP(理化学研究所AIP) Zhejiang University(浙江大学) University of California, Davis(加州大学戴维斯分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);SFT(abstract)

AI总结 本文提出ALTPRAG数据集,通过对比推理评估不同训练阶段LLMs的实用性能力发展,发现模型规模和数据规模的增加提升其对实用性提示的敏感性,SFT和RLHF进一步增强其在认知-实用性场景中的表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07430 2026-01-13 cs.CL cs.AI 91%

KALE: Enhancing Knowledge Manipulation in Large Language Models via Knowledge-aware Learning

KALE:通过知识感知学习增强大语言模型的知识操作

Qitan Lv, Tianyu Liu, Qiaosheng Zhang, Xingcheng Xu, Chaochao Lu

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);post-training(abstract);SFT(abstract)

AI总结 KALE通过知识感知学习框架提升大语言模型的知识操作能力,利用知识图谱生成高质量推理过程并优化模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06780 2026-01-13 cs.CL cs.AI 90%

Multi-Stage Evolutionary Model Merging with Meta Data Driven Curriculum Learning for Sentiment-Specialized Large Language Modeling

多阶段进化模型合并与元数据驱动的课程学习用于情感专业化的大语言模型

Keito Inoshita, Xiaokang Zhou, Akira Kawai

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MEM-MCL模型,通过元数据驱动课程学习和进化算法提升大语言模型在情感分析中的准确性和多任务处理能力。

Comments This paper was presented at the 10th IEEE International Conference on Data Science and Systems in December 2024 and is awaiting publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.07389 2026-01-13 cs.LG cs.AI cs.IT math.IT 88%

On the Non-decoupling of Supervised Fine-tuning and Reinforcement Learning in Post-training

在训练后阶段,监督微调与强化学习无法解耦

Xueyan Niu, Bo Bai, Wei Han, Weixi Zhang

机构 * Theory Laboratory Central Research Institute, 2012 Laboratories(理论实验室中央研究院,2012实验室) Huawei Technologies Co., Ltd(华为技术有限公司)

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 研究证明在训练后阶段,监督微调与强化学习无法解耦,且在交替训练顺序下会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏