arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-07 至 2026-01-07 共收录 11 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 11 篇

2512.13102 2026-01-07 cs.AI 85%

Socratic Students: Teaching Language Models to Learn by Asking Questions

苏格拉底学生:教语言模型通过提问学习

Rajeev Bhatt Ambati, Tianyi Niu, Aashu Singh, Shlok Mishra, Snigdha Chaturvedi, Shashank Srivastava

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 指令微调 :language model(title,abstract);large language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 本文提出ODQS框架,通过任务结果训练语言模型提问技能,提升交互推理的准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02609 2026-01-07 cs.LG cs.AI cs.CL cs.DC stat.ML 85%

Chronicals: A High-Performance Framework for LLM Fine-Tuning with 3.51x Speedup over Unsloth

Chronicals: 一种高性能的LLM微调框架,相比Unsloth提速3.51倍

Arjun S. Nair

机构 * Independent Researcher(独立研究者)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Chronicals通过四种协同优化,实现了比Unsloth快3.51倍的LLM微调速度,并提供了完整的数学基础和实现。

Comments 61 pages, 25 figures, open-source framework available at https://github.com/Ajwebdevs/Chronicals and pip install chronicals

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02500 2026-01-07 cs.LG cs.AI 79%

GEM-Style Constraints for PEFT with Dual Gradient Projection in LoRA

基于LoRA的GEM风格约束与双梯度投影的持续学习

Brian Tekmen, Jason Yin, Qianqian Tong

机构 * Department of Computer Science University of North Carolina Greensboro(计算机科学系北卡罗来纳州立大学) Department of Computer Science North Carolina State University(计算机科学系北卡罗来纳州立大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 I-GEM通过在LoRA子空间内应用GEM约束,实现低开销的持续学习,有效提升模型性能并减少计算成本。

Comments Work accepted to the NSF REU Symposium at the 2025 IEEE International Conference on Data Mining (ICDM). Correspondence to: betekmen@uncg.edu

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02983 2026-01-07 cs.SD cs.AI 77%

Interpretable All-Type Audio Deepfake Detection with Audio LLMs via Frequency-Time Reinforcement Learning

通过频率-时间强化学习实现可解释的多类型音频深度伪造检测

Yuankun Xie, Xiaoxuan Guo, Jiayi Zhou, Tao Wang, Jian Liu, Ruibo Fu, Xiaopeng Wang, Haonan Cheng, Long Ye

机构 * Communication University of China(中国通信大学) Machine Intelligence, Ant Group(蚂蚁集团机器智能部) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 本文提出FT-GRPO方法,通过频率-时间强化学习实现多类型音频深度伪造检测的可解释性与高性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01896 2026-01-07 cs.CL cs.AI 73%

Tackling the Inherent Difficulty of Noise Filtering in RAG

应对RAG中噪声过滤的固有难度

Jingyu Liu, Jiaen Lin, Yong Liu

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学人工智能学院) Beijing Key Laboratory of Big Data Management and Analysis Methods(北京大数据管理与分析方法重点实验室) School of Software Tsinghua University(清华大学软件学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种新的微调方法,旨在提升LLM在RAG中对相关信息和不相关信息的区分能力,从而增强模型的鲁棒性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01887 2026-01-07 cs.LG cs.AI 73%

Safety at One Shot: Patching Fine-Tuned LLMs with A Single Instance

单次实例实现安全:用一个实例修补微调的LLM

Jiawen Zhang, Lipeng He, Kejia Chen, Jian Lou, Jian Liu, Xiaohu Yang, Ruoxi Jia

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 通过单个安全示例高效修复微调后的LLM安全性,无需牺牲实用性且成本极低。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03204 2026-01-07 cs.AI cs.MA 70%

InfiAgent: An Infinite-Horizon Framework for General-Purpose Autonomous Agents

InfiAgent: 通用自主代理的无限时间 horizon 框架

Chenglin Yu, Yuchen Wang, Songmiao Wang, Hongxia Yang, Ming Li

机构 * The University of Hong Kong(香港大学) The Hong Kong Polytechnic University(香港理工大学)

专题命中 指令微调 :LLM(abstract);prompting(abstract);分类 cs.AI

AI总结 InfiAgent 通过外部化持久状态实现无限时间 horizon 任务的稳定推理,无需任务特定微调即可在长时间任务中超越传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09146 2026-01-07 cs.CL 70%

DoPE: Denoising Rotary Position Embedding

DoPE: 去噪旋转位置嵌入

Jing Xiong, Liyang Fan, Hui Shen, Zunhai Su, Min Yang, Lingpeng Kong, Ngai Wong

机构 * The University of Hong Kong(香港大学) University of Michigan, Ann Arbor(密歇根大学安阿伯分校) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 DoPE通过去噪旋转位置嵌入提升大型语言模型在长上下文外推和鲁棒性方面的性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.11160 2026-01-07 eess.AS cs.SD 67%

S2ST-Omni: Hierarchical Language-Aware SpeechLLM Adaptation for Multilingual Speech-to-Speech Translation

S2ST-Omni: 多语言语音到语音翻译的分层语言感知语音LLM适应

Yu Pan, Xiongfei Wu, Yuguang Yang, Jixun Yao, Lei Ma, Jianjun Zhao

机构 * Tencent(腾讯) ByteDance Ltd.(字节跳动)

专题命中 指令微调 :LLM(abstract);prompting(abstract)

AI总结 S2ST-Omni通过分层语言感知架构和模块化TTS后端,实现多语言语音到语音翻译的高准确性和灵活性。

Comments Working in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01584 2026-01-07 cs.CL 57%

Steerability of Instrumental-Convergence Tendencies in LLMs

在大语言模型中操控工具收敛倾向的可行性

Jakub Hoscilowicz

机构 * Warsaw University of Technology(华沙技术大学)

专题命中 指令微调 :prompting(abstract);分类 cs.CL

AI总结 该研究通过反工具提示显著降低大语言模型的收敛率,揭示了可控性与安全之间的矛盾,为AI系统的设计提供了新的安全策略。

Comments Code is available at https://github.com/j-hoscilowicz/instrumental_steering

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.23346 2026-01-07 cs.LG 57%

Block-Diagonal LoRA for Eliminating Communication Overhead in Tensor Parallel LoRA Serving

分块对角LoRA用于消除张量并行LoRA服务中的通信开销

Xinyu Wang, Jonas M. Kübler, Kailash Budhathoki, Yida Wang, Matthäus Kleindessner

机构 * University of Warwick(沃里克大学) Amazon Web Services(亚马逊网络服务)

专题命中 指令微调 :LLM(abstract);分类 cs.LG

AI总结 本文提出分块对角LoRA方法,通过限制LoRA因素为分块对角,减少通信开销,提升端到端服务效率。

详情

展开后加载摘要…

URL PDF HTML 收藏