arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 21 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 21 篇

2601.23161 2026-02-02 cs.SD cs.CL 90%

DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

DIFFA-2:一种实用的扩散大型语言模型用于通用音频理解

Jiaming Zhou, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);preference optimization(abstract)

AI总结 DIFFA-2是一种基于扩散模型的实用大型音频语言模型,通过升级语音编码器和双适配器提升音频理解性能,且在实际训练预算下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09190 2026-02-02 cs.LG cs.AI 90%

Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining

多级安全连续投影:无需重新训练的微调大语言模型安全增强方法

Bing Han, Feifei Zhao, Dongcheng Zhao, Guobin Shen, Ping Wu, Yu Shi, Yi Zeng

机构 * Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知人工智能实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需重新训练的微调后安全增强方法MSCP,通过多级表示对齐和安全方向投影,有效抑制有害输出并提升与人类偏好的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22169 2026-02-02 cs.CL cs.AI cs.CR cs.LG 89%

In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

葡萄酒中的真理与漏洞:通过醉酒语言诱导检验LLM安全性

Anudeex Shetty, Aditya Joshi, Salil S. Kanhere

机构 * School of Computer Science and Engineering, UNSW Sydney(计算机科学与工程学院,新南威尔士大学悉尼分校) School of Computing and Information System, the University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过诱导LLM产生醉酒语言,研究其安全漏洞,发现其易受劫持攻击和隐私泄露,揭示了LLM安全性的潜在风险。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06777 2026-02-02 cs.CV cs.AI 89%

MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension

MolX: 通过多模态扩展增强大型语言模型的分子理解能力

Khiem Le, Zhichun Guo, Kaiwen Dong, Xiaobao Huang, Bozhao Nan, Roshni Iyer, Xiangliang Zhang, Olaf Wiest, Wei Wang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, IN, USA(诺丁汉大学) University of California, Los Angeles, CA, USA(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MolX通过多模态扩展提升LLM对分子的理解能力,利用SMILES和分子图提取细粒度特征,并结合分子指纹提升性能,有效提升分子相关任务表现。

Comments MLoG-GenAI@KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25736 2026-02-02 cs.CL cs.AI cs.IT cs.NI math.IT 88%

Think Less, Label Better: Multi-Stage Domain-Grounded Synthetic Data Generation for Fine-Tuning Large Language Models in Telecommunications

少思多标:多阶段领域导向的合成数据生成用于电信领域大型语言模型微调

Chenhua Shi, Gregor Macdonald, Bhavika Jalli, Wanlu Lei, John Zou, Mridul Jain, Joji Philip

机构 * Ericsson(爱立信)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种多阶段自动化方法,利用领域知识图生成高质量合成数据,用于电信领域大型语言模型的微调,减少人工标注依赖,提升数据质量。

Comments 6 pages, 6 figures, 5 tables, IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23006 2026-02-02 cs.CL 85%

InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning

InstructDiff:通过微分熵实现领域自适应的数据选择以实现高效的LLM微调

Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Peking University(北京大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) SUFE(上海财经大学) SUSTech(南方科技大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 InstructDiff通过微分熵实现领域自适应的数据选择,提升LLM微调效率,实验显示在数学推理和通用指令遵循任务上分别提高17%和52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17564 2026-02-02 eess.IV cs.CV cs.LG 83%

ModalTune: Fine-Tuning Slide-Level Foundation Models with Multi-Modal Information for Multi-task Learning in Digital Pathology

ModalTune: 通过多模态信息细调滑片级基础模型以实现数字病理学中的多任务学习

Vishwesh Ramanathan, Tony Xu, Pushpak Pati, Faruk Ahmed, Maged Goubran, Anne L. Martel

机构 * Sunnybrook Research Institute(辛普森布鲁斯研究所在) University of Toronto(多伦多大学) Google Research(谷歌研究)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 ModalTune通过引入多模态信息和大型语言模型,实现数字病理学中多任务学习的统一细调框架,提升癌症生存和亚型预测性能。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI 81%

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23182 2026-02-02 cs.CL 79%

FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation

FourierSampler: 通过频率引导生成解锁扩散语言模型的非自回归潜力

Siyang He, Qiqi Wang, Xiaoran Liu, Hongnan Ma, Yiwei Shi, Yuerong Song, Ying Zhu, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 FourierSampler通过频域滑动窗口机制,在扩散语言模型中实现非自回归生成,提升生成效果并超越自回归模型

Comments 15 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21572 2026-02-02 cs.LG eess.SP 79%

RefineBridge: Generative Bridge Models Improve Financial Forecasting by Foundation Models

RefineBridge: 生成桥梁模型通过基础模型提升金融预测

Anthony Bolton, Wuyang Zhou, Zehua Chen, Giorgos Iacovides, Danilo Mandic

机构 * Department of Electrical and Electronic Engineering, Imperial College London, UK(帝国理工学院伦敦分校电子与电气工程系) Department of CST, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 RefineBridge通过生成桥梁模型改进金融预测,利用可处理的Schrödinger Bridge框架提升时间序列基础模型的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22873 2026-02-02 eess.AS cs.AI cs.CL cs.SD 79%

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

EmoShift: 轻量级激活引导用于增强情感感知语音合成

Li Zhou, Hao Jiang, Junjie Li, Tianrui Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EmoShift通过轻量级激活引导框架提升情感感知语音合成的情感表达与自然性。

Comments Activation Steering; Emotion-Aware TTS; Speech Synthesis; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21558 2026-02-02 cs.CL 77%

ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas

ASTRA: 自动化合成代理轨迹与强化环境

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian Zhang, Jade Ouyang, Junxi Yin, Jiong Chen, Baoyan Guo, Lei Zhang, Junjie Tao, Yuansheng Song, Ming Cui, Chengwei Liu

机构 * Beike Language and Intelligence(北溪语言与智能)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 ASTRA通过可扩展数据合成和可验证强化学习,自动化训练工具增强语言模型代理,实现多轮稳定学习和高性能工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 75%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21795 2026-02-02 cs.LG cs.AI 73%

Effective LoRA Adapter Routing using Task Representations

利用任务表示的有效LoRA适配器路由

Akash Dhasade, Anne-Marie Kermarrec, Igor Pavlovic, Diana Petrescu, Rafael Pires, Mathis Randl, Martijn de Vos

机构 * EPFL(苏黎世联邦理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LORAUTER通过任务表示实现高效适配器路由,优于现有方法并在未见过的任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05568 2026-02-02 cs.LG cs.AI 73%

Ravan: Multi-Head Low-Rank Adaptation for Federated Fine-Tuning

Ravan:用于联邦微调的多头低秩适应

Arian Raje, Baris Askin, Divyansh Jhunjhunwala, Gauri Joshi

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Ravan通过多头低秩适应方法提升联邦微调的准确率,实现高效参数更新和高模型表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19404 2026-02-02 cs.AI cs.LG 73%

RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization

RPO:基于部分推理优化的强化微调

Hongzhu Yi, Xinming Wang, Zhenghao zhang, Tianyu Zong, Yuanxiang Wang, Jun Xie, Tao Yu, Haopeng Jin, Kaixin Xu, Feng Chen, Jiahuan Chen, Yujia Yang, Zhenyu Guan, Bingkang Shi, Jungang Xu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过部分推理优化显著降低训练时间,提升大型语言模型的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09026 2026-02-02 cs.LG cs.CR 70%

Detecting Instruction Fine-tuning Attacks using Influence Function

利用影响函数检测指令微调攻击

Jiawei Li

机构 * Tsinghua University(清华大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出一种无需先验知识的检测方法,通过影响函数和语义转换识别污染示例,提升模型鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22182 2026-02-02 cs.CR cs.AI 57%

ShellForge: Adversarial Co-Evolution of Webshell Generation and Multi-View Detection for Robust Webshell Defense

ShellForge: 基于对抗性共进化的小壳生成与多视角检测的稳健小壳防御

Yizhong Ding

机构 * Beijing Electronic Science and Technology Institute(北京电子科技研究所) Technology Institute(技术研究所)

专题命中 指令微调 :LLM(abstract);分类 cs.AI

AI总结 ShellForge通过对抗性共进化框架,结合自动化小壳生成与多视角检测,提升Webshell防御的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03370 2026-02-02 q-bio.QM cs.AI cs.CE 57%

InstructPLM-mu: 1-Hour Fine-Tuning of ESM2 Beats ESM3 in Protein Mutation Predictions

InstructPLM-mu:在1小时内微调ESM2在蛋白质突变预测中优于ESM3

Junde Xu, Yapin Shi, Lijun Lang, Taoyong Cui, Zhiming Zhang, Guangyong Chen, Jiezhong Qiu, Pheng-Ann Heng

机构 * The Chinese University of Hong Kong(香港中文大学) Hangzhou Institute of Medicine, CAS(杭州医学研究所,中国科学院) Hangzhou Institute for Advanced Study, UCAS(杭州先进研究 institute,中国科学院大学) University of Chinese Academy of Sciences(中国科学院大学) Tianjin University(天津大学)

专题命中 指令微调 :language model(abstract);分类 cs.AI

AI总结 InstructPLM-mu通过1小时微调ESM2在蛋白质突变预测中超越ESM3,揭示了结构输入对模型性能的关键影响。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14133 2026-02-02 cs.RO cs.CV 50%

TwinBrainVLA: Unleashing the Potential of Generalist VLMs for Embodied Tasks via Asymmetric Mixture-of-Transformers

TwinBrainVLA: 通过非对称Transformer混合释放通用视觉语言模型在具身任务中的潜力

Bin Yu, Shijie Lian, Xiaopeng Lin, Yuliang Wei, Zhaolong Shen, Changti Wu, Yuzhuo Miao, Xinming Wang, Bailing Wang, Cong Huang, Kai Chen

机构 * HIT(哈尔滨工业大学) ZGCA(中钢集团人工智能研究院) ZGCI(中钢集团智能计算研究院) HUST(华中科技大学) HKUST(GZ)(香港科技大学(广州)) BUAA(北京航空航天大学) ECNU(华东师范大学) CASIA(中国科学院自动化研究所) DeepCybo

专题命中 指令微调 :language model(abstract)

AI总结 TwinBrainVLA通过非对称Transformer混合机制,利用冻结的通用视觉语言模型和可训练的专家路径,实现机器人任务中的具身智能提升。

Comments GitHub: https://github.com/ZGC-EmbodyAI/TwinBrainVLA

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22547 2026-02-02 cs.IR 50%

PersonaAct: Simulating Short-Video Users with Personalized Agents for Counterfactual Filter Bubble Auditing

PersonaAct: 通过个性化代理模拟短视频用户以进行反事实过滤气泡审计

Shilong Zhao, Qinggang Yang, Zhiyi Yin, Xiaoshi Wang, Zhenxing Chen, Du Su, Xueqi Cheng

专题命中 指令微调 :LLM(abstract)

AI总结 PersonaAct通过个性化代理模拟短视频用户,提升过滤气泡审计的保真度和深度,揭示内容压缩现象并释放首个开源数据集。

详情

展开后加载摘要…

URL PDF HTML 收藏