arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-30 至 2026-01-30 共收录 13 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 13 篇

2509.20758 2026-01-30 cs.CL 85%

SFT Doesn't Always Hurt General Capabilities: Revisiting Domain-Specific Fine-Tuning in LLMs

SFT并不总是损害通用能力:重新审视LLM中的领域特定微调

Jiacheng Lin, Zhongruo Wang, Kun Qian, Tian Wang, Arvind Srinivasan, Hansi Zeng, Ruochen Jiao, Xie Zhou, Jiri Gesi, Dakuo Wang, Yufan Guo, Kai Zhong, Weiqi Zhang, Sujay Sanghavi, Changyou Chen, Hyokun Yun, Lihong Li

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Amazon(亚马逊) University of Massachusetts Amherst(马萨诸塞大学阿姆赫斯特分校) University of Texas at Austin(德克萨斯大学奥斯汀分校) University at Buffalo(布法罗大学) Northeastern University(东北大学)

专题命中 指令微调 :SFT(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文研究了SFT对LLM通用能力的影响,发现较小学习率可缓解性能下降,提出TALR方法在平衡领域特定性能与通用能力方面表现优异。

Comments Accepted by ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.13258 2026-01-30 cs.CL 85%

Towards Transparent RAG: Fostering Evidence Traceability in LLM Generation via Reinforcement Learning

迈向透明的RAG:通过强化学习促进LLM生成中的证据可追溯性

Jingyi Ren, Yekun Xu, Xiaolong Wang, Weitao Li, Ante Wang, Weizhi Ma, Yang Liu

机构 * DCST \& AIR, Tsinghua University Beijing, China DCST, Tsinghua University Beijing, China AIR, Tsinghua University Beijing, China DSCT \& AIR, Tsinghua University Beijing, China DCST \& AIR, Tsinghua University DCST, Tsinghua University AIR, Tsinghua University DSCT \& AIR, Tsinghua University

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 TRACE通过强化学习提升LLM生成中的证据可追溯性,实现透明输出和准确性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22128 2026-01-30 cs.AI cs.CE q-bio.QM 81%

The Patient is not a Moving Document: A World Model Training Paradigm for Longitudinal EHR

患者并非静态文档:一种用于纵向电子健康记录的world model训练范式

Irsyad Adam, Zekai Chen, David Laprade, Shaun Porwal, David Laub, Erik Reinertsen, Arda Pekis, Kevin Brown

专题命中 指令微调 :large language model(abstract);language model(abstract);foundation model(abstract);SFT(abstract)

AI总结 本文提出SMB-Structure模型,通过结合联合嵌入预测架构和next-token预测,学习捕捉疾病动态的嵌入,实现对高异质性复杂任务的竞争力表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22158 2026-01-30 cs.CL 81%

Context Parametrization with Compositional Adapters

基于组合适配器的上下文参数化

Josip Jukić, Martin Tutek, Jan Šnajder

机构 * TakeLab, University of Zagreb, Croatia(Take实验室,扎格雷布大学,克罗地亚)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 CompAs通过组合结构的适配器参数,提升LLM在长上下文和多任务中的效率与稳定性,提供一种更高效的部署方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21670 2026-01-30 cs.CV cs.AI cs.LG physics.comp-ph 81%

MORPH: PDE Foundation Models with Arbitrary Data Modality

MORPH:具有任意数据模态的PDE基础模型

Mahindra Singh Rautela, Alexander Most, Siddharth Mansingh, Bradley C. Love, Alexander Scheinker, Diane Oyen, Nathan Debardeleben, Earl Lawrence, Ayan Biswas

机构 * Computing and Artificial Intelligence Division (CAI), Los Alamos National Laboratory, NM, US(计算与人工智能部门(CAI),洛斯阿拉莫斯国家实验室)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 MORPH是一种基于卷积视觉变压器的PDE基础模型,通过多模态处理和高效注意机制实现对异质科学数据的高效学习。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22047 2026-01-30 cs.CL 77%

On the Paradoxical Interference between Instruction-Following and Task Solving

关于指令遵循与任务解决之间的悖论性干扰

Yunjia Qi, Hao Peng, Xintong Shi, Amy Xin, Xiaozhi Wang, Bin Xu, Lei Hou, Juanzi Li

机构 * Department of Computer Science and Technology, BNRist(计算机科学与技术系,BNRist)

专题命中 指令微调 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.CL

AI总结 本文揭示指令遵循可能干扰LLMs任务解决能力,并提出SUSTAINSCORE指标量化此干扰,通过实验表明添加自我显而易见约束会导致性能下降。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.01918 2026-01-30 cs.LG quant-ph 77%

Superpositional Gradient Descent: Harnessing Quantum Principles for Model Training

叠加梯度下降:利用量子原理进行模型训练

Ahmet Erdem Pamuk, Emir Kaan Özdemir, Şuayp Talha Kocabay

机构 * Mustafa Hakan G\"uven c er Science High School Ankara, T\"urkiye \. I stanbul Erkek High School \. I stanbul, T\"urkiye T\"UB\. I TAK Science High School Kocaeli, T\"urkiye

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出叠加梯度下降方法,通过量子原理提升模型训练效率,实验证明其在序列分类和LLM微调中表现优于AdamW。

Comments Accepted at 2025 IEEE International Conference on Quantum Artificial Intelligence (IEEE QAI 2025). This is the accepted version of the paper. The final published version will appear in the IEEE proceedings. \c{opyright} 2025 IEEE. Personal use of this material is permitted. Permission from IEEE must be obtained for all other uses

Journal ref Proc. IEEE QAI 2025, Naples, Italy, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20901 2026-01-30 cs.CR 71%

Towards Sensitivity-Aware Language Models

面向敏感性感知的语言模型

Dren Fazlija, Iyiola E. Olatunji, Daniel Kudenko, Sandipan Sikdar

专题命中 指令微调 :language model(title)

AI总结 本文提出了一种方法,通过监督微调提升四比特量化LLMs的敏感性感知能力,使其在隐私保护方面表现更优,同时保持其他任务性能。

Comments 11 pages, 3 figures, 2 tables, AISTATS 2026; Project Page: https://drenfazlija.github.io/towards-sa-llms/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20911 2026-01-30 cs.CV cs.AI 70%

Non-Markov Multi-Round Conversational Image Generation with History-Conditioned MLLMs

非马尔可夫多轮对话图像生成与历史条件化大语言模型

Haochen Zhang, Animesh Sinha, Felix Juefei-Xu, Haoyu Ma, Kunpeng Li, Zhipeng Fan, Meng Dong, Xiaoliang Dai, Tingbo Hou, Peizhao Zhang, Zecheng He

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出非马尔可夫多轮对话图像生成方法,通过历史条件化框架和数据构建策略提升多轮一致性与指令遵循性,同时保持单轮编辑能力。

Comments 19 pages, 19 figures, plan for TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21426 2026-01-30 cs.CV 67%

MultiModal Fine-tuning with Synthetic Captions

多模态微调与合成描述

Shohei Enomoto, Shin'ya Yamaguchi

机构 * NTT Tokyo(日本NTT东京)

专题命中 指令微调 :large language model(abstract);language model(abstract)

AI总结 本文提出通过多模态大语言模型生成合成描述,提升多模态微调效果,尤其在少样本学习中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21618 2026-01-30 cs.AI cs.CL 62%

Semantic Content Determines Algorithmic Performance

语义内容决定算法性能

Martiño Ríos-García, Nawaf Alampara, Kevin Maik Jablonka

机构 * Laboratory of Organic Macromolecular Chemistry (IOMC), Friedrich Schiller University Jena, Humboldtstrasse 10, 07743 Jena, Germany HIPOLE Jena (Helmholtz Institute for Polymers in Energy Applications Jena), Lessingstrasse 12-14, 07743 Jena, Germany Center for Energy Environmental Chemistry Jena (CEEC Jena), Friedrich Schiller University Jena, Philosophenweg 7a, 07743 Jena, Germany Jena Center for Soft Matter (JCSM), Friedrich Schiller University Jena, Philosophenweg 7, 07743 Jena, Germany

专题命中 指令微调 :LLM(abstract);分类 cs.CL、cs.AI

AI总结 研究揭示大语言模型的性能受输入语义影响,通过WhatCounts实验展示不同语义内容导致计数准确率显著变化,表明模型对输入意义存在隐性依赖。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25889 2026-01-30 cs.LG 57%

$π_\texttt{RL}$: Online RL Fine-tuning for Flow-based Vision-Language-Action Models

$π_\ exttt{RL}$: 流基于视觉-语言-动作模型的在线强化学习微调

Kang Chen, Zhihao Liu, Tonghe Zhang, Zhen Guo, Si Xu, Hao Lin, Hongzhi Zang, Xiang Li, Quanlu Zhang, Zhaofei Yu, Guoliang Fan, Tiejun Huang, Yu Wang, Chao Yu

机构 * Tsinghua University(清华大学) Peking University(北京大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Carnegie Mellon University(卡内基梅隆大学) Infinigence AI Zhongguancun Academy(中关村学院)

专题命中 指令微调 :SFT(abstract);分类 cs.LG

AI总结 本文提出$π_\ exttt{RL}$方法,通过流噪声和流SDE技术,解决大规模流基于VLA模型中强化学习微调的挑战,提升模型在分布内和分布外任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17816 2026-01-30 cs.CV 50%

Enhancing Semantic Segmentation with Continual Self-Supervised Pre-training

通过持续自监督预训练增强语义分割

Brown Ebouky, Ajad Chhatkuli, Cristiano Malossi, Christoph Studer, Roy Assaf, Andrea Bartezzaghi

机构 * ETH Zurich(苏黎世联邦理工学院) IBM Research – Zurich(IBM瑞士研究实验室)

专题命中 指令微调 :foundation model(abstract)

AI总结 本文提出GLARE,一种持续自监督预训练任务,用于提升语义分割性能,通过块级增强和区域一致性约束,结合轻量级适配器模块,实现低数据域下的高效适应。

Comments 23 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏