arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12855 信号源:cs.CL, cs.AI, cs.LG

1. 指令微调 1064 篇

2607.07916 2026-07-10 cs.AI cs.LG 新提交 86%

Persona Cartography: Charting Language Model Personality Traits in Weight Space

人物角色制图:在权重空间中描绘语言模型的个性特征

Luke Baines, Anton Gonzalvez Hawthorne, Mariia Koroliuk, Irakli Shalibashvili, Clément Dumas, Konstantinos Voudouris, David Demitri Africa

机构 * dsit.gov.uk(数字科学与创新部)

专题命中 指令微调 :language model(title,abstract);LLM(abstract);large language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大型语言模型人物角色,用大五人格框架将其视为行为特征空间位置,训练低秩适配器控制特征,评估其效果,发现可构建混合人物角色并保持性能,还表明特征轴影响安全行为,引入无监督管道,为人格测量等架桥。

Comments 85 pages, 80 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31166 2026-07-01 cs.CL cs.LG 新提交 86%

TAG-DLM: Diffusion Language Models for Text-Attributed Graph Learning

TAG-DLM:面向文本属性图学习的扩散语言模型

Lingjie Chen, Yuanchen Bei, Haobo Xu, Yanjun Zhao, Yuzhong Chen, Hanghang Tong

机构 * UIUC(伊利诺伊大学厄巴纳-香槟分校) VISA(VISA研究院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出TAG-DLM方法,通过掩码扩散语言模型统一文本推理与图消息传递,线性化邻域并利用拓扑注意力掩码实现图结构注入,无需微调即可适应节点分类、链接预测等任务,性能优于现有基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10684 2026-06-10 cs.LG cs.AI 新提交 86%

Divide and Cooperate: Role-Decomposed Multi-Agent LLM Training with Cross-Agent Learning Signals

分工与合作:基于跨智能体学习信号的角色分解多智能体LLM训练

Jaewan Park, Solbee Cho, Jay-Yoon Lee

机构 * Seoul National University(首尔大学)

专题命中 指令微调 :LLM(title,title_cn);language agent(abstract);分类 cs.AI、cs.LG

AI总结 提出DAC框架,将多步推理分解为搜索和生成两个子任务,分别由专用智能体处理,并通过跨智能体学习信号解决信用分配问题,在QA基准上超越全参数微调的单体模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26661 2026-08-28 cs.IR 新提交 86%

When Does Supervised Fine-Tuning Reduce Instruction Sensitivity?

监督微调何时会降低指令敏感性?

Jaekeol Choi

专题命中 指令微调 :SFT(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究探讨了监督微调(SFT)对大型语言模型指令敏感性的影响,发现SFT的稳健性效应因模型规模、类型及适应设置而异,且敏感性还受预测评分协议影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26197 2026-08-28 cs.SE 新提交 86%

Harness Engineering for Predictable Agentic Systems: An Empirical Study of Deterministic Execution Constraints

利用工程实现可预测的智能体系统:确定性执行约束的实证研究

Saransh Dhage

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本研究通过实证探究harness工程中确定性执行约束对LLM智能体的影响,发现添加结构化规划可提升可复现性与任务成功率,但延迟存在模型依赖的成本差异。

Comments 9 pages, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01635 2026-08-04 cs.CV 新提交 86%

Mitigating Visual Degradation in MLLMs via Spatial-Spectral Visual Anchor Learning

通过空间-光谱视觉锚学习缓解多模态大语言模型(MLLMs)中的视觉退化

Qianlong Yang, Bowen Ye, Xianda Guo, Yanlun Peng, Wenke Huang, Hongyuan Zhang, Yulei Jia

机构 * China University of Petroleum (East China)(中国石油大学(华东)) Shanghai Jiao Tong University(上海交通大学) Wuhan University(武汉大学) Great Wall Motor(长城汽车) Nanyang Technological University(南洋理工大学) The University of Hong Kong(香港大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 针对MLLMs推理时的视觉表示退化问题,提出SSVAL方法,通过VAPI及辅助对齐损失实现稳定视觉锚,性能优于现有方法。

Comments This paper has been accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.31408 2026-07-01 cs.CR cs.OS 新提交 86%

EnclaveX: End-to-End Confidential AI with CPU/GPU TEEs

EnclaveX: 端到端机密AI与CPU/GPU TEE

Robert Schambach, Quoc Do Le, Sergei Arnautov, Christof Fetzer

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出结合CPU和GPU TEE的端到端工作流,通过Intel TDX和AMD SEV-SNP等机制保障AI/LLM应用的机密性和完整性,并评估了性能开销。

Comments 8 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25987 2026-06-25 cs.CL cs.AI cs.LG 新提交 86%

Weave of Formal Thought

形式思维之织

Alexandre Bouayad

专题命中 指令微调 :SFT(abstract,abstract_cn);LLM(abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出WoFT框架,结合完整语法约束解码与潜在变量微调,使语言模型生成语法有效代码并学习结构表示,在Python上降低14.3%交叉熵。

Comments Code is available at https://github.com/alexbouayad/formal

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18633 2026-06-18 cs.MA 新提交 86%

PersonalPlan: Planning Multi-Agent Systems for Personalized Programming Learning

PersonalPlan: 面向个性化编程学习的多智能体系统规划

Zhiyuan Wen, Jiannong Cao, Peng Gao, Haochen Shi, Wengpan Kuan, Bo Yuan, Xiuxiu Qi

专题命中 指令微调 :SFT(summary_cn,abstract);LLM(abstract,abstract_cn)

AI总结 提出PersonalPlan,一种两阶段多智能体规划器,通过分层SFT和奖励自适应GRPO生成可执行、个性化且具有教学支架的计划,在MAP-PPL数据集上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16827 2026-06-16 cs.SE 新提交 86%

No Resource, No Benchmarks, No Problem? Evaluating and Improving LLMs for Code Generation in No-Resource Languages

无资源、无基准、无问题?评估和改进无资源语言的代码生成大语言模型

Alessandro Giagnorio, Alberto Martin-Lopez, Gabriele Bavota

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 研究无资源语言(LLM未见训练数据的语言)的代码生成问题,通过构建三个基准并实验提示技术、预训练和微调方法,提出权重差异迁移方法提升性能。

Comments Accepted for publication at IEEE Transactions on Software Engineering

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16215 2026-06-16 cs.CL cs.AI cs.LG 新提交 86%

PACT: Privileged Trace Co-Training for Multi-Turn Tool-Use Agents

PACT: 多轮工具使用智能体的特权轨迹协同训练

Zhenbang Du, Jun Luo, Zhiwei Zheng, Xiangchi Yuan, Kejing Xia, Dachuan Shi, Qirui Jin, Qijia He, Shaofeng Zou, Yingbin Liang, Wenke Lee

机构 * Georgia Institute of Technology(佐治亚理工学院) Ohio State University(俄亥俄州立大学) University of Pennsylvania(宾夕法尼亚大学) Arizona State University(亚利桑那州立大学)

专题命中 指令微调 :SFT(summary_cn,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PACT框架,通过特权轨迹(专家轨迹)在训练时提供密集监督信号,结合轨迹条件RL和组件感知SFT损失,避免推理时依赖轨迹,显著提升多轮工具使用智能体的性能。

Comments Project page: https://zhenbangdu.github.io/pact-project-page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15696 2026-06-16 cs.AI cs.CL cs.LG 新提交 86%

Do LLMs Reliably Identify Correct Information Units in Aphasic Discourse?

LLMs 能否可靠识别失语症语篇中的正确信息单元?

Jason M Pittman, Yesenia Medina-Santos, Anton Phillips, Brielle C. Stark

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 研究评估指令微调大语言模型在零样本和少样本提示下对失语症语篇进行词级正确信息单元分类的性能,发现少样本提示可提升效果但一致性仍不足。

Comments 5 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11854 2026-06-11 cs.LG cs.AI cs.CL 新提交 86%

Fine-tuning Multi-modal LLMs with ART: Art-based Reinforcement Training

使用ART微调多模态大语言模型:基于艺术的强化训练

Michal Chudoba, Sergey Alyaev, Petra Galuscakova, Tomasz Wiktorski

机构 * University of Stavanger(斯塔万格大学) NORCE Research(NORCE研究机构)

专题命中 指令微调 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 提出ART方法,通过优化原始视觉输入将信息注入冻结的多模态大语言模型,实现软提示微调,无需修改计算图,在数学和工具使用基准上达到与LoRA相当的精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09393 2026-06-09 cs.CV 新提交 86%

CapRL++: Unified Reinforcement Learning with Verifiable Rewards for Dense Image and Video Captioning

CapRL++:基于可验证奖励的统一强化学习用于密集图像和视频描述生成

Penghui Yang, Long Xing, Xiaoyi Dong, Yuhang Zang, Yuhang Cao, Yibin Wang, Yujie Zhou, Jiazi Bu, Jianze Liang, Qidong Huang, Jiaqi Wang, Feng Wu, Dahua Lin

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Microsoft(微软) Shanghai AI Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) Alibaba Cloud(阿里云) The Chinese University of Hong Kong(香港中文大学)

专题命中 指令微调 :LLM(abstract,abstract_cn);SFT(abstract,abstract_cn);language model(abstract);pretraining(abstract)

AI总结 提出CapRL++框架,利用可验证奖励的强化学习(RLVR)优化多模态描述生成,通过非视觉语言模型回答问题的准确性作为奖励,提升密集描述质量,在20多个基准上超越传统监督微调。

Comments 26 pages, 10 figures. Project page: https://github.com/InternLM/CapRL. arXiv admin note: text overlap with arXiv:2509.22647

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07246 2026-06-08 cs.AR 新提交 86%

MailoHLS: Multi-Adapter Structure-Aware Learning for Pareto-Driven HLS Pragma Optimization

MailoHLS: 面向帕累托驱动HLS编译指示优化的多适配器结构感知学习

Elena Vouvali, Dimosthenis Masouros, Aggelos Ferikoglou, Dimitrios Soudris, Sotirios Xydis

专题命中 指令微调 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出MailoHLS混合框架,结合LLM语义推理与GNN结构建模,通过交叉注意力、目标条件LoRA适配器和帕累托优化,实现HLS编译指示的联合优化,在延迟优化上最高提速12.42倍,并持续生成近帕累托最优设计。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27867 2026-08-31 cs.AI 新提交 85%

CoRe-MoE: Compact Reusable MoE for Continual Multimodal Instruction Tuning

CoRe-MoE:用于持续多模态指令调优的紧凑可混合混合专家模型

Runze Liu, Naibin Gu, Mingxu Ai, Yuqing Li, Peng Fu, Zheng Lin, Weiping Wang

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) School of Cyber Security, University of Chinese Academy of Sciences(中国科学院大学网络空间安全学院)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对持续多模态指令调优中 LoRA-MoE 参数开销大的问题,提出 CoRe-MoE 框架,通过复用方向基减少参数,在 MLLM 上性能提升达 5.90 点且参数仅为顺序 LoRA 的 1%。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18085 2026-08-20 cs.CL 新提交 85%

Persona-Guided LLM Agents for Task-Oriented Dialogue

面向任务型对话的角色引导大语言模型智能体

Maryam Shoaeinaeini, Brent Harrison, A. B. Siddique

机构 * University of Kentucky(肯塔基大学)

专题命中 指令微调 :LLM(title,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究构建无需训练的框架,通过三种情境评估多模型在SGD数据集上的表现,发现适应用户人格存在权衡,Try情境的线索式适应可更可靠实现感知人格的任务型对话。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17162 2026-08-19 cs.LG 新提交 85%

OraclePhys: A Systematic Framework for LLM Fine-Tuning on Structural Mechanics

OraclePhys:面向结构力学的大语言模型微调系统框架

Mingyu Li, Guorui Song, Jing Lin, Haoqian Wang

机构 * University of Houston(休斯顿大学) Tsinghua University(清华大学)

专题命中 指令微调 :LLM(title,abstract);language model(abstract);分类 cs.LG

AI总结 本研究提出OraclePhys,一种面向结构力学的大语言模型微调系统框架,含自动评分基准、多形式监督数据集及对照训练研究,发现标签答案形式而非比特数决定微调效果,训练所得8B模型达空间结构响应任务数据精度前沿。

Comments 18 pages, 8 figures, 9 tables. Under review at ACL Rolling Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.14649 2026-08-18 cs.LG 新提交 85%

Discrete Diffusion Language Models Are Training-Free Multi-Label Classifiers

离散扩散语言模型是无需训练的多标签分类器

Pawan Kumar

机构 * International Institute of Information Technology, Hyderabad(印度海得拉巴国际信息技术学院)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.LG

AI总结 本研究提出无需训练的多标签分类方法dLLM-SetScore,基于离散掩码扩散语言模型,在多个数据集上对比基准模型,验证了其性能优势并完成了相关理论分析。

Comments Accepted to SIAM SDM 2026, 39 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05126 2026-08-06 cs.CL cs.MM 新提交 85%

Spoken Function Calling: A New Perspective on Spoken Language Understanding for Large Audio Language Models

语音函数调用:面向大型音频语言模型的语音理解新视角

Yuezhang Peng, Yuxin Liu, Changfeng Gao, Zhifu Gao, Xiangang Li, Xie Chen

机构 * Shanghai Jiao Tong University(上海交通大学) Token Foundry, Alibaba Group(阿里巴巴集团Token Foundry) Shanghai Innovation Institute(上海创新研究院)

专题命中 指令微调 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL

AI总结 该研究提出语音函数调用(SFC)这一新型语义理解视角,构建SFC-Bench数据集并评估LLMs与LALMs性能,经后训练提升LALMs的SFC能力,实验显示SFC优于传统SLU,可大幅提升语义提取准确率。

Comments ACM Multimedia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03660 2026-08-05 cs.AI 新提交 85%

Taming the Implicit: Dual-Channel Risk-Aware Reinforcement Fine-Tuning for Continual Multimodal Post-Training

驯服隐式:面向持续多模态后训练的双通道风险感知强化微调

Yibei Liu, Jiajun Chen, Qianle Zhang, Tangyue Jin, Mengying Zhu, Meng Xi, Yangyang Wu

专题命中 指令微调 :post-training(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对持续多模态后训练中RFT算法在任务分布偏移下遗忘加剧的问题,提出双通道风险感知强化微调框架RAPO,通过策略与数据通道的风险管控降低遗忘,在MLLM-CL基准上使遗忘减少79.8%且保留新任务竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01835 2026-08-04 cs.AI 新提交 85%

Rewriting or Reweighting? A Geometric Account in Language Models

重写还是重加权?语言模型中的几何视角

Juntong Wang, Shengkun Yang, Xiyuan Wang, Muhan Zhang

专题命中 指令微调 :language model(title);SFT(abstract,abstract_cn);post-training(abstract);分类 cs.AI

AI总结 本研究提出行为流形分析方法,通过ACT与NOC空间的几何视角,发现监督微调重写语言模型行为几何、奖励优化重加权该几何的机制差异,为理解后训练目标提供统一框架。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28657 2026-08-03 cs.AI 新提交 85%

TAPR: Enhancing LLM Performance with a Task-Aware Prompt Rewriter

TAPR:利用任务感知提示重写器提升大语言模型性能

Oliver Savolainen, Emanuele Bastianelli, Hosein Azarbonyad

机构 * University of Amsterdam(阿姆斯特丹大学) Elsevier(爱思唯尔)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究提出TAPR模型,采用带GRPO的强化学习训练,可将用户提示优化为任务适配的提示,经微调Phi-4-mini-instruct后,在多任务基准测试中提升了大语言模型的准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26922 2026-07-30 cs.LG 新提交 85%

Two Calls Beat Five Agents: Evaluating Multi-Agent Pipelines Against Self-Refinement for Local Language Models

两次调用胜过五个智能体:针对本地语言模型的多智能体流水线与自我优化的评估

Ashish Prajapati, Om Mohite

专题命中 指令微调 :language model(title);LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG

AI总结 本研究对比多智能体流水线与自我优化方法,发现针对本地7B模型,两次调用自我优化在GSM8K表现更优且令牌用量低,经任务感知重设计后在HumanEval也能维持高准确率,简单方法优于多智能体架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26831 2026-07-30 cs.CL 新提交 85%

Language Models are not Equally Robust to Non-Canonical Tokenization across Languages

语言模型对跨语言非规范分词的鲁棒性存在差异

Poulami Ghosh, Preethi Jyothi

机构 * IIT Bombay(印度理工学院孟买分校)

专题命中 指令微调 :language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文研究发现语言模型对非规范分词的鲁棒性因语言而异,Llama-3.1-8B等模型在高碎片化语言中性能下降,LoRA微调可有效缓解分词敏感性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25292 2026-07-29 cs.AI 新提交 85%

Instruction-Tuned Language Models Cannot Sample from Distributions They Can Describe

指令微调语言模型无法从它们能描述的分布中进行采样

Chaemin Jang, Dongman Lee, Jihee Kim

机构 * School of Computing, KAIST(韩国科学技术院计算学院) School of Business and Technology Management, KAIST(韩国科学技术院商业与技术管理学院)

专题命中 指令微调 :language model(title,abstract);instruction tuning(abstract);post-training(abstract);分类 cs.AI

AI总结 研究发现指令微调语言模型无法从其能描述的分布中采样,存在“知道/做”分裂,通过让模型描述分布可减半误差,还提出PPA在无额外成本下降低21%误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23146 2026-07-28 cs.LG 新提交 85%

Foundation Models and Fine-Tuning: Toward a New Generation of Models for Time Series Forecasting

基础模型与微调:迈向新一代时间序列预测模型

Morad Laglil, Bertrand Pracca, Emilie Devijver, Eric Gaussier

机构 * Univ. Grenoble Alpes, CNRS, Grenoble INP, LIG(格勒诺布尔阿尔卑斯大学、法国国家科学研究中心、格勒诺布尔国立综合理工学院、信息与地理实验室) Savoye(萨瓦亚)

专题命中 指令微调 :foundation model(title,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究受自然语言处理中大型语言模型突破启发,探讨基础模型用于时间序列预测,回顾其架构、预训练策略等,研究预训练后微调选定基础模型,实证结果表明微调可提高预测精度

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21279 2026-07-24 cs.CL 新提交 85%

A Unified Moral-Value Dataset for Instruction Tuning

用于指令微调的统一道德价值数据集

Zhaohui Zeng, Florian Mai

机构 * RWTH Aachen(亚琛工业大学) University of Bonn(波恩大学) Lamarr Institute for Machine Learning and Artificial Intelligence(拉玛尔机器学习与人工智能研究所)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对大语言模型与人类价值观对齐问题,构建统一道德价值数据集用于指令微调,通过合并现有数据集并转换格式而成,实验表明其结合通用任务数据集训练可保持性能,为对齐研究提供资源。

Comments Accepted at the 4th International Workshop on Value Engineering in AI (VALE 2026), co-located with IJCAI-ECAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20511 2026-07-24 cs.AI 新提交 85%

SiGMA: Sign-Guided Merging and Adaptation for Multimodal Continual Instruction Tuning

SiGMA:用于多模态持续指令微调的符号引导合并与适配

Keonhee Park, Gunhee Kim

机构 * Seoul National University(首尔国立大学)

专题命中 指令微调 :instruction tuning(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究多模态持续指令微调中存在的问题,提出SiGMA框架,通过训练时符号引导自适应调优、推理时符号引导合并减轻负面干扰,在相关基准实验中显著减少干扰且性能优于现有方法。

Comments Accepted at ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.18026 2026-07-21 cs.AI 新提交 85%

Rethinking Heterogeneous LLM Merging: A Weighted Model Averaging Perspective

重新思考异构语言模型合并:加权模型平均视角

Jiahe Fan, Yinghao Hou, Si Chen, Aiyuan Zhang, Hong Xie, Defu Lian

机构 * University of Science and Technology of China(中国科学技术大学) School of Computer Science and Technology, University of Science and Technology of China(中国科学技术大学计算机科学与技术学院)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究异构语言模型合并问题,通过无训练的维度适配和比率控制插值,在联合式与交叉式合并中进行实验,结果表明简单参数平均结合轻量级适配和比率控制是强大基线,揭示直接加权融合的限制及对复杂方法的制约。

Comments 17 pages, 3 figures, 20 tables, preprint

详情

展开后加载摘要…

URL PDF HTML 收藏