Transporting Task Vectors across Different Architectures without Training
在不同架构间传输任务向量而无需训练
机构 * AImageLab, University of Modena and Reggio Emilia(AImageLab,Modena和雷吉奥艾米利亚大学)
专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出Theseus方法,通过功能匹配在不同宽度模型间传输任务更新,无需训练或反向传播,展示了在视觉和语言模型上的改进效果。
Comments Accepted at the International Conference on Machine Learning (ICML), 2026