arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 7565 信号源:cs.CL, cs.AI, cs.LG

1. 知识编辑与模型理解 7565 篇

2602.12952 2026-07-31 cs.LG cs.AI cs.CV 版本更新 62%

Transporting Task Vectors across Different Architectures without Training

在不同架构间传输任务向量而无需训练

Filippo Rinaldi, Aniello Panariello, Giacomo Salici, Angelo Porrello, Simone Calderara

机构 * AImageLab, University of Modena and Reggio Emilia(AImageLab,Modena和雷吉奥艾米利亚大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Theseus方法,通过功能匹配在不同宽度模型间传输任务更新,无需训练或反向传播,展示了在视觉和语言模型上的改进效果。

Comments Accepted at the International Conference on Machine Learning (ICML), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26792 2026-07-30 stat.ML cs.AI cs.CE cs.LG q-fin.CP 新提交 62%

Crossing-Free Probabilistic K-Line Forecasts Without Retraining

无需重新训练的无交叉概率K线预测

Runyao Yu, Yuchen Tao, Yujie Chen, Wentao Wang, Derek W. Bunn

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出无需重新训练的KQSP方法,解决概率K线预测的分位数与K线交叉问题,保持预测准确性并将交叉率降至零。

Comments 8 pages, 2 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25600 2026-07-30 cs.IR cs.AI cs.CL 版本更新 62%

Beyond Self-Knowledge: Propagating Uncertainty Across Reasoning and Retrieval in LLMs

超越自我认知:在语言模型中跨推理与检索传播不确定性

Chandan Kumar Sah, Li Zhang, Xiaoli Lian

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在知识密集型问答中,利用黑盒语言模型的置信度指导检索路由。核心方法是BeyondUncertainty,先得临时答案和置信度,依阈值决定检索策略。该方法提升了平均词元级F1,减少检索段落,在多数设置中优于随机分配,揭示了证据获取与词元效率的权衡。

Comments 9 pages, 6 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25459 2026-07-29 cs.LG cs.AI q-fin.ST 新提交 62%

Emergent Latent-State Computation under Stochastic Volatility

随机波动率下的涌现潜态计算

Xiaoyu Huang, Lulu Wang

机构 * Temple University(天普大学) Dickinson College(迪金森学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究序列模型在部分可观测下如何表示潜在随机动态,发现在随机波动率设置中有两阶段计算,Transformer中潜态可解码性在特定阶段出现,输出头替换揭示部分退化原因,为机械可解释性提供有用基准。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23379 2026-07-28 cs.CL cs.AI 新提交 62%

When Activation Oracles Learn Not to Read: Concept-Specific Blind Spots in Fine-Tuned Oracles

当激活预言机学会不读取时:微调预言机中的特定概念盲点

Tobias Bersia, Tatiana Gaintseva

机构 * Queen Mary University of London(伦敦玛丽女王大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究在禁忌词猜测设置下,激活预言机经微调后成为特定概念反读取器的现象,发现其无法恢复自身训练时存在的概念,失败源于读取路径,揭示了行为泄漏等因素可分离,引发对可解释性接口可靠性的担忧。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23361 2026-07-28 cs.DS cs.CL cs.LG 新提交 62%

Hallucination Rates in Language Generation

语言生成中的幻觉率

Debmalya Panigrahi, Fan Wei, Ian Zhang

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究有(无限)幻觉的语言生成极限,表明即使幻觉率为0也使极限生成更强大,展示了由幻觉率和生成目标语言比例表征的语言集合严格层次结构,确立幻觉率为语言生成理论研究的重要参数。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.21491 2026-07-24 cs.CL cs.LG 新提交 62%

What, Where, and How: Disentangling the Roles of Task, Language, and Model in Code Model Representations

是什么、在哪里以及如何:解开任务、语言和模型在代码模型表示中的作用

Piotr Wilam

机构 * University College London(伦敦大学学院)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究独立训练的语言模型在代码表示上的情况,通过2x2设计扩展概念电路提取方法,测量语法概念,发现任务决定概念获专用电路,模型决定电路位置及增长方式,还得出如Rust与Python电路差异等结论,为后续测试奠定基础。

Comments 16 pages, 11 figures, 6 tables. Code: https://github.com/piotrwilam/Atlas2x2 ; dataset: https://huggingface.co/datasets/piotrwilam/Atlas2x2

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20652 2026-07-24 cs.LG cs.AI 新提交 62%

Scaling Interpretable Transformers with Parity Bottleneck Layers

使用奇偶瓶颈层扩展可解释的Transformer

Andrew Mack, Kraig Yuheng Tou, Mark Henry, Zhengxun Wu, Lauren Greenspan

机构 * Principles of Intelligence(智能原理)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究旨在解决训练可解释Transformer模型的难题,提出ParityTransformer架构,通过奇偶瓶颈层实现,实验表明其在稀疏探测任务中表现良好,在特征相关指标上更优,朝着训练内部表示可设计解释的模型迈出一步。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18543 2026-07-23 cs.AI cs.CL cs.SE 版本更新 62%

CEO-Bench: Can Agents Play the Long Game?

CEO-Bench:智能体能否玩转长期博弈?

Haozhe Chen, Karthik Narasimhan, Zhuang Liu

机构 * Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出CEO-Bench,通过模拟500天运营初创公司的任务,评估语言模型智能体在长期、不确定、动态环境下的综合决策能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17770 2026-07-21 cs.CV cs.AI cs.LG 新提交 62%

Measuring Monosemanticity in Sparse Autoencoders via Latent Activation Coherence

通过潜在激活一致性测量稀疏自编码器中的单语义性

Katarzyna Filus, Sebastian Pokuciński

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对可解释人工智能中评估稀疏自编码器单语义性的挑战,提出无标签的Tversky单语义性分数(TMS),通过激活集一致性衡量。在多种模型和设置下评估,结果显示TMS受编码器各向异性影响小,能揭示训练动态,还能体现概念删除有效性。

Comments This is a preprint version. A shorter version of this paper has been accepted for presentation and publication in the post-workshop proceedings of the 8th International Workshop on eXplainable Knowledge Discovery in Data Mining (XKDD 2026), co-located with ECML PKDD 2026. The appendix is included only in this preprint and is not part of the peer-reviewed proceedings paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16448 2026-07-21 cs.LG cs.AI 新提交 62%

Retrieval is Enough: Training-Free Interpretability with a Tool-Using Agent

检索就足够了:使用工具的智能体实现无需训练的可解释性

Sriram Balasubramanian, Soheil Feizi

机构 * University of Maryland(马里兰大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究神经网络激活可解释性方法,提出HARP方法,即让语言模型智能体利用激活向量数据库及工具,通过迭代查询、形成并验证假设来实现无需训练的可解释性,该方法在多方面表现出色,还凸显现有训练方法局限并推动新基准测试。

Comments 25 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13302 2026-07-21 cs.AI cs.LG 版本更新 62%

Physics-Guided Spatiotemporal Learning for Coastal Wave Peak Period Estimation from Video

物理引导的时空学习用于从视频估计海岸波浪峰值周期

Abubakar Hamisu Kamagata, Dharm Singh Jat, Attlee Munyaradzi Gamundani, Abhishek Srivastava, Paramasivam Saravanakumar

机构 * Namibia University of Science and Technology(纳米比亚科技大学) Indian Institute of Technology Indore(印度理工学院印多尔分校) Namdeb Diamond Corporation(纳米比亚钻石公司)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 提出物理引导的深度时空学习框架,结合自动区域检测、模拟到真实迁移学习和物理信息正则化,从海岸视频直接估计近岸波浪峰值周期,验证了基于Transformer和轻量级循环卷积架构的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15847 2026-07-20 cs.CL cs.AI 新提交 62%

CAMMAR: Culture-Aware Matryoshka for Metaphorical Arabic Representations

CAMMAR:用于隐喻阿拉伯语表示的文化感知套娃

Suzan Awinat, Alfonso Ortega del Puente

机构 * Autonomous University of Madrid (UAM)(马德里自治大学) IE University(IE大学) Oviedo University(奥维耶多大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对阿拉伯语语言模型语义模糊问题,提出CAMMAR框架,通过分阶段语义课程组织意义到嵌套子空间,基于词汇与隐喻表示距离产生隐喻性几何度量,在新数据集上评估,有监督时检测隐喻效果好,还发现基于形态学词根有提升。

Comments 14 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.17522 2026-07-20 cs.CL cs.LG 版本更新 62%

An expressivity analysis of hierarchical modelling in deep transformers via bounded-depth grammars

深度Transformer中基于有界深度文法的层次建模的表达性分析

Vinoth Nandakumar, Qiang Qu, Pramod Thebe, Sakshi Khachariya, Tongliang Liu

机构 * University of Sydney(悉尼大学) San Francisco State University(旧金山州立大学) IIT Madras(印度理工学院马德拉斯分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过有界深度上下文无关文法,证明深度Transformer的深度随文法深度线性增长,神经元数随派生树形状和产生式规则数量缩放,支持线性表示假说。

Comments Withdrawing submission to implement major revisions based on journal feedback

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.06592 2026-07-15 cs.CL cs.LG 版本更新 62%

Hierarchical Latent Structures in Data Generation Process Unify Mechanistic Phenomena across Scale

数据生成过程中层次化潜在结构在跨尺度的机理现象中统一

Jonas Rohweder, Subhabrata Dutta, Iryna Gurevych

机构 * Ubiquitous Knowledge Processing Lab (UKP Lab) Department of Computer Science, Technical University of Darmstadt and National Research Center for Applied Cybersecurity ATHENE, Germany(通用知识处理实验室(UKP Lab)计算机科学系,达姆施塔特技术大学和应用网络安全国家研究中心ATHENE,德国)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 本文通过生成合成语料库研究数据生成过程中层次结构对语言模型中归纳头、功能向量和海德拉效应等现象的统一解释。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08605 2026-07-10 cs.CV cs.AI cs.LG 新提交 62%

When Structured Sparse Autoencoders Learn Consistent Concepts Across Modalities

当结构化稀疏自编码器跨模态学习一致概念时

Weiduo Liao, Yunqiao Yang, Ying Wei

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究视觉语言模型中普通稀疏自编码器难以学习模态一致概念的问题,提出结构化稀疏自编码器$S^2AE$,通过图像块分组及结构化稀疏正则化强化概念一致性,经实验验证该方法在语义对齐等方面有提升,能促进跨模态表示更连贯解缠。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07724 2026-07-10 cs.LG cs.CL 新提交 62%

Uncertainty-gated selection for block-sparse attention

用于块稀疏注意力的不确定性门控选择

Thomas Rossi

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对块稀疏注意力截断短视问题,提出信息价值路由器,通过测量 top-k 截断决定性程度调整保留集。该方法与主干无关,可堆叠现有方法。实验表明其在多个模型上提升召回率,保留准确率,且减少运行时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.12629 2026-07-09 cs.LG cs.AI 新提交 62%

The Signs Were Always There: Training-Free Concept Detection and Steering in Raw Transformer Dimensions

Bag of Dims:通过维度级符号模式实现无需训练的机制可解释性

Varun Reddy Nalagatla

机构 * Amazon Web Services(亚马逊云服务)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Bag of Dims框架,证明Transformer隐藏状态的标准基即可作为无需训练的特征基,通过维度符号模式编码语义,并在三个模型上验证了其有效性。

Comments Preprint. 35 pages, 5 figures. Detection method reproducible from the paper; full steering code to follow

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11399 2026-07-09 cs.LG cs.AI cs.RO 版本更新 62%

Can We Really Learn One Representation to Optimize All Rewards?

我们真的能学习一种表示来优化所有奖励吗?

Chongyi Zheng, Royina Karegoudra Jayanth, Benjamin Eysenbach

机构 * Princeton University(普林斯顿大学)

专题命中 知识编辑与模型理解 :pretraining(abstract);分类 cs.AI、cs.LG

AI总结 研究无监督预训练中通过交互的无监督学习,聚焦前向 - 后向表示学习。通过理论分析阐明其表示存在条件及收敛情况,提出更易理解和优化的变体。实验表明该变体误差更小、零样本性能提升,还能为下游任务提供有效初始化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06402 2026-07-08 cs.CV cs.AI cs.LG 新提交 62%

What Images Cannot Say: Language-Guided Olfactory Representation Learning

图像无法表达的:语言引导的嗅觉表征学习

Eleftherios Tsonis, Xi Wang, Vicky Kalogeiton

机构 * LIX, École Polytechnique, IP Paris, CNRS(LIX,巴黎高等理工学院,IP巴黎,CNRS)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 研究图像与嗅觉对齐难题,提出SCENT多模态框架,利用视觉语言模型生成场景描述符,训练气味编码器,通过语言引导潜在分解分离特定对象气味与环境贡献,提升跨模态检索性能,产生可解释表征。

Comments ECCV 2026. Project page: https://www.lix.polytechnique.fr/vista/projects/2026_scent_tsonis/

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05861 2026-07-08 cs.CL cs.LG 新提交 62%

Mitigating Factual Hallucination in Large Reasoning Models via Mixed-Mode Advantage Regularization

通过混合模式优势正则化减轻大型推理模型中的事实幻觉

Kaishen Wang, Tong Zheng, Xuehao Cui, Ruibo Chen, Tianyi Xiong, Heng Huang

机构 * Department of Computer Science, University of Maryland, College Park(计算机科学系,马里兰大学,College Park)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 研究大型推理模型在面向事实问答中存在思维诱导幻觉的问题,提出MARGO框架,通过构建混合模式展开组评估思维价值,抑制幻觉思维,实验证明该方法在提升事实可靠性的同时保留了推理能力。

Comments 19 pages, 3 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05013 2026-07-07 cs.CL cs.LG 新提交 62%

Knowledge Knows, Verbalization Tells: Disentangling Latent Directions for Mathematical Solvability in LLMs

知识所知,语言所表:解开大语言模型中数学可解性的潜在方向

Nikolaos Xiros, Maria-Eleni Zoumpoulidi, Georgios Paraskevopoulos

机构 * Institute for Language and Speech Processing, Athena Research Center(语言与语音处理研究所,雅典娜研究中心)

专题命中 知识编辑与模型理解 :prompting(abstract);分类 cs.CL、cs.LG

AI总结 研究大语言模型数学推理中数学问题可解性判定难题,通过分别探究可解性知识与语言表达的表征,揭示二者在模型隐藏状态中可分离,还表明提示不可解线索等可减少编造,操纵表征能改善模型弃权。

Comments 14 pages, 9 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03574 2026-07-07 cs.LG cs.AI cs.PL 新提交 62%

Differentiate the Evaluator, Not the Program: An Efficient Runtime Representation for Neuro-Symbolic Learning

区分评估器,而非程序:神经符号学习的高效运行时表示

Lucas Sheneman

机构 * Institute for Interdisciplinary Data Sciences(交叉学科数据科学研究所) University of Idaho(爱达荷大学)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.AI、cs.LG

AI总结 研究神经符号学习中程序与参数协同搜索瓶颈,提出原生可微虚拟机(NDVM),将符号结构与可微数值状态分离,实现运行时差异化,提升搜索效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01336 2026-07-03 quant-ph cond-mat.dis-nn cond-mat.str-el cs.AI cs.LG 新提交 62%

Mechanistic Interpretability and Causal Feature Steering of Neural Quantum States via Sparse Autoencoders

神经量子态的机械可解释性与因果特征引导:基于稀疏自编码器

Zihao Qi, Christopher Earls

机构 * Department of Physics, Cornell University(康奈尔大学物理系) Center for Applied Mathematics, Cornell University(康奈尔大学应用数学中心)

专题命中 知识编辑与模型理解 :post-training(abstract);分类 cs.AI、cs.LG

AI总结 利用稀疏自编码器从神经量子态内部激活中无监督提取物理可观测量相关特征,并通过后训练干预单一特征因果地平滑引导对应可观测量,揭示其可解释内部表示。

Comments 15 pages, 7 figures. Comments welcome!

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01359 2026-07-02 cs.LG cs.AI 版本更新 62%

PaAno: Patch-Based Representation Learning for Time-Series Anomaly Detection

PaAno:基于片段的时序异常检测表示学习

Jinju Park, Seokho Kang

机构 * Department of Industrial Engineering, Sungkyunkwan University(成均馆大学工业工程系)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 PaAno提出一种轻量高效的时序异常检测方法,通过提取短时片段并使用1D卷积神经网络进行嵌入,结合三元组损失和预设任务损失提升表示学习效果,实验证明在多种评估指标上优于现有方法。

Comments Accepted by the 14th International Conference on Learning Representations (ICLR 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23220 2026-06-30 cs.CL cs.LG 62%

Model Directions, Not Words: Mechanistic Topic Models Using Sparse Autoencoders

模型方向,而非词语:使用稀疏自编码器的机制性主题模型

Carolina Zheng, Nicolas Beltran-Velez, Sweta Karlekar, Claudia Shi, Achille Nazaret, Asif Mallik, Amir Feder, David M. Blei

机构 * Columbia University(哥伦比亚大学) Google Research(谷歌研究院) Independent(独立研究者)

专题命中 知识编辑与模型理解 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出机制性主题模型(MTMs),利用稀疏自编码器学习可解释特征,以揭示深层概念主题,并通过topic judge评估框架验证其有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14814 2026-06-26 cs.LG cs.CL 版本更新 62%

Learning State-Tracking from Code Using Linear RNNs

利用线性RNN从代码中学习状态追踪

Julien Siems, Riccardo Grazzi, Korbinian Pöppel, Kirill Kalinin, Hitesh Ballani, Babak Rahmani

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.CL、cs.LG

AI总结 通过将置换组合任务转换为带状态揭示的代码,研究线性RNN在状态追踪中的表现,发现其优于Transformer,但在部分可观测状态下不如非线性RNN。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.20743 2026-06-23 cs.LG cs.AI 新提交 62%

Massive Activations Are Architecturally Robust: A Controlled Scratch/Commitment Residual Stream Test

大规模激活在架构上是鲁棒的:一种受控的暂存/提交残差流测试

Maruthi Vemula

机构 * University of North Carolina at Chapel Hill(北卡罗来纳大学教堂山分校)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 通过引入Ledger Residuals架构分离残差流的读写角色,发现大规模激活并非伪影,而是功能性的,在受保护通道中重新出现。

Comments 7 pages, 2 figures, 2 tables. Code at https://github.com/MaruthiV/ledger-residuals

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19821 2026-06-19 cs.AI cs.LG 新提交 62%

TelcoAgent: A Scalable 5G Multi-KPM Forecasting With 3GPP-Grounded Explainability

TelcoAgent: 一种可扩展的5G多KPM预测与3GPP基础可解释性

Geon Kim, Dara Ron, Sukhdeep Singh, Suyog Moogi, Pranshav Gajjar, V V N K Someswara Rao Koduri, Een Kee Hong, Vijay K. Shah

机构 * NextG Wireless Lab, North Carolina State University(北卡罗来纳州立大学下一代无线实验室) Kyung Hee University(庆熙大学)

专题命中 知识编辑与模型理解 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 提出TelcoAgent框架,利用基础模型实现多KPM的零样本预测,通过3GPP知识图谱和可解释性管道提供可操作诊断。

Comments 6 pages, 6 figures. Submitted to IEEE GLOBECOM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.19679 2026-06-19 cs.LG cs.AI 新提交 62%

LOKI: Memory-Free Null-Space Constrained Lifelong Knowledge Editing

LOKI: 无记忆零空间约束的终身知识编辑

Masih Eskandar, Miquel Sirera Perelló, Stratis Ioannidis, Jennifer Dy

机构 * Department of Electrical and Computer Engineering(电气与计算机工程系)

专题命中 知识编辑与模型理解 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LOKI方法,通过希尔伯特-施密特独立性准则动态选择层,并将梯度更新投影到模型权重的零空间,实现无需访问旧知识的终身知识编辑,平均准确率提升14%。

详情

展开后加载摘要…

URL PDF HTML 收藏