arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12403 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 12403 篇

2607.05552 2026-07-08 cs.CL cs.AI cs.CY 新提交 88%

The yes-no bias of large language models reflects answer order and wording, not shifts in moral judgment

大语言模型的是非偏差反映答案顺序和措辞,而非道德判断的转变

Haonan Huang

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 研究大语言模型在道德困境判断中的是非偏差,通过交叉对称化等心理测量方法区分逻辑判断、词汇等因素,发现前沿模型立场与形式无关,部分模型存在顺序和词汇偏差,最小模型可总结伪像,强调跨框架测量模型重视内容。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13873 2026-06-15 cs.LG cs.CL 新提交 88%

Natively Unlearnable Large Language Models

原生不可学习的大语言模型

Gaurav R. Ghosal, Pratyush Maini, Aditi Raghunathan

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 预训练与数据 :large language model(title);language model(title);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 提出NULLs模型,通过共享骨干和稀疏激活的sinks分离数据源贡献,实现无需梯度更新的高效遗忘,在维基百科上验证了单篇文章遗忘的有效性和鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.11081 2026-06-10 cs.LG cs.AI 新提交 88%

Unifying Local Communications and Local Updates for LLM Pretraining

统一大语言模型预训练中的本地通信与本地更新

Pietro Cagnasso, Eugene Belilovsky, Edouard Oyallon

机构 * Concordia University(康考迪亚大学) Mila CNRS, Sorbonne University(法国国家科学研究中心,索邦大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title);分类 cs.AI、cs.LG

AI总结 提出GASLoC算法,通过去中心化训练框架统一本地通信与更新,在异构带宽下优于DiLoCo,支持自适应优化器和多本地步骤。

Comments 38 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14147 2026-06-09 cs.AI cs.LG 版本更新 88%

An Alternative Trajectory for Generative AI

生成AI的另一种轨迹

Margarita Belova, Yuval Kansal, Yihao Liang, Jiaxin Xiao, Niraj K. Jha

机构 * Princeton University(普林斯顿大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 本文提出通过构建领域特定超智能(DSS)来改进生成AI,利用符号抽象提升领域推理能力,避免LLM合成数据的模型崩溃问题,实现可持续发展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04928 2026-06-04 cs.LG cs.CL 88%

Data Attribution in Large Language Models via Bidirectional Gradient Optimization

通过双向梯度优化实现大型语言模型中的数据归因

Frédéric Berdoz, Luca A. Lanzendörfer, Kaan Bayraktar, Roger Wattenhofer

机构 * EPFL, Switzerland(瑞士联邦理工学院) ETH Zurich, Switzerland(瑞士苏黎世联邦理工学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于双向梯度优化的训练数据归因方法,用于自动回归大型语言模型,以识别影响模型输出的关键训练数据,提升模型可解释性。

Comments Presented at the AI Governance (AIGOV) Workshop at AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11331 2026-05-29 cs.LG cs.AI 88%

Jailbreak Scaling Laws for Large Language Models: Polynomial-Exponential Crossover

大型语言模型的越狱缩放定律:多项式-指数交叉

Indranil Halder, Annesya Banerjee, Cengiz Pehlevan

机构 * John A. Paulson School of Engineering And Applied Sciences, Harvard University(哈佛大学约翰·A·保罗森工程与应用科学学院) Department of Brain and Cognitive Sciences, Massachusetts Institute of Technology(麻省理工学院脑科学与认知科学系) Speech and Hearing Bioscience and Technology, Harvard Medical School(哈佛医学院语音与听力生物科学与技术系) Kempner Institute for the Study of Natural and Artificial Intelligence, Harvard University(哈佛大学自然与人工智能研究学院) Center for Brain Science, Harvard University(哈佛大学脑科学中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 研究发现对抗性提示注入攻击可使攻击成功率从无注入时的缓慢多项式增长变为随推理样本数指数增长,并通过自旋玻璃模型从理论上解释了这一现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21465 2026-05-28 cs.CL cs.LG 88%

DRTriton: Large-Scale Synthetic Data Driven Reinforcement Learning for Triton Kernel Generation

DRTriton:大规模合成数据驱动的强化学习用于Triton内核生成

Siqi Guo, Ming Lin, Tianbao Yang

机构 * Texas A&M University(德克萨斯大学)

专题命中 预训练与数据 :LLM(summary_cn,abstract_cn);SFT(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 提出DRTriton框架,通过合成数据生成、课程强化学习和测试时搜索,训练LLM将PyTorch程序转换为优化的Triton内核,在KernelBench Level 2任务中超越GPT-5.2和Claude-Sonnet-4.5。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.01793 2026-05-21 cs.LG cs.AI 88%

Creating Artificial Students that Never Existed: Leveraging Large Language Models and CTGANs for Synthetic Data Generation

创建从未存在过的虚拟学生:利用大型语言模型和CTGANs进行合成数据生成

Mohammad Khalil, Sam Urmian, Ronas Shakya, Qinyi Liu

机构 * Centre for the Science of Learning & Technology (SLATE)(学习科学与技术中心(SLATE)) University of Bergen(卑尔根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

AI总结 本文研究了利用生成对抗网络(GANs)和大型语言模型(LLMs)生成合成表格数据的潜力,探讨了通过合成数据创建虚拟学生以服务于学习分析模型的可能性,并评估了不同生成模型的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16823 2026-05-20 cs.CL cs.AI 88%

Disentangling generalization and memorization in large language models using chess

通过国际象棋解构大型语言模型中的泛化与记忆

Leonard S. Pleiss, Maximilian Schiffer, Robert K. von Weizsaecker

机构 * Technical University of Munich(慕尼黑技术大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过国际象棋测试环境,研究大型语言模型中泛化与记忆能力的区别,发现模型在相关先验知识稀疏时性能显著下降,表明系统泛化能力有限,需超越规模的机制来实现鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.14466 2026-05-19 cs.CL cs.AI 88%

Toward Robust Multilingual Adaptation of LLMs for Low-Resource Languages

迈向低资源语言LLM鲁棒多语言适应

Haolin Li, Haipeng Zhang, Mang Li, Yaohua Wang, Lijie Wen, Yu Zhang, Biqing Huang

机构 * Department of Automation, Tsinghua University, Beijing, China(清华大学自动化系) Alibaba International Digital Commerce Group, Beijing, China(阿里巴巴国际数字 commerce 集团) School of Software, Tsinghua University, Beijing, China(清华大学软件学院)

专题命中 预训练与数据 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LiRA框架,通过轻量级微调实现低资源语言LLM的鲁棒多语言适应,结合Arca和LaSR组件提升跨语言语义一致性与表示稳定性。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17656 2026-05-11 q-bio.QM cs.AI cs.LG 88%

Pretraining a Foundation Model for Small-Molecule Natural Products

为小分子天然产物预训练一个基础模型

Yuheng Ding, Bo Qiang, Shaoning Li, Yiran Zhou, Jie Yu, Qi Li, Cheng Shi, Liangren Zhang, Yusong Wang, Nanning Zheng, Zhenming Liu

机构 * State Key Laboratory of Natural and Biomimetic Drugs(天然与仿生药物国家重点实验室) School of Pharmaceutical Sciences, Peking University(北京大学药学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于天然产物独特性质的预训练基础模型,通过对比学习和掩码图学习目标,提升分子骨架和侧链信息的表征能力,在天然产物挖掘和药物发现任务中取得SOTA成果。

Comments Accepted by Nature Machine Intelligence(2026)

Journal ref Nature Machine Intelligence(2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18381 2026-04-21 cs.AI cs.LG 88%

Learning from Less: Measuring the Effectiveness of RLVR in Low Data and Compute Regimes

在数据较少的情况下:评估RLVR在低数据和计算环境下的有效性

Justin Bauer, Thomas Walshe, Derek Pham, Harit Vishwakarma, Armin Parchami, Frederic Sala, Paroma Varma

机构 * Anonymous Institution, Anonymous City, Anonymous Region, Anonymous Country(匿名机构,匿名城市,匿名地区,匿名国家)

专题命中 预训练与数据 :LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究了在低数据和计算资源下,RLVR对小型语言模型性能的影响,发现混合复杂度数据集能显著提升样本效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.04799 2026-04-17 cs.CL cs.AI 88%

DA-Cramming: Enhancing Cost-Effective Language Model Pretraining with Dependency Agreement Integration

DA-Cramming:通过依赖协议整合提升高效语言模型预训练

Martin Kuo, Jianyi Zhang, Dongting Li, Yiran Chen

机构 * Center for Computational Evolutionary Intelligence, Duke University(计算进化智能中心,杜克大学)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出DA-Cramming框架,通过整合依赖协议信息提升语言模型预训练效果,采用双阶段流程和四个专用子模型捕捉依赖协议并生成嵌入,实验证明其在多种任务上表现优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16370 2026-03-26 cs.CL cs.AI 88%

Can structural correspondences ground real world representational content in Large Language Models?

结构对应能否在大语言模型中 grounding 现实世界表征内容?

Iwan Williams

机构 * Centre for Philosophy of AI, University of Copenhagen(人工智能哲学中心,哥本哈根大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文探讨大语言模型是否能表征现实世界,提出结构对应理论,并指出需克服文本局限性以实现真实世界内容的 grounding。

Journal ref Mind & Language (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.05598 2026-03-13 cs.LG astro-ph.IM cs.AI physics.comp-ph 88%

On the Value of Tokeniser Pretraining in Physics Foundation Models

在物理基础模型中tokenizer预训练的价值

Hadi Sotoudeh, Payel Mukhopadhyay, Ruben Ohana, Michael McCabe, Neil D. Lawrence, Shirley Ho, Miles Cranmer

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文探讨了在物理基础模型中预训练tokenizer对准确性和效率的影响,发现领域内预训练可显著提升模拟性能,并引入灵活的时空压缩操作以适应多样化的下游任务。

Comments 16 pages, 4 figures. Workshop paper at ICLR 2026 AI & PDE

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09437 2026-03-10 cs.LG cs.AI 88%

Diffusion-Guided Pretraining for Brain Graph Foundation Models

基于扩散的脑图基础模型预训练

Xinxu Wei, Rong Zhou, Lifang He, Yu Zhang

机构 * Department of Electrical and Computer Engineering, Lehigh University, Bethlehem, PA, USA(电气与计算机工程系,莱维大学) Department of Computer Science and Engineering, Lehigh University, Bethlehem, PA, USA(计算机科学与工程系,莱维大学) Department of Psychiatry and Behavioral Sciences, Stanford University School of Medicine, Stanford, CA, USA(精神病学与行为科学系,斯坦福大学医学院)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 本文提出基于扩散的预训练框架,通过结构感知的掩码策略和拓扑感知的图级读出,提升脑图表示的鲁棒性和有效性。

Comments Paper has some mistakes

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01348 2026-03-03 cs.LG cs.AI 88%

UTICA: Multi-Objective Self-Distllation Foundation Model Pretraining for Time Series Classification

UTICA:面向时间序列分类的多目标自蒸馏基础模型预训练

Yessin Moakher, Youssef Attia El Hili, Vasilii Feofanov

机构 * Ecole Polytechnique(巴黎高等师范学院) Huawei Noah’s Ark Lab(华为诺亚实验室) com(42.com)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 UTICA通过自蒸馏方法在时间序列分类中实现最先进的性能,结合增强裁剪和块掩码技术,提升模型对时间和局部结构的表征能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.19548 2026-02-24 cs.CL cs.LG 88%

Beyond a Single Extractor: Re-thinking HTML-to-Text Extraction for LLM Pretraining

超越单一提取器:重新思考用于LLM预训练的HTML到文本提取

Jeffrey Li, Josh Gardner, Doug Kang, Fangping Shi, Karanjeet Singh, Chun-Liang Li, Herumb Shandilya, David Hall, Oncel Tuzel, Percy Liang, Ludwig Schmidt, Hadi Pour Ansari, Fartash Faghri

机构 * Apple(苹果公司) Stanford(斯坦福大学) University of Washington(华盛顿大学)

专题命中 预训练与数据 :LLM(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过结合多种提取器提升HTML到文本提取的效率与效果,显著提高LLM预训练数据的token产出并改善下游任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05495 2026-02-24 cs.CL cs.AI 88%

Transport and Merge: Cross-Architecture Merging for Large Language Models

传输与合并:面向大语言模型的跨架构合并

Chenhang Cui, Binyun Yang, Fei Shen, Yuxin Chen, Jingnan Zheng, Xiang Wang, An Zhang, Tat-Seng Chua

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出基于最优传输的跨架构合并框架,实现从高资源模型到低资源模型的有效知识转移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18200 2026-01-27 cs.LG cs.AI 88%

HeterCSI: Channel-Adaptive Heterogeneous CSI Pretraining Framework for Generalized Wireless Foundation Models

HeterCSI:面向通用无线基础模型的通道自适应异构CSI预训练框架

Chenyu Zhang, Xinchen Lyu, Chenshan Ren, Shuhan Liu, Qimei Cui, Xiaofeng Tao

机构 * National Engineering Research Center for Mobile Network Technologies, Beijing University of Posts and Telecommunications(中国移动网络技术国家工程研究中心,北京邮电大学) Department of Broadband Communication, Pengcheng Laboratory(宽带通信系,鹏城实验室) Key Laboratory of Ethnic Language Intelligent Analysis and Security Governance of MOE, Minzu University of China(民族语言智能分析与安全治理重点实验室,中央民族大学) China Telecom Corporation Limited Gansu Branch(中国电信集团甘肃分公司)

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(title,abstract);分类 cs.AI、cs.LG

AI总结 HeterCSI通过解决CSI尺度异质性和场景多样性问题,提出一种通道自适应的异构CSI预训练框架,提升无线基础模型的泛化能力和效率。

Comments 13 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.14160 2026-01-21 cs.CL cs.AI 88%

Domain-Adaptation through Synthetic Data: Fine-Tuning Large Language Models for German Law

通过合成数据实现领域适应:通过合成数据微调大型语言模型进行德国法律问答

Ali Hamza Bashir, Muhammad Rehan Khalid, Kostadin Cvejoski, Jana Birr, Jule Berghaus, Armin Berger, Sandra Halscheidt, Christian Temath, Rafet Sifa, David Berghaus

机构 * Fraunhofer IAIS(弗劳恩霍夫人工智能研究所) Georg-August-University Göttingen(哥廷根乔治-亚历山大大学) Lamarr Institute(拉马尔研究所) University of Bonn(波恩大学) JetBrains Research(JetBrains研究)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文通过合成数据生成方法微调大型语言模型,提升其在德国法律问答任务中的性能,展示合成数据在替代人工标注方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05184 2026-01-09 cs.AI cs.CL 88%

Observations and Remedies for Large Language Model Bias in Self-Consuming Performative Loop

大语言模型自我消耗表现性循环中的观测与对策

Yaxuan Wang, Zhongteng Cai, Yujia Bao, Xueru Zhang, Yang Liu

机构 * University of California, Santa Cruz(加州大学圣克ruz分校) The Ohio State University(俄亥俄州立大学) Center for Advanced AI, Accenture(Accenture高级人工智能中心)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本研究提出自我消耗表现性循环(SCPL)概念,通过实验发现表现性循环会增加偏好偏见并降低差异偏见,设计奖励拒绝采样策略以缓解偏见。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12608 2025-12-23 cs.CL cs.AI 88%

Human-Inspired Learning for Large Language Models via Obvious Record and Maximum-Entropy Method Discovery

通过明显记录和最大熵方法发现实现大语言模型的人类启发式学习

Hong Su

机构 * School of Computer Science, Chengdu University of Information Technology(计算机科学学院,成都信息科技学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出了一种人类启发式学习框架,通过明显记录和最大熵方法发现,提升大语言模型在罕见场景下的学习能力和方法多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14887 2025-12-18 cs.CL cs.AI cs.IR 88%

Integrating Large Language Models and Knowledge Graphs to Capture Political Viewpoints in News Media

将大型语言模型与知识图谱结合以捕捉新闻媒体中的政治观点

Massimiliano Fadda, Enrico Motta, Francesco Osborne, Diego Reforgiato Recupero, Angelo Salatino

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出利用大型语言模型和知识图谱结合的方法,提升新闻媒体中政治观点的识别与分类性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21265 2025-12-03 cs.CL cs.AI 88%

Multilingual Pretraining for Pixel Language Models

多语言预训练用于像素语言模型

Ilker Kesen, Jonas F. Lotz, Ingo Ziegler, Phillip Rust, Desmond Elliott

机构 * Department of Computer Science, University of Copenhagen(计算机科学系,哥本哈根大学) ROCKWOOL Foundation Research Unit(ROCKWOOL基金会研究单位)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.AI

AI总结 PIXEL-M4通过多语言预训练提升了像素语言模型对多种语言的支持能力,尤其在非拉丁字母语言中表现更优。

Comments EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2306.06031 2025-11-18 q-fin.ST cs.CL cs.LG q-fin.TR 88%

FinGPT: Open-Source Financial Large Language Models

Hongyang Yang, Xiao-Yang Liu, Christina Dan Wang

机构 * AI4Finance Foundation(AI4Finance基金会) Columbia University(哥伦比亚大学) New York University Shanghai(纽约大学上海)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted by the FinLLM Symposium at IJCAI 2023. Recipient of the Best Presentation Award (Hongyang Yang). Workshop link: https://finllm.github.io/workshop. This is the first official FinGPT paper; please cite this work when referencing FinGPT

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02494 2025-10-22 cs.LG cs.CL 88%

Analyzing Similarity Metrics for Data Selection for Language Model Pretraining

Dylan Sam, Ayan Chakrabarti, Afshin Rostamizadeh, Srikumar Ramalingam, Gui Citovsky, Sanjiv Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google Research(谷歌研究)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10085 2025-10-14 cs.CR cs.AI cs.LG 88%

Pharmacist: Safety Alignment Data Curation for Large Language Models against Harmful Fine-tuning

Guozhi Liu, Qi Mu, Tiansheng Huang, Xinhua Wang, Li Shen, Weiwei Lin, Zhang Li

机构 * School of Computer Science and Engineering, South China University of Technology(华南理工大学计算机科学与工程学院) School of Computer Science at Georgia Institute of Technology(佐治亚理工学院计算机科学系) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区网络科学与技术学院) Second Affiliated Hospital of Guangzhou University of Chinese Medicine(广州中医药大学第二附属医院) China and Pengcheng Laboratory(中 Pengcheng 实验室)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.03781 2025-10-07 cs.CL cs.AI 88%

Rezwan: Leveraging Large Language Models for Comprehensive Hadith Text Processing: A 1.2M Corpus Development

Majid Asgari-Bidhendi, Muhammad Amin Ghaseminia, Alireza Shahbazi, Sayyed Ali Hossayni, Najmeh Torabian, Behrouz Minaei-Bidgoli

机构 * Noor Avaran Jelvehaye Maanaei Najm Co.(诺尔·阿瓦兰·贾尔韦哈耶·马纳埃尼纳姆公司) Iran University of Science and Technology(伊朗科学技术大学) Islamic Azad University(伊斯兰 Azad 大学)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

Comments 9 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00125 2025-10-02 cs.CL cs.AI cs.CR 88%

Direct Token Optimization: A Self-contained Approach to Large Language Model Unlearning

Hong kyu Lee, Ruixuan Liu, Li Xiong

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏