arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-23 至 2026-02-23 共收录 131 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 15 篇

2602.18010 2026-02-23 cs.SD 89%

Scaling Audio-Text Retrieval with Multimodal Large Language Models

通过多模态大语言模型扩展音频-文本检索

Jilan Xu, Carl Thomé, Danijela Horak, Weidi Xie, Andrew Zisserman

机构 * Visual Geometry Group, University of Oxford(牛津大学视觉几何组) Epidemic Sound School of Artificial Intelligence, Shanghai Jiao Tong University(上海交通大学人工智能学院)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 AuroLA通过多模态大语言模型实现音频-文本检索的扩展,利用可扩展的数据管道和混合NCE损失提升检索性能。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20674 2026-02-23 cs.CL cs.AI 87%

PonderLM: Pretraining Language Models to Ponder in Continuous Space

PonderLM:在连续空间中预训练语言模型以进行思考

Boyi Zeng, Shixiang Song, Siyuan Huang, Yixuan Wang, He Li, Ziwei He, Xinbing Wang, Zhiyu Li, Zhouhan Lin

机构 * LUMIA Lab(LUMIA实验室) Shanghai Jiao Tong University(上海交通大学) Institute for Advanced Algorithms Research Shanghai(上海高级算法研究所) Shanghai Innovation Institute(上海创新研究院)

专题命中 预训练与数据 :language model(title,abstract);pretraining(title);分类 cs.CL、cs.AI

AI总结 PonderLM通过在连续空间中引入思考过程,提升语言模型的认知处理能力,实验表明其在多个基准测试中优于现有模型。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17871 2026-02-23 cs.CV cs.AI cs.LG cs.MM 86%

Understanding the Fine-Grained Knowledge Capabilities of Vision-Language Models

理解视觉语言模型的细粒度知识能力

Dhruba Ghosh, Yuhui Zhang, Ludwig Schmidt

机构 * Stanford University(斯坦福大学)

专题命中 预训练与数据 :language model(title,abstract);LLM(abstract);pretraining(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了视觉语言模型在细粒度知识任务中的表现,发现更好的语言模型和视觉编码器对细粒度分类性能有显著影响,预训练阶段也至关重要。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10160 2026-02-23 cs.CL cs.AI cs.LG 85%

Alignment Pretraining: AI Discourse Causes Self-Fulfilling (Mis)alignment

对齐预训练:人工智能 discourse 导致自我实现的(不)对齐

Cameron Tice, Puria Radmard, Samuel Ratnam, Andy Kim, David Africa, Kyle O'Brien

机构 * Geodesic Research(Geodesic研究机构) UK AI Security Institute(英国人工智能安全研究所) University of Cambridge(剑桥大学) University of Oxford(牛津大学)

专题命中 预训练与数据 :pretraining(title,abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过预训练不同量级的AI discourse,发现其对下游对齐有显著影响,表明预训练数据塑造对齐先验的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17881 2026-02-23 cs.CL cs.AI cs.LG 83%

Understanding Unreliability of Steering Vectors in Language Models: Geometric Predictors and the Limits of Linear Approximations

理解语言模型中转向向量的不可靠性:几何预测器与线性近似的局限性

Joschka Braun

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG;foundation model(comments)

AI总结 该研究探讨了语言模型中转向向量的可靠性问题,发现训练数据和行为表示对转向效果有显著影响,提出几何预测器和非线性近似方法以提升稳定性。

Comments Master's Thesis, University of Tübingen. 89 pages, 34 figures. Portions of this work were published at the ICLR 2025 Workshop on Foundation Models in the Wild (see arXiv:2505.22637)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18137 2026-02-23 cs.CL cs.AI cs.LG 80%

Agentic Adversarial QA for Improving Domain-Specific LLMs

代理对抗问答:提升领域特定大语言模型

Vincent Grari, Ciprian Tomoiaga, Sylvain Lamprier, Tatsunori Hashimoto, Marcin Detyniecki

机构 * Stanford University(斯坦福大学) Polish Academy of Science, IBS PAN, Warsaw, Poland(波兰科学院、IBS PAN、华沙、波兰)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出了一种对抗性问题生成框架,通过生成语义具有挑战性的问题来提升领域特定大语言模型的适应能力。

Comments 9 pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16552 2026-02-23 cs.IR cs.CL 79%

Revela: Dense Retriever Learning via Language Modeling

Revela:通过语言建模进行密集检索器学习

Fengyu Cai, Tong Chen, Xinran Zhao, Sihao Chen, Hongming Zhang, Sherry Tongshuang Wu, Iryna Gurevych, Heinz Koeppl

机构 * Technical University of Darmstadt(达姆施塔特技术大学) University of Washington(华盛顿大学) Carnegie Mellon University(卡内基梅隆大学) Microsoft(微软) Tencent AI Lab(腾讯人工智能实验室)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL

AI总结 Revela通过语言建模方法实现自监督检索器学习,无需标注数据即可在多个基准上超越监督模型。

Comments Accepted to ICLR 2026 (Oral). Camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18066 2026-02-23 cs.CV 78%

Faster Training, Fewer Labels: Self-Supervised Pretraining for Fine-Grained BEV Segmentation

更快的训练,更少的标签:用于细粒度BEV分割的自监督预训练

Daniel Busch, Christian Bohn, Thomas Kurbiel, Klaus Friedrichs, Richard Meyes, Tobias Meisen

机构 * University of Wuppertal(乌珀塔尔大学) APTIV(APTIV公司)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 本文提出一种自监督预训练方法,通过减少标注数据和训练时间,提升细粒度BEV分割性能。

Comments This Paper has been accepted to the 2026 IEEE Intelligent Vehicles Symposium (IV)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02228 2026-02-23 cs.LG 77%

xLSTM Scaling Laws: Competitive Performance with Linear Time-Complexity

xLSTM缩放定律:具有线性时间复杂度的竞争力表现

Maximilian Beck, Kajetan Schweighofer, Sebastian Böck, Sebastian Lehner, Sepp Hochreiter

机构 * ELLIS Unit Linz, Institute for Machine Learning, JKU Linz, Austria(林茨ELLIS单位、机器学习研究所、JKU林茨,奥地利) NXAI GmbH, Linz, Austria(林茨NXAI公司,奥地利)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 xLSTM在保持竞争力的同时,展现出线性时间复杂度和更优的缩放性能,优于Transformer架构。

Comments Accepted at ICLR 2026. Code and data available at https://github.com/NX-AI/xlstm_scaling_laws

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17080 2026-02-23 cs.LG math.OC 77%

Adam Improves Muon: Adaptive Moment Estimation with Orthogonalized Momentum

Adam改进Muon:基于正交动量的自适应矩估计

Minxin Zhang, Yuxuan Liu, Hayden Schaeffer

专题命中 预训练与数据 :large language model(abstract);language model(abstract);pretraining(abstract);分类 cs.LG

AI总结 本文提出NAMO和NAMO-D优化器,通过正交化动量与基于范数的Adam型噪声适应相结合,提升大语言模型训练性能。

Comments 39 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16986 2026-02-23 cs.IR cs.SI 67%

Bending the Scaling Law Curve in Large-Scale Recommendation Systems

在大规模推荐系统中弯曲缩放定律曲线

Qin Ding, Kevin Course, Linjian Ma, Jianhui Sun, Ruochen Liu, Zhao Zhu, Chunxing Yin, Wei Li, Dai Li, Yu Shi, Xuan Cao, Ze Yang, Han Li, Xing Liu, Bi Xue, Hongwei Li, Rui Jian, Daisy Shi He, Jing Qian, Matt Ma, Qunshu Zhang, Rui Li

专题命中 预训练与数据 :large language model(abstract);language model(abstract)

AI总结 ULTRA-HSTU通过创新的序列设计和稀疏注意机制,在大规模推荐系统中实现了显著的训练和推理效率提升,同时保持高质量的推荐性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17868 2026-02-23 cs.LG cs.AI 62%

MantisV2: Closing the Zero-Shot Gap in Time Series Classification with Synthetic Data and Test-Time Strategies

MantisV2: 通过合成数据和测试时策略缩小零样本时间序列分类的差距

Vasilii Feofanov, Songkang Wen, Jianfeng Zhang, Lujia Pan, Ievgen Redko

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 MantisV2通过合成数据和测试时策略提升时间序列分类的零样本性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18252 2026-02-23 cs.CV cs.AI 57%

On the Adversarial Robustness of Discrete Image Tokenizers

对离散图像标记器的对抗鲁棒性的研究

Rishika Bhagwatkar, Irina Rish, Nicolas Flammarion, Francesco Croce

机构 * Mila - Quebec AI Institute(魁北克AI研究所) EPFL(苏黎世联邦理工学院) ELLIS Institute Finland - Aalto University(芬兰ELLIS研究所-阿莱大学)

专题命中 预训练与数据 :foundation model(abstract);分类 cs.AI

AI总结 本文研究了离散图像标记器的对抗鲁棒性,提出了一种无监督对抗训练方法以提升其鲁棒性,适用于多种多模态任务。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18224 2026-02-23 cs.RO cs.LG 57%

SimVLA: A Simple VLA Baseline for Robotic Manipulation

SimVLA:一种简单的VLA基线用于机器人操作

Yuankai Luo, Woping Chen, Tong Liang, Baiqiao Wang, Zhenguo Li

专题命中 预训练与数据 :pretraining(abstract);分类 cs.LG

AI总结 SimVLA通过简化设计实现了最先进的机器人操作性能,展示了最小参数模型在模拟和真实环境中的优越表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05647 2026-02-23 cs.LG cs.CV 57%

Learning to Weight Parameters for Training Data Attribution

学习权重参数以训练数据归因

Shuangqi Li, Hieu Le, Jingyi Xu, Mathieu Salzmann

机构 * EPFL(苏黎世联邦理工学院) Stony Brook University(史蒂文斯理工学院) UNC Charlotte(北卡罗来纳大学夏洛特分校)

专题命中 预训练与数据 :language model(abstract);分类 cs.LG

AI总结 本文提出一种无需标注标签即可直接从数据学习参数重要性权重的方法,提升训练数据归因的准确性与细粒度分析能力。

Comments 31 pages

Journal ref ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 12 篇

2602.17835 2026-02-23 cs.LG 87%

Influence-Preserving Proxies for Gradient-Based Data Selection in LLM Fine-tuning

保留影响的梯度基数据选择代理

Sirui Chen, Yunzhe Qi, Mengting Ai, Yifan Sun, Ruizhong Qiu, Jiaru Zou, Jingrui He

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 Iprox通过两阶段框架直接从目标模型生成保留影响的代理,有效提升LLM微调中基于梯度的数据选择效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.15050 2026-02-23 cs.CL 83%

Entailed Opinion Matters: Improving the Fact-Checking Performance of Language Models by Relying on their Entailment Ability

蕴含观点重要性:通过依赖生成语言模型的蕴含能力提升事实核查性能

Gaurav Kumar, Ayush Garg, Debajyoti Mazumder, Aditya Kishore, Babu kumar, Jasabanta Patro

机构 * Department of Data Science and Engineering(数据科学与工程系) Indian Institute of Science Education and Research(印度科学教育与研究学院)

专题命中 指令微调 :language model(title,abstract);prompting(abstract);分类 cs.CL

AI总结 本文提出通过生成语言模型的蕴含能力提升事实核查性能,通过证据分类和蕴含论证训练仅编码器的语言模型,以提高事实核查的准确性。

Comments 22 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.03099 2026-02-23 cs.CL cs.LG 79%

Topic Modeling with Fine-tuning LLMs and Bag of Sentences

基于微调大语言模型和句子袋的主题建模

Johannes Schneider

机构 * University of Liechtenstein(列支敦士登大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出FT-Topic方法,通过自动构建训练数据集并结合SenClu方法实现高效主题建模。

Comments This is the submitted journal version of enhanced with the novel fine-tuning part of "Efficient and Flexible Topic Modeling using Pretrained Embeddings and Bag of Sentences'' which appeared at the International Conference on Agents and Artificial Intelligence(ICAART) in 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14201 2026-02-23 cs.CV cs.AI 77%

GeoEyes: On-Demand Visual Focusing for Evidence-Grounded Understanding of Ultra-High-Resolution Remote Sensing Imagery

GeoEyes: 面向超高清遥感影像证据驱动理解的按需视觉聚焦

Fengxiang Wang, Mingshuo Chen, Yueying Li, Yajie Yang, Yifan Zhang, Long Lan, Xue Yang, Hongda Sun, Yulin Wang, Di Wang, Jun Song, Jing Zhang, Bo Du

机构 * National University of Defense Technology, China(国防科技大学) Beijing University of Posts and Telecommunications, China(北京邮电大学) University of the Chinese Academy of Sciences, China(中国科学院大学) Shanghai Jiao Tong University, China(上海交通大学) Wuhan University, China(武汉大学) Chinese Academy of Science, China(中国科学院) Tsinghua University, China(清华大学) Renmin University of China, China(中国人民大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.AI

AI总结 GeoEyes通过分阶段训练框架,结合冷启动数据集和代理强化学习方法,解决超高清遥感影像中证据获取不足的问题,提升视觉问答任务的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18055 2026-02-23 cs.LG 70%

Continual-NExT: A Unified Comprehension And Generation Continual Learning Framework

Continual-NExT: 一种统一的理解和生成持续学习框架

Jingyang Qiao, Zhizhong Zhang, Xin Tan, Jingyu Gong, Yanyun Qu, Yuan Xie

机构 * East China Normal University(华东师范大学) Shanghai Innovation Institute(上海创新研究院) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Xiamen University(厦门大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出Continual-NExT框架,通过MAGE方法提升双到双多模态大语言模型的持续学习能力,实现跨模态知识转移和减少遗忘。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17809 2026-02-23 cs.LG 70%

Calibrated Adaptation: Bayesian Stiefel Manifold Priors for Reliable Parameter-Efficient Fine-Tuning

校准适应:基于贝叶斯斯蒂夫尔流形先验的可靠参数高效微调

Ibne Farabi Shihab, Sanjeda Akter, Anuj Sharma

机构 * Department of Computer Science, Iowa State University(计算机科学系,爱荷华州立大学) Department of Civil, Construction and Environmental Engineering, Iowa State University(土木、建设与环境工程系,爱荷华州立大学)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 SBA通过在斯蒂夫尔流形上使用贝叶斯先验,提高参数高效微调的可靠性,减少校准误差并提升领域转移性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17799 2026-02-23 cs.CV 67%

Enabling Training-Free Text-Based Remote Sensing Segmentation

无需训练的基于文本的遥感分割

Jose Sosa, Danila Rukhovich, Anis Kacem, Djamila Aouada

机构 * SnT, University of Luxembourg(SnT,卢森堡大学)

专题命中 指令微调 :language model(abstract);foundation model(abstract)

AI总结 本研究提出无需额外训练的遥感分割方法,结合对比和生成型VLMs与SAM,实现零样本开放词汇语义分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.09658 2026-02-23 cs.LG cs.AI cs.CV 62%

Gradient-Sign Masking for Task Vector Transport Across Pre-Trained Models

任务向量跨预训练模型传输的梯度符号遮蔽

Filippo Rinaldi, Aniello Panariello, Giacomo Salici, Fengyuan Liu, Marco Ciccone, Angelo Porrello, Simone Calderara

机构 * University of Modena and Reggio Emilia(摩德纳和雷吉奥艾米利亚大学) Vector Institute(向量研究所) University of Toronto(多伦多大学)

专题命中 指令微调 :foundation model(abstract);分类 cs.AI、cs.LG

AI总结 GradFix通过近似梯度符号结构,利用少量标记样本实现任务向量跨预训练模型的高效转移,提升多任务和多源模型性能。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.18181 2026-02-23 cs.LG 57%

SeedFlood: A Step Toward Scalable Decentralized Training of LLMs

SeedFlood:迈向大规模大语言模型去中心化训练的一小步

Jihun Kim, Namhoon Lee

专题命中 指令微调 :LLM(abstract);分类 cs.LG

AI总结 SeedFlood 通过利用零阶更新的种子可重构结构,实现去中心化训练的高效通信和大规模扩展。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.08059 2026-02-23 cs.LG 57%

Mitigating Subject Dependency in EEG Decoding with Subject-Specific Low-Rank Adapters

通过主体特定低秩适配器缓解EEG解码中的主体依赖性

Timon Klein, Piotr Minakowski, Sebastian Sager, Steffen Schotthöfer

机构 * Department of Mathematics(数学系) Otto von Guericke University Magdeburg(奥托·冯·格里克大学马格德堡分校) Max Planck Institute for Dynamics of Complex Technical Systems(复杂技术系统动力学马克斯·普朗克研究所) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 指令微调 :foundation model(abstract);分类 cs.LG

AI总结 SuLoRA通过分解权重为共享和主体特定部分,提升EEG解码中跨主体鲁棒性,实现参数更少但性能更优的解码模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.13671 2026-02-23 cs.HC cs.CY 50%

I, Robot? Exploring Ultra-Personalized AI-Powered AAC; an Autoethnographic Account

我,机器人?探索超个性化AI驱动的AAC;一项自传式研究

Tobias M. Weinberg, Ricardo E. Gonzalez Penuela, Stephanie Valencia, Thijs Roumen

专题命中 指令微调 :language model(abstract)

AI总结 本文探讨超个性化AI驱动的AAC系统对用户自主权、身份和隐私的影响,通过自传式研究发现个性化建议重塑了交流方式,强调了设计支持真实表达的AAC技术的重要性。

Comments 16 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18612 2026-02-23 cs.CV 50%

Mod-Adapter: Tuning-Free and Versatile Multi-concept Personalization via Modulation Adapter

Mod-Adapter:通过调制适配器实现无需微调的多概念个性化

Weizhi Zhong, Huan Yang, Zheng Liu, Huiguo He, Zijian He, Xuesong Niu, Di Zhang, Guanbin Li

机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队) Shenzhen Loop Area Institute, Shenzhen, China(深圳循环区研究所) Guangdong Key Laboratory of Big Data Analysis and Processing, Guangzhou, China(广东大数据分析与处理重点实验室) South China University of Technology, Guangzhou, China(华南理工大学)

专题命中 指令微调 :language model(abstract)

AI总结 本文提出Mod-Adapter方法,通过调制适配器实现无需微调的多概念个性化,有效定制物体和抽象概念,提升生成质量。

Comments Accepted by ICLR 2026, project page: https://weizhi-zhong.github.io/Mod-Adapter

详情

展开后加载摘要…

URL PDF HTML 收藏

3. 后训练与偏好优化 1 篇

2602.15854 2026-02-23 cs.CL cs.AI 86%

Decoupling Strategy and Execution in Task-Focused Dialogue via Goal-Oriented Preference Optimization

通过目标导向的偏好优化实现任务导向对话中的解耦策略与执行

Jingyi Xu, Xingyu Ren, Zhoupeng Shou, Yumeng Zhang, Zhiqiang You

机构 * School of Information Engineering, China Jiliang University, Hangzhou, China(信息工程学院,中国浙江大学,杭州,中国) College of Chemical and Biological Engineering, Zhejiang University, Hangzhou, China(化学与生物工程学院,浙江大学,杭州,中国)

专题命中 后训练与偏好优化 :preference optimization(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出GOPO框架,通过解耦策略规划与响应生成,提升任务导向对话系统的长周期任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 长上下文与记忆 6 篇

2602.17837 2026-02-23 cs.CR cs.CL cs.LG 90%

TFL: Targeted Bit-Flip Attack on Large Language Model

TFL:针对大语言模型的定向位翻转攻击

Jingkai Guo, Chaitali Chakrabarti, Deliang Fan

机构 * School of Electrical, Computer and Energy Engineering(电气、计算机与能源工程学院) Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.CL、cs.LG

AI总结 TFL是一种新型定向位翻转攻击框架,通过精确操控LLM输出并减少对无关输入的影响,提升攻击的隐蔽性和针对性。

Comments 13 pages, 11 figures. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17931 2026-02-23 cs.LG cs.AI 86%

Memory-Based Advantage Shaping for LLM-Guided Reinforcement Learning

基于记忆的优势塑造用于LLM引导的强化学习

Narjes Nourzad, Carlee Joe-Wong

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种基于记忆的优势塑造方法,通过构建记忆图来提升LLM引导强化学习的样本效率和学习速度,减少对连续LLM监督的依赖。

Comments Association for the Advancement of Artificial Intelligence (AAAI)

详情

展开后加载摘要…

URL PDF HTML 收藏