arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-02 至 2026-02-02 共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 预训练与数据 14 篇

2409.10825 2026-02-02 cs.IR cs.AI cs.ET cs.LG 90%

Unveiling and Mitigating Bias in Large Language Model Recommendations: A Path to Fairness

揭示和缓解大型语言模型推荐中的偏见:走向公平的一条路

Anindya Bijoy Das, Shahnewaz Karim Sakib

机构 * Computer Science and Engineering, University of Tennessee at Chattanooga(计算机科学与工程系,田纳西大学查塔努加分校)

专题命中 预训练与数据 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了基于LLM的推荐系统中的偏见问题,提出通过提示工程和检索增强生成策略来缓解偏见,以实现更公平的推荐。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23090 2026-02-02 cs.CE q-bio.QM 82%

Omni-fMRI: A Universal Atlas-Free fMRI Foundation Model

Omni-fMRI:一种无图谱的fMRI基础模型

Mo Wang, Wenhao Ye, Junfeng Xia, Junxiang Zhang, Xuanye Pan, Minghao Xu, Haotian Deng, Hongkai Wen, Quanying Liu

专题命中 预训练与数据 :foundation model(title,abstract);pretraining(abstract)

AI总结 Omni-fMRI提出了一种无需图谱的fMRI基础模型,通过动态拼接机制实现高效预训练,提升了脑表示学习的可扩展性和可重复性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04347 2026-02-02 cs.CL cs.LG 81%

Unmasking Backdoors: An Explainable Defense via Gradient-Attention Anomaly Scoring for Pre-trained Language Models

揭示后门:通过梯度-注意力异常评分对预训练语言模型进行可解释防御

Anindya Sundar Das, Kangjie Chen, Monowar Bhuyan

机构 * Umeå University(乌梅学院) Nanyang Technological University(南洋理工大学)

专题命中 预训练与数据 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本文提出通过梯度-注意力异常评分对预训练语言模型进行可解释防御,有效降低后门攻击成功率。

Comments 17 pages total (9 pages main text + 6 pages appendix + references), 16 figures. Preprint version; the final camera-ready version may differ. Accepted to ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22467 2026-02-02 cs.RO cs.CV 78%

CARE: Multi-Task Pretraining for Latent Continuous Action Representation in Robot Control

CARE:用于机器人控制的潜在连续动作表示的多任务预训练

Jiaqi Shi, Xulong Zhang, Xiaoyang Qu, Jianzong Wang

机构 * Ping An Technology (Shenzhen) Co., Ltd.(平安科技(深圳)有限公司) University of Science and Technology of China(中国科学技术大学)

专题命中 预训练与数据 :pretraining(title,abstract)

AI总结 CARE通过多任务预训练学习连续动作表示,提升机器人控制的可扩展性和可解释性。

Comments Accepted to 2026 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22935 2026-02-02 cs.CR cs.AI 77%

Protecting Private Code in IDE Autocomplete using Differential Privacy

在IDE自动补全中使用差分隐私保护私有代码

Evgeny Grigorenko, David Stanojević, David Ilić, Egor Bogomolov, Kostadin Cvejoski

机构 * JetBrains Research(JetBrains研究)

专题命中 预训练与数据 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出利用差分隐私保护IDE自动补全中用户代码隐私,通过DP训练模型有效防御成员推断攻击,同时保持模型性能。

Comments 6 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00219 2026-02-02 cs.LG cs.AI cs.CL cs.NE 75%

Thoughtbubbles: an Unsupervised Method for Parallel Thinking in Latent Space

Thoughtbubbles: 一种用于潜在空间中并行思维的无监督方法

Houjun Liu, Shikhar Murty, Christopher D. Manning, Róbert Csordás

机构 * Department of Computer Science, Stanford University, Stanford, CA, United States(计算机科学系,斯坦福大学,斯坦福,CA,美国)

专题命中 预训练与数据 :language model(abstract);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Thoughtbubbles是一种通过预训练学习并行自适应计算的转换器变体,能够在潜在空间中实现更高效的计算,提升模型的推理性能和零样本评估表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22690 2026-02-02 cs.LG cs.AI 73%

Do Transformers Have the Ability for Periodicity Generalization?

Transformer 是否具备周期性泛化能力?

Huanyu Liu, Ge Li, Yihong Dong, Sihan Wu, Peixu Wang, Sihao Cheng, Taozhi Chen, Kechi Zhang, Hao Zhu, Tongxuan Liu

机构 * School of Computer Science, Peking University(北京大学计算机科学学院) College of AI, Tsinghua University(清华大学人工智能学院) School of Science and Engineering, The Chinese University of Hong Kong (Shenzhen)(香港中文大学(深圳)科学与工程学院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究了 Transformer 在周期性泛化方面的局限性,通过引入抽象代数和推理视角,揭示了模型在处理复合周期性任务时的不足,并提出了可控生成基准 Coper。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.00068 2026-02-02 cs.CL cs.AI 73%

Framing Political Bias in Multilingual LLMs Across Pakistani Languages

在巴基斯坦多种语言中框架化政治偏见

Afrozah Nadeem, Mark Dras, Usman Naseem

机构 * School of Computing, Macquarie University(计算机学院,麦考瑞大学)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究评估了巴基斯坦五种语言中13种先进LLM的政治偏见,发现其在区域语言中表现出更集权的框架,强调文化适应的偏见审计框架的重要性。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23153 2026-02-02 cs.LG 70%

Behemoth: Benchmarking Unlearning in LLMs Using Fully Synthetic Data

Behemoth:使用完全合成数据对LLM中的去学习进行基准测试

Eugenia Iofinova, Dan Alistarh

机构 * IST Austria(IST奥地利研究院)

专题命中 预训练与数据 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 Behemoth通过完全合成数据框架评估大语言模型中的去学习效果,揭示了模型编辑的挑战与改进方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.02521 2026-02-02 cs.SD cs.AI cs.CL 62%

FLM-Audio: Natural Monologues Improves Native Full-Duplex Chatbots via Dual Training

FLM-Audio: 自然独白提升原生全双工聊天机器人通过双训练

Yiqun Yao, Xiang Li, Xin Jiang, Xuezhi Fang, Naitong Yu, Wenjia Ma, Aixin Sun, Yequan Wang

机构 * Beijing Academy of Artificial Intelligence, Beijing, China(北京人工智能研究院) Nanyang Technological University, Singapore(南洋理工大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL、cs.AI

AI总结 FLM-Audio通过双训练策略和连续独白提升全双工聊天机器人的响应质量和体验。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22439 2026-02-02 cs.CL 61%

Stop Jostling: Adaptive Negative Sampling Reduces the Marginalization of Low-Resource Language Tokens by Cross-Entropy Loss

停止推搡:自适应负采样减少交叉熵损失对低资源语言标记的边缘化

Galim Turumtaev

专题命中 预训练与数据 :language model(abstract,journal_ref);分类 cs.CL

AI总结 本文提出自适应负采样技术,通过减少交叉熵损失对低资源语言标记的边缘化影响,提升模型对低资源语言的表示能力。

Comments Accepted at LoResLM 2025 (COLING 2025 workshop). Oral presentation

Journal ref In Proceedings of the First Workshop on Language Models for Low-Resource Languages (LoResLM 2025), pages 373-386, Abu Dhabi, United Arab Emirates. Association for Computational Linguistics

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22410 2026-02-02 cs.CL 57%

Word-Centered Semantic Graphs for Interpretable Diachronic Sense Tracking

基于词中心语义图的可解释历时意义跟踪

Imene Kolli, Kai-Robin Lange, Jonas Rieger, Carsten Jentsch

机构 * University of Zurich(苏黎世大学) TU Dortmund University(多特蒙德技术大学)

专题命中 预训练与数据 :language model(abstract);分类 cs.CL

AI总结 本文提出基于词中心语义图的方法,用于可解释地追踪词义随时间的变化,通过整合分布相似性和词汇替代性,揭示多义性动态和意义演变轨迹。

Comments 20 pages, 16 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06746 2026-02-02 cs.CV cs.AI 57%

AlignGemini: Generalizable AI-Generated Image Detection Through Task-Model Alignment

AlignGemini: 通过任务-模型对齐实现通用的AI生成图像检测

Ruoxin Chen, Jiahui Gao, Kaiqing Lin, Keyue Zhang, Yandan Zhao, Isabel Guan, Taiping Yao, Shouhong Ding

机构 * Tencent Youtu Lab East China University of Science Shenzhen University Hong Kong University of Science Department of XXX, University of YYY, Location, Country School of ZZZ, Institute of WWW, Location, Country

专题命中 预训练与数据 :language model(abstract);分类 cs.AI

AI总结 AlignGemini通过任务-模型对齐原则,结合语义和像素伪影检测,提升AI生成图像检测的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21280 2026-02-02 cs.CV 50%

Token Entropy Regularization for Multi-modal Antenna Affiliation Identification

基于令牌熵正则化的多模态天线归属识别

Dong Chen, Ruoyu Li, Xinyan Zhang, Jialei Xu, Ruosen Zhao, Zhikang Zhang, Lingyun Li, Zizhuang Wei

机构 * Huawei(华为) The University of Hong Kong(香港大学) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳))

专题命中 预训练与数据 :pretraining(abstract)

AI总结 本文提出基于令牌熵正则化的多模态天线归属识别方法,通过融合视频、几何特征和PCI信号,提升通信网络优化效率。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 指令微调 21 篇

2601.23161 2026-02-02 cs.SD cs.CL 90%

DIFFA-2: A Practical Diffusion Large Language Model for General Audio Understanding

DIFFA-2:一种实用的扩散大型语言模型用于通用音频理解

Jiaming Zhou, Xuxin Cheng, Shiwan Zhao, Yuhang Jia, Cao Liu, Ke Zeng, Xunliang Cai, Yong Qin

机构 * College of Computer Science, Nankai University(南开大学计算机科学学院) Meituan LongCat Interaction Team(美团LongCat交互团队)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);instruction tuning(abstract);preference optimization(abstract)

AI总结 DIFFA-2是一种基于扩散模型的实用大型音频语言模型,通过升级语音编码器和双适配器提升音频理解性能,且在实际训练预算下表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09190 2026-02-02 cs.LG cs.AI 90%

Multi-Level Safety Continual Projection for Fine-Tuned Large Language Models without Retraining

多级安全连续投影:无需重新训练的微调大语言模型安全增强方法

Bing Han, Feifei Zhao, Dongcheng Zhao, Guobin Shen, Ping Wu, Yu Shi, Yi Zeng

机构 * Beijing Key Laboratory of Safe AI and Superalignment(北京安全人工智能与超对齐重点实验室) Beijing Institute of AI Safety and Governance(北京人工智能安全与治理研究院) Brain-inspired Cognitive AI Lab, Institute of Automation, Chinese Academy of Sciences(脑启发认知人工智能实验室,中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Long-term AI(长期人工智能)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种无需重新训练的微调后安全增强方法MSCP,通过多级表示对齐和安全方向投影,有效抑制有害输出并提升与人类偏好的对齐度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22169 2026-02-02 cs.CL cs.AI cs.CR cs.LG 89%

In Vino Veritas and Vulnerabilities: Examining LLM Safety via Drunk Language Inducement

葡萄酒中的真理与漏洞:通过醉酒语言诱导检验LLM安全性

Anudeex Shetty, Aditya Joshi, Salil S. Kanhere

机构 * School of Computer Science and Engineering, UNSW Sydney(计算机科学与工程学院,新南威尔士大学悉尼分校) School of Computing and Information System, the University of Melbourne(计算与信息系统学院,墨尔本大学)

专题命中 指令微调 :LLM(title,abstract);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文通过诱导LLM产生醉酒语言,研究其安全漏洞,发现其易受劫持攻击和隐私泄露,揭示了LLM安全性的潜在风险。

Comments WIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.06777 2026-02-02 cs.CV cs.AI 89%

MolX: Enhancing Large Language Models for Molecular Understanding With A Multi-Modal Extension

MolX: 通过多模态扩展增强大型语言模型的分子理解能力

Khiem Le, Zhichun Guo, Kaiwen Dong, Xiaobao Huang, Bozhao Nan, Roshni Iyer, Xiangliang Zhang, Olaf Wiest, Wei Wang, Ting Hua, Nitesh V. Chawla

机构 * University of Notre Dame, IN, USA(诺丁汉大学) University of California, Los Angeles, CA, USA(加州大学洛杉矶分校)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 MolX通过多模态扩展提升LLM对分子的理解能力,利用SMILES和分子图提取细粒度特征,并结合分子指纹提升性能,有效提升分子相关任务表现。

Comments MLoG-GenAI@KDD'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.25736 2026-02-02 cs.CL cs.AI cs.IT cs.NI math.IT 88%

Think Less, Label Better: Multi-Stage Domain-Grounded Synthetic Data Generation for Fine-Tuning Large Language Models in Telecommunications

少思多标:多阶段领域导向的合成数据生成用于电信领域大型语言模型微调

Chenhua Shi, Gregor Macdonald, Bhavika Jalli, Wanlu Lei, John Zou, Mridul Jain, Joji Philip

机构 * Ericsson(爱立信)

专题命中 指令微调 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种多阶段自动化方法,利用领域知识图生成高质量合成数据,用于电信领域大型语言模型的微调,减少人工标注依赖,提升数据质量。

Comments 6 pages, 6 figures, 5 tables, IEEE ICC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23006 2026-02-02 cs.CL 85%

InstructDiff: Domain-Adaptive Data Selection via Differential Entropy for Efficient LLM Fine-Tuning

InstructDiff:通过微分熵实现领域自适应的数据选择以实现高效的LLM微调

Junyou Su, He Zhu, Xiao Luo, Liyu Zhang, Hong-Yu Zhou, Yun Chen, Peng Li, Yang Liu, Guanhua Chen

机构 * Peking University(北京大学) University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Tsinghua University(清华大学) SUFE(上海财经大学) SUSTech(南方科技大学)

专题命中 指令微调 :LLM(title);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 InstructDiff通过微分熵实现领域自适应的数据选择,提升LLM微调效率,实验显示在数学推理和通用指令遵循任务上分别提高17%和52%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17564 2026-02-02 eess.IV cs.CV cs.LG 83%

ModalTune: Fine-Tuning Slide-Level Foundation Models with Multi-Modal Information for Multi-task Learning in Digital Pathology

ModalTune: 通过多模态信息细调滑片级基础模型以实现数字病理学中的多任务学习

Vishwesh Ramanathan, Tony Xu, Pushpak Pati, Faruk Ahmed, Maged Goubran, Anne L. Martel

机构 * Sunnybrook Research Institute(辛普森布鲁斯研究所在) University of Toronto(多伦多大学) Google Research(谷歌研究)

专题命中 指令微调 :foundation model(title,abstract);language model(abstract);分类 cs.LG

AI总结 ModalTune通过引入多模态信息和大型语言模型,实现数字病理学中多任务学习的统一细调框架,提升癌症生存和亚型预测性能。

Journal ref Proceedings of the IEEE/CVF International Conference on Computer Vision (ICCV), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.10197 2026-02-02 cs.AI 81%

Don't Just Fine-tune the Agent, Tune the Environment

不要只微调智能体,而是微调环境

Siyuan Lu, Zechuan Wang, Hongxuan Zhang, Qintong Wu, Leilei Gan, Chenyi Zhuang, Jinjie Gu, Tao Lin

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Westlake University(西湖大学) Nanjing University(南京大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 本文提出环境微调方法,通过结构化课程和环境增强,使智能体无需专家轨迹即可高效学习复杂行为,实现更稳健的泛化能力。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.23182 2026-02-02 cs.CL 79%

FourierSampler: Unlocking Non-Autoregressive Potential in Diffusion Language Models via Frequency-Guided Generation

FourierSampler: 通过频率引导生成解锁扩散语言模型的非自回归潜力

Siyang He, Qiqi Wang, Xiaoran Liu, Hongnan Ma, Yiwei Shi, Yuerong Song, Ying Zhu, Tianyi Liang, Zengfeng Huang, Ziwei He, Xipeng Qiu

专题命中 指令微调 :language model(title,abstract);分类 cs.CL

AI总结 FourierSampler通过频域滑动窗口机制,在扩散语言模型中实现非自回归生成,提升生成效果并超越自回归模型

Comments 15 pages, 6 figures, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21572 2026-02-02 cs.LG eess.SP 79%

RefineBridge: Generative Bridge Models Improve Financial Forecasting by Foundation Models

RefineBridge: 生成桥梁模型通过基础模型提升金融预测

Anthony Bolton, Wuyang Zhou, Zehua Chen, Giorgos Iacovides, Danilo Mandic

机构 * Department of Electrical and Electronic Engineering, Imperial College London, UK(帝国理工学院伦敦分校电子与电气工程系) Department of CST, Tsinghua University, Beijing, China(清华大学计算机科学与技术系)

专题命中 指令微调 :foundation model(title,abstract);分类 cs.LG

AI总结 RefineBridge通过生成桥梁模型改进金融预测,利用可处理的Schrödinger Bridge框架提升时间序列基础模型的预测性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22873 2026-02-02 eess.AS cs.AI cs.CL cs.SD 79%

EmoShift: Lightweight Activation Steering for Enhanced Emotion-Aware Speech Synthesis

EmoShift: 轻量级激活引导用于增强情感感知语音合成

Li Zhou, Hao Jiang, Junjie Li, Tianrui Wang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) The Hong Kong Polytechnic University(香港理工大学) Tianjin University(天津大学)

专题命中 指令微调 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EmoShift通过轻量级激活引导框架提升情感感知语音合成的情感表达与自然性。

Comments Activation Steering; Emotion-Aware TTS; Speech Synthesis; Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21558 2026-02-02 cs.CL 77%

ASTRA: Automated Synthesis of agentic Trajectories and Reinforcement Arenas

ASTRA: 自动化合成代理轨迹与强化环境

Xiaoyu Tian, Haotian Wang, Shuaiting Chen, Hao Zhou, Kaichi Yu, Yudian Zhang, Jade Ouyang, Junxi Yin, Jiong Chen, Baoyan Guo, Lei Zhang, Junjie Tao, Yuansheng Song, Ming Cui, Chengwei Liu

机构 * Beike Language and Intelligence(北溪语言与智能)

专题命中 指令微调 :large language model(abstract);language model(abstract);SFT(abstract);分类 cs.CL

AI总结 ASTRA通过可扩展数据合成和可验证强化学习,自动化训练工具增强语言模型代理,实现多轮稳定学习和高性能工具使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25801 2026-02-02 cs.LG cs.AI cs.CL cs.CV 75%

Metis-SPECS: Decoupling Multimodal Learning via Self-distilled Preference-based Cold Start

Metis-SPECS: 通过基于偏好自我蒸馏的冷启动解耦多模态学习

Kun Chen, Peng Shi, Haibo Qiu, Zhixiong Zeng, Siqi Yang, Wenji Mao, Lin Ma

机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所MAIS) Meituan(美团)

专题命中 指令微调 :language model(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 Metis-SPECS通过基于偏好的自我蒸馏冷启动框架解耦多模态学习,提升泛化能力和下游RL表现。

Comments Published as a conference paper at ICLR 2026!

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21795 2026-02-02 cs.LG cs.AI 73%

Effective LoRA Adapter Routing using Task Representations

利用任务表示的有效LoRA适配器路由

Akash Dhasade, Anne-Marie Kermarrec, Igor Pavlovic, Diana Petrescu, Rafael Pires, Mathis Randl, Martijn de Vos

机构 * EPFL(苏黎世联邦理工学院)

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 LORAUTER通过任务表示实现高效适配器路由,优于现有方法并在未见过的任务上取得最佳成绩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.05568 2026-02-02 cs.LG cs.AI 73%

Ravan: Multi-Head Low-Rank Adaptation for Federated Fine-Tuning

Ravan:用于联邦微调的多头低秩适应

Arian Raje, Baris Askin, Divyansh Jhunjhunwala, Gauri Joshi

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Ravan通过多头低秩适应方法提升联邦微调的准确率,实现高效参数更新和高模型表达性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19404 2026-02-02 cs.AI cs.LG 73%

RPO:Reinforcement Fine-Tuning with Partial Reasoning Optimization

RPO:基于部分推理优化的强化微调

Hongzhu Yi, Xinming Wang, Zhenghao zhang, Tianyu Zong, Yuanxiang Wang, Jun Xie, Tao Yu, Haopeng Jin, Kaixin Xu, Feng Chen, Jiahuan Chen, Yujia Yang, Zhenyu Guan, Bingkang Shi, Jungang Xu

专题命中 指令微调 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RPO通过部分推理优化显著降低训练时间,提升大型语言模型的训练效率。

详情

展开后加载摘要…

URL PDF HTML 收藏