arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

大模型推理能力

大模型数学、逻辑、规划、多步推理和测试时计算能力。

共收录 45515 信号源:cs.CL, cs.AI, cs.LG

1. 数学推理 3258 篇

2608.01522 2026-08-04 cs.LG cs.AI cs.CL 新提交 67%

Question Begets Question: Self-Evolving Curriculum for Reinforcement Fine-Tuning on Competition Mathematics

问题催生问题:面向竞赛数学强化微调的自演进课程

Longtian Bao, Jianyou Wang, Yang Zhang, Youze Zheng, Ramamohan Paturi

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文针对竞赛数学强化微调的三大困难,提出Question-begets-Question(QbQ)方法及自演进课程,使Qwen2.5-Math-7B的AIME任务pass@1从5.6%提升至16.5%,且能解决更难问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00004 2026-08-04 cs.CL cs.AI cs.LG 新提交 67%

Cost-Effective Automated Judging of Natural-Language Mathematical Proofs

自然语言数学证明的高性价比自动评判

Benjamin Grayzel

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究以 IMO-GradingBench 为基准,验证 GPT-OSS 120B 等三个低成本模型作为数学证明评判器的效果,发现全票通过规则的低成本方案与前沿模型效果相当,成本低达 100 倍。

Comments 7 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20639 2026-08-04 cs.CL cs.AI cs.LG 版本更新 67%

Latent Collaboration in Multi-Agent Systems

多智能体系统中的潜在协作

Jiaru Zou, Ruizhong Qiu, Gaotang Li, Xiyuan Yang, Katherine Tieu, Pan Lu, Ke Shen, Hanghang Tong, Yejin Choi, Jingrui He, James Zou, Mengdi Wang, Ling Yang

机构 * University of Washington(华盛顿大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出LatentMAS框架,使LLM智能体在连续潜在空间直接协作,无需文本中介,实现更高精度、更低开销和更快推理。

Comments ICML2026 Spotlight, Project: https://github.com/Gen-Verse/LatentMAS

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06382 2026-08-03 stat.ML cs.AI cs.CL cs.GT cs.LG 67%

On the Fundamental Impossibility of Hallucination Control in Large Language Models

Michał P. Karpowicz

机构 * Samsung AI Center(三星人工智能中心)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

Comments Mathematics debugged, added examples and illustrations, corrected claims, and re-edited, typos removed

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22837 2026-07-28 cs.LG cs.AI cs.CL 新提交 67%

Frustratingly Simple Black-Box Adaptation of Language Models via Logit Bias

通过对数偏差对语言模型进行极其简单的黑箱适应

Ofek I. Cohen, Lior Shani, Aviv Rosenberg, Ankur Samanta, Tal Wagner, Yonathan Efroni

机构 * Tel Aviv University(特拉维夫大学) Google Research(谷歌研究院) Columbia University(哥伦比亚大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究如何通过简单API级控制调整语言模型,开发黑箱方法学习对数偏差向量,无需修改模型权重或梯度,该方法在数学和推理基准上优于基础模型,是一种轻量级的语言模型适应机制。

Comments 36 pages, 4 figures, 6 tables. Appendix included. Code available at https://github.com/Ofek-Israeli/logit_bias_lm_adaptation

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22554 2026-07-28 cs.AI cs.CL cs.LG 新提交 67%

Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy

相同问题,不同答案:超越准确率评估大语言模型的可靠性

Kazem Faghih, Yize Cheng, Shoumik Saha, Mobina Pournemat, Armin Gerami, Soheil Feizi

机构 * University of Maryland, College Park(马里兰大学帕克分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究大语言模型在不同等效表述问题下的答案变化,发现其输出依赖措辞,准确率指标掩盖不稳定性,实例级行为不稳定,提出自释义策略可恢复潜在知识提升性能,强调评估一致性对展现模型可靠性的重要性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04763 2026-07-28 cs.LG cs.AI cs.CL stat.ML 版本更新 67%

Multi-Turn On-Policy Distillation with Prefix Replay

基于前缀重放的多轮在线策略蒸馏

Baohao Liao, Hanze Dong, Christof Monz, Xinxing Xu, Li Dong, Furu Wei

机构 * Microsoft Research(微软研究院) University of Amsterdam(阿姆斯特丹大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究用于智能体任务的在线策略蒸馏,提出重放前缀在线策略蒸馏方法,复用预收集教师轨迹作重放前缀,解决多轮在线策略蒸馏的前缀陷阱问题,提高效率且保持或提升精度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16872 2026-07-21 cs.CL cs.AI cs.LG 新提交 67%

Trace-Based On-Policy Distillation for Masked Diffusion Language Models

基于轨迹的策略蒸馏用于掩码扩散语言模型

Haolin Ren, Ziyang Huang, Chenhao Yuan, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对扩散大语言模型推理训练后处理难的问题,提出基于轨迹的策略蒸馏(TOPD)框架,通过在目标模型去噪轨迹上监督,利用教师模型获取令牌分布并以反向KL目标更新,在数学推理基准上提升了模型准确率且减少计算量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16255 2026-07-21 cs.LG cs.AI cs.CL 新提交 67%

Feature Generation Using LLMs: An Evolutionary Algorithm Approach

使用大语言模型进行特征生成:一种进化算法方法

Aria Nourbakhsh, Benoît Alcaraz, Christoph Schommer

机构 * University of Luxembourg(卢森堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究利用大语言模型解决表格数据特征生成问题,创建管道结合属性与提示生成新特征,经选择算法筛选,应用于八个不同数据集,结果显示语言模型生成的新特征有助于给定任务并提升分类效果。

Journal ref Commun. Comput. Inf. Sci. 2471, 48-64 (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.04411 2026-07-21 cs.LG cs.AI cs.CL 版本更新 67%

Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing

Mediator:基于较少参数冲突和不确定性路由的内存高效大语言模型合并

Kunfeng Lai, Zhenheng Tang, Xinglin Pan, Peijie Dong, Xiang Liu, Haolan Chen, Huacan Wang, Li Shen, Bo Li, Xiaowen Chu

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型合并中参数冲突致性能下降等问题,提出基于层参数冲突情况分别处理,结合任务算术稀疏性解耦专家,依输入数据任务不确定性选合并专家,实验表明该方法提升性能且降低系统成本。

Comments work in progress. arXiv admin note: text overlap with arXiv:2405.09673 by other authors

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15200 2026-07-17 cs.CL cs.AI cs.LG 新提交 67%

Mask-Aware Policy Gradients for Diffusion Language Models

用于扩散语言模型的掩码感知策略梯度

Haran Raajesh, Kulin Shah, Adam Klivans, Philipp Krähenbühl

机构 * The University of Texas at Austin(德克萨斯大学奥斯汀分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对强化学习扩展到MDLMs的难题,将MDLM生成形式化为两阶段动作MDP,使策略梯度分解为令牌项和掩码项,结合优化这两项在数学推理和编码基准测试中取得了最优成绩。

Comments Accepted at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13643 2026-07-16 cs.LG cs.AI cs.CL 新提交 67%

Consensus as Privileged Context for Label-Free Self-Distillation

作为无标签自蒸馏特权上下文的共识

John Gkountouras, Josip Jukić, Ivan Titov

机构 * ILLC, University of Amsterdam(逻辑、语言与计算研究所,阿姆斯特丹大学) ILCC, University of Edinburgh(信息实验室,爱丁堡大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究旨在提高无标签大语言模型推理准确性,提出CANON方法将共识转化为token级监督,通过采样多个解决方案并以达到多数答案的方案为条件设置模型快照来监督。实验表明该方法大幅提升性能,还能迁移,改进非单纯分布锐化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25996 2026-07-07 cs.AI cs.CL cs.LG 新提交 67%

Autodata: An agentic data scientist to create high quality synthetic data

Autodata: 一种创建高质量合成数据的智能数据科学家方法

Ilia Kulikov, Chenxi Whitehouse, Tianhao Wu, Yixin Nie, Swarnadeep Saha, Eryk Helenowski, Weizhe Yuan, Olga Golovneva, Jack Lanchantin, Yoram Bachrach, Jakob Foerster, Xian Li, Han Fang, Sainbayar Sukhbaatar, Jason Weston

机构 * Meta

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Autodata方法,让AI代理充当数据科学家,通过元优化学习创建更优的训练和评估数据,在计算机科学、法律推理和数学推理任务上优于传统方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.00254 2026-07-02 cs.DB 新提交 67%

Query-Centric Optimization of AI Workflows via Approximate Query Processing and Proxy Models

基于近似查询处理和代理模型的AI工作流查询中心优化

Huayi Wang, Jun Xu, Gromit Yeuk-Yin Chan

专题命中 数学推理 :reasoning(abstract);math reasoning(abstract)

AI总结 提出将AI工作流视为声明式查询,利用近似查询处理(AQP)和代理模型(PM)过滤减少昂贵模型调用,在TPC-DS和LLM流水线上实现85-90%和60-70%的调用减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01002 2026-07-02 cs.CL cs.AI cs.LG 新提交 67%

Logit-Contribution Scoring Identifies Non-Literal Retrieval Heads

Logit贡献评分识别非字面检索头

Aryo Pradipta Gema, Beatrice Alex, Pasquale Minervini

机构 * University of Edinburgh(爱丁堡大学) Heriot-Watt University(赫瑞瓦特大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Logit贡献评分(LOCOS),通过OV电路输出投影到答案标记方向,识别大语言模型中执行非字面检索的注意力头,消融实验显著降低ROUGE-L而保持其他能力。

Comments 41 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30704 2026-07-01 cs.LG cs.AI cs.CL 新提交 67%

From Search to Synthesis: Training LLMs as Zero-Shot Workflow Generators

从搜索到合成:训练大语言模型为零样本工作流生成器

Gan Luo, Zihan Qin, Bin Dong, Wotao Yin

机构 * School of Mathematics Science, Peking University(北京大学数学科学学院)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MetaFlow,将工作流生成视为元学习问题,通过两阶段训练(监督微调+强化学习)使模型能生成可泛化的任务级工作流,在问答、代码生成和数学推理任务上实现零样本泛化。

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.27731 2026-06-29 cs.CL cs.AI cs.CE cs.LG 新提交 67%

Enhancing Numerical Prediction in LLMs via Smooth MMD Alignment

通过平滑MMD对齐增强LLM中的数值预测

Zhuo Zuo, Li Yue, Wenhao Zheng, Chenpeng Wang, Xianggen Liu

机构 * College of Computer Science, Sichuan University, Chengdu, China(四川大学计算机学院,成都,中国)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对LLM在数值预测任务中精度不足的问题,提出平滑最大均值差异(SMMD)方法,通过数值令牌的距离核和图平滑对齐预测分布,在数学推理等任务中显著提升准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05106 2026-06-15 cs.AI cs.CL cs.LG 版本更新 67%

Token-Level LLM Collaboration via FusionRoute

通过融合路由实现令牌级LLM协作

Nuoya Xiong, Yuhang Zhou, Hanqing Zeng, Zhaorun Chen, Furong Huang, Shuchao Bi, Lizhu Zhang, Zhuokai Zhao

机构 * [cs.AI](计算机科学与人工智能)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出FusionRoute框架,通过轻量级路由器在解码步骤中选择最合适的专家并补充对数几率以优化下一个令牌分布,解决了单个通用模型在多个领域表现不佳的问题,同时在多个基准测试中优于其他方法。

Comments 25 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14169 2026-06-15 cs.LG cs.AI cs.CL 版本更新 67%

Deep Dense Exploration for LLM Reinforcement Learning via Pivot-Driven Resampling

基于枢轴驱动重采样的LLM强化学习深度密集探索

Yiran Guo, Zhongjian Qiao, Yingqi Xie, Jie Liu, Dan Ye, Ruiqing Zhang, Shuang Qiu, Lijie Xu

机构 * Institute of Software, Chinese Academy of Sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Baidu(百度)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对大语言模型强化学习中探索效率低的问题,提出深度密集探索(DDE)策略,通过识别失败轨迹中的可恢复枢轴状态并局部密集重采样,结合双流优化目标,在数学推理基准上优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13598 2026-06-12 cs.AI cs.CL cs.LG cs.MA 新提交 67%

Reward Modeling for Multi-Agent Orchestration

多智能体编排的奖励建模

King Yeung Tsang, Zihao Zhao, Vishal Venkataramani, Haizhou Shi, Zixuan Ke, Semih Yavuz, Shafiq Joty, Hao Wang

机构 * Rutgers University(罗杰斯大学) Salesforce AI Research(Salesforce人工智能研究)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出OrchRM框架,通过自监督学习从多智能体执行中间产物构建奖励模型,无需人工标注,实现高效编排器训练和测试时扩展,在多个领域提升性能并降低计算成本。

Comments Preprint; work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.23982 2026-06-11 cs.CL cs.AI cs.CY cs.LG cs.NE 版本更新 67%

Toward Preference-aligned Large Language Models via Residual-based Model Steering

基于残差模型引导的偏好对齐大型语言模型

Lucio La Cava, Andrea Tagarelli

机构 * DIMES Dept., University of Calabria, Italy(卡利博大学DIMES系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PaLRS方法,利用残差流中的偏好信号提取轻量级引导向量,无需训练即可在推理时对齐模型偏好,在数学推理和代码生成任务上取得一致提升,同时节省大量时间。

Comments Accepted at IJCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07810 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

SLMJury: Can Small Language Models Judge as Well as Large Ones?

SLMJury:小型语言模型能否像大型模型一样进行评判?

Anish Laddha, Nitesh Pradhan, Gaurav Srivastava

机构 * LNMIIT Virginia Tech(弗吉尼亚理工大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出SLMJury框架,评估小型语言模型作为评判者的能力,发现领域依赖的过度思考效应、领域泛化差异、闭端与开端评判能力分离,以及多智能体辩论降低准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07527 2026-06-09 cs.CL cs.AI cs.LG 新提交 67%

Post-training is (Massive) Supervised Learning

后训练是(大规模)监督学习

Michael Hassid, Yossi Adi, Roy Schwartz

机构 * FAIR, Meta AI(Meta AI 基础人工智能研究团队) The Hebrew University of Jerusalem(耶路撒冷希伯来大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文论证当前LLM后训练阶段(SFT+RL)实质是回归到BERT时代的“预训练-微调”范式,通过实验表明从零开始后训练的模型也能取得显著性能,并提出应转向“学会学习”的训练方式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09085 2026-06-09 cs.LG cs.AI cs.CL cs.IR 版本更新 67%

MMR-GRPO: Accelerating GRPO-Style Training through Diversity-Aware Reward Reweighting

MMR-GRPO:通过多样性感知奖励重加权加速GRPO风格训练

Kangda Wei, Ruihong Huang

机构 * Department of Computer Science and Engineering(计算机科学与工程系)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MMR-GRPO方法,利用最大边际相关性根据完成多样性重加权奖励,减少冗余样本,加速GRPO训练,在保持性能的同时平均减少47.9%训练步数和70.2%时间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05152 2026-06-08 cs.LG cs.AI cs.CL 版本更新 67%

Reinforcement Learning from Rich Feedback with Distributional DAgger

利用丰富反馈的强化学习与分布式DAgger

Rishabh Agrawal, Jacob Fein-Ashley, Paria Rashidinejad

机构 * University of Southern California(南加州大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出DistIL算法,通过分布式DAgger利用丰富反馈(如执行轨迹、工具输出等)进行前向交叉熵优化,实现单调策略改进和更好的Pass@N性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.04244 2026-06-04 cs.AI cs.CL cs.CV cs.LG 67%

VAMPS: Visual-Assisted Mathematical Problem Solving Benchmark

VAMPS: 视觉辅助数学问题求解基准

Amirhossein Dabiriaghdam, Shayan Vassef, Mohammadreza Bakhtiari, Yasamin Medghalchi, Ilker Hacihaliloglu, Mesrob Ohannessian, Lele Wang, Giuseppe Carenini

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出VAMPS基准,通过1,168道双语多选题评估多模态大模型在借助绘图工具进行数学推理时的表现,发现直接解析求解优于工具辅助视觉求解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.03391 2026-06-03 cs.LG cs.AI cs.CL 67%

When Model Merging Breaks Routing: Training-Free Calibration for MoE

当模型合并破坏路由:MoE的无训练校准

Canbin Huang, Tianyuan Shi, Xiaojun Quan, Jingang Wang, Jianfei Zhang, Qifan Wang

机构 * University of Science and Technology of China(中国科学技术大学)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对MoE架构中模型合并导致的路由崩溃问题,提出基于二阶曲率的无训练校准方法HARC,通过闭式解和共轭梯度法高效重对齐路由器,显著提升数学推理和代码生成性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01058 2026-05-29 cs.LG cs.AI cs.CL 67%

Good SFT Optimizes for SFT, Better SFT Prepares for Reinforcement Learning

好的SFT优化SFT,更好的SFT为强化学习做准备

Dylan Zhang, Yufeng Xu, Haojin Wang, Qingzhi Chen, Hao Peng

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) New York University (Shanghai)(纽约大学(上海))

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对当前SFT-RL流程中离线SFT数据分布与在线RL策略分布不匹配的问题,提出基于策略评估的离线学习损失重加权方法PEAR,通过重要性采样重加权SFT损失,提升后续RL训练效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.20369 2026-05-21 cs.CL cs.AI cs.LG 67%

DEL: Digit Entropy Loss for Numerical Learning of Large Language Models

DEL:用于大语言模型数值学习的数字熵损失

Zhaohui Zheng, Chenhang He, Shihao Wang, Yuxuan Li, Ming-Ming Cheng, Lei Zhang

机构 * The Hong Kong Polytechnic University(香港理工大学) VCIP, College of Computer Science, Nankai University(南开大学计算机学院VCIP)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出Digit Entropy Loss (DEL)用于大语言模型的自回归数值学习,通过重新设计传统无监督熵优化,引入数字条件概率和二元交叉熵,使熵优化转向监督方式,同时推广整数基于的数值学习到浮点数优化,从而提升数值预测的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04998 2026-05-20 cs.LG cs.AI cs.CL 67%

Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning

学习率至关重要:Vanilla LoRA可能足以用于LLM微调

Yu-Ang Lee, Ching-Yun Ko, Pin-Yu Chen, Mi-Yen Yeh

机构 * National Taiwan University(国立台湾大学) IBM Research(IBM研究院) Academia Sinica(台湾“学术院”)

专题命中 数学推理 :reasoning(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文通过广泛的超参数搜索重新评估了九种代表性的LoRA变体和Vanilla LoRA,在数学推理、常识推理、代码生成和指令遵循等任务上,发现不同的LoRA方法偏好不同的学习率范围。当学习率正确调整时,所有方法都能达到相似的峰值性能,这表明Vanilla LoRA仍然是一个有竞争力的基线,而单一训练配置下的改进可能并不反映一致的方法优势。

Comments Project page: https://github.com/yuang-lee/lr-matters-lora

详情

展开后加载摘要…

URL PDF HTML 收藏