arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 56 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 56 篇

2608.28044 2026-08-31 cs.PF cs.DC cs.LG 新提交 92%

Characterization of Request and Token Energy Costs for LLM Inference Workloads on GPU Platforms

GPU平台上大语言模型(LLM)推理工作负载的请求与令牌能耗特征

Prabhu Vellaisamy, Vanessa Lam, Shawn Blanton, John Paul Shen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究构建LLM推理分解能耗模型,在NVIDIA H100、H200 GPU上评估密集与MoE模型的能耗特征,发现需同时优化请求与令牌能耗,而非仅降低单位令牌能耗。

Comments Accepted at the 2026 IEEE International Symposium on Workload Characterization (IISWC 2026). 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28113 2026-08-31 cs.CL 新提交 91%

H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference

H-Scale:面向NVFP4亚字节大语言模型推理的Hessian引导型尺度优化

Hao Yu, Zheng Li, Dayiheng Liu, Jianwei Zhang

机构 * Qwen Team, Alibaba Inc.(通义千问团队,阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对NVFP4亚字节LLM推理中每组缩放因子优化不足的问题,提出H-Scale方法,利用二阶代理选择硬件合法尺度,改进NVFP4基准并接近BF16参考值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04342 2026-08-31 cs.CL 版本更新 90%

Pruning Laws for Large Language Models

大语言模型的剪枝规律

Ayan Sengupta, Siddhant Chaudhary, Tanmoy Chakraborty

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出剪枝规律这一可解释缩放关系,可预测剪枝后大语言模型的性能,能跨不同模型、剪枝方法和任务迁移,为高效部署LLMs提供原则性框架。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28327 2026-08-31 cs.CR cs.AI cs.CL 新提交 90%

Layered LLM Defenses as an Ensemble: Access Tiers, Inference Cost, and the Measured Failure Correlation Between Defense Layers

分层大语言模型防御作为集成体:访问层级、推理成本与防御层间实测失败相关性

Abrar Alotaibi, Muhammad Shahid Jabbar, Sadam Al-Azani, Moataz Ahmed

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM防御堆叠的假设,实测发现其防御层间存在正失败相关性,导致防御效果未达预期,需端到端实测堆叠表现而非仅依赖多样性选择成员。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28008 2026-08-31 cs.CV 新提交 90%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28011 2026-08-31 cs.AI 新提交 90%

Coverage, Not Credit: Failure-Credit Routing of Zeroth-Order Perturbation Budgets Does Not Improve On-Pool Sample Efficiency for LLM Agents

覆盖度而非信用:零阶扰动预算的失败-信用路由并不能提升LLM智能体的池内样本效率

Yuxu Ge

机构 * University of York(约克大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究探究将ZO/ES扰动预算按LLM智能体失败信用路由是否提升池内样本效率,发现多数场景下无显著增益,仅在未见过的BFCL函数的保留端点上有一处例外,还记录了三种相关实验失败模式。

Comments 19 pages, 3 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27472 2026-08-31 cs.AI 新提交 90%

LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation

大语言模型增强的因果发现:边存在性与方向的概率融合

Neville K. Kitson, Anthony Constantinou

机构 * Queen Mary University of London(伦敦玛丽女王大学) Causaliq

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究将BNSL与Gemini等LLM的因果知识通过概率依赖图融合,在26个基准网络上使F1值平均提升0.056,证明概率不确定性表示可有效提升因果图准确性。

Comments Accepted as a poster at Probabilistic Graphical Models (PGM) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03779 2026-08-31 cs.CL 版本更新 90%

Tracing the complexity profiles of different linguistic phenomena through the intrinsic dimension of LLM representations

通过LLM表示的内在维度追溯不同语言现象的复杂性特征

Marco Baroni, Emily Cheng, Iria de-Dios-Flores, Francesca Franzon

机构 * Universitat Pompeu Fabra (UPF)(巴塞罗那自治大学) ICREA(加泰罗尼亚凝聚态物理与应用研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究通过LLM表示的内在维度揭示语言复杂性对比,发现复杂现象在不同层间表现出更高的维度差异。

Comments Published as a conference paper at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28400 2026-08-31 cs.CR cs.SE 新提交 89%

When Verified Source Becomes Attack Input: Defending Smart Contracts Against LLM-Based Vulnerability Scanning

当已验证源码成为攻击输入:防御智能合约免受基于大语言模型(LLM)的漏洞扫描

Mingyuan Huang, Zimo Ji, Yifan Mo, Shuai Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出DeLLMGuard框架,通过分离源码与运行时执行并验证相关信息,在保留公开源码披露和授权审计的同时,降低LLM智能体对智能合约漏洞扫描的准确性,防御恶意扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27621 2026-08-31 cs.SE 新提交 89%

Predicting LLM Performance from Prompt Linguistic Features: An Empirical Study in Requirements Engineering

从提示语言特征预测大语言模型(LLM)性能:需求工程领域的实证研究

Quim Motger, Alessio Miaschi, Xavier Franch, Mohammad Amin Zadenoori, Alessio Ferrari

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本研究通过生成9000个语言受控的提示变体,利用5个开源LLM在需求分类任务上证实,提示的语言特征可显著预测LLM性能,为低成本提示选择提供了可解释的先验方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28099 2026-08-31 cs.AI cs.CL 新提交 89%

Speculative Probing: LLM Monitoring at Speculative-Decoding Cost

推测式探测:以推测解码成本实现大语言模型监控

Collin Zhang, Tingwei Zhang, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技学院)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出将LLM的推测解码模块改造为序列分类器,在可忽略开销下实现高效分类,其小型探测模型在多任务上优于零样本GPT-5.4-mini,部分任务性能匹配专用8B安全分类器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28496 2026-08-31 cs.CL 新提交 89%

Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation

混沌中的阶梯:测试时缩放何时、如何(或许还有为何)提升大语言模型的机器翻译性能

Di Wu, Sergey Troshin, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探究LLM的序列式与并行式测试时缩放在机器翻译中的特性,发现序列式采样性能上限更高,可提升翻译流畅度但在大推理预算下会降准,还分析了其机制与鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28003 2026-08-31 cs.LG cs.AI 新提交 88%

A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization Under a Quality-Degradation Constraint

质量退化约束下性能最大化的大语言模型量化中层级位宽分配方法

Artem Safronov

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文针对Gemma-3-1B提出质量退化约束下性能最大化的层级位宽分配方法,结合SA-PTQ敏感性分布优化TensorRT-LLM量化,在RTX 5090上实现最高19.1%延迟降低,为LLM量化提供新方案。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17194 2026-08-31 cs.CR 版本更新 88%

Progressive Behavioral Drift through Compression Valleys in Large Language Models

在阴影中引导:大型语言模型中激活空间攻击的因果放大

Zhiyuan Xu, Stanislav Abaimov, Joseph Gardiner, Sana Belguith

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出通过因果放大效应,利用激活空间攻击实现对大型语言模型行为的可控引导,展示了其在安全性和有效性上的贡献。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27875 2026-08-31 cs.AI 新提交 87%

HyQuant: Hybrid-Precision Quantization for LLM Attention

HyQuant:面向大语言模型注意力机制的混合精度量化方法

Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin Ouyang, Feihu Zhou, Kun Zhang, Zhenyu Guo, Hao Pan, Guangtao Xue, Yiming Zhang

机构 * Xiamen University(厦门大学) Tencent Penglai Lab(腾讯蓬莱实验室) Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 HyQuant是一种面向LLM注意力的混合精度量化框架,通过保留关键区域高精度、量化其余部分,在各类任务上实现近乎无损精度,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27512 2026-08-31 cs.LG cs.AI cs.CL cs.CR 新提交 87%

Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap

语言模型中量化触发的后门:跨量化器可迁移性与验证-部署差距

Jacopo Dardini, Claudio Stanzione, Giordano Colò, Giuseppe Fenza

机构 * University of Bologna(博洛尼亚大学) Luiss Guido Carli University(路易斯 Guido Carli 大学) Live Tech University of Salerno(萨勒诺大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现仅源精度审计无法排除语言模型的量化触发后门,提出量化行为等价类理论,在多语言模型中实现量化后激活的后门攻击,证明攻击持久性与量化方案及模型架构相关。

Comments Accepted at the 21st International Conference on Availability, Reliability and Security (ARES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28276 2026-08-31 cs.LG 新提交 86%

Parser States Already Know: Structure-Conditioned KV Persistence for Structured Generation

解析器状态已掌握:面向结构化生成的结构感知KV持久化

Linze Wu, Xinrui Chen

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM结构化生成中KV压缩未利用结构信号的问题,提出PASK方法,通过解析器信号优化KV持久化,在Qwen3-4B上显著提升性能并降低资源消耗。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28532 2026-08-31 cs.NI eess.SY 新提交 86%

xTRUCE: A Provably Safe Arbiter for Multi-xApp Conflict Mitigation in Agentic O-RAN

xTRUCE:面向智能体开放式无线接入网(O-RAN)中多xApp冲突缓解的可证明安全仲裁器

Le Xia, Rose Qingyang Hu, Paul S. Kudyba, Zhenlin An, Haijian Sun

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对O-RAN中LLM驱动xApp提案的冲突等问题,提出可证明安全的仲裁器xTRUCE,通过三层约束层次与两阶段仲裁机制保障gNB控制安全,经仿真和空中实验验证其有效性。

Comments 13 pages, 7 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28194 2026-08-31 eess.SY 新提交 86%

SafeLink-Agent: Agentic Maintenance for Adaptive Bitrate Controllers over Dynamic Starlink Networks

SafeLink-Agent:面向动态Starlink网络的自适应码率控制器的智能体式维护框架

Hongjun Xie, Bowen Zhang, Genke Yang, Pengcheng Luo

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对动态Starlink网络下ABR控制器难以适配复杂配置的问题,提出SafeLink-Agent框架,通过LLM智能体生成并验证补丁,显著降低了不同类型ABR控制器的严重会话比例,提升了流媒体鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22070 2026-08-31 cs.CE 版本更新 85%

Catellect-VL-2B: A Vision-Language Model for Edge-Based Feline Behavior Understanding

SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型

YuHang Wu, HaoXian Liu, Jia Tao

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);prompting(abstract)

AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28455 2026-08-31 cs.CV cs.AI 新提交 84%

ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT

ARC-CT:用于3D胸部CT的解剖路由对比视觉-语言学习

Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol, Şeyda Ertekin

机构 * Harvard Medical School(哈佛医学院) METU-DTX Digital Transformation and Innovation Center(METU-DTX数字转型与创新中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARC-CT是一种基于LLM提取的报告标签、无需人工标注的区域感知对比视觉-语言框架,通过三个组件解决胸部CT全局对比学习的局限,在18种异常上实现0.86无掩码宏观AUC,性能优于高效基线和大Transformer模型。

Comments Accepted to the Thoracic Image Analysis (TIA) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28160 2026-08-31 cs.AR cs.AI cs.HC 新提交 81%

Gen-TAS: A Generative AI-Aided Hardware-Software Task Allocation Framework for FPGA-GPP Heterogeneous Systems

Gen-TAS:面向FPGA-GPP异构系统的生成式AI辅助软硬件任务分配框架

Mary Kong, Yuqin Zhao, Semih Vazgecen, Cristian Sestito, Themis Prodromakis

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 Gen-TAS是一种知识增强LLM框架,结合任务图分析与RAG技术,为FPGA-GPP异构系统生成用户特定的可解释任务分配策略,在CNN、SDR工作负载实验中实现稳定的需求驱动分配,延迟导向场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27514 2026-08-31 cs.CL cs.AI 新提交 81%

Trajectory-Level Speculative Decoding for Diffusion Language Models

用于扩散语言模型的轨迹级推测解码

Tianxiang Pan, Baitao Gong, Mo Guang, Hongwei Yong, Tianpeng Jiang, Yaqian Li, Zheng Cao, Kaiwen Long

机构 * Li Auto Inc.(理想汽车)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型低置信度下吞吐量受限的问题,提出轨迹级推测解码框架,结合置信度分层树探索与分块并行评估,实现7-14倍加速且准确率变化极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27460 2026-08-31 cs.CL cs.LG 新提交 81%

Accelerating LLM Inference via Vector Index Based Output Embeddings

基于向量索引的输出嵌入加速大语言模型推理

Martin Loretz, Sepp Hochreiter

专题命中 效率与部署 :LLM(title,abstract_cn);分类 cs.CL、cs.LG

AI总结 该研究针对大语言模型推理时的输出嵌入内存瓶颈,提出用基于HNSW的向量索引替代稠密词汇投影,在保持生成质量的同时,使Gemma 3 270M的端到端解码吞吐量提升最高达82%。

Comments ICML 2026 - AdaptFM Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28511 2026-08-31 cs.AI 新提交 79%

Training Communication-Efficient Mixture-of-Experts Language Models with Layer Re-Configuration

通过层重配置训练通信高效的混合专家语言模型

Simeng Sun, Roger Waleffe

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 该研究提出CE-MoE模型,通过异构层模式解耦令牌与通道混合深度,在2B至31.5B参数规模下降低训练成本,31.5B时减少33.3%GPU小时数,下游性能与推理效率均提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27857 2026-08-31 cs.AI 新提交 79%

SpikeOPD: Stable On-Policy Distillation for Autoregressive Spiking Language Models

SpikeOPD:自激语言模型的稳定在线策略蒸馏方法

Enqiao Lu, Xingrui Yu, Yiwei Fu, Zhenglin Wan, Pengfei Zhou, Wangbo Zhao, Muqing Jian, Xueyi Zhang, Yang You, Ivor Tsang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Agency for Science, Technology and Research (A*STAR), Singapore(新加坡科技研究局) Nanyang Technological University, Singapore(新加坡南洋理工大学) Peking University(北京大学) National University of Singapore(新加坡国立大学) Rice University(莱斯大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 针对自回归脉冲语言模型的前缀不匹配问题,提出SpikeOPD框架,结合教师校正、策略锚定与分层脉冲正则化,提升不同规模模型的准确率并保留稀疏计算特性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.24696 2026-08-31 cs.LG cs.AI 版本更新 79%

On-policy Distillation with Verifiable Reward

结合可验证奖励的在线蒸馏

Wenze Lin, Jiale Zhao, Xitai Jiang, Songde Rao, Yining Li, Shenzhi Wang, Bingxiang He, Gao Huang

机构 * LeapLab, Tsinghua University(清华大学LeapLab) Beihang University(北京航空航天大学) SMS, Peking University(北京大学SMS) NLPLab, Tsinghua University(清华大学NLPLab)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 本研究提出OPDVR方法,无缝结合OPD与RLVR且不增加超参数,经六个推理基准实验验证其性能优于标准OPD。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.12119 2026-08-31 cs.CV cs.AI cs.CL 版本更新 79%

PRISM: Self-Pruning Intrinsic Selection Method for Training-Free Multimodal Data Selection

PRISM:免训练多模态数据选择的自剪枝内在选择方法

Jinhe Bi, Aniri, Zengjie Jin, Yifan Wang, Danqi Yan, Wenke Huang, Xiaowen Ma, Sikuan Yan, Artur Hecker, Mang Ye, Xun Xiao, Hinrich Schuetze, Volker Tresp, Yunpu Ma

机构 * LMU Munich(慕尼黑大学) Munich Research Center, Huawei Technologies(慕尼黑研究中心,华为技术) METEOR School of Computer Science, Wuhan University(武汉大学计算机学院) Munich Center for Machine Learning(慕尼黑机器学习中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);instruction tuning(abstract);分类 cs.CL、cs.AI

AI总结 针对多模态大语言模型视觉指令数据冗余问题,提出一种免训练框架PRISM,通过隐式重中心化消除视觉特征各向异性导致的全局语义漂移,实现高效数据选择,在降低计算成本的同时提升模型性能。

Comments Accepted to EMNLP 2026 and selected for the ACL 2026 Best Paper Consideration

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28145 2026-08-31 cs.CV 新提交 78%

Dual-Stream Semantic Guidance with Prototype Anchor Calibration for Source-Fully-Free Adaptation of Vision-Language Models

用于视觉语言模型无源域适应的带原型锚定校准的双流语义引导

Weiwei Xiang, Shun Peng, Guangyi Xiao, Hao Chen, Lei Yang

机构 * College of Computer Science and Electronic Engineering, Hunan University(湖南大学计算机与电子工程学院) Huaihua University(怀化学院)

专题命中 效率与部署 :language model(title,abstract)

AI总结 针对无源全自由域适应的双语义漂移问题,提出DSSG框架及带原型锚定校准的DSSG-PAC,在多基准上性能优于SOTA且适配时间降低18.9%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27960 2026-08-31 cs.AI 新提交 77%

When Teacher Guidance Misleads: Reward-Aligned On-Policy Distillation

当教师指导产生误导:奖励对齐的在线策略蒸馏

Siyuan Gan, Yuhan Li, Xiran Wang, Linjian Meng, Boyan Wang, Zhen Zhao, Jing Huo, Yang Gao

机构 * State Key Laboratory of Novel Software Technology, Nanjing University(南京大学现代软件技术国家重点实验室) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI

AI总结 针对在线策略蒸馏中教师指导与结果奖励不一致的问题,提出RA-OPD方法,通过过滤不一致轨迹提升学生模型性能,在7个数学基准和3个代码基准上优于标准OPD及其他变体。

详情

展开后加载摘要…

URL PDF HTML 收藏