arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-02-04 至 2026-02-04 共收录 299 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 73 篇

2602.03051 2026-02-04 cs.CL 85%

SAES-SVD: Self-Adaptive Suppression of Accumulated and Local Errors for SVD-based LLM Compression

SAES-SVD: 自适应抑制累积和局部误差用于基于SVD的LLM压缩

Xing Hu, Dawei Yang, Yuan Cheng, Zhixuan Chen, Zukang Xu

机构 * Houmo AI Nanjing University(南京大学)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 SAES-SVD通过联合优化层内重建和层间误差补偿,有效抑制LLM压缩中的累积和局部误差,提升压缩后性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17360 2026-02-04 cs.DC 85%

Cortex: Achieving Low-Latency, Cost-Efficient Remote Data Access For LLM via Semantic-Aware Knowledge Caching

Cortex: 通过语义感知的知识缓存实现低延迟、低成本的远程数据访问用于大语言模型

Chaoyi Ruan, Chao Bi, Kaiwen Zheng, Ziji Shi, Xinyi Wan, Jialin Li

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 Cortex通过语义感知的知识缓存架构,实现LLM代理在远程数据访问中的低延迟和低成本,提升吞吐量和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03422 2026-02-04 cs.IR 85%

RankSteer: Activation Steering for Pointwise LLM Ranking

RankSteer: 激活引导用于点wise LLM 排序

Yumeng Wang, Catherine Chen, Suzan Verberne

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 RankSteer 通过激活引导框架提升零样本点wise LLM 排序性能,利用三个解耦方向校准排序行为,无需修改模型权重。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03184 2026-02-04 cs.LG cs.CL 84%

DynSplit-KV: Dynamic Semantic Splitting for KVCache Compression in Efficient Long-Context LLM Inference

DynSplit-KV: 动态语义分割用于高效长上下文LLM推理中的KV缓存压缩

Jiancai Ye, Jun Liu, Qingchen Li, Tianlang Zhao, Hanbin Zhang, Jiayi Pan, Ningyi Xu, Guohao Dai

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 DynSplit-KV通过动态语义分割和统一映射策略,提升长上下文LLM推理的准确性与效率,减少内存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02708 2026-02-04 cs.LG cs.AI cs.CL 83%

BinaryPPO: Efficient Policy Optimization for Binary Classification

BinaryPPO:用于二分类任务的高效策略优化

Punya Syon Pandey, Zhijing Jin

机构 * University of Toronto(多伦多大学) Vector Institute(向量研究所) Max Planck Institute for Intelligent Systems, Tübingen, Germany(智能系统马克斯·普朗克研究所)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

AI总结 BinaryPPO通过置信度加权奖励机制提升二分类任务的准确率,优于传统监督微调方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01865 2026-02-04 cs.IR cs.AI 83%

GRAB: An LLM-Inspired Sequence-First Click-Through Rate Prediction Modeling Paradigm

GRAB: 一种受大语言模型启发的序列优先点击通过率预测建模范式

Shaopeng Chen, Chuyue Xie, Huimin Ren, Shaozong Zhang, Han Zhang, Ruobing Cheng, Zhiqiang Cao, Zehao Ju, Yu Gao, Jie Ding, Xiaodong Chen, Xuewu Jiao, Shuanglong Li, Liu Lin

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 GRAB通过引入因果动作感知多通道注意力机制,实现了在点击通过率预测上的性能提升,并在实际部署中实现了更高的收入和CTR。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03742 2026-02-04 cs.CV 82%

Edge-Optimized Vision-Language Models for Underground Infrastructure Assessment

边缘优化的视觉-语言模型用于地下基础设施评估

Johny J. Lopez, Md Meftahul Ferdaus, Mahdi Abdelguerfi

机构 * Canizaro Livingston Gulf States Center for Environmental Informatics(卡尼扎罗利文斯顿海湾州环境信息中心) University of New Orleans(新奥尔良大学)

专题命中 效率与部署 :language model(title,abstract);post-training(abstract)

AI总结 本文提出边缘优化的视觉-语言模型,用于高效生成地下基础设施缺陷的摘要,结合轻量级分割模型与微调VLM,实现资源受限设备上的实时检测与总结。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03358 2026-02-04 cs.AI cs.CL cs.LG 82%

GFlowPO: Generative Flow Network as a Language Model Prompt Optimizer

GFlowPO:生成流网络作为语言模型提示优化器

Junmo Cho, Suhan Kim, Sangjune An, Minsu Kim, Dong Bok Lee, Heejun Lee, Sung Ju Hwang, Hae Beom Lee

机构 * Korea Advanced Institute of Science Korea University Mila -- Qu\'ebec AI Institute

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 GFlowPO通过生成流网络和动态内存更新机制,提升语言模型提示优化的样本效率和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13847 2026-02-04 cs.CL cs.AI cs.LG 82%

DynaSpec: Context-aware Dynamic Speculative Sampling for Large-Vocabulary Language Models

DynaSpec: 一种基于上下文的动态推测采样方法用于大词汇量语言模型

Jinbin Zhang, Nasib Ullah, Erik Schultheis, Rohit Babbar

机构 * Department of Computer Science(计算机科学系) Aalto University(阿alto大学) Deep Algorithms and Systems Lab(深度算法与系统实验室) IST Austria(IST奥地利研究院) University of Bath(巴斯大学)

专题命中 效率与部署 :language model(title);LLM(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 DynaSpec通过动态短名单机制提升大词汇量语言模型的推测解码效率,实现更高的吞吐量和更精确的验证

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22984 2026-02-04 cs.AI cs.CL 81%

From Deferral to Learning: Online In-Context Knowledge Distillation for LLM Cascades

从延迟到学习:在线上下文知识蒸馏用于LLM级联

Yu Wu, Shuo Wu, Ye Tao, Yansong Li, Anand D. Sarwate

机构 * Department of XXX, University of YYY, Location, Country(XXX系,YYY大学,地点,国家) School of ZZZ, Institute of WWW, Location, Country(ZZZ学院,WWW研究所,地点,国家) Department of Electrical and Computer Engineering, Rutgers University, NJ, USA(电气与计算机工程系,Rutgers大学,新泽西州,美国) Computer Engineering Department, University of Illinois Chicago, Illinois, USA(计算机工程系,伊利诺伊大学芝加哥分校,伊利诺伊州,美国)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.CL、cs.AI

AI总结 Inter-Cascade通过在线上下文知识蒸馏提升LLM级联性能,实现弱模型在任务中学习,减少强模型调用并提高整体准确率。

Comments 32 pages, 6 figures, 23 tables, under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21249 2026-02-04 cs.CV cs.AI cs.LG 81%

Decipher-MR: A Vision-Language Foundation Model for 3D MRI Representations

Decipher-MR:一种用于3D MRI表示的视觉-语言基础模型

Zhijian Yang, Noel DSouza, Istvan Megyeri, Xiaojian Xu, Amin Honarmandi Shandiz, Farzin Haddadpour, Krisztian Koos, Laszlo Rusko, Emanuele Valeriano, Bharadwaj Swaninathan, Lei Wu, Parminder Bhatia, Taha Kass-Hout, Erhan Bas

机构 * GE Healthcare(通用电气医疗)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG

AI总结 Decipher-MR是一种专门针对3D MRI的视觉-语言基础模型,通过自监督学习和报告引导的文本监督,实现对多种医学任务的高效支持。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.12728 2026-02-04 cs.CV cs.MM 80%

SpecFLASH: A Latent-Guided Semi-autoregressive Speculative Decoding Framework for Efficient Multimodal Generation

SpecFLASH: 一种基于潜在引导的半自回归推测解码框架,用于高效多模态生成

Zihua Wang, Ruibo Li, Haozhe Du, Joey Tianyi Zhou, Yu Zhang, Xu Yang

机构 * Southeast University, Nanjing, China(东南大学) Nanyang Technological University, Singapore(南洋理工大学) A STAR Centre for Frontier AI Research (CFAR), Singapore(A STAR前沿人工智能研究中心)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);instruction tuning(abstract)

AI总结 SpecFLASH是一种针对多模态生成的高效推测解码框架,通过潜在引导的token压缩和半自回归解码方案,显著提升视觉任务的解码速度。

Comments Under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03537 2026-02-04 cs.LG 79%

MatGPTQ: Accurate and Efficient Post-Training Matryoshka Quantization

MatGPTQ:准确且高效的后训练Matryoshka量化

Maximilian Kleinegger, Elvir Crnčević, Dan Alistarh

机构 * Vienna University of Technology, Vienna, Austria Institute of Science \& Technology Austria (ISTA), Vienna, Austria

专题命中 效率与部署 :post-training(title,abstract);分类 cs.LG

AI总结 MatGPTQ通过单次训练生成多精度模型,提升低比特精度下的性能,实现高效且准确的后训练量化。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03529 2026-02-04 cs.NI cs.AI cs.MM 79%

Morphe: High-Fidelity Generative Video Streaming with Vision Foundation Model

Morphe: 基于视觉基础模型的高保真生成视频流媒体

Tianyi Gong, Zijian Cao, Zixing Zhang, Jiangkai Wu, Xinggong Zhang, Shuguang Cui, Fangxin Wang

机构 * School of Science and Engineering, The Chinese University of Hong Kong, Shenzhen(科学与工程学院,香港中文大学(深圳)) Shenzhen Future Network of Intelligence Institute(深圳未来网络智能研究院) Wangxuan Institute of Computer Technology, Peking University(王轩计算机技术研究所,北京大学)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 Morphe基于视觉基础模型,通过联合训练和智能分组丢弃技术,实现高保真度、低带宽的实时视频流媒体传输。

Comments Accepted by NSDI 2026 Fall

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22926 2026-02-04 cs.LG 79%

Simple Denoising Diffusion Language Models

简单去噪扩散语言模型

Huaisheng Zhu, Zhengyu Chen, Shijie Zhou, Zhihui Xie, Yige Yuan, Shiqi Chen, Zhimeng Guo, Siyuan Xu, Hangfan Zhang, Vasant Honavar, Teng Xiao

机构 * Penn State University(宾夕法尼亚州立大学) University at Buffalo(布法罗大学) University of Washington(华盛顿大学) The University of Hong Kong(香港大学) City University of Hong Kong(城市大学) Alibaba Group(阿里巴巴集团) Allen Institute for AI (AI2)(人工智能研究所(AI2))

专题命中 效率与部署 :language model(title);pretraining(abstract);分类 cs.LG

AI总结 本文提出了一种简化且改进的去噪损失公式,用于均匀状态扩散模型,以提高训练稳定性与效率,并在大规模模型上展示了良好的扩展性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03134 2026-02-04 cs.CV cs.AI 79%

SwiftVLM: Efficient Vision-Language Model Inference via Cross-Layer Token Bypass

SwiftVLM: 通过跨层令牌绕过实现高效的视觉-语言模型推理

Chen Qian, Xinran Yu, Danyang Li, Guoxuan Chi, Zheng Yang, Qiang Ma, Xin Miao

机构 * Tsinghua University, Beijing, China(清华大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.AI

AI总结 SwiftVLM通过跨层令牌绕过方法,在视觉-语言模型中实现高效的推理,优于现有修剪策略,提升准确率与效率的平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03119 2026-02-04 cs.LG eess.SP 79%

Function-Space Empirical Bayes Regularisation with Large Vision-Language Model Priors

函数空间经验贝叶斯正则化与大视觉-语言模型先验

Pengcheng Hao, Huaze Tang, Ercan Engin Kuruoglu, Wenbo Ding

机构 * Institute of Data and Information, Tsinghua Shenzhen International Graduate School, Shenzhen, China(数据与信息研究所,清华大学深圳国际研究生院,深圳,中国)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 本文提出VLM-FS-EB框架,利用大视觉-语言模型生成语义上下文点,构建高效功能先验,提升预测性能和不确定性估计,尤其在异常检测和数据稀缺场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.19402 2026-02-04 cs.AI 79%

PROTEUS: SLA-Aware Routing via Lagrangian RL for Multi-LLM Serving Systems

PROTEUS:通过拉格朗日强化学习实现多LLM服务系统的SLA感知路由

Amit Singh Bhatti, Vishal Vaddina, Dagnachew Birru

机构 * Phi Labs(Phi实验室) Quantiphi(Quantiphi公司) Boston, USA(美国波士顿)

专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI

AI总结 PROTEUS通过拉格朗日强化学习实现多LLM服务系统的SLA感知路由,能够根据运行时指定的准确性目标动态调整路由决策,显著提升准确性和成本效率。

Comments Submitted to EuroMLSys26

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02862 2026-02-04 cs.AI cs.LG 79%

STEER: Inference-Time Risk Control via Constrained Quality-Diversity Search

STEER: 通过受约束的质量多样性搜索实现推理时间的风险控制

Eric Yang, Jong Ha Lee, Jonathan Amar, Elissa Ye, Yugang Jia

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 STEER通过受约束的质量多样性搜索实现推理时间的风险控制,提供可调节的决策保守性调整,提升临床分诊等场景下的行为覆盖和准确性。

Comments 20 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02581 2026-02-04 cs.LG cs.AI 79%

QuantLRM: Quantization of Large Reasoning Models via Fine-Tuning Signals

QuantLRM:通过微调信号对大推理模型进行量化

Nan Zhang, Eugene Kwek, Yusen Zhang, Muyu Pan, Suhang Wang, Prasenjit Mitra, Rui Zhang

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Carnegie Mellon University Africa(卡内基梅隆大学非洲分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI、cs.LG

AI总结 QuantLRM通过微调信号对大推理模型进行量化,通过拟合二次函数保护两端,提升量化效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02548 2026-02-04 cs.LG cs.AI cs.CV cs.MA 79%

ToolTok: Tool Tokenization for Efficient and Generalizable GUI Agents

ToolTok: 为高效且通用的GUI代理的工具标记化

Xiaoce Wang, Guibin Zhang, Junzhe Li, Jinzhe Tu, Chun Li, Ming Li

机构 * Department of Computer Science, Tsinghua University, Beijing, China(清华大学计算机科学系) Guangming Laboratory, Shenzhen, China(光明实验室) National University of Singapore, Singapore(新加坡国立大学) Peking University, Beijing, China(北京大学) MSU-BIT-SMBU Joint Research Center of Applied Mathematics, Shenzhen MSU–BIT University(MSU-BIT-SMBU应用数学联合研究中心)

专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.AI、cs.LG

AI总结 ToolTok通过多步路径寻找范式,利用语义锚定机制和易到难课程,实现高效且通用的GUI代理,以较少数据获得优异性能。

Comments 8 pages main paper, 18 pages total, 8 figures, 5 tables, code at https://github.com/ZephinueCode/ToolTok

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00003 2026-02-04 cs.IR cs.AI cs.LG 79%

Orchestrating Heterogeneous Experts: A Scalable MoE Framework with Anisotropy-Preserving Fusion

协调异质专家:一种具有各向异性保持融合的可扩展MoE框架

Ye Liu, Xu Chen, Wuji Chen, Mang Li

机构 * Institute of Intelligent Technology, Alibaba International Digital Commerce Group(智能技术研究所,阿里巴巴国际数字商务集团)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出一种可扩展的MoE框架,通过协调异质专家并保持各向异性融合,提升跨境电子商务搜索相关性建模性能。

Comments 4 pages, 2 figures. Accepted at the Workshop on TIME of the ACM Web Conference 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.20041 2026-02-04 cs.LG cs.AI 79%

CiMRAG: CiM-Aware Domain-Adaptive and Noise-Resilient Retrieval-Augmented Generation for Edge-Based LLMs

CiMRAG: 面向边缘LLM的意识域自适应与噪声鲁棒检索增强生成

Shih-Hsuan Chiu, Ming-Syan Chen

机构 * National Taiwan University(国立台湾大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CiMRAG通过TONEL框架提升边缘LLM在噪声环境下的检索准确性和域适应性。

Comments Accepted by ICASSP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.09369 2026-02-04 cs.LG cs.CL 79%

Encoder-Free Knowledge-Graph Reasoning with LLMs via Hyperdimensional Path Retrieval

无需编码器的知识图谱推理:通过超维路径检索实现LLM

Yezi Liu, William Youngwoo Chung, Hanning Chen, Calvin Yeung, Mohsen Imani

机构 * University of California, Irvine(加州大学 Irvine 分校)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 PathHD通过超维路径检索实现无需编码器的知识图谱推理,提升效率与可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03510 2026-02-04 cs.CV 78%

Semantic Routing: Exploring Multi-Layer LLM Feature Weighting for Diffusion Transformers

语义路由:探索多层LLM特征加权用于扩散变换器

Bozhou Li, Yushuo Guan, Haolin Li, Bohan Zeng, Yiyan Ji, Yue Ding, Pengfei Wan, Kun Gai, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) Nanjing University(南京大学) Fudan University(复旦大学)

专题命中 效率与部署 :LLM(title,abstract)

AI总结 本文提出深度-wise语义路由方法,通过多层LLM特征加权提升文本到图像生成的准确性与稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03472 2026-02-04 cs.CV 78%

Inlier-Centric Post-Training Quantization for Object Detection Models

以内点为中心的后训练量化方法用于目标检测模型

Minsu Kim, Dongyeun Lee, Jaemyung Yu, Jiwan Hur, Giseop Kim, Junmo Kim

机构 * KAIST(韩国科学技术院) NAVER AI Lab.(NAVER人工智能实验室) DGIST(韩国科学技术院)

专题命中 效率与部署 :post-training(title,abstract)

AI总结 InlierQ通过梯度感知的体积显著性分数分离异常和信息性内点,实现目标检测模型的高效量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08150 2026-02-04 cs.IR 78%

DiffuGR: Generative Document Retrieval with Diffusion Language Models

DiffuGR:基于扩散语言模型的生成性文档检索

Xinpeng Zhao, Zhaochun Ren, Yukun Zhao, Zhenyang Li, Mengqi Zhang, Jun Feng, Ran Chen, Ying Zhou, Zhumin Chen, Shuaiqiang Wang, Dawei Yin, Xin Xin

专题命中 效率与部署 :language model(title,abstract)

AI总结 DiffuGR通过扩散语言模型实现生成性文档检索,解决DocID生成与自然语言生成不匹配及效率与准确性权衡问题,提升检索性能与灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01709 2026-02-04 cs.CL 77%

ARTIS: Agentic Risk-Aware Test-Time Scaling via Iterative Simulation

ARTIS: 通过迭代模拟实现代理风险感知的测试时间扩展

Xingshan Zeng, Lingzhi Wang, Weiwen Liu, Liangyou Li, Yasheng Wang, Lifeng Shang, Xin Jiang, Qun Liu

机构 * Huawei Technologies Co., Ltd(华为技术有限公司) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 ARTIS通过迭代模拟提升代理在高风险环境中的可靠性和鲁棒性,采用风险感知的模拟器改进决策效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.03782 2026-02-04 cs.CV cs.RO 75%

QVLA: Not All Channels Are Equal in Vision-Language-Action Model's Quantization

QVLA:视觉-语言-动作模型量化中并非所有通道都平等

Yuhao Xu, Yantai Yang, Zhenyang Fan, Yufan Liu, Yuming Li, Bing Li, Zhipeng Zhang

机构 * AutoLab, School of Artificial Intelligence, Shanghai Jiao Tong University(自动化实验室,人工智能学院,上海交通大学) Anyverse Dynamics State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Terminal Technology Department, Alipay, Ant Group(终端技术部,蚂蚁集团)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 QVLA提出了一种动作导向的量化框架,通过按通道分配比特数来优化视觉-语言-动作模型的压缩,实现了更高的性能和效率。

Comments ICLR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.18795 2026-02-04 cs.LG cs.AI cs.CL 75%

Reuse your FLOPs: Scaling RL on Hard Problems by Conditioning on Very Off-Policy Prefixes

重用FLOPs:通过条件化非常离策略前缀来扩展RL在困难问题上的应用

Amrith Setlur, Zijian Wang, Andrew Cohen, Paria Rashidinejad, Sang Michael Xie

机构 * Meta Carnegie Mellon University(卡内基梅隆大学) University of Southern California(南加州大学)

专题命中 效率与部署 :LLM(abstract);SFT(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 通过条件化离策略前缀提升RL在困难问题上的学习效率,实现更快的训练奖励和更高的最终奖励。

详情

展开后加载摘要…

URL PDF HTML 收藏