arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2145 篇

2608.01428 2026-08-04 cs.RO cs.AI cs.LG 新提交 73%

When Replanning Becomes the Bottleneck: Budgeted Replanning for Embodied Agents

当重规划成为瓶颈:具身智能体的预算型重规划

Shuaijun Liu, Feiyang You, Xingwei Chen, Ningxin Su

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对具身智能体重规划延迟超标的瓶颈问题,提出搭载E-RECAP渐进式token剪枝方法的BRACE控制器,通过预算控制循环减少token消耗、降低SLO违反率,在多平台任务中提升了重规划的实时性与成功率。

Comments 20 pages total: 9 pages main text, 3 pages references, and 8 pages appendix; 18 figures and 32 tables. Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00175 2026-08-04 cs.LG cs.AI 新提交 73%

Inference-Time Policy Alignment for Fair Reinforcement Learning

用于公平强化学习的推理时策略对齐

Umer Siddique, Peilang Li, Conor Wallace, Yongcan Cao

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究提出乘法策略塑造框架,在不更新预训练RL策略参数的情况下,于推理时提升公平性,同时保留核心任务性能,适用于各类深度RL智能体。

Comments Accepted at the Reinforcement Learning Conference (RLC) 2026. 13 pages main + appendix, 5 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00146 2026-08-04 cs.CL cs.AI 新提交 73%

DiffusionGemma Technical Report

DiffusionGemma 技术报告

DiffusionGemma Team, Adrien Ali Taïga, James Assiene, Daniele Calandriello, Rahma Chaabouni, João Gante, Tamara von Glehn, Nate Keating, Chris Knutsen, Martin Kukla, Tianlin Liu, Ivan Lobov, Ofir Nabati, João Gabriel Oliveira, Nicolas Perez-Nieves, Nastasia Prutianova, Bobak Shahriari, Jean Tarbouriech, Pavel Tyletski, Çağlar Ünlü, Cindy Wu, Glenn Cameron, Jerome Connor, Sertan Girgin, Maarten Grootendorst, Alon Levkovitch, Eliya Nachmani, Omar Sanseviero, Piotr Stanczyk, Quentin Berthet, Andrew Campbell, Clément Crepy, Valentin De Bortoli, Arnaud Doucet, Romuald Elie, Alexandre Galashov, Klaus Greff, Alexis Jacq, David Ruhe, Yu-Han Wu, Sebastian Flennerhag, Brendan O'Donoghue, George Scrivener, Shantanu Thakoor

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出开放权重语言模型 DiffusionGemma,通过并行优化 256 个 token 块规避 AR 模型顺序解码瓶颈,经两阶段微调后实现 1500 token/秒生成速度,性能优于带推测解码的 AR 模型,还支持多模态等功能并为混合解码提供方向。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00059 2026-08-04 cs.CL cs.AI 新提交 73%

Neural Circuit Function Inference with LLMs

基于大型语言模型的神经环路功能推断

Yijie Yin, Albert Cardona

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 该研究提出LLantia方法,结合连接组与文献,分层推断神经环路及细胞类型功能,以果蝇大脑为对象验证方法,为神经环路研究提供支撑。

Comments 26 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28405 2026-07-31 cs.AI cs.LG 新提交 73%

QuantWAMs: Calibrating at the Right Granularity for World Action Models

QuantWAMs:为世界动作模型校准至合适粒度

Jiacheng Zhou, Jinfan Lv, Ruixuan Li, Longtai Zhang, Yan Wang, Wenqiang Zhang, Lizhe Qi

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) School of Data Science and Engineering, East China Normal University(华东师范大学数据科学与工程学院)

专题命中 效率与部署 :post-training(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 本文提出QuantWAMs框架,通过三种校准策略优化后训练量化,在WAMs上实现内存大幅降低与速度提升,同时保持与FP16接近的性能,验证了部署可行性。

Comments 13 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28022 2026-07-31 cs.LG cs.AI 新提交 73%

Flux-OPD: On-Policy Distillation with Evolving Contexts

Flux-OPD:基于演化上下文的在线策略蒸馏

Yuran Wang, Zekun Wang, Bohan Zeng, Ruixu Zhang, Wenxuan Liu, Liu Yang, Yifan Dai, Yang Shi, Bozhou Li, Chengzhuo Tong, Daili Hua, Yuanxing Zhang, Wentao Zhang

机构 * Peking University(北京大学) Kling Team(KLING团队) Tsinghua University(清华大学) Shanghai Jiao Tong University(上海交通大学) Zhongguancun Academy(中关村学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 该研究针对开放域大语言模型训练缺乏可验证奖励的问题,提出Flux-OPD范式,利用演化上下文作为监督,通过分解反向KL目标优化,在开放域任务上性能优于现有OPD范式。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22961 2026-07-28 cs.LG cs.CL 新提交 73%

Verbalized Particle Posterior: Bayesian Inference over Natural Language Hypotheses

语言化粒子后验:对自然语言假设的贝叶斯推断

Yan Zhang, Shikan Lian, Shibo Li

机构 * Florida State University(佛罗里达州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.LG

AI总结 研究针对语言化机器学习无不确定性度量等问题,提出语言化粒子后验方法,通过维护自然语言假设粒子并更新预测,在回归等基准测试中表现优于单个VML运行,能消除灾难性单运行失败,且后验可检查。

Comments 26 pages, 10 tables, 2 algorithms; includes appendices

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20791 2026-07-24 cs.AI cs.CL 新提交 73%

Refusal-Gated Decoding: Preserving Refusal Behavior Under High-Temperature Sampling

拒绝门控解码:在高温采样下保留拒绝行为

Phillip Howard, Xin Su, Allen Roush, Manikandan Ravikiran, Amir Abdullah

机构 * Thoughtworks

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI

AI总结 研究高温采样下大语言模型拒绝行为受温度影响的问题,提出顺序解码方法,能在高温时保留模型贪婪解码拒绝响应且延迟小,经实验在三个基准数据集上保留91 - 99%的拒绝行为,不影响安全提示高温响应。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20467 2026-07-24 cs.AI cs.LG 新提交 73%

DC-Leap: Training-Free Acceleration of dLLMs via Draft-Guided Contiguous Leaping Decoding

DC-Leap:通过草稿引导的连续跳跃解码实现无训练的dLLMs加速

Yanhua Jiao, Tianyi Wu, Xiaoxi Sun, Yulin Li, HuiLing Zhen, Libo Qin, Baotian Hu, Zhuotao Tian, Min Zhang

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) Huawei Noah’s Ark Lab(华为诺亚方舟实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对dLLMs并行解码中因保守置信阈值致效率低的问题,提出DC-Leap框架。其采用动态连续验证策略消除JPDE,结合草稿引导解码机制。实验表明该框架能大幅加速dLLMs,长序列生成加速显著,且保证生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.20434 2026-07-24 cs.CL cs.AI 新提交 73%

Break Through the Compression Bottleneck: From Theory to Practice

突破压缩瓶颈:从理论到实践

Xiusheng Huang, Lu Wang, Yequan Wang, Jun Zhao, Kang Liu

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究语言模型压缩瓶颈问题,通过数学证明和实验验证低秩分解与量化非正交,组合会致性能降,进而提出对角粘合方法(DAM),可有效结合二者并减轻性能损失,为相关研究奠定基础。

Comments 18 pages, 3 figures,

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19353 2026-07-23 cs.AI cs.LG 新提交 73%

Benchmarking Confidential GPU Inference on NVIDIA H100 under Intel TDX

在英特尔 TDX 下对 NVIDIA H100 上的机密 GPU 推理进行基准测试

Wei Wang, Abdul Hyee Waqas, Burns Smith

机构 * Mozilla

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究在英特尔 TDX 下 NVIDIA H100 GPU 上,比较标准与机密计算模式对语言模型推理的影响。通过两个模型实验,测量多项指标,发现机密模式会使首次令牌时间增加、全局令牌吞吐量下降,较大模型更早饱和,为容量规划提供参考。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19223 2026-07-22 cs.LG cs.CL 新提交 73%

AdaFlash: Adaptive Speculative Decoding via On-Policy Distilled Diffusion Drafters

AdaFlash:通过策略蒸馏扩散草稿器实现自适应推测解码

Yu-Yang Qian, Hao-Cong Wu, Chen Chen, Jiacheng Sun, Zhenhua Dong, Peng Zhao, Zhi-Hua Zhou

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) Huawei Foundation Model Dept(华为基础模型部)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 研究针对扩散草稿器在推测解码中存在的问题,提出AdaFlash框架,包含基于策略蒸馏算法和自适应长度头,有效降低方差,实验证明该框架能提高推理速度,尤其在高并发场景中吞吐量显著提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17283 2026-07-21 cs.AI cs.LG 新提交 73%

Lossless but Not Free: An Empirical Anatomy of Speculative Decoding on Consumer Hardware

无损但不免费:消费级硬件上推测性解码的实证剖析

Param Chordiya

机构 * University of California, San Diego(加利福尼亚大学圣地亚哥分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型单流自回归解码受内存带宽限制问题,核心方法是推测性解码,通过小草稿模型与目标模型配合及拒绝采样规则重构计算。在苹果硅笔记本上实证研究五种配置,验证分布等效性,揭示加速与减速原因,表明该方法在特定条件下才有效。

Comments 15 pages, 5 figures, 4 tables. Code, benchmark harness, and all result artifacts: https://github.com/ParamChordiya/speculative_decoding_engine

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16248 2026-07-21 cs.LG cs.AI 新提交 73%

High-accuracy Low-Bit KV-Cache Quantization via Local Distribution Restoration

通过局部分布恢复实现高精度低比特 KV 缓存量化

Gradwell Dzikanyanga, Yanqi Pan, Weihao Yang, Donglei Wu, Wen Xia, Hao Huang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究长上下文大语言模型推理中 KV 缓存量化问题,提出局部分布恢复技术,实现 DGAP。该技术可检测高风险步骤并恢复 top-K 候选分布,实验证明在 Llama-3.1-8B 等模型上能提升准确率、降低分布漂移,保持低比特缓存占用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16246 2026-07-21 cs.LG cs.AI 新提交 73%

Let the Data Decide: Supervision Analysis, Capability Trade-offs, and Adaptive Objective Routing in Continued Pre-Training via Off-Policy Distillation

让数据决定:通过离策略蒸馏进行持续预训练中的监督分析、能力权衡和自适应目标路由

Jiangan Yuan, Zhixuan Li, Han Xu

机构 * Baidu Inc.(百度公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究离策略蒸馏中训练数据、目标参数化和模型能力的相互作用,通过分解问题进行“目标到能力”和“数据到目标”分析,引入诊断指标量化张力,探讨自适应目标路由,表明有效路由取决于信号质量,将持续预训练重构为监督设计问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.15161 2026-07-17 cs.LG cs.CL 新提交 73%

On-Policy Delta Distillation

策略内增量蒸馏

Byeongho Heo, Jaehui Hwang, Sangdoo Yun, Dongyoon Han

机构 * NAVER AI Lab(NAVER人工智能实验室)

专题命中 效率与部署 :instruction tuning(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究基于策略内蒸馏,引入新的增量信号作为蒸馏奖励,提出策略内增量蒸馏方法。实验表明该方法能显著改进策略内蒸馏,使推理语言模型在短训练期内表现出色,优于传统方法。

Comments 19 pages, 4 figures, 12 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14506 2026-07-17 cs.LG cs.AI 新提交 73%

Non-vacuous Generalization Bounds for Reinforcement Learning with Verifiable Rewards

具有可验证奖励的强化学习的非空泛化界限

Yuxuan Zhu, Rohan Alur, Daniel Kang

机构 * UIUC(伊利诺伊大学厄巴纳 - 香槟分校) MIT(麻省理工学院) Bridgewater AIA Labs(布里奇沃特人工智能实验室)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对具有可验证奖励的强化学习在十亿参数规模下泛化性差的问题,通过将PAC-贝叶斯压缩界限与Gumbel-max重参数化技巧结合,并提出渐进式RLVR框架,在多领域建立非空泛化界限,性能优于基础模型且接近微调模型。

Comments 22 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14107 2026-07-17 cs.CL cs.AI 新提交 73%

Polestar: Drift-Aware Cache Calibration and Token Commitment for Efficient Inference of Diffusion LLMs

北极星:用于扩散语言模型高效推理的漂移感知缓存校准和令牌承诺

Mingyu Lee, Akshat Ramachandran, Souvik Kundu, Tushar Krishna

机构 * Georgia Institute of Technology(佐治亚理工学院) Intel AI Group(英特尔人工智能集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对扩散语言模型推理效率受双向注意力和静态阈值影响的问题,提出北极星框架,利用令牌表示漂移信号,由北极星缓存和北极星提交两组件构成,大幅提升了模型在准确性-吞吐量方面的表现及解码并行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13399 2026-07-16 cs.CL cs.LG 新提交 73%

Demystifying On-Policy Distillation: Roles, Pathologies, and Regulations

揭开在线策略蒸馏的神秘面纱:作用、问题及调控

Rui Wang, Hongru Wang, Yi Chen, Boyang Xue, Tianqing Fang, Wenhao Yu, Kam-Fai Wong

机构 * The Chinese University of Hong Kong(香港中文大学) Tencent AI Lab(腾讯人工智能实验室)

专题命中 效率与部署 :LLM(abstract);post-training(abstract);分类 cs.CL、cs.LG

AI总结 研究在线策略蒸馏的作用、问题及调控,阐明其为探索催化剂,揭示师生不匹配和长度利用问题,提出优势裁剪和对数尺度压缩调控,实验表明良好调控的信号质量决定OPD中成功探索。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13078 2026-07-16 cs.CR cs.AI cs.LG 新提交 73%

Operational Evidence Gaps for LLMs in Fraud Detection and Trust-and-Safety Workflows

大语言模型在欺诈检测和信任与安全工作流程中的操作证据差距

Keyur Gabani

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 研究LLMs用于欺诈检测等信任与安全工作流程时的操作证据差距。通过对相关操作源编码调查发现证据失衡,欺诈任务部分大但缺乏关键证据。贡献了FORTE框架和部署证据清单,确定支持LLMs部署所需研究。

Comments 22 pages, 3 figures, 6 tables. Ancillary files include the evidence matrix, search note, and numeric claim check

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.12696 2026-07-15 cs.CL cs.AI cs.DC 新提交 73%

Less Experts, Faster Decoding: Cost-Aware Speculative Decoding for Mixture-of-Experts

更少专家,更快解码:用于专家混合模型的成本感知推测解码

Jincheng Xie, Runheng Liu, Heyan Huang, Yawen Ling, Hanbin Dai, Yu Zheng, Wen Hu

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究针对大规模专家混合模型推理效率受专家激活模式影响的问题,提出成本感知推测解码框架EcoSpec,通过纳入预测的边际专家激活成本进行草稿选择,在多个模型和基准测试中减少活跃专家足迹、提高解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.11399 2026-07-14 cs.CL cs.AI 新提交 73%

Agentic Routing: The Harness-Native Data Flywheel

智能体路由:原生执行框架的数据飞轮

Xinchen Liu, Hang Zhou, Yingjie Zong, Yuchuan Tian, Liuyang Song, Shuo Zhang, Yulong Li, Wei He, Mengyu Zheng, Runke Liu, Siyang Cheng, Xiang Kuang, Hailin Hu, Kai Han, Yunhe Wang

机构 * TokenRhythm Technologies(TokenRhythm科技公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究大型语言模型智能体中模型选择问题,提出原生执行框架智能体路由范式,依执行框架状态选模型,其决策产生的数据记录形成数据飞轮,经实例化验证,表明该路由不仅控成本,更是智能体训练的数据引擎。

Comments Code: https://github.com/opensquilla/opensquilla

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10803 2026-07-14 cs.LG cs.AI 新提交 73%

Weight-Adjusted Gradients Reveal Parameter Importance and Failure Modes in LLMs

权重调整梯度揭示大语言模型中的参数重要性和失效模式

Shrestha Datta, Hongfu Liu, Anshuman Chhabra

机构 * University of South Florida(南佛罗里达大学) Brandeis University(布兰迪斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究大语言模型中参数重要性,提出权重调整梯度(WAG)方法,通过捕捉权重与梯度相互作用识别关键参数,揭示新的相互作用关系,展示其在多应用中的效用,为模型分析、调试和控制提供统一方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09936 2026-07-14 cs.LG cs.AI cs.CR 新提交 73%

SMETA-ZSL:Semantic Meta-Alignment for Zero-Shot Threat Classification

SMETA-ZSL:用于零样本威胁分类的语义元对齐

Ivan Alejandro Montoya Sanchez, Anantaa Kotal, Aritran Piplai

机构 * The University of Texas at El Paso(德克萨斯大学艾尔帕索分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对网络安全新威胁无标注数据问题,提出SMETA-ZSL方法,通过对比微调、情景元学习和知识蒸馏等,从重叠语言描述学习语义原型并对齐行为特征,实现跨可见-未见类别的泛化,在7个基准测试中性能远超先前方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.09791 2026-07-14 cs.LG cs.CL 新提交 73%

Gauge dependence and structured-output corruption in sign-branched repetition penalties: measurements across models, inference stacks, and alternative repetition controls

符号分支重复惩罚中的规范依赖性和结构化输出损坏:跨模型、推理堆栈和替代重复控制的测量

Peter Hollows

专题命中 效率与部署 :LLM(abstract);RLHF(abstract);分类 cs.CL、cs.LG

AI总结 研究符号分支重复惩罚中规范依赖性和结构化输出损坏问题,发现其惩罚定义不明确且损坏输出,将惩罚应用于归一化对数概率可消除这些问题,给出了相关机制、测量及归一化变体。

Comments 8 pages, 2 figures, 4 tables. Code, data, per-stack survey and git genealogy: https://github.com/captainpete/repetition-penalty-gauge

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08779 2026-07-13 cs.LG cs.AI 新提交 73%

Signed Symmetric Quantization for Few-Bit Integers

用于少比特整数的带符号对称量化

Ian Colbert, Eashan Dash, Pablo Monteagudo-Lago, Juan Amboage, Srinidhi N, Giuseppe Franco, Nicholas J. Fraser, Arun Ramachandran

机构 * AMD(超威半导体公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究少比特整数量化问题,提出带符号对称量化方法,通过有原则的符号选择规则放置额外可表示值,保持对称量化运行时特征,理论分析其在量化误差上有条件最优,实证验证在模型上有效果提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08690 2026-07-10 cs.LG cs.AI 新提交 73%

A Practical Investigation of Training-free Relaxed Speculative Decoding

无训练的松弛推测解码的实践研究

Guoxuan Xia, Luka Ribar, Paul Balanca

机构 * Graphcore(Graphcore公司)

专题命中 效率与部署 :LLM(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究无训练的松弛推测解码技术,统一现有方法于共享框架,在当代环境下基准测试,发现松弛需大量能力评估,且许多方法依赖良好语言模型作为起草器,不适用于轻量级专用多令牌预测起草器。

Comments preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.10358 2026-07-10 cs.LG cs.AI 新提交 73%

KG-SoftMAP: Soft Knowledge-Graph Priors for Bayesian Network Structure Learning from Sparse Discrete Data

KG-SoftMAP: 基于软知识图谱先验的稀疏离散数据贝叶斯网络结构学习

Guoliang Xu, James E. Corter

机构 * Columbia University(哥伦比亚大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI、cs.LG

AI总结 针对稀疏离散数据中贝叶斯网络结构学习困难的问题,提出KG-SoftMAP方法,将加权有向知识图谱编码为软先验,结合BDeu评分与logit形式先验最大化MAP目标,在合成与真实数据上显著提升结构恢复性能。

Comments 12 pages, 2 figures, 4 tables; includes a 24-page technical supplement

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05541 2026-07-08 cs.LG cs.AI 新提交 73%

Self-Review Reinforcement Learning (SRRL) with Cross-Episode Memory and Policy Distillation

具有跨情节记忆和策略蒸馏的自我审查强化学习

Muhammad Zain Amin, Kibele Sebnem Yildirim

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究针对强化学习中环境反馈稀疏或延迟问题,提出自我审查强化学习框架,通过策略梯度优化自我审查,经选择性蒸馏内化改进到基础策略,用跨情节记忆保留成功审查,在GSM8K基准上评估,该框架优于基线且学习效率更高。

Comments 9 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.05399 2026-07-08 cs.CL cs.AI cs.DC 新提交 73%

Benchmarking KV-Cache Optimizations across Task Quality and System Performance for Long-Context Serving

针对长上下文服务,跨任务质量和系统性能对KV缓存优化进行基准测试

Nikita Agrawal, Ruben Mayer

机构 * University of Bayreuth(拜罗伊特大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 研究长上下文服务中KV缓存优化,通过工作负载感知基准评估多种优化机制,测量多项指标。发现仅压缩率不能预测性能,不同机制表现各异,为长上下文服务系统提供工作负载感知的KV缓存机制选择及部署指导。

详情

展开后加载摘要…

URL PDF HTML 收藏