arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-31 至 2026-08-31 共收录 351 信号源:cs.CL, cs.AI, cs.LG

1. 评测与基准 75 篇

2509.04438 2026-08-31 cs.CV cs.CL 版本更新 57%

The Telephone Game: Evaluating Semantic Drift in Unified Models

电话游戏:评估统一模型中的语义漂移

Sabbir Mollah, Rohit Gupta, Sirnam Swetha, Qingyang Liu, Ahnaf Munir, Mubarak Shah

机构 * Center For Research in Computer Vision, University of Central Florida, USA(计算机视觉研究中心,中央佛罗里达大学)

专题命中 评测与基准 :language model(abstract);分类 cs.CL

AI总结 该研究提出语义漂移协议(SDP)等方法,评估统一模型在交替执行图像-文本理解与生成时的语义漂移,发现现有孤立基准无法预测模型的多轮表现,为统一模型可靠性评估提供了更准确的方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28453 2026-08-31 cs.CV 新提交 50%

Prompt-Guided Interactive Segmentation of Interstitial Lung Disease in Thoracic CT

基于提示引导的胸部CT中间质性肺疾病交互式分割

Vasilis Dedousis, Lubnaa Abdur Rahman, Lorenzo Brigatο, Ethan Dack, Andreas Christe, Christoph Frank, Manuela Funke-Chambour, Justus Roos, Adrian Huber, Lukas Ebner, Stavroula Mougiakakou

机构 * University of Bern(伯尔尼大学) Graduate School for Cellular and Biomedical Sciences(细胞与生物医学科学研究生院) Bern University Hospital(伯尔尼大学医院) Lucern Cantonal Hospital(卢塞恩州立医院) Lausanne University Hospital (CHUV) and University of Lausanne(洛桑大学医院(CHUV)与洛桑大学)

专题命中 评测与基准 :foundation model(abstract)

AI总结 本研究首次将MedSAM2适配到胸部CT的3D ILD交互式分割任务,经实验验证全模型微调结合BBox等提示可提升分割性能,还提出了基于自动分割先验与放射科医生提示的端到端工作流程。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28244 2026-08-31 hep-ph 新提交 50%

HEPLocalAgent 1.0: Running Collider Simulations from Plain-Language Requests on Your Own Computer

HEPLocalAgent 1.0:在本地计算机上基于纯文本请求运行对撞机模拟

Aadarsh Singh, Sudhir K. Vempati

专题命中 评测与基准 :language model(abstract)

AI总结 该研究提出开源本地界面HEPLocalAgent 1.0,可从自然语言请求构建对撞机模拟工作流,经测试其在47个案例中部分指标表现良好,需专家批准而非自主运行。

Comments 24 pages, 9 tables, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26866 2026-08-31 cs.CV 版本更新 50%

Order Matters: A Chinese Multi-Panel Meme Benchmark for Vision-Language Reasoning

顺序很重要:面向视觉-语言推理的中文多面板梗图基准

Haihan Li, Haihao Li, Zhenfei Xu, Jize Qian, Yubo Xie

机构 * Shanghai Maritime University(上海海事大学) Dalian Maritime University(大连海事大学)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究推出中文多面板梗图基准CMPM,评估大型视觉-语言模型对梗图的顺序感知推理能力,发现模型在打乱顺序时准确率大幅下降,Gemini 3.1 Pro和GPT-5.5表现优于开源模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25434 2026-08-31 cs.IR 版本更新 50%

DocPC: Document-Level Visual Retrieval via Representative Page Composition

DocPC:基于代表性页面组合的文档级视觉检索

Chengsong You, Qiyi Jiang, Junwei Zhou, Xiaoyu Cao, Weiyao Wang, Yiwei Xu, Ziyan Zhao, Zhen Sun, Qicheng Zhu, Xuanyi Fu, Yufan Chen, Yilun Li, Rongkang Xiong, Yunhai Hu, Nan Du

专题命中 评测与基准 :language model(abstract)

AI总结 针对现有视觉文档检索以页面为中心的问题,提出DocPC框架,通过组合代表性页面实现文档级索引,在DocViRe基准上性能优于最强页面级基线且存储成本大幅降低。

Comments 15 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08273 2026-08-31 cs.RO cs.CV 版本更新 50%

Action- and Language-Conditioned Video Assessment for Embodied Control

面向具身控制的动作与语言条件视频评估

Hwanhee Kim, Jaehyun Jang, Seungmin Cha, Hyeonseo Yun, Donghoon Lee, Chang D. Yoo

机构 * Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院) School of Electrical Engineering, Korea Advanced Institute of Science and Technology (KAIST)(韩国科学技术院电气工程学院)

专题命中 评测与基准 :language model(abstract)

AI总结 该研究提出ALVA轨迹评估器,结合视觉观测、动作序列与语言指令评估具身控制任务,在模拟3D家庭环境中误报率低,作为反馈机制可提升闭环策略优化效果。

Comments 21 pages, 7 figures. v2: updated Funding section

Journal ref Sensors 26(16), 5046 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 效率与部署 58 篇

2608.28044 2026-08-31 cs.PF cs.DC cs.LG 新提交 92%

Characterization of Request and Token Energy Costs for LLM Inference Workloads on GPU Platforms

GPU平台上大语言模型(LLM)推理工作负载的请求与令牌能耗特征

Prabhu Vellaisamy, Vanessa Lam, Shawn Blanton, John Paul Shen

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 该研究构建LLM推理分解能耗模型,在NVIDIA H100、H200 GPU上评估密集与MoE模型的能耗特征,发现需同时优化请求与令牌能耗,而非仅降低单位令牌能耗。

Comments Accepted at the 2026 IEEE International Symposium on Workload Characterization (IISWC 2026). 13 pages, 6 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28113 2026-08-31 cs.CL 新提交 91%

H-Scale: Hessian-Guided Scale Refinement for NVFP4 Sub-Byte LLM Inference

H-Scale:面向NVFP4亚字节大语言模型推理的Hessian引导型尺度优化

Hao Yu, Zheng Li, Dayiheng Liu, Jianwei Zhang

机构 * Qwen Team, Alibaba Inc.(通义千问团队,阿里巴巴集团)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 针对NVFP4亚字节LLM推理中每组缩放因子优化不足的问题,提出H-Scale方法,利用二阶代理选择硬件合法尺度,改进NVFP4基准并接近BF16参考值。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.04342 2026-08-31 cs.CL 版本更新 90%

Pruning Laws for Large Language Models

大语言模型的剪枝规律

Ayan Sengupta, Siddhant Chaudhary, Tanmoy Chakraborty

机构 * IIT Delhi(印度理工学院德里分校)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本研究提出剪枝规律这一可解释缩放关系,可预测剪枝后大语言模型的性能,能跨不同模型、剪枝方法和任务迁移,为高效部署LLMs提供原则性框架。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28327 2026-08-31 cs.CR cs.AI cs.CL 新提交 90%

Layered LLM Defenses as an Ensemble: Access Tiers, Inference Cost, and the Measured Failure Correlation Between Defense Layers

分层大语言模型防御作为集成体:访问层级、推理成本与防御层间实测失败相关性

Abrar Alotaibi, Muhammad Shahid Jabbar, Sadam Al-Azani, Moataz Ahmed

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究针对LLM防御堆叠的假设,实测发现其防御层间存在正失败相关性,导致防御效果未达预期,需端到端实测堆叠表现而非仅依赖多样性选择成员。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28008 2026-08-31 cs.CV 新提交 90%

Visual Token Coding for Video Multimodal Large Language Models

面向视频多模态大语言模型的视觉令牌编码

Chenxin Fang, Tao Chen, JunChao You, Jun Peng, Yiyi Zhou, Rongrong Ji

机构 * Xiamen University(厦门大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract)

AI总结 本文提出面向视频多模态大语言模型的视觉令牌编码VTC,新增动态设计得到$VTC_{Dy}$,在Qwen3-VL等模型上实验显示其在低令牌预算下仍保持高性能,且为即插即用设计无需额外调优。

Comments 9 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28011 2026-08-31 cs.AI 新提交 90%

Coverage, Not Credit: Failure-Credit Routing of Zeroth-Order Perturbation Budgets Does Not Improve On-Pool Sample Efficiency for LLM Agents

覆盖度而非信用:零阶扰动预算的失败-信用路由并不能提升LLM智能体的池内样本效率

Yuxu Ge

机构 * University of York(约克大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 该研究探究将ZO/ES扰动预算按LLM智能体失败信用路由是否提升池内样本效率,发现多数场景下无显著增益,仅在未见过的BFCL函数的保留端点上有一处例外,还记录了三种相关实验失败模式。

Comments 19 pages, 3 figures, 7 tables. Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27472 2026-08-31 cs.AI 新提交 90%

LLM-Augmented Causal Discovery: Probabilistic Fusion of Edge Existence and Orientation

大语言模型增强的因果发现:边存在性与方向的概率融合

Neville K. Kitson, Anthony Constantinou

机构 * Queen Mary University of London(伦敦玛丽女王大学) Causaliq

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究将BNSL与Gemini等LLM的因果知识通过概率依赖图融合,在26个基准网络上使F1值平均提升0.056,证明概率不确定性表示可有效提升因果图准确性。

Comments Accepted as a poster at Probabilistic Graphical Models (PGM) 2026 Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03779 2026-08-31 cs.CL 版本更新 90%

Tracing the complexity profiles of different linguistic phenomena through the intrinsic dimension of LLM representations

通过LLM表示的内在维度追溯不同语言现象的复杂性特征

Marco Baroni, Emily Cheng, Iria de-Dios-Flores, Francesca Franzon

机构 * Universitat Pompeu Fabra (UPF)(巴塞罗那自治大学) ICREA(加泰罗尼亚凝聚态物理与应用研究中心)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.CL

AI总结 研究通过LLM表示的内在维度揭示语言复杂性对比,发现复杂现象在不同层间表现出更高的维度差异。

Comments Published as a conference paper at EMNLP 2026

Journal ref Proceedings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28400 2026-08-31 cs.CR cs.SE 新提交 89%

When Verified Source Becomes Attack Input: Defending Smart Contracts Against LLM-Based Vulnerability Scanning

当已验证源码成为攻击输入:防御智能合约免受基于大语言模型(LLM)的漏洞扫描

Mingyuan Huang, Zimo Ji, Yifan Mo, Shuai Wang

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本文提出DeLLMGuard框架,通过分离源码与运行时执行并验证相关信息,在保留公开源码披露和授权审计的同时,降低LLM智能体对智能合约漏洞扫描的准确性,防御恶意扫描。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27621 2026-08-31 cs.SE 新提交 89%

Predicting LLM Performance from Prompt Linguistic Features: An Empirical Study in Requirements Engineering

从提示语言特征预测大语言模型(LLM)性能:需求工程领域的实证研究

Quim Motger, Alessio Miaschi, Xavier Franch, Mohammad Amin Zadenoori, Alessio Ferrari

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 本研究通过生成9000个语言受控的提示变体,利用5个开源LLM在需求分类任务上证实,提示的语言特征可显著预测LLM性能,为低成本提示选择提供了可解释的先验方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09130 2026-08-31 cs.LG 89%

UniComp: A Unified Evaluation of Large Language Model Compression via Pruning, Quantization, and Distillation

UniComp: 通过剪枝、量化和蒸馏对大型语言模型压缩的统一评估

Jonathan von Rad, Yong Cao, Andreas Geiger

机构 * University College London(伦敦大学学院) University of Tübingen(图宾根大学) Tübingen AI Center(图宾根人工智能中心)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出UniComp框架,统一评估剪枝、量化和知识蒸馏三种压缩方法,从性能、可靠性和效率三个维度在40个数据集上分析,发现知识偏差、性能与可靠性解耦以及任务特定校准可提升推理性能。

Comments Accepted as conference paper at EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28099 2026-08-31 cs.AI cs.CL 新提交 89%

Speculative Probing: LLM Monitoring at Speculative-Decoding Cost

推测式探测:以推测解码成本实现大语言模型监控

Collin Zhang, Tingwei Zhang, Vitaly Shmatikov

机构 * Cornell Tech(康奈尔科技学院)

专题命中 效率与部署 :LLM(title,summary_cn);language model(abstract);分类 cs.CL、cs.AI

AI总结 该研究提出将LLM的推测解码模块改造为序列分类器,在可忽略开销下实现高效分类,其小型探测模型在多任务上优于零样本GPT-5.4-mini,部分任务性能匹配专用8B安全分类器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28496 2026-08-31 cs.CL 新提交 89%

Ladders in Chaos: When, How, (and Perhaps Why) Does Test-Time Scaling Improve LLM Machine Translation

混沌中的阶梯:测试时缩放何时、如何(或许还有为何)提升大语言模型的机器翻译性能

Di Wu, Sergey Troshin, Christof Monz, Antske Fokkens, Vlad Niculae

机构 * University of Amsterdam(阿姆斯特丹大学) Vrije Universiteit Amsterdam(阿姆斯特丹自由大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究探究LLM的序列式与并行式测试时缩放在机器翻译中的特性,发现序列式采样性能上限更高,可提升翻译流畅度但在大推理预算下会降准,还分析了其机制与鲁棒性。

Comments Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28003 2026-08-31 cs.LG cs.AI 新提交 88%

A Method for Layer Bit-Width Allocation in LLM Quantization via Performance Maximization Under a Quality-Degradation Constraint

质量退化约束下性能最大化的大语言模型量化中层级位宽分配方法

Artem Safronov

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI、cs.LG

AI总结 本文针对Gemma-3-1B提出质量退化约束下性能最大化的层级位宽分配方法,结合SA-PTQ敏感性分布优化TensorRT-LLM量化,在RTX 5090上实现最高19.1%延迟降低,为LLM量化提供新方案。

Comments 22 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17194 2026-08-31 cs.CR 版本更新 88%

Progressive Behavioral Drift through Compression Valleys in Large Language Models

在阴影中引导:大型语言模型中激活空间攻击的因果放大

Zhiyuan Xu, Stanislav Abaimov, Joseph Gardiner, Sana Belguith

专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract,abstract_cn)

AI总结 本文提出通过因果放大效应,利用激活空间攻击实现对大型语言模型行为的可控引导,展示了其在安全性和有效性上的贡献。

Comments EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27875 2026-08-31 cs.AI 新提交 87%

HyQuant: Hybrid-Precision Quantization for LLM Attention

HyQuant:面向大语言模型注意力机制的混合精度量化方法

Jiatong Ding, Bingxin Xing, Yu Zhang, Dian Ding, Xiaodong Yi, Xianbin Ouyang, Feihu Zhou, Kun Zhang, Zhenyu Guo, Hao Pan, Guangtao Xue, Yiming Zhang

机构 * Xiamen University(厦门大学) Tencent Penglai Lab(腾讯蓬莱实验室) Shanghai Jiao Tong University(上海交通大学) Xi’an Jiaotong University(西安交通大学)

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 HyQuant是一种面向LLM注意力的混合精度量化框架,通过保留关键区域高精度、量化其余部分,在各类任务上实现近乎无损精度,提升效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27512 2026-08-31 cs.LG cs.AI cs.CL cs.CR 新提交 87%

Quantization-Triggered Backdoors in Language Models: Cross-Quantizer Transferability and the Validation--Deployment Gap

语言模型中量化触发的后门:跨量化器可迁移性与验证-部署差距

Jacopo Dardini, Claudio Stanzione, Giordano Colò, Giuseppe Fenza

机构 * University of Bologna(博洛尼亚大学) Luiss Guido Carli University(路易斯 Guido Carli 大学) Live Tech University of Salerno(萨勒诺大学)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);post-training(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究发现仅源精度审计无法排除语言模型的量化触发后门,提出量化行为等价类理论,在多语言模型中实现量化后激活的后门攻击,证明攻击持久性与量化方案及模型架构相关。

Comments Accepted at the 21st International Conference on Availability, Reliability and Security (ARES 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28276 2026-08-31 cs.LG 新提交 86%

Parser States Already Know: Structure-Conditioned KV Persistence for Structured Generation

解析器状态已掌握:面向结构化生成的结构感知KV持久化

Linze Wu, Xinrui Chen

机构 * Hangzhou Institute for Advanced Study(杭州高等研究院) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG

AI总结 针对LLM结构化生成中KV压缩未利用结构信号的问题,提出PASK方法,通过解析器信号优化KV持久化,在Qwen3-4B上显著提升性能并降低资源消耗。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28532 2026-08-31 cs.NI cs.SY eess.SY 新提交 86%

xTRUCE: A Provably Safe Arbiter for Multi-xApp Conflict Mitigation in Agentic O-RAN

xTRUCE:面向智能体开放式无线接入网(O-RAN)中多xApp冲突缓解的可证明安全仲裁器

Le Xia, Rose Qingyang Hu, Paul S. Kudyba, Zhenlin An, Haijian Sun

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 针对O-RAN中LLM驱动xApp提案的冲突等问题,提出可证明安全的仲裁器xTRUCE,通过三层约束层次与两阶段仲裁机制保障gNB控制安全,经仿真和空中实验验证其有效性。

Comments 13 pages, 7 figures. This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28194 2026-08-31 eess.SY cs.SY 新提交 86%

SafeLink-Agent: Agentic Maintenance for Adaptive Bitrate Controllers over Dynamic Starlink Networks

SafeLink-Agent:面向动态Starlink网络的自适应码率控制器的智能体式维护框架

Hongjun Xie, Bowen Zhang, Genke Yang, Pengcheng Luo

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract)

AI总结 该研究针对动态Starlink网络下ABR控制器难以适配复杂配置的问题,提出SafeLink-Agent框架,通过LLM智能体生成并验证补丁,显著降低了不同类型ABR控制器的严重会话比例,提升了流媒体鲁棒性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22070 2026-08-31 cs.CE 版本更新 85%

Catellect-VL-2B: A Vision-Language Model for Edge-Based Feline Behavior Understanding

SoulGard-VL-2B:用于边缘端猫行为理解的视觉语言模型

YuHang Wu, HaoXian Liu, Jia Tao

专题命中 效率与部署 :language model(title,abstract);post-training(abstract);prompting(abstract)

AI总结 本研究提出基于Qwen3-VL-2B后训练得到的边缘端VLM SoulGard-VL-2B,结合多阶段后训练方案,在RK3576芯片上实现高准确率与低延迟,可生成猫行为JSON结构化输出,提升了动物VLM的实用性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28455 2026-08-31 cs.CV cs.AI 新提交 84%

ARC-CT: Anatomy-Routed Contrastive Vision-Language Learning for 3D Chest CT

ARC-CT:用于3D胸部CT的解剖路由对比视觉-语言学习

Huseyin Umut Isik, Mehmet Alp Ozaydin, Sila Kurugol, Şeyda Ertekin

机构 * Harvard Medical School(哈佛医学院) METU-DTX Digital Transformation and Innovation Center(METU-DTX数字转型与创新中心)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 ARC-CT是一种基于LLM提取的报告标签、无需人工标注的区域感知对比视觉-语言框架,通过三个组件解决胸部CT全局对比学习的局限,在18种异常上实现0.86无掩码宏观AUC,性能优于高效基线和大Transformer模型。

Comments Accepted to the Thoracic Image Analysis (TIA) Workshop at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.28160 2026-08-31 cs.AR cs.AI cs.HC 新提交 81%

Gen-TAS: A Generative AI-Aided Hardware-Software Task Allocation Framework for FPGA-GPP Heterogeneous Systems

Gen-TAS:面向FPGA-GPP异构系统的生成式AI辅助软硬件任务分配框架

Mary Kong, Yuqin Zhao, Semih Vazgecen, Cristian Sestito, Themis Prodromakis

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 Gen-TAS是一种知识增强LLM框架,结合任务图分析与RAG技术,为FPGA-GPP异构系统生成用户特定的可解释任务分配策略,在CNN、SDR工作负载实验中实现稳定的需求驱动分配,延迟导向场景下获显著加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27514 2026-08-31 cs.CL cs.AI 新提交 81%

Trajectory-Level Speculative Decoding for Diffusion Language Models

用于扩散语言模型的轨迹级推测解码

Tianxiang Pan, Baitao Gong, Mo Guang, Hongwei Yong, Tianpeng Jiang, Yaqian Li, Zheng Cao, Kaiwen Long

机构 * Li Auto Inc.(理想汽车)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 针对扩散语言模型低置信度下吞吐量受限的问题,提出轨迹级推测解码框架,结合置信度分层树探索与分块并行评估,实现7-14倍加速且准确率变化极小。

详情

展开后加载摘要…

URL PDF HTML 收藏