arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-06-30 至 2026-06-30 共收录 595 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 86 篇

2606.04050 2026-06-30 cs.LG cs.AI 90%

LiftQuant: Continuous Bit-Width LLM via Dimensional Lifting and Projection

LiftQuant: 通过维度提升和投影实现连续位宽的LLM

Liulu He, XuanAng Liu, Juntao Liu, Taolue Feng, Ting Lu, Chunsheng Gan, Zhiyv Peng, Yuan Du, Huanrui Yang, Yijiang Liu, Li Du

机构 * Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出LiftQuant框架,通过“提升-投影”机制实现准连续位宽控制,以精确适配内存预算,在70B模型上以2.4位压缩超越现有2位模型。

Comments ICML 2026 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.03339 2026-06-30 cs.CY cs.AR cs.CL cs.HC 90%

Arapai: An Offline-First LLM Architecture for Adaptive Learning in Low-Connectivity Environments

面向低连接环境的离线优先LLM架构:用于自适应学习

Joseph Walusimbi, Ann Move Oguti, Joshua Benjamin Ssentongo, Keith Ainebyona

机构 * University of Nairobi(内罗毕大学)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本文提出一种离线优先的LLM架构,适用于低连接环境中的自适应学习,通过本地推理和硬件感知模型选择,提供课程对齐的解释和结构化学术支持,适应不同教育阶段的学习者需求。

Comments 8 pages, 6 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30391 2026-06-30 cs.DC 89%

Energy-Aware Scheduling for Serverless LLM Serving on Shared GPUs

面向共享GPU的无服务器LLM服务的能量感知调度

Tianyu Wang, Gourav Rattihalli, Aditya Dhakal, Longfei Shangguan, Dejan Milojicic

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对无服务器LLM服务中多模型共享GPU带来的能耗优化难题,提出Festina系统,通过协同请求放置、SM分区和GPU工作点调整,在满足TTFT/TBT SLO前提下,实现集群能耗降低高达56%。

Comments 13 pages body and 5 pages appendix, 19 pages total

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29986 2026-06-30 cs.AR cs.DC 89%

HBM Is Not All You Need: Efficient Disaggregated LLM Serving across Memory-heterogeneous Accelerators

HBM并非唯一选择:跨内存异构加速器的高效分解式LLM服务

Zhixiang Wei, Yun Wang, James Yen, Mingyuan Xia, Zhengwei Qi

专题命中 效率与部署 :LLM(title,title_cn)

AI总结 针对LLM推理中预填充阶段HBM带宽闲置问题,提出HMA-Serve系统,通过分阶段量化、计算-传输流水线和延迟反量化,在GDDR加速器上高效执行预填充,实现3.2倍吞吐提升和4.8倍性价比提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28962 2026-06-30 cs.CR cs.LG 89%

FlipGuard: Defending Large Language Models Against Quantization-Conditioned Backdoor Attacks

FlipGuard:防御针对大型语言模型的量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen

机构 * School of Cyber Science and Technology(网络安全科学与技术学院) Suzhou Research Institute of Shandong University(山东大学苏州研究院)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn);分类 cs.LG

AI总结 提出FlipGuard防御框架,通过量化前扰动权重打破后门触发条件,有效抑制量化条件后门攻击,并引入DER指标统一评估安全、效用与成本。

Comments Accepted by ICME 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28708 2026-06-30 cs.CL cs.LG 88%

AnTenA: Actionable and Explainable Tensor Analysis System with Large Language Models

AnTenA: 基于大语言模型的可操作且可解释的张量分析系统

Dawon Ahn, Auder Der, Evangelos E. Papalexakis

机构 * University of California, Riverside CA 92507, USA(加州大学河滨分校) Neuralix AI

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 提出AnTenA系统,利用大语言模型知识解释张量分解提取的共聚类潜在模式,通过前向和反向推理任务评估解释质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29563 2026-06-30 cs.CL cs.AI 88%

Coverage-Driven KV Cache Eviction for Efficient and Improved Inference of LLM

覆盖驱动的KV缓存淘汰策略用于高效且改进的大语言模型推理

Shuvendu Roy, Mengyao Zhai, Hossein Hajimirsadeghi, Golnoosh Samei

机构 * RBC Borealis(RBC 培生)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 针对大语言模型推理中KV缓存内存开销大、现有淘汰策略导致长上下文任务性能下降的问题,提出覆盖感知的K-VEC策略,通过跨头跨层覆盖模块提升token保留,在LongBench上最高提升10.35点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28679 2026-06-30 cs.CR cs.AI 87%

Capability Gates Are Not Authorization: Confused-Deputy Failures in LLM Agent Frameworks

能力门控并非授权:LLM 代理框架中的混淆代理失败

David Mellafe Zuvic

机构 * Independent Security Research(独立安全研究)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 本文审计了 LangChain、LlamaIndex 和 Stripe Agent Toolkit 等框架,发现它们默认仅提供能力门控而非每次调用的值授权,导致混淆代理漏洞。作者提出 ScopeGate,一个五阶段授权框架,实验证明其能有效阻止未经授权的操作。

Comments 7 pages, 3 figures, 3 tables. Artifact: https://github.com/raceksd-source/scopegate-runtime (run_proof.sh)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29223 2026-06-30 cs.LG 87%

Depth Exploration for LLM Decoding

LLM解码的深度探索

Weisi Yang, Zipeng Sun, Stephen Xia

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.LG

AI总结 提出DEX算法,通过并行探索多个候选深度而非单深度选择,在保持无损解码的同时减少计算开销,优于现有深度选择方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30626 2026-06-30 cs.AI 86%

DOPD: Dual On-policy Distillation

DOPD:双重在线策略蒸馏

Xinlei Yu, Gen Li, Qingyi Si, Guibin Zhang, Yuqi Xu, Congcong Wang, Shuai Dong, Kaiwen Tuo, Xiangyu Zeng, Kaituo Feng, Qunzhong Wang, Yang Shi, Xiaobin Hu, Xiangyu Yue, Jiaqi Wang, Shuicheng Yan

机构 * NUS(新加坡国立大学) MMLab, CUHK(香港中文大学多媒体实验室) PKU(北京大学) Explore Academy, JD(京东探索研究院)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出DOPD方法,通过优势感知的双重蒸馏范式动态分配令牌级监督,缓解特权幻觉,在LLM和VLM上优于传统在线策略蒸馏。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06133 2026-06-30 math.OC cs.AI cs.LG 86%

LLM Serving Optimization with Variable Prefill and Decode Lengths

具有可变预填和解码长度的LLM服务优化

Meixuan Wang, Yinyu Ye, Zijie Zhou

机构 * Department of Computer Science and Technology, Tsinghua University(清华大学计算机科学与技术系) Department of Management Science and Engineering, Stanford University(斯坦福大学管理科学与工程系) Department of Industrial Engineering and Decision Analytics, HKUST(香港科技大学工业工程与决策分析系)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 研究在固定KV缓存内存预算下,异构提示和响应长度的离线调度问题,提出Sorted-F算法以平衡批次大小与下游解码成本,实现常数因子近似保证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.14851 2026-06-30 cs.DC cs.AI cs.LG 86%

Efficient Serving of LLM Applications with Probabilistic Demand Modeling

通过概率需求建模实现LLM应用的高效服务

Yifei Liu, Zuo Gan, Zhenghao Gan, Weiye Wang, Chen Chen, Yizhou Shan, Xusheng Chen, Zhenhua Han, Yifei Zhu, Shixuan Sun, Minyi Guo

机构 * Shanghai Jiao Tong University(上海交通大学) Huawei Cloud(华为云) Unaffiliated(无隶属机构)

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出Hermes系统,利用概率需求图建模LLM应用资源需求,采用Gittins策略优化调度顺序,预热冷后台,提升服务效率,减少平均完成时间70%以上,P95完成时间80%以上。

Journal ref ACM Transactions on Architecture and Code Optimization 23, 2, Article (June 2026), 1-25

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10480 2026-06-30 cs.DC cs.AI 85%

Scalable Synthesis of distributed LLM workloads through Symbolic Tensor Graphs

通过符号张量图实现分布式大语言模型工作负载的可扩展合成

Changhai Man, Joongun Park, Hanjiang Wu, Huan Xu, Srinivas Sridharan, Tushar Krishna

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出STAGE框架,通过符号张量图高效建模分布式AI工作负载,支持多种并行策略,实现大规模LLM和MoE模型的高保真仿真。

Comments ISCA2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.01878 2026-06-30 cs.LG 85%

Geometrically Principled Randomized Optimization for Efficient LLM Training

基于几何原则的随机优化用于高效的LLM训练

Sahar Rajabi, Nayeema Nonta, Sirisha Rambhatla

机构 * CriticalML Lab, University of Waterloo(滑铁卢大学CriticalML实验室)

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 本文提出GrassWalk和GrassJump算法,通过随机游走和跳跃在Grassmannian流形上导航,结合子空间感知优化器和恢复丢失的梯度信号,实现LLM预训练的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06516 2026-06-30 cs.CL 85%

You Had One Job: Per-Task Quantization Using LLMs' Hidden Representations

你只有一份工作:利用LLM隐藏表示进行每任务量化

Amit LeVi, Raz Lapid, Rom Himelstein, Chaim Baskin, Ravid Shwartz Ziv, Avi Mendelson

机构 * Technion—Israel Institute of Technology(技术ion—以色列理工学院) Zenity(Zenity公司) DeepKeep(DeepKeep公司) Ben-Gurion University of the Negev(巴伊兰大学) New York University(纽约大学)

专题命中 效率与部署 :LLM(title_cn,abstract);post-training(abstract);分类 cs.CL;foundation model(comments)

AI总结 本文提出TAQ框架,通过任务校准提示分配更高精度给任务相关的transformer层,提升精度-内存比和部署性能。

Comments Accepted at ICML 2026 Workshop on AdaptFM: Resource-Adaptive Foundation Model Inference

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29712 2026-06-30 cs.CL 84%

Why Struggle with Continuous Latents? Interpretable Discrete Latent Reasoning via Rendered Compression

为何纠结于连续潜变量?通过渲染压缩实现可解释的离散潜变量推理

Shuochen Chang, Qingyang Liu, Shaobo Wang, Bingjie Gao, Qianli Ma, Haonan Zhao, Yibo Miao, Yulin Sun, Zelin Peng, Jiangtong Li, Li Niu

机构 * Shanghai Jiao Tong University(上海交通大学) Tongji University(同济大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);large language model(abstract);language model(abstract);pretraining(abstract)

AI总结 提出离散潜变量推理(DLR)方法,将连续潜状态转化为离散令牌,通过渲染压缩实现高效、可解释的潜空间推理,在五个基准上优于先前方法并达到20倍压缩。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08761 2026-06-30 cs.DC cs.AI 新提交 83%

APEX4: Efficient Pure W4A4 LLM Inference via Intra-SM Compute Rebalancing

APEX4: 通过SM内计算重平衡实现高效纯W4A4 LLM推理

Hong Guo, Nianhui Guo, Weixing Wang, Jona Otholt, Christoph Meinel, Haojin Yang

机构 * Hasso Plattner Institute(霍普夫-普拉特纳研究所) GreenBit.AI German University of Digital Science(德国数字科学大学)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI

AI总结 针对W4A4量化中CUDA核心反量化瓶颈,提出基于SM内计算平衡的ρ感知粒度自适应方法,设计纯INT4 GEMM内核,在多种GPU上实现最高2.09倍加速。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16856 2026-06-30 cs.CL 83%

Online Experiential Learning for Language Models

在线经验学习用于语言模型

Tianzhu Ye, Li Dong, Qingxiu Dong, Xun Wu, Shaohan Huang, Furu Wei

机构 * Microsoft Research(微软研究院)

专题命中 效率与部署 :language model(title,abstract);large language model(abstract);分类 cs.CL

AI总结 本文提出在线经验学习框架OEL,使语言模型能持续从自身部署经验提升,通过经验知识提取与参数固化实现在线学习循环,提升任务准确性和效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29961 2026-06-30 cs.LG cs.AI 82%

DuoMem: Towards Capable On-Device Memory Agents via Dual-Space Distillation

DuoMem: 通过双空间蒸馏实现高效的设备端记忆代理

Peyman Hosseini, Ondrej Bohdal, Ahmed Alajrami, Andrea Maracani, Ignacio Castro, Matthew Purver, Mete Ozay, Savas Ozkan, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Queen Mary University of London(伦敦女王大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 提出DuoMem双空间蒸馏框架,将大型教师模型的过程问题解决能力转移到紧凑学生模型,在ALFWorld基准上将4B参数模型的任务成功率从4.3%提升至77.9%,接近72B教师模型的87.1%,且参数增加少于10M,速度提升3倍以上。

Comments 18 pages, 7 figures, 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05307 2026-06-30 cs.CY 82%

The LLM Mirage: Economic Interests and the Subversion of Weaponization Controls

大语言模型的幻象:经济利益与武器化控制的颠覆

Ritwik Gupta, Andrew W. Reddie

专题命中 效率与部署 :LLM(title,abstract);language model(abstract)

AI总结 本文分析大语言模型幻象如何影响AI安全政策,提出基于效果和国际人道法的武器化定义,并构建测量基础设施。

Comments Accepted to the ACM Conference on Fairness, Accountability, and Transparency 2026 in Montreal, Canada

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01731 2026-06-30 cs.CV 82%

SpectralX: Parameter-efficient Domain Generalization for Spectral Remote Sensing Foundation Models

SpectralX: 为光谱遥感基础模型实现参数高效的领域泛化

Yuxiang Zhang, Wei Li, Mengmeng Zhang, Jiawei Han, Ran Tao, Shunlin Liang

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract)

AI总结 SpectralX通过两阶段训练方法,利用HyperT和AoMoA实现对多光谱/超光谱数据的高效适应,提升领域泛化性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30304 2026-06-30 cs.DL cs.AI cs.IR 81%

Research Entity Extraction and Topic Detection from UKRI Grant Proposals

从UKRI资助提案中提取研究实体和检测主题

Xingran Ruan, Angelo Salatino, Rosa Filgueira, Kara Moraw, Alexandru Marcoci, Gemma Derrick, Sarah Callaghan

机构 * EPCC, University of Edinburgh, UK(埃克塞特大学埃平中心,英国) Knowledge Media Institute, The Open University, UK(开放大学知识媒体研究所,英国) Institute for Technology and Humanity, University of Cambridge, UK(剑桥大学技术与人类研究所,英国) Centre for Higher Education Transformations, School of Education, University of Bristol, UK(布里斯托大学教育学院高等教育转型中心,英国) University of Oxford, UK(牛津大学,英国)

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 比较三种LLM方法(GPT-4o、Mistral和定制算法DSIT-Taxonomies)从资助提案中提取和分类研究实体,发现Mistral在主题分类准确率(90.5%)上优于DSIT-Taxonomies(71.4%),且与GPT-4o质量相当。

Comments Accepted at the STI-ENID Conference. Will be presented in September 2026 in Antwerp (Belgium)

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30093 2026-06-30 cs.CL cs.IR 81%

Efficient Retrieval-Augmented Generation via Token Co-occurrence Graphs

基于Token共现图的高效检索增强生成

Gianluca Bonifazi, Christopher Buratti, Michele Marchetti, Federica Parlapiano, Giulia Quaglieri, Davide Traini, Domenico Ursino, Luca Virgili

机构 * Università Politecnica delle Marche(波尔蒂纳拉理工大学) Università di Modena e Reggio Emilia(摩德纳和雷焦艾米利亚大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 提出TIGRAG框架,利用滑动窗口共现统计构建Token共现知识图谱,结合图语义扩展和神经重排序实现多跳推理,在三个QA基准上优于稠密检索和图RAG方法,同时降低索引和推理开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20610 2026-06-30 cs.SE cs.CL 81%

SpecMind: Cognitively Inspired, Interactive Multi-Turn Framework for Postcondition Inference

SpecMind:基于认知的、交互式多轮框架用于后置条件推断

Cuong Chi Le, Minh V. T Pham, Tung Vu Duy, Cuong Duc Van, Huy N. Phan, Hoang N. Phan, Tien N. Nguyen

机构 * The University of Texas at Dallas(德克萨斯大学达拉斯分校) FPT Software AI Center(FPT软件AI中心) VinUniversity(文大学) Nanyang Technological University(南洋理工大学)

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 SpecMind通过多轮交互式提示方法提升后置条件生成的准确性和完整性,利用反馈驱动模型迭代优化,增强代码理解和程序行为对齐。

Comments Accepted in ACL 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16956 2026-06-30 cs.CL cs.LG q-bio.GN 81%

GeneMamba: An Efficient and Effective Foundation Model on Single Cell Data

GeneMamba:一种高效且有效的单细胞数据基础模型

Cong Qi, Hanzhang Fang, Siqi Jiang, Xun Song, Tianxing Hu, Wei Zhi

机构 * New Jersey Institute of Technology(新泽西理工学院)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.LG

AI总结 GeneMamba基于状态空间建模构建,采用Bi-Mamba架构实现线性时间复杂度,通过预训练和生物信息学目标提升单细胞转录组分析的效率与性能。

Journal ref IJCNN 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.02898 2026-06-30 cs.AI cs.CL 81%

Aligning Language Model Benchmarks with Pairwise Preferences

将语言模型基准与成对偏好对齐

Marco Gutierrez, Xinyi Leng, Hannah Cyberey, Jonathan Richard Schwarz, Ahmed Alaa, Thomas Hartvigsen

机构 * School of Data Science, University of Virginia(弗吉尼亚大学数据科学学院) Imperial College London(伦敦帝国理工学院) Thomson Reuters Foundational Research(汤姆森路透基础研究) Department of Electrical Engineering and Computer Science, UC Berkeley and UCSF(伯克利大学电气工程与计算机科学系及旧金山大学)

专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI

AI总结 提出BenchAlign方法,通过利用语言模型在问题级别的性能与模型成对排名,自动调整离线基准权重,使新基准能根据偏好准确排序未见模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.30367 2026-06-30 cs.RO 80%

FutureNav: Unified World-Action Modeling for Vision-and-Language Navigation

FutureNav: 面向视觉与语言导航的统一世界-动作建模

Lingfeng Zhang, Zeying Gong, Xiaoshuai Hao, Haoxiang Fu, Qiang Zhang, Mingliang Zhou, Hangjun Ye, Xiaojun Liang, Junwei Liang, Wenbo Ding

机构 * Tsinghua University(清华大学) Pengcheng Laboratory(鹏城实验室) The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Xiaomi EV(小米电动车) National University of Singapore(新加坡国立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);foundation model(abstract)

AI总结 提出FutureNav,一种基于VLM的统一世界-动作建模框架,通过联合优化动作策略、逆/前向动力学和未来状态预测四个目标,在4B规模骨干上实现多VLN基准的最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28344 2026-06-30 cs.IR cs.AI cs.CL cs.CV cs.LG 80%

PIXELRAG: Web Screenshots Beat Text for Retrieval-Augmented Generation

PIXELRAG:网页截图在检索增强生成中优于文本

Yichuan Wang, Zhifei Li, Zirui Wang, Paul Teiletche, Lesheng Jin, Matei Zaharia, Joseph E. Gonzalez, Sewon Min

专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出PixelRAG方法,以网页截图替代文本进行检索和阅读,利用视觉嵌入模型和对比学习,在30M截图库上实现端到端RAG,在多项任务中优于文本基线,准确率提升最高18.1%,并通过图像压缩降低3倍token成本。

Comments Our code is available at https://github.com/StarTrail-org/PixelRAG

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29640 2026-06-30 eess.SP cs.AI 79%

Fast Wireless Foundation Models with Early-Exits

具有早期退出的快速无线基础模型

Omar Mashaal, Hatem Abou-Zeid

机构 * Department of Electrical and Software Engineering, University of Calgary(卡尔加里大学电气与软件工程系)

专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI

AI总结 针对无线基础模型计算成本高的问题,提出在冻结编码器上附加轻量级任务头并选择最优退出阶段,实现可变深度推理,减少93% FLOPs并提升未见分布外任务准确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29275 2026-06-30 cs.LG 79%

Adaptive Block Diffusion: Resolving Training-Inference Mismatch in Diffusion Language Models

自适应块扩散:解决扩散语言模型中的训练-推理不匹配问题

Gagan Jain

机构 * Microsoft AI(微软人工智能)

专题命中 效率与部署 :language model(title,abstract);分类 cs.LG

AI总结 提出自适应块扩散(ABD),通过将配置视为随机变量,在完整配置空间上训练单一模型,解决扩散语言模型中固定上下文结构导致的训练与推理不匹配问题,保证覆盖配置下的去噪最优性。

详情

展开后加载摘要…

URL PDF HTML 收藏