arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 1111 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 1111 篇

2608.00316 2026-08-13 cs.LG stat.ML 版本更新 70%

Agentic Bayesian Optimization through Surrogate-Augmented Autoresearch

基于代理的贝叶斯优化:通过代理增强的自动研究

Paul Brunzema, Louis Tiao, Nhat Le, Kevin De Angeli, Yao Xuan, Djordje Gligorijevic

机构 * Meta RWTH Aachen University(亚琛工业大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出代理式贝叶斯优化范式,构建Sara代理与lenz后端,在合成及真实基准测试中,其兼具可靠性与性能,还可动态重构优化问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17154 2026-08-13 cs.NI cs.DC cs.LG 版本更新 70%

OrderMoE: An expert similarity driven distributed edge MoE inference

OrderMoE:一种由专家相似度驱动的分布式边缘混合专家推理

Xin Yuan, Ning Li, Quan Chen, Wenchao Xu, Song Guo

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究在资源受限边缘基础设施部署MoE推理的挑战,提出OrderMoE框架,通过构建专家相似度模型、设计分组部署策略和选择算法,平衡推理延迟等指标,实验表明其能显著降低相关指标,仅带来小的推理质量下降。

Comments 17 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17554 2026-08-13 cs.LG stat.ML 版本更新 70%

A Theoretical Framework for Modular Learning of Robust Generative Models

模块化鲁棒生成模型的理论框架

Corinna Cortes, Mehryar Mohri, Yutao Zhong

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 本文提出模块化鲁棒生成模型的理论框架,通过门控机制结合预训练专家,理论证明其在数据混合下的稳健性,并通过实验验证其优于整体模型的性能。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16465 2026-08-12 cs.AI cs.CE 版本更新 70%

When Agent Automation Becomes Profitable: Quantifying and Insuring Autonomous AI Risk through Trace-Economic Underwriting

当智能体自动化变得有利可图:通过痕迹经济核保量化和保险自主AI风险

Binyan Xu, Xilin Dai, Fan Yang, Kehuan Zhang

机构 * The Chinese University of Hong Kong(香港中文大学) University of Science and Technology of China(中国科学技术大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 提出痕迹经济核保方法,通过量化客户-任务-痕迹片段级别的风险并转移至保险,使自主AI部署在经济上可接受,实验显示定价误差从$17.7K降至$569,风险降低72%。

Comments 26 pages, 14 figures, 29 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28803 2026-08-12 cs.CV cs.LG 版本更新 70%

HoloQ-VLA: Uniform W4A4 Quantization of Vision-Language-Action Models

Ω-QVLA: 通过复合旋转和逐步缩放实现视觉-语言-动作模型的鲁棒量化

Xinyu Wang, Mingze Li, Sicheng Lyu, Dongxiu Liu, Kaicheng Yang, Ziyu Zhao, Yufei Cui, Xiao-Wen Chang, Peng Lu

机构 * McGill University(麦吉尔大学) Université de Montréal(蒙特利尔大学) Beijing University of Posts and Telecommunications(北京邮电大学) Shanghai Jiao Tong University(上海交通大学) Mila – Quebec AI Institute(魁北克AI研究所)

专题命中 效率与部署 :LLM(abstract_cn);post-training(abstract);分类 cs.LG

AI总结 提出Ω-QVLA,首个无需训练的后训练量化框架,通过复合SVD-Hadamard旋转和逐步DiT激活缩放量化,将VLA模型的语言骨干和扩散动作头统一压缩至W4A4精度,在LIBERO上达到或超越FP16性能,内存减少71.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05624 2026-08-12 cs.MA cs.LG 版本更新 70%

Behavioral Inference at Scale: The Fundamental Asymmetry Between Motivations and Belief Systems

大规模行为推断:动机与信念系统之间的根本不对称性

Jason Starace, Terence Soule

机构 * Department of Computer Science University of Idaho(计算机科学系 俄克拉荷马州立大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 研究通过大规模实验揭示动机与信念系统在行为推断中的根本不对称性,发现动机推断效率远超信念系统,且信念系统推断的瓶颈在于信息理论限制。

Comments Published in Transactions on Machine Learning Research (2026). OpenReview: https://openreview.net/forum?id=aDMDqtw63H

Journal ref Transactions on Machine Learning Research, ISSN 2835-8856 (2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03921 2026-08-11 cs.AI cs.NE 版本更新 70%

The Transformer Revolution, Part 1: Dynamic Processing through Output-Weight Interconnections

Transformer革命 第一部分:通过输出-权重互连实现的动态处理

Marco Giunti, Fabrizia Giulia Garavaglia

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出Transformer推理阶段的SIDPP计算机制,通过输出-权重互连构建依赖提示的动态变换,其贡献随提示长度增加,还推测人类语言处理或为类似SIDPP的形式。

Comments v1: 7 Sections, References, Appendix, Tables (2 tables), Figures Part A (6 figures), Figures Part B (42 figures), Figures Part C (5 figures); v2: corrected typos, new version of Figure 20

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03836 2026-08-11 cs.LG cs.DC cs.LO cs.SE 版本更新 70%

Resume Means Resume: A Machine-Checked Conformance Contract for Checkpoint, Interrupt, and Resume Semantics in Workflow Persistence Layers

恢复即恢复:工作流持久层中检查点、中断与恢复语义的机器可检查一致性契约

Sajjad Khan

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.LG

AI总结 该研究提出了RESUME CONTRACT契约,用TLA+模型等方法验证了五个智能体工作流框架的一致性问题,并通过REMIT修复了相关故障。

Comments 25 pages, 10 tables, 1 figure. Supplementary material included as an ancillary file. v3: rejoins a paragraph split across a table float and harmonizes a label glyph in the supplement; no change to results, claims, or numbers

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.07080 2026-08-11 cs.SD cs.AI eess.AS 版本更新 70%

dots.tts Technical Report

dots.tts 技术报告

Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

机构 * ByteDance(字节跳动)

专题命中 效率与部署 :foundation model(abstract);post-training(abstract);分类 cs.AI

AI总结 提出一个20亿参数的连续自回归TTS基础模型,通过多目标AudioVAE、全历史条件流匹配和无奖励自校正后训练,在Seed-TTS-Eval上取得最优性能,并支持低延迟推理。

Comments 22 pages, 2 figures. Revised technical report with updated technical content, experiments, efficiency results, references, figures, project links, and abstract metadata formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.06247 2026-08-11 cs.CR cs.AI 版本更新 70%

SALLIE: Generation-Free Hidden-State Detection of Jailbreaks and Prompt Injections Across Text and Vision

SALLIE:防范潜在语言与图像攻击

Guy Azov, Ofer Rivlin, Guy Shtar

机构 * Intuit

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 SALLIE是一种轻量级运行时检测框架,通过机制可解释性提取模型内部激活信号,有效应对文本和图像攻击,无需性能降级或架构修改。

Comments 17 pages, 5 figures, 17 tables. Preprint under review. v2: substantially revised - new title expansion, reworked method presentation, added calibration-regime analysis (shared / threshold-only / fully calibrated) and matched-protocol comparison with RCS-KCD; technical appendices A-H now included

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02637 2026-08-11 cs.MA cs.CL cs.PL 版本更新 70%

StitchCUDA: An Automated Multi-Agents End-to-End GPU Programing Framework with Rubric-based Agentic Reinforcement Learning

StitchCUDA:一种基于规则的多智能体端到端GPU编程框架与基于代理的强化学习

Shiyang Li, Zijian Zhang, Winson Chen, Yuebo Luo, Mingyi Hong, Caiwen Ding

机构 * Department of Computer Science\&Engineering, University of Minnesota-Twin Cities, Minnesota, USA Department of Electrical Engineering, University of Minnesota-Twin Cities, Minnesota, USA

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 StitchCUDA通过基于规则的多智能体强化学习,实现了端到端GPU编程的高效生成与验证,显著提升了性能和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.02791 2026-08-11 cs.SE cs.AI 版本更新 70%

Contamination Means Overestimation? A Fine-Grained Empirical Study in Code Intelligence

重新审视数据污染在代码智能中的影响

Zhen Yang, Hongyi Lin, Yifan He, Junqi Wang, Zeyu Sun, Shuo Liu, Jie Xu, Pengpeng Wang, Zhongxing Yu, Qingyuan Liang

机构 * Shandong University(山东大学) Institute of Software, Chinese Academy of sciences(中国科学院软件研究所) City University of Hong Kong(香港城市大学) Columbia University(哥伦比亚大学) Peking University(北京大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文重新审视了数据污染对代码智能模型的影响,发现不同模型在不同污染场景下的表现差异显著,挑战了污染必然导致性能高估的传统观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20968 2026-08-11 cs.DC cs.AI 版本更新 70%

Mesh-Attention: A New Communication-Efficient Distributed Attention with Improved Data Locality

Mesh-Attention: 一种新的通信高效分布式注意力机制,具有改进的数据本地性

Sirui Chen, Jingji Chen, Siqi Zhu, Ziheng Jiang, Yanghua Peng, Xuehai Qian

机构 * Tsinghua University(清华大学) Purdue University(普渡大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) ByteDance Seed(字节跳动种子)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 Mesh-Attention通过改进的数据本地性,提高了分布式注意力的通信效率和可扩展性,实验显示在大规模GPU上实现了显著的加速和通信量减少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10903 2026-08-11 cs.AI 版本更新 70%

Multi-Granular Node Pruning for Causal Circuit Discovery

多粒度节点剪枝用于因果电路发现

Muhammad Umair Haider, Hammad Rizwan, Hassan Sajjad, A. B. Siddique

机构 * Department of Computer Science, University of Kentucky, USA(美国肯塔基大学计算机科学系) Department of Computer Science, Dalhousie University, Canada(加拿大达尔豪斯大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种节点级剪枝框架,通过可学习掩码和多粒度稀疏惩罚,在单次微调中从大语言模型中高效发现最小因果电路,节点更少且性能相当,内存占用降低5-10倍。

Comments Published at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19969 2026-08-11 cs.AI 版本更新 70%

M$^3$Prune: Hierarchical Communication Graph Pruning for Efficient Multi-Modal Multi-Agent Retrieval-Augmented Generation

M$^3$Prune: 多模态多智能体分层通信图剪枝用于高效多模态多智能体检索增强生成

Weizi Shao, Taolin Zhang, Zijie Zhou, Chen Chen, Chengyu Wang, Xiaofeng He

机构 * East China Normal University(东华大学) Hefei University of Technology(合肥工业大学) China University of Petroleum(中国石油大学) Guangdong university of Finance & Economics(广东财经大学) Alibaba Group(阿里巴巴集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 M$^3$Prune通过分层通信图剪枝提升多模态多智能体检索增强生成的效率和性能。

Comments Critical flaw in Eq.(5)/Alg.1 (Sec 3.2): scoring fails Lipschitz continuity in multi-modal spaces, causing invalid hierarchy. Thus, latency/FLOPs in Tables 2&3 are overestimated & irreproducible. Core defect unfixable by minor update. Withdraw to avoid misleading; will revise theory & experiments

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04904 2026-08-07 cs.CL 版本更新 70%

Strengthening Target-Language Features: SAE-Based Steering for Multilingual Inference

强化目标语言特征:基于SAE的多语言推理引导

Hongsheng Wang, Philipp Koehn

机构 * Johns Hopkins University(约翰斯·霍普金斯大学)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对多语言大模型性能跨语言差异问题,提出基于SAE的推理时引导方法,通过注入目标语言特征提升模型在XCOPA、XNLI、MGSM等基准上的准确率。

Comments Corrected an author name. No changes to the paper content

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03529 2026-08-06 cs.CL 版本更新 70%

Consensus Measures for Unstructured Biomedical Text Annotations

非结构化生物医学文本标注的一致性度量

Pascal Wullschleger, Christian Kreis, Martin A. Walter, Jennifer Foster, Marc Pouly

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对生物医学非结构化文本标注的一致性量化难题,提出基于自然语言推理的折中度量方案,经实验验证多种语义等价度量的特性及局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01867 2026-08-05 cs.CL 版本更新 70%

CRISP: Critical Step Perception for Training Efficient Deep Search Agents

CRISP:用于训练高效深度搜索智能体的关键步骤感知

Haosi Mo, Zihao Yan, Ruiqing Zhang, Zhongli Li, Hexuan Deng, Xuebo Liu, Min Zhang

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究针对深度搜索智能体效率低的问题,提出CRISP框架,通过区分关键与冗余交互优化奖励,在保持准确率的同时,使BrowseComp和HLE-Verified上的交互回合分别减少15.1%和33.2%。

Comments 15 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01034 2026-08-05 cs.CL 版本更新 70%

Opt.Gear Technical Report

Opt.Gear技术报告

Juneyoung Park, Youngwook Kwon

专题命中 效率与部署 :language model(abstract);foundation model(abstract);分类 cs.CL

AI总结 Opt.Gear系列含多参数规模模型,采用混合架构优化KV缓存,数据效率高,支持多硬件部署,还推出可在MCU运行的Opt.Gear-1M,为边缘应用提供实用基础。

Comments [OptAI] OptGear Model Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.29397 2026-08-05 cs.CL cs.PF 版本更新 70%

Studying quantization trade-offs for efficient inference deployment in machine translation

研究高效机器翻译推理部署中的量化权衡

Jim Zhao, Sohir Maskey, Koen Oostermeijer, Douglas Orr, Teryn Jones

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 该研究针对EuroLLM和Hy-MT2等5款1.7B至22B的翻译模型,结合文档分块与W4A8/W8A8量化,发现量化效率与翻译质量的权衡还受分块策略影响,且Hy-MT2比EuroLLM更耐量化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14010 2026-08-05 cs.CV cs.AI 版本更新 70%

A Deployment-Friendly Foundational Framework for Efficient Computational Pathology

一种适用于部署的高效计算病理学基础框架

Yu Cai, Cheng Jin, Zhengyu Zhang, Jiabo Ma, Fengtao Zhou, Yingxue Xu, Zhengrui Guo, Yihui Wang, Zhengyu Zhang, Ling Liang, Yonghao Tan, Pingcheng Dong, Du Cai, On Ki Tang, Chenglong Zhao, Zhijian Cen, Ying Tan, Xi Wang, Can Yang, Yali Xu, Jing Cui, Zhenhui Li, Ronald Cheong Kin Chan, Yueping Liu, Feng Gao, Xiuming Zhang, Li Liang, Hao Chen, Kwang-Ting Cheng

机构 * Department of Electronic and Computer Engineering, The Hong Kong University of Science and Technology(电子与计算机工程系,香港科学与技术大学) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Department of Pathology, Nanfang Hospital, School of Basic Medical Sciences, Southern Medical University(病理学系,南芳医院,南方医科大学) Guangdong Province Key Laboratory of Molecular Tumor Pathology(广东省分子肿瘤病理学重点实验室) Jinfeng Laboratory, Chongqing, China(锦峰实验室,重庆,中国) Department of General Surgery (Colorectal Surgery), The Sixth Affiliated Hospital, Sun Yat-sen University(普外科(结直肠外科),中山大学第六附属医院)

专题命中 效率与部署 :foundation model(abstract);pretraining(abstract);分类 cs.AI

AI总结 LitePath是一种高效计算病理学基础框架,通过压缩模型和自适应碎片选择器,显著降低计算成本,实现快速、节能的病理图像分析。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15782 2026-08-04 cs.AI cs.CV 版本更新 70%

Mitigating Visual Hallucinations in Multimodal Systems through Retrieval-Augmented Reliability-Aware Inference

通过检索增强的可靠性感知推理缓解多模态系统中的视觉幻觉

Pratheswaran Hariharan, Haiping Xu, Donghui Yan

机构 * University of Massachusetts, Dartmouth(马萨诸塞大学达特茅斯分校)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 提出一种检索增强的可靠性感知推理框架,利用外部视觉证据库和多个可靠性指标进行决策门控,在不重训练模型的情况下减少视觉幻觉,将接受预测准确率从85.84%提升至88.88%。

Comments 29 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.00811 2026-08-04 econ.EM cs.AI 版本更新 70%

Certificates without Electrons? Theory and Evidence on Impacts from AI-Driven Power Demand

没有电子的证书?AI驱动电力需求影响的理论与证据

Dana Golden, Aruna Balasubramanian, Niranjan Balasubramanian

机构 * Department of Economics, Stony Brook University(石溪大学经济系) Department of Computer Science, Stony Brook University(石溪大学计算机科学系)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 通过博弈论模型和自然实验,研究AI数据中心使用可再生能源证书和购电协议对电网可靠性、电价和排放的影响,发现证书无法解决时序错配问题,而共置储能可有效缓解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21027 2026-08-04 cs.AI 版本更新 70%

HypEHR: Hyperbolic Modeling of Electronic Health Records for Efficient Question Answering

HypEHR:基于超几何建模的电子健康记录用于高效问答

Yuyu Liu, Sarang Rajendra Patil, Mengjia Xu, Tengfei Ma

机构 * Department of Computer Science, Stony Brook University(石英布大学计算机科学系) Department of Data Science, New Jersey Institute of Technology(新泽西理工学院数据科学系) Department of Biomedical Informatics, Stony Brook University(石英布大学生物医学信息学系)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.AI

AI总结 HypEHR通过超几何建模将电子健康记录中的代码、就诊和问题嵌入超几何空间,利用几何一致的交叉注意力和类型特定的指针头进行问答,预训练后在两个基准上实现高效问答。

Comments Accepted by Findings of ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26497 2026-08-03 cs.CL 版本更新 70%

BM25 Wins at Scale: A Scaling Study of Retrieval-Augmented Generation Paradigms

哪种RAG范式在规模化场景下表现最优?检索增强生成范式的规模化研究

Pengyu Wang, Benfeng Xu, Shaohan Wang, Mingxuan Du, Xin Zeng, Huarui Wu, Lei Zhang, Licheng Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Metastone Technology(Metastone科技) Information Technology Research Center, Beijing Academy of Agriculture and Forestry Sciences(北京农林科学院信息技术研究中心)

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL

AI总结 本文通过28个嵌套语料层级的受控研究,对比四类RAG范式的规模化表现,发现BM25综合性能最优,Agent+BM25全规模准确率达69.4,图基RAG存在构建瓶颈。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25266 2026-08-03 cs.CV cs.LG 版本更新 70%

FORGE: Frame Orthogonality in Relevance Geometry for Long-Form Video Understanding

FORGE:用于长视频理解的相关几何中的帧正交性

Ghazal Kaviani, Ghassan AlRegib

机构 * Georgia Institute of Technology(佐治亚理工学院) Center for Signal and Information Processing (CSIP)(信号与信息处理中心 (CSIP)) School of Electrical and Computer Engineering(电气与计算机工程学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.LG

AI总结 研究长视频理解中推理时最大化查询相关信息问题,提出FORGE模型无关方法,通过在预训练嵌入空间引入查询条件几何统一相关性和多样性,实验证明该方法在关键帧选择和问答上有显著提升。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.13657 2026-07-31 cs.LG 版本更新 70%

Dense Supervision, Sparse Updates: On the Sparsity and Geometry of On-Policy Distillation

密集监督,稀疏更新:论策略蒸馏的稀疏性与几何结构

Guo Yu, Wenlin Liu, Yulan Hu, Hao-Xuan Ma, Jun-Peng Jiang, Han-Jia Ye

机构 * School of Artificial Intelligence, Nanjing University(南京大学人工智能学院) National Key Laboratory for Novel Software Technology, Nanjing University(南京大学计算机软件新技术国家重点实验室) Amap, Alibaba Group(阿里巴巴集团高德地图)

专题命中 效率与部署 :language model(abstract);post-training(abstract);分类 cs.LG

AI总结 本文分析策略蒸馏(OPD)中参数更新的稀疏性和几何特性,发现更新稀疏且集中于小权重坐标,并验证了稀疏子网络的有效性。

Comments Code is available at https://github.com/SydCS/OPD-Param-Analysis

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14649 2026-07-31 cs.CL 版本更新 70%

GradMAP: Faster Layer Pruning with Gradient Metric and Projection Compensation

GradMAP: 更快的层剪枝与梯度度量和投影补偿

Hao Liu, Guangyan Li, Wensheng Zhang, Yongqiang Tang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 GradMAP通过梯度度量和投影补偿实现更快的层剪枝,提升剪枝效率和性能。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25852 2026-07-30 cs.CL 版本更新 70%

AngelSpec: Towards Real-World High Performance Inference with Speculative Decoding

AngelSpec:通过推测解码实现现实世界中的高性能推理

Hong Liu, Rui Cen, Junhan Shi, Guangshuo Qin, Jiebin Zhang, Tianyu Liu, Runzhi Fan, Guoliang Zhao, Ruobing Xie, Kai Zhang, Song Liu, Guanghua Yu, Jianchen Zhu

机构 * Tencent Inc.(腾讯公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究旨在通过推测解码实现高性能推理,提出AngelSpec统一训练框架,在训练、架构、推理层面解决异质性问题,其DFly框架提升了接受长度和吞吐量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23597 2026-07-30 cs.CR cs.CL 版本更新 70%

HiTMS: A High-Throughput Multi-Stream Linguistic Steganography Framework

HiTMS:一个高通量多流语言隐写框架

Ruiyi Yan, Zhongliang Yang, Yugo Murawaki

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 HiTMS针对现有语言隐写术单流方案的局限,提出在多轮交互响应中分配秘密,通过批处理调用提高吞吐量,用自描述框架和密钥派生调度保证可恢复性,实验显示其速度提升且降低隐写分析器AUROC,并发增加时吞吐量持续提高。

详情

展开后加载摘要…

URL PDF HTML 收藏