arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 61 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 61 篇

2608.26132 2026-08-28 cs.LG cs.CL 新提交 92%

SLM-Conditioned Hierarchical Relation Routing for Labeled Property Graph Learning

面向带属性标签图学习的SLM条件分层关系路由

Michal Podstawski

机构 * NASK National Research Institute(NASK国家研究院)

专题命中 效率与部署 :SLM(title,title_cn);language model(abstract);small language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究针对带属性标签图学习的传统图神经网络的静态属性表示局限,提出SLM条件分层关系路由架构,结合拓扑GNN与参数高效SLM实现可解释的语义集成,提升图学习的预测能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09080 2026-08-28 cs.LG cs.CL 版本更新 92%

Beyond FLOPs: Benchmarking Real Inference Acceleration of LLM Pruning under a GEMM-Centric Taxonomy

超越FLOPs:基于GEMM中心分类法的LLM剪枝真实推理加速基准测试

Haozhe Hu, Hao Wu, Anhao Zhao, Longwei Ding, Peiran Yin, Yunpu Ma, Xiaoyu Shen

机构 * Ningbo Institute of Digital Twin, Eastern Institute of Technology, Ningbo(宁波数字孪生研究院,东方理工大学(宁波)) Department of Computing, The Hong Kong Polytechnic University(香港理工大学计算学系) Munich Center for Machine Learning, LMU Munich(慕尼黑大学机器学习慕尼黑中心)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 提出一种基于GEMM维度的剪枝方法分类法,通过统一基准框架系统评估不同剪枝方法在加速-质量帕累托前沿上的表现,发现静态深度剪枝在低质量损失下最优,为LLM剪枝加速提供统一视角。

Comments 28 pages, 21 figures, accepted by EMNLP2026 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22179 2026-08-28 cs.CL 版本更新 92%

The Score Granularity Gap in Black-Box LLM Classification: A Comparative Study of Confidence Constructions

黑盒LLM分类中的分数粒度差距:置信度构建的比较研究

Ao Sun, Tian Sun, Jiaxing Geng

机构 * institutetext: 1 1(机构1) institutetext: 2 2(机构2) institutetext: 3 3(机构3)

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究黑盒LLM分类中置信度分数的粒度差距,比较七种构建方法,发现单次口头置信度排名良好但取值有限,多查询聚合可帮助弱模型但可能降低强模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27455 2026-08-28 cs.CL 新提交 90%

CritICL: Inference-Time Weak-to-Strong Generalization from Small Language Model Failure Modes

CritICL:基于小语言模型失败模式的推理时弱到强泛化

Yufan Wu, Yinghui He, Zhengyi Hu, Lang Wei, Ruichen Li, Qifan Yang, Ting Zhu

机构 * The Ohio State University(俄亥俄州立大学) Princeton University(普林斯顿大学)

专题命中 效率与部署 :language model(title,abstract);small language model(title);LLM(abstract,abstract_cn);large language model(abstract)

AI总结 CritICL是一种新型推理时框架,利用小语言模型的结构化失败模式,通过两种变体提升推理性能,效率优于标准上下文学习和测试时缩放方法。

Comments this https URL (https://github.com/umwyf/CRITICL)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26389 2026-08-28 cs.CL cs.LG 新提交 90%

LowRankArena: A Standardized Evaluation Platform for SVD-Based LLM Compression

LowRankArena:面向基于SVD的大语言模型压缩的标准化评估平台

Zishan Shao, Lixun Zhang, Kangning Cui, Wenhao Wu, Jinhee Kim, Yixiao Wang, Ting Jiang, Hancheng Ye, Qinsi Wang, Fan Yang, Danyang Zhuo, Yiran Chen, Hai Li

机构 * Duke University(杜克大学) Wake Forest University(维克森林大学)

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 该研究提出LowRankArena这一标准化评估平台,解决基于SVD的LLM压缩研究中评估不统一的问题,通过审计五种SVD方法揭示过往发现的条件性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06753 2026-08-28 cs.AI cs.LG cs.PF 版本更新 90%

Pushing the Envelope of LLM Inference with Ultra-Low-Bit Quantized Models

推动AI-PC和英特尔GPU上LLM推理的边界

Evangelos Georganas, Dhiraj Kalamkar, Alexander Heinecke, Pradeep Dubey

机构 * Intel Corporation(英特尔公司)

专题命中 效率与部署 :LLM(title,title_cn);分类 cs.AI、cs.LG

AI总结 本文通过优化CPU和GPU上的低比特推理框架,实现了在AI-PC和英特尔Xe GPU上更高效的LLM推理,提升了端到端延迟和GEMM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27427 2026-08-28 cs.SE cs.AI 新提交 90%

Persona-Execution Separation: An Architecture Pattern for Evolving LLM Agents under Execution Audit

角色-执行分离:一种用于在执行审计下演进大型语言模型智能体的架构模式

Yisen Xi

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出角色-执行分离(PES)架构模式,将LLM智能体的角色与执行分属不同信任域,满足角色自由演进、执行可追溯等需求,并通过试点验证其有效性。

Comments 36 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26780 2026-08-28 cs.AI 新提交 90%

AI Control Scientist: LLM-driven Agentic System for Automated Control Design

AI控制科学家:用于自动控制设计的大语言模型驱动的智能体系统

Haiteng Wang, Weihao Li, Jing Zhang, Lei Ren

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出首个LLM驱动的智能体系统AI控制科学家,通过任务建模、控制器设计、参数调优三个智能体自动生成优化控制器,性能优于现有基线,有望推动控制系统设计从人类驱动转向智能体驱动。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26391 2026-08-28 cs.SE 新提交 89%

Investigating Software Aging in LLM-Generated Software Systems across Generation-and-Execution Environments

研究跨生成与执行环境的大语言模型生成软件系统中的软件老化现象

Cesar Santos, Michele Vitagliano, Roberto Natella, Ermeson Andrade

专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract)

AI总结 本文实验研究了LLM生成的多语言服务应用的软件老化,发现内存使用是最一致的老化指标,仅功能正确性不足以评估其持续运行的可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04562 2026-08-28 cs.AI cs.NE 版本更新 89%

Heaviside Continuity of Rolling Coefficients for Eliminating Epistemic Entropy in Large Language Models

用于消除大语言模型认知熵的滚动系数的海维赛德连续性

MY Pitsane, Hope Mogale

机构 * North-West University, RSA(南非北开普大学) University of Pretoria, RSA(南非彼得里亚大学) Mankind Research Labs, Sandton(沙顿人类研究实验室)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);分类 cs.AI

AI总结 研究大语言模型输出难检测错误的问题,提出海维赛德连续性的滚动系数框架,将推理重新表述为谓词门控状态转换,结合模型置信度与并行验证信号,防止无效状态传播,降低认知熵。

Comments Major revisions are going to be implemented and the paper will be restored later

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26676 2026-08-28 cs.CL cs.AI cs.LG 新提交 89%

FOCUS & RePAIR: Mitigating Text Degeneration via Token-Level Guidance for Pruned Large Language Models

FOCUS与RePAIR:针对剪枝后的大语言模型,通过令牌级引导缓解文本退化问题

Junyoung Lee, Sehyeon Park, Shinhyoung Jang, Seonha Ryu, Hojeong Kim, Hyunsei Lee, Il Hong Suh, Yeseong Kim

机构 * POSTECH(浦项科技大学) Daegu Gyeongbuk Institute of Science and Technology (DGIST)(大邱庆北科学技术院) Hanyang University(汉阳大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对剪枝后大语言模型的文本退化问题,提出FOCUS与RePAIR两种令牌级引导微调方法,在两类生成任务上均有效减少重复并提升生成质量。

Comments Accepted to ICML 2026 as a Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26140 2026-08-28 cs.CL cs.LG 新提交 88%

Affix Cache for Diffusion Large Language Models

扩散大语言模型的词缀缓存

Kaihua Liang, An Zhong, Xin Tan, Zafar Ayyub Qazi, Hong Xu, Jian Weng, Marco Canini

机构 * KAUST(阿卜杜拉国王科技大学) CUHK(香港中文大学) LUMS(拉合尔管理科学大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.LG

AI总结 针对扩散大语言模型高效推理难题,提出面向词缀的ACache缓存机制,通过复用词缀缓存并仅重新计算约20%关键锚定词元,可降低延迟、提升吞吐量并恢复精度损失。

Comments 15 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.25647 2026-08-28 cs.CE 版本更新 88%

Smallholder Farmers on Remote Islands Receiving Retrieval-Grounded Multilingual LLM Assistance and Agronomic Advice

基于检索的多语言LLM辅助工具用于岛屿小农户

Nikolaos D. Tantaroudas, Ilias Karachalios, Andrew J. McCracken

专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract)

AI总结 针对偏远岛屿小农户获取农业建议困难且方言知识缺乏全球语料支持的问题,提出嵌入双语电商平台的对话AI助手Falco eleonorae,通过工具增强检索(MCP)获取本地化数据,实现可信的多语言、语音和图像交互。

Comments 13, 4

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26574 2026-08-28 cs.CL 新提交 88%

Dependency-Aware Revocable Decoding for Efficient Diffusion Large Language Model Inference

面向高效扩散大语言模型推理的依赖感知可撤销解码

Wooje Park, Insu Lee, Minyoung Noh, Jaeyun Jang, Sungmin Lee, Kyuhong Shim, Byonghyo Shim

机构 * Seoul National University(首尔大学) Sungkyunkwan University(成均馆大学)

专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 针对扩散大语言模型可撤销解码中不可靠token损坏验证上下文的问题,提出无需训练的依赖感知可撤销解码框架,在12个基准上相比Saber实现2.71倍加速与4.35分CIDEr提升,优化了速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26844 2026-08-28 cs.CR 新提交 88%

Are We Shooting Flies with Cannons? Trade-off Analysis for AI-based 5G Intrusion Detection

我们是否在小题大做?基于AI的5G入侵检测的权衡分析

Federica Uccello, Simin Nadjm-Tehrani

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 本研究针对5G网络入侵检测任务,对比XGBoost、TabNet和LLM等模型,发现XGBoost在性能与计算成本上的权衡最优,强调需根据任务适用性选择模型而非追求复杂度。

Comments This paper was accepted and presented at the 2026 IEEE International Symposium on Measurement in Networking and Communications and will appear in the conference proceedings soon

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26117 2026-08-28 cs.DB cs.AI 新提交 87%

From SQL to Knowledge Graphs: An LLM-Driven Multi-Agent Approach with Data Schema Improvement

从SQL到知识图谱:一种基于大语言模型的多智能体方法及数据模式改进

Dinh-Khanh Pham, Quy-Anh Dang, Lam Mai Thanh, Khanh Bui, Truong-Son Hy

专题命中 效率与部署 :LLM(title,summary_cn);分类 cs.AI

AI总结 该研究提出一种LLM驱动的多智能体系统,可将RDBMS自动转换为图数据库,经实验验证其问答准确率及延迟表现均优于传统SQL方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22774 2026-08-28 cs.AR cs.DC 版本更新 87%

Characterizing CPU-Induced Slowdowns in Multi-GPU LLM Inference

多GPU大语言模型推理中CPU引起的性能下降特征分析

Euijun Chung, Yuxiao Jia, Aaron Jezghani, Hyesoon Kim

专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 通过分析多GPU大语言模型推理负载,发现CPU资源不足导致GPU利用率低下,增加CPU核心数可显著提升性能并降低首令牌延迟。

Comments Accepted to IISWC 2026. Camera-ready version with updated experiments and discussion on agentic LLM workloads

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.21957 2026-08-28 cs.IT cs.AI cs.LG eess.SP 版本更新 87%

MambaCSP: Hybrid-Attention State Space Models for Hardware-Efficient Channel State Prediction

MambaCSP: 用于硬件高效通道状态预测的混合注意力状态空间模型

Aladin Djuhera, Haris Gacanin, Holger Boche

机构 * Technical University Munich, Germany(慕尼黑技术大学,德国) RWTH Aachen University, Germany(亚琛工业大学,德国)

专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出MambaCSP,一种混合注意力状态空间模型,通过线性时间Mamba模型替代LLM,提升CSI预测精度与效率,降低资源消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26699 2026-08-28 cs.CR cs.SE 新提交 87%

KubeCap: A Framework for Capability Minimization in Kubernetes via Static Analysis and LLM-Assisted Rule Inference

KubeCap:一种通过静态分析和大语言模型辅助规则推理实现Kubernetes中能力最小化的框架

Yuhao Liu, Yingnan Zhou, Weijie Liu, Yan Jia, Zheli Liu

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 KubeCap是基于静态分析和LLM辅助规则推理的框架,可推断Kubernetes工作负载的最小能力集,平均降低54.97%的能力,优于相关基线,有效实施最小权限原则。

Comments 12 pages, 5 figures, accepted to the 37th IEEE International Symposium on Software Reliability Engineering (ISSRE 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26523 2026-08-28 cs.DC 新提交 87%

VPP: Virtual Pipeline Parallelism for Efficient Chunked Prefill in Long-Context LLM Inference

VPP:用于长上下文大语言模型推理中高效分块预填充的虚拟流水线并行技术

Yan Shi, Xiaochao Wang, Jingchun Gao, Jintao Luo, Xinyi Zhou, Feng Liu, Kui Luo, Xushi Li, Xinjie Guo, Liangjun Feng

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 该研究提出VPP虚拟流水线并行技术,通过虚拟阶段布局优化解决长上下文LLM分块预填充的流水线气泡问题,在长序列等场景下显著提升吞吐量并降低气泡率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26195 2026-08-28 cs.SE 新提交 87%

Cost-Utility Alignment in LLM Agent Trajectories:Profiling,Attribution,Diagnosis,Adaptation,and Evaluation

大语言模型智能体轨迹中的成本-效用对齐:分析、归因、诊断、适配与评估

Dan Liu, Jian Li

专题命中 效率与部署 :LLM(title,summary_cn)

AI总结 本研究提出以轨迹为中心的成本-效用对齐框架,通过五阶段分析解决LLM智能体资源消耗与任务贡献不匹配问题,为资源感知的智能体设计部署提供结构化基础。

Comments 12pages,3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27206 2026-08-28 cs.CV cs.AI 新提交 86%

PACE: A Unified Condense-and-Extract Paradigm for Fast VLM Inference

PACE:用于快速视觉语言模型推理的统一压缩-提取范式

Junjie Liu, Shengyuan Ye, Xu Chen

机构 * Sun Yat-sen University(中山大学) Power Dispatch Control Center, Guangdong Power Grid Co., Ltd.(广东电网有限责任公司电力调度控制中心) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.AI

AI总结 针对视觉语言模型推理成本随视觉 token 增多而上升的问题,提出无需训练的 PACE 框架,集成到 Qwen2.5-VL-7B 后仅用 10% 视觉 token 保留 93.8% 原性能,TTFT 加速 3.1 倍。

Comments 22 pages, 9 figures, 13 tables. Accepted to Findings of EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.29239 2026-08-28 cs.CR 版本更新 86%

QuantGuard: Learnable Rounding for Repairing Quantization-Conditioned Backdoors in LLMs

打破舍入陷阱:保护LLM免受量化条件后门攻击

Aoying Zheng, Anqi Du, Zizhuang Deng, Yuxuan Chen, Shanqing Guo, Kening Zheng

专题命中 效率与部署 :LLM(title_cn,abstract);large language model(abstract);language model(abstract)

AI总结 提出QuantGuard方法,通过可微舍入控制变量和误差引导的舍入反转约束等机制,在仅使用少量校准数据且不修改量化算法的情况下,阻断后门激活路径,有效降低攻击成功率至接近干净模型水平。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27038 2026-08-28 cs.CL 新提交 85%

Cascaded Batch Prompting

级联批量提示

Sho Hoshino, Peinan Zhang

机构 * CyberAgent(赛博agent公司)

专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 针对批量提示导致大语言模型下游任务性能不可预测的问题,提出级联批量提示方法,在多项选择问答等任务上性能优于单提示基线,且加速效果与批量大小成正比,在帕累托前沿达到新最优。

Comments EMNLP 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.18475 2026-08-28 cs.LG cs.AI 版本更新 85%

GAMMA: Global Bit Allocation for Mixed-Precision Models under Arbitrary Budgets

GAMMA:在任意预算下为混合精度模型进行全局位分配

Zhangyang Yao, Haiyan Zhao, Haoyu Wang, Xu Han

机构 * Beihang University(北航) Tsinghua University(清华) ByteDance Inc(字节跳动)

专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 本文提出GAMMA框架,通过后训练流水线学习模块级精度偏好,优化教师强制隐藏状态重建目标并利用整数规划实现精确预算分配,从而在任意预算下提升大语言模型的精度,优于固定精度基线和搜索基混合精度方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26235 2026-08-28 cs.AI cs.PF 新提交 83%

The Reasoning Tax: Token Economics of LLM Reasoning Across Task Types and Deployment Contexts

推理成本:不同任务类型与部署场景下大语言模型推理的令牌经济学

Sachin Gopal Wani, Ajay Dholakia, David Ellison

专题命中 效率与部署 :LLM(title);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出令牌经济得分(TES)指标,通过151组实证分析发现任务结构比难度更影响推理效率,推理投入存在收益递减,应按需选择性启用大语言模型推理。

Comments 15 pages, 8 figures and tables, accepted at the 2026 TPCTC Conference and will be published at Performance Evaluation and Benchmarking (Springer)

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26354 2026-08-28 astro-ph.CO astro-ph.IM cs.LG physics.data-an 新提交 83%

Cross-simulator transfer with foundation model summaries: Towards robust SKA-era reionization inference

基于基础模型摘要的跨模拟器迁移:迈向SKA时代的稳健再电离推断

Yannic Pietschke, Caroline Heneka, Ayodele Ore, Romain Meriot

专题命中 效率与部署 :foundation model(title,abstract);pretraining(abstract);分类 cs.LG

AI总结 该研究提出用在半数值模拟上预训练的基础模型SKATR,实现跨模拟器迁移的再电离推断,精度达监督基线水平且模拟量减少2.6倍,在SKA噪声下仍表现优异。

Comments 12 pages, 5 figures, prepared for submission to A&A

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27439 2026-08-28 cs.CR cs.AI 新提交 81%

RedEvoAgent: Automatic Red-Teaming Agent with Experience-Driven Skill Evolution

RedEvoAgent:具备经验驱动技能演化的自动红队代理

Junjie Zhang, Hui Liu, Kecheng Chen, Xianbo Mo, Changsheng Chen, Haoliang Li

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对LLM代理的越狱攻击风险,提出RedEvoAgent黑盒红队代理,通过提炼攻击轨迹实现技能演化,在多基准实验中性能优于基线,工具效率更高且可迁移。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27244 2026-08-28 cs.DB cs.AI 新提交 81%

Compositional Online Learning for Semantic Data Processing Systems

面向语义数据处理系统的组合式在线学习

Paweł Liskowski, Fuheng Zhao, Benjamin Han, Anupam Datta, Dimitris Tsirogiannis

专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.AI

AI总结 针对语义数据处理系统中LLM调用成本高、延迟大的问题,提出组合式在线学习框架,在Cortex AISQL案例中实现约8倍的实际性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26581 2026-08-28 cs.LG 新提交 81%

Activation Outliers Matter: Robust Recovery for Quantized Multimodal LLMs

激活异常值很重要:量化多模态大语言模型的鲁棒恢复

Tanzila Rahman, Mehran Taghian Jazi, Yunke Peng, Zhuang Ma, Anandharaju Durai Raju, Yao Wang, Xing Huang, Hei Yi Mak, Shadan Golestan, Hoang Le, Yonghan Dong, Wei Guo, Yaoyuan Wang

机构 * Huawei(华为)

专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn);分类 cs.LG

AI总结 本研究针对多模态大语言模型超低比特量化的性能损失问题,提出Residual Fallback Quantization框架,可有效恢复MXFP4、HiF4量化下的性能,缩小与BF16基线的差距。

Comments 14 Pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏