arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 2014 信号源:cs.CL, cs.AI, cs.LG

1. 效率与部署 2014 篇

2607.15047 2026-07-17 cs.CV cs.AI cs.LG 新提交 76%

Parameter-efficient Prompt Tuning of Vision Foundation Model With Adaptive Focal Loss for Interpretable MCI Screening

基于自适应焦点损失的视觉基础模型参数高效提示调优用于可解释的轻度认知障碍筛查

Javad Khoramdel, Farhad Hoseyni, Amirhossein Nikoofard

机构 * APAC Research Group, Faculty of Electrical Engineering, K. N. Toosi University of Technology(亚太研究小组,电气工程学院,伊朗德黑兰的KN Toosi科技大学)

专题命中 效率与部署 :foundation model(title);分类 cs.AI、cs.LG

AI总结 研究针对轻度认知障碍筛查中数据与诊断问题,提出用冻结DINOv2 - Small模型经特定提示令牌参数高效调优的框架,结合自适应焦点损失处理边界模糊性,在交叉验证中表现良好,优于ResViT基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07557 2026-07-09 cs.CL cs.LG 新提交 76%

PALS: Percentile-Aware Layerwise Sparsity for LLM Pruning

PALS:用于大语言模型剪枝的百分位数感知分层稀疏性

Yazdan Jamshidi, Alexey Shvets

机构 * Palo Alto Networks(帕洛阿尔托网络公司)

专题命中 效率与部署 :LLM(title);分类 cs.CL、cs.LG

AI总结 研究针对大语言模型剪枝中各层重要性差异被忽略的问题,提出PALS方法,基于激活幅度第99百分位数调整每层稀疏性,在LLaMA - 2 - 7B上效果显著,且成本低无需微调,还发现基于梯度的分配效果不佳。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01480 2026-07-03 cs.AI cs.LG 新提交 76%

Procedural Memory Distillation: Online Reflection for Self-Improving Language Models

程序记忆蒸馏:用于自我改进语言模型的在线反思

Ye Liu, Srijan Bansal, Bo Pang, Yang Li, Zeyu Leo Liu, Yifei Ming, Zixuan Ke, Shafiq Joty, Semih Yavuz

专题命中 效率与部署 :language model(title);分类 cs.AI、cs.LG

AI总结 提出程序记忆蒸馏(PMD),通过在线提取跨回合信号(轨迹、反思策略、行为模式)并蒸馏到策略权重中,使语言模型在推理时无需额外记忆,相比SDPO在SCIKNOWEVAL和LIVECODEBENCH上分别提升3.8-5.5%和7.9-13.6%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.32022 2026-07-01 cs.LG cs.CL 新提交 76%

SemRF: A Semantic Reference Frame for Residual-Stream Dynamics in Language Models

SemRF:语言模型中残差流语义参考框架

Jian Gu, Aldeida Aleti, Chunyang Chen, Hongyu Zhang

机构 * Monash University(莫纳什大学) Technical University of Munich(慕尼黑工业大学) Chongqing University(重庆大学)

专题命中 效率与部署 :language model(title);分类 cs.CL、cs.LG

AI总结 提出语义参考框架(SemRF),通过锚点固定实现残差流语义坐标的稳定测量,并利用Voronoi迹定义最小作用路径,揭示层间计算与参数效率的关系。

Comments an early-stage version

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20953 2026-08-24 cs.CL cs.AI cs.LG cs.PF 新提交 75%

Quantization-Aware Healing: A Practical Recipe for Recovering Compressed, 4-Bit LLMs

量化感知修复:恢复压缩4位大语言模型的实用方案

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

机构 * Multiverse Computing(多元宇宙计算公司)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对压缩4位大模型部署时性能下降问题,提出量化感知修复方案,直接从原始未压缩模型蒸馏4位学生模型,在多基准测试中表现优于量化感知训练,且部署便捷。

Comments Patent Application Number: 26382838.6 / P202602102EP

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20210 2026-08-21 cs.IR cs.AI cs.CL cs.LG 新提交 75%

Daedalus-150M: A Convolution-Attention Hybrid Designed for CPU Inference

Daedalus-150M:专为CPU推理设计的卷积-注意力混合架构

Christos Koutsiaris

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出专为CPU推理设计的Daedalus-150M混合架构,在5项任务基准得分超预设线,击败多款更大数据训练的模型,解码速度随上下文长度增长优势显著。

Comments 8 pages, 2 figures, 10 tables. Code, weights and the measurement artefacts behind every number: https://github.com/unseen1980/daedalus

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18294 2026-08-20 stat.ME cs.AI cs.CL cs.LG stat.ML 新提交 75%

Debiased Inference for AI-Generated Data without Gold-Standard Labels: Identification via Multiple Imperfect Measurements

无黄金标准标签的AI生成数据的去偏推断:通过多个不完美测量进行识别

Naoki Egami, Sooahn Shin

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对无黄金标准标签的AI生成数据的下游分析偏差问题,提出DMM框架,结合多个不完美AI测量实现有效推断,经模拟验证其有效性与效率提升作用,还开发了条件独立性假设的诊断方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18114 2026-08-20 cs.CL cs.AI cs.LG eess.SP q-bio.NC 新提交 75%

Accurate Decoding of Natural Sentences from Non-Invasive Brain Recordings

从非侵入式脑记录中准确解码自然句子

Mingfang Zhang, Jarod Lévy, Cedric Rommel, Jérémy Rapin, Corentin Bel, Julie Bonnaire, Daniel Nieto, Pierre Bourdillon, Svetlana Pinet, Stéphane d'Ascoli, Thomas Moreau, Jean-Rémi King

机构 * Meta AI École Normale Supérieure(高等师范学院) Université PSL(巴黎文理大学) CNRS(法国国家科学研究中心) Hospital Foundation Adolphe de Rothschild(阿道夫·德·罗斯柴尔德医院基金会) Univ. Lille(里尔大学) Basque Center on Cognition, Brain and Language(巴斯克认知、大脑与语言中心) Paris Cité University(巴黎城市大学) Inria(法国国家信息与自动化研究所) Université Paris-Saclay(巴黎萨克雷大学) INSERM(法国国家健康与医学研究院) CEA(法国原子能和替代能源委员会)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究提出Brain2Qwerty v2模型,利用MEG记录解码自然句子,平均WER为39%,准确率随数据量提升,通过AI技术缩小非侵入式与颅内脑机接口的性能差距。

Comments Mingfang Zhang and Jarod Lévy contributed equally to this work

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17941 2026-08-19 cs.LG cs.AI cs.CL 新提交 75%

Efficient RLVR Scheduling via Graph-Structured Online Difficulty Estimation

基于图结构在线难度估计的高效RLVR调度

Zhizhao Liu, Zhiliang Tian, Xi Wang, Zhihua Wen, Yihang Xiong, Zhiquan Lai, Dongsheng Li

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 该研究针对RLVR中探索预算分配低效问题,提出即插即用的图结构在线难度估计器,可跨样本共享反馈、缓解冷启动与过时问题,集成后实现难度自适应探索,在多模型与基准上性能更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17402 2026-08-19 cs.CV 新提交 75%

MoE-ViE: Mixture of Experts Vision Encoder for Efficient Image and Video Understanding

MoE-ViE:用于高效图像与视频理解的混合专家视觉编码器

Bonan Zhang, Shiyu Dong, Quan Hung Tran, Katharina Gschwind, Shuqi Yang, Sijia Chen, Adel Ahmadyan, Seungwhan Moon, Lu Zhang, Ahmed Kirmani, Babak Damavandi, Anuj Kumar

机构 * Meta

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本研究提出MoE-ViE,通过细粒度MoE拓扑、无辅助损失平衡变体、专用MoE内核及帧级蒸馏等设计,实现高效图像与视频理解,性能优于对应密集模型及更大规模SOTA编码器。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15913 2026-08-18 cs.CR 新提交 75%

Conjunctive Poisoning in AI Supply-Chain Applications

AI供应链应用中的联合中毒攻击

Nokimul Hasan Arif, Qian Lou, Mengxin Zheng

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本研究提出AI供应链中的联合中毒攻击,通过包装器与元数据的交互改变模型行为,提出TIF-BAH防御,揭示AI部署中存在未被现有防御覆盖的部署时行为风险。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13925 2026-08-17 cs.LG cs.AI cs.CL 新提交 75%

CForce: Boosting Parallel Decoding for dLLMs via Consistency Forcing

CForce:通过一致性强制提升扩散大语言模型(dLLMs)的并行解码性能

Yuji Ren, Chenkai Xu, Zhuocheng Gong, Jianguo Li, Zhijie Deng

机构 * Shanghai Jiao Tong University(上海交通大学) Ant Group(蚂蚁集团)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出CForce方法,通过一致性强制提升dLLMs的并行解码性能,在LLaDA模型上实验证实其在高并行解码预算下可优化速度-质量权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11593 2026-08-13 cs.SD eess.AS 新提交 75%

Luna-TTS Family Technical Report

Luna-TTS 系列技术报告

Feng Yin, Shuai Shi, Junjie Zheng, Kechenying Zhou, Yiqiu Wang, Chenyang He, Qiuhua Jiang, Mengxiao Bi, Yanmin Qian, Mingxin Chen, Xun Gong, Tianteng Gu, Bing Han, Peng Jiang, Chenda Li, Haiyang Sun, Han Wang, Wei Wang, Yi Wang, Leying Zhang, Wangyou Zhang, Chushu Zhou

机构 * VUI Labs Research(VUI实验室研究院)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 该研究提出基于扩散语言模型的 Luna-TTS 系列 TTS 系统,含非自回归与实时自回归变体,在多数据集上的语音识别、相似度及情感控制等指标优于对比系统。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12286 2026-08-13 math-ph math.MP 新提交 75%

PatternFormer: Learning Multiple Solution Patterns in Reaction--Diffusion Systems

PatternFormer:学习反应-扩散系统中的多种解模式

Zhipeng Chang, Wenpeng Yin, Wenrui Hao

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 该研究提出基于大语言模型的PatternFormer框架,可学习非线性偏微分方程的多种解,在非线性椭圆问题和Gray-Scott问题上表现优异,还可微调以构建解景观通用基础模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10489 2026-08-12 cs.CV 新提交 75%

When Vision Becomes Text: Visual Token Pruning via Cross-Modal Residual Guidance in VLMs

当视觉变为文本:视觉语言模型(VLM)中基于跨模态残差引导的视觉令牌剪枝

Congyang Ou, Ruike Song, Yang Zhou, Libo Sun, Haokui Zhang, Zhenbo Luo

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 该研究针对视觉语言模型(VLM)海量视觉令牌导致推理成本高的问题,提出基于跨模态残差(CMR)的无训练压缩方法SIEVE,在LLaVA-NeXT-7B上仅保留11.1%视觉令牌,实现显著加速与缓存缩减且性能损失极小。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07627 2026-08-11 cs.AI cs.CL cs.LG cs.MA 新提交 75%

From Single Chatbots to Governed Agent Ecosystems: An Agentic AI Pattern Catalogue and Orchestration Framework for Mission-Critical Hospital Information Management Systems

从单一聊天机器人到受管控的智能体生态系统:面向关键任务型医院信息管理系统的智能体AI模式目录与编排框架

Manideep Dhar, Ritwik Singh, Sharat Chandra Kumar Manikonda

专题命中 效率与部署 :LLM(abstract,abstract_cn);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对医院信息管理系统提出以合规为核心的智能体AI模式目录与编排框架,可减少文档处理时间等成本、强化管控,助力医院将AI投资转化为可持续回报。

Comments Peer-reviewed published article

Journal ref International Journal of Innovative Science and Research Technology (IJISRT), 11-2026(5), IJISRT26MAY1651

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05959 2026-08-07 cs.SE 新提交 75%

AgentExecutor: Partial Code Execution via Agentic Context Generation

AgentExecutor:基于智能体上下文生成的部分代码执行工具

Junkai Chen, Chengran Yang, Xing Hu, Zhenhao Li, Xin Xia, David Lo

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出多智能体框架AgentExecutor,通过三阶段设计和自适应优化策略提升部分代码执行效果,在两个数据集上的覆盖度、执行时间和成本均优于现有最优方法Treefix。

Comments ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04610 2026-08-06 cs.CV 新提交 75%

HiSC: Hierarchical Spatial Clustering Token Compression for Efficient 3D Scene Understanding

HiSC:用于高效3D场景理解的分层空间聚类令牌压缩

Jiuhe Qu, Yingping Liang, Ying Fu

机构 * Beijing Institute of Technology(北京理工大学)

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 本文提出无训练框架HiSC,通过SGraM策略和SCluP范式实现3D VLMs的分层空间聚类令牌压缩,在高剪枝率下实现超90%令牌减少且性能下降极小,验证了其有效性。

Comments Accepted by ACM MM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04405 2026-08-06 cs.LG cs.AI cs.CL 新提交 75%

Training-Free Hashing-Based Attention via Binary Principal Components

基于二元主成分的无训练哈希注意力机制

Daohai Yu, Zhanpeng Zeng, Keyu Chen, Wenhao Li, Zhifeng Shen, Luxi Lin, Ruizhi Qiao, Xing Sun, Rongrong Ji

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对长上下文LLMs自注意力的解码效率瓶颈,提出无训练的BinaryPC方法,通过数据二元主成分构建哈希码,在保持精度的同时将解码吞吐量提升3.56倍。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04175 2026-08-06 cs.CV 新提交 75%

TriCLE: Tri-Modal Vision-Language Reasoning for Edge-Deployed Fine-Grained Clustering

TriCLE:面向边缘部署的细粒度聚类的三模态视觉-语言推理

Kishor Datta Gupta, Md. Mahfuzur Rahman, Fahad Rahman, Ahmed Rafi Hasan, Faysal Mehrab Chowdhury, Mohd Ariful Haque, Roy George

机构 * Clark Atlanta University(克拉克亚特兰大大学) United International University(国际大学) North South University(北南大学)

专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract)

AI总结 TriCLE是面向边缘部署的三模态视觉-语言系统,通过生成伪热视图和伪激光雷达深度,结合对齐策略实现细粒度飞机聚类,适配8GB内存边缘设备,验证与测试均取得良好性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04033 2026-08-06 cs.CR 新提交 75%

SoK: How Frontier AI Reshapes System-Level Security Risk Dynamics in Critical Infrastructure

SoK:前沿人工智能如何重塑关键基础设施中的系统级安全风险动态

Chandra Thapa, Mohan Baruwal Chhetri, Marthie Grobler, Shahroz Tariq, Tooba Aamir

专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract)

AI总结 本研究提出五维风险动态框架,分析前沿人工智能重塑关键基础设施系统级安全风险的机制,指出学术研究与运营约束的错配,推动系统级安全保证研究。

Comments 19 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03796 2026-08-05 cs.CL cs.AI cs.LG 新提交 75%

Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss

大语言模型的高效知识蒸馏:离线Top-K对数概率与融合分块KL损失

Bakbergen Ryskulov, Iker García-Ferrero, David Montero, David Jansen, Ali Hashemi, Jezabel R. Garcia, Antonio Tiene, Román Orús

专题命中 效率与部署 :language model(abstract);small language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本研究针对大语言模型知识蒸馏成本高的问题,提出离线Top-K对数概率方法与融合分块KL损失,提升训练效率、降低内存占用,相关实现已开源。

Comments Patent Application Pending. EP26382987.1

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.28815 2026-08-03 cs.SE 新提交 75%

Preventing Premature Commitment in Coding Agents with an Evidence-Conditioned Execution Layer

通过证据条件执行层防止编码智能体的过早提交

Yisen Xu, Chenglin Li, Zehao Wang, Jinqiu Yang, Tse-Hsun Chen

专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract)

AI总结 ECLoop是介于编码智能体与仓库间的证据条件执行层,可防止过早提交,在SWE-bench Verified上提升Pass@1指标4.8-11.8个百分点,同时降低平均token消耗。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26513 2026-07-30 cs.RO 新提交 75%

Explicit Kinematic Guidance from Analytic Concepts for Vision-Language-Action Models

面向视觉-语言-动作模型的来自解析概念的显式运动学引导

Mingyang Sun, Jiude Wei, Xiujian Liang, Qichen He, Donglin Wang, Cewu Lu, Jianhua Sun

机构 * Zhejiang University(浙江大学) Shanghai Innovation Institute(上海创新研究院) Fudan University(复旦大学) Westlake University(西湖大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 效率与部署 :foundation model(abstract,abstract_cn);post-training(abstract)

AI总结 该研究针对视觉-语言-动作模型忽略3D物体结构信息的缺陷,构建概念专家模块生成解析概念,通过双阶段机制提供显式引导,提升了模型的操作成功率与学习效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24062 2026-07-28 cs.LG cs.AI cs.CL 新提交 75%

ACRL: Adaptive Control of Training-Inference Discrepancy for Stable Reinforcement Learning

ACRL:用于稳定强化学习的训练-推理差异自适应控制

Wenwu Fan, Qihong Lin, Zhijie Xia, Zhuo Zheng, Sihao Wang, Qiang Chen, Liangsheng Zhu

机构 * Huawei(华为)

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对大语言模型强化学习训练因训练与推理差异导致的不稳定问题,提出自适应控制强化学习(ACRL)方法,可维持训练-推理差异在合理范围,稳定训练,增加策略熵,提升探索与准确性,实验表现优于BF16基线和重要性采样修复。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.23665 2026-07-28 cs.SE 新提交 75%

Multi-level Code Optimization via Mixture of Prompts

通过混合提示进行多级代码优化

Yun Peng, Jun Wan, Jiakun Liu, Shuzheng Gao, David Lo, Xiaoxue Ren

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对代码优化中传统方法不适用于动态语言及现有大语言模型优化存在的问题,提出基于混合提示架构的Optimo方法,能在多个抽象层次优化代码,在不同代码基准测试中表现优异,大幅提升代码效率。

Comments This paper has been accepted by ASE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22545 2026-07-28 cs.LG cs.AI cs.CL cs.CR 新提交 75%

Semalith v1.4: A Calibrated 184M Safety Classifier Achieving State-of-the-Art Prompt-Injection Detection at 44x Fewer Parameters than Llama-Guard-3-8B

Semalith v1.4:一个经过校准的1.84亿参数安全分类器,在参数比Llama - Guard - 3 - 8B少44倍的情况下实现了先进的提示注入检测

Tejasvi C. Addagada

专题命中 效率与部署 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 研究针对金融服务等场景中大语言模型安全分类需求,提出Semalith v1.4分类器,能单步实现三轴安全分类,经训练和对比测试,在提示注入检测上表现出色且参数少,还给出不同场景下的部署建议。

Comments 16 pages, 8 tables, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.22184 2026-07-27 cs.CR cs.SE 新提交 75%

DeFiScreener: Efficient DeFi Attack Pre-screening in Smart Contracts via Historical Case Matching

DeFiScreener:通过历史案例匹配在智能合约中进行高效的DeFi攻击预筛选

Rui Cao, Shaojing Fan, Zhimei Sui, Liming Fang, Ziqi Yang, Yingying Jiao, Zhenguang Liu

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究针对DeFi安全风险检测覆盖有限的问题,提出DeFiScreener框架,通过构建函数调用树、利用大语言模型生成语义嵌入,经两级筛选识别潜在易受攻击的函数和调用序列,实验证明该框架在攻击预筛选中有高召回率和精确率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.19740 2026-07-23 cs.LO 新提交 75%

Neuro-Symbolic AI for Korean Criminal Law: Sentencing Prediction and Document Drafting

用于韩国刑法的神经符号人工智能:量刑预测与文件起草

Yeonseok Lee

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 针对韩国刑法中量刑预测与文件起草问题,提出神经符号框架,用大语言模型提取语义,可满足性模理论求解器计算法定罚款,减少幻觉风险,并纳入人工参与验证,对交通犯罪量刑指南形式化,支持简易起诉。

Comments 17 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.16100 2026-07-20 cs.DC 新提交 75%

Every Microsecond Matters: Achieving Near Speed-of-Light Latency in GPU Collectives

每微秒都至关重要:在GPU集合通信中实现接近光速的延迟

Siyuan Shen, Anton Korzh, John Bachan, Tiancheng Chen, Arnav Goel, Ludwig Schneider, Pouya Kousha, Zhenhao He, Sylvain Jeaugey, Kamil Iskra, Nishank Chandawala, Jeff R. Hammond, Torsten Hoefler

专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract)

AI总结 研究在扩展网络中使GPU集合通信接近硬件光速下限的方法,确定关键原则,基于NCCL开发低延迟接口实现新对称集合,微基准测试和实际应用表明能降低延迟、提升吞吐量,对AI推理和传统HPC工作负载有益。

详情

展开后加载摘要…

URL PDF HTML 收藏