Tangram: Hiding GPU Heterogeneity for Efficient LLM Parallelization
Tangram: 隐藏GPU异构性以实现高效的大语言模型并行化
专题命中 效率与部署 :LLM(title,abstract)
AI总结 提出Tangram系统,通过将并行化规划与GPU异构性解耦,利用同构GPU岛和模型切片组合成工作平衡流水线,实现现有异构不可知并行化器在异构集群中的高效使用,训练吞吐量提升高达2.3倍。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
Tangram: 隐藏GPU异构性以实现高效的大语言模型并行化
专题命中 效率与部署 :LLM(title,abstract)
AI总结 提出Tangram系统,通过将并行化规划与GPU异构性解耦,利用同构GPU岛和模型切片组合成工作平衡流水线,实现现有异构不可知并行化器在异构集群中的高效使用,训练吞吐量提升高达2.3倍。
视觉编码器作为隐私边界:无编码器视觉-语言模型中的视觉令牌侧信道
机构 * School of Engineering, Institute of Science Tokyo(东京科学大学工学院) ; College of Control Science and Engineering, Zhejiang University(浙江大学控制科学与工程学院) ; Department of Electrical and Computer Engineering, National University of Singapore(新加坡国立大学电气与计算机工程系)
专题命中 效率与部署 :language model(title,abstract)
AI总结 研究无编码器视觉-语言模型中视觉令牌侧信道导致的隐私泄露问题,通过解码器攻击从中间视觉令牌恢复图像和文本,发现空间采样保真度是关键因素,并指出KV缓存也存在泄露风险。
实时语言模型阻塞:现场音乐伴奏生成的案例研究
机构 * MBZUAI(穆罕默德·本·扎耶德人工智能大学)
专题命中 效率与部署 :language model(title,abstract)
AI总结 提出StreamMUSE系统,在客户端-服务器架构中实现帧同步流式推理,通过现场音乐伴奏任务验证了不同延迟环境下实时同步的有效性。
Comments Accepted to RTAS 2026. 14 pages, 5 figures, 3 tables
自精化流水线中的非对称容量分配
机构 * Drexel University(德雷塞尔大学) ; University of California Irvine(加州大学欧文分校)
专题命中 效率与部署 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.LG
AI总结 本研究针对自精化流水线开展分阶段模型规模研究,发现生成、修订阶段需更大模型,批判阶段对规模不敏感,为多阶段语言模型系统的非对称容量分配提供了实用指导。
基于协同蒸馏发现与双引导鲁棒训练的开放词汇三维目标检测
机构 * School of Computer Science and Engineering, University of Electronic Science and Technology of China(电子科技大学计算机科学与工程学院) ; Singapore University of Technology and Design(新加坡科技设计大学) ; School of Computer Science and Technology, Hainan University(海南大学计算机科学与技术学院)
专题命中 效率与部署 :LLM(abstract,abstract_cn);foundation model(abstract);分类 cs.AI
AI总结 本研究提出含协同蒸馏发现与双引导训练的开放词汇3D目标检测框架,在SUN RGB-D等数据集上性能优于现有最优方法。
Comments Accepted by ECCV26
超越FLOPs:面向代码相关任务的可持续大语言模型的能量感知知识蒸馏
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对代码相关任务,发现FLOPs并非可靠的能耗指标,提出结合能量代理模型的Morph知识蒸馏方法,可将学生模型推理能耗降90%、内存降86%,实现LLMs的可持续部署。
PWLR:用于边界感知分布外检测的成对见证局部拒绝
机构 * Guangdong Provincial Key Laboratory of Stomatology(广东省口腔医学重点实验室) ; Key Laboratory of Machine Intelligence and Advanced Computing, MOE(教育部机器智能与先进计算重点实验室)
专题命中 效率与部署 :LLM(abstract,abstract_cn);prompting(abstract);分类 cs.LG
AI总结 针对视觉语言检测器极少用语言作为混淆ID类别边界证据的问题,提出PWLR方法,结合MLLM生成的局部线索与全局类别得分,在多基准上改进了视觉语言基线的OOD检测性能。
Comments Accepted by ACM MM 2026
将反向KL重新思考为自适应熵蒸馏
机构 * School of Computer Science and Engineering, Sun Yat-sen University(中山大学计算机科学与工程学院) ; School of Science and Technology, Hong Kong Metropolitan University(香港都会大学科技学院)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 该研究针对知识蒸馏难以平衡忠实模仿与鲁棒生成的问题,提出自适应熵蒸馏(AED)方法,通过分解反向KL目标函数并利用教师熵动态校准模仿强度,在指令遵循与数学推理基准上表现更优。
Tripwire:通过统计验证的安全神经元触发对齐后的拒绝行为
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文提出无需训练的Tripwire防御方法,通过统计验证安全神经元触发对齐拒绝,将攻击成功率降至最高2.0%,MT-Bench实用性下降仅0.5%-5.3%,为最优防御之一。
基于几何知识蒸馏的时序锚定组合式相机运动理解
机构 * The Hong Kong University of Science and Technology(香港科技大学) ; Tencent(腾讯)
专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.AI
AI总结 本研究提出CamDistill方法,通过几何知识蒸馏实现时序锚定的组合式相机运动理解,推出含4229个片段的CamChoreo基准,提升了相机运动识别的细粒度与效率。
SiriusDeliver:腾讯的数据仓库交付自动化方案
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 腾讯提出SiriusDeliver端到端交付自动化智能体,集成三类组件,经离线实验和腾讯云WeData大规模部署验证,可显著提升DW交付的成功率、效率,缩短交付时间与工程师工作量。
Comments 13 pages, 13 figures, 3 tables. Under submission
SwiftQK:面向查询-键归一化的快速且通信高效的张量并行方法
机构 * Korea University(高丽大学)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 SwiftQK是一种多GPU的RMSNorm核,通过仅交换标量归一化统计量并重叠归约与计算,大幅降低了张量并行下查询-键归一化的通信开销与延迟,提升了大型语言模型的推理效率。
RP-OPSD:基于推理枢轴引导的多语言推理迁移在线策略自蒸馏
机构 * Nanjing University(南京大学)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对多语言推理迁移中现有在线策略自蒸馏未优先考虑关键推理信号的问题,提出 RP-OPSD 方法,利用教师视图分布偏移引导特权蒸馏,在 17 种语言的数学推理基准上优于基线,提升了多语言推理能力。
Comments 16 pages. Under review
基于归因引导调控的大语言模型谄媚行为的令牌级诊断
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本研究针对大语言模型的谄媚行为,提出基于集成梯度的权威份额指数进行令牌级归因诊断,构建调控向量实现推理时无重训的谄媚缓解,使最极端案例的谄媚率从96%降至25%。
保真度≠安全性:轻度压缩的大语言模型通过所有无数据质量防护,但在智能体执行中生成指令中不存在的流程步骤
专题命中 效率与部署 :LLM(summary_cn);language model(abstract);分类 cs.CL
AI总结 该研究发现轻度压缩LLM虽通过困惑度、MMLU等无数据质量防护,但在智能体执行SOP时会生成指令外流程步骤,提出基于压缩误差双轴统计量的无数据筛查方法以保障智能体安全。
基于特权自蒸馏的对比强化策略优化
专题命中 效率与部署 :large language model(abstract);language model(abstract);post-training(abstract);分类 cs.LG
AI总结 该研究针对在线策略自蒸馏的暴露偏差问题,提出CRPO方法,通过对比学习与分组对比保留优化信号,在13个推理基准上提升了训练稳定性与泛化性。
卡尔曼与课程学习结合:面向自适应RL微调的高效动态提示选择
机构 * Beihang University(北京航空航天大学) ; Zhongguancun Academy(中关村学院) ; Nanyang Technological University(南洋理工大学) ; Communication University of China(中国传媒大学)
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出KGPS方法,将提示选择转化为动态状态估计问题,适配RL训练动态,在多推理基准和RL算法上较基线提升准确率与rollout效率,在在线提示选择中达最优。
OmniQEC:通过人工智能科学家发现实用的量子纠错码
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究旨在发现实用量子纠错码,核心方法是用OmniQEC,它结合自我进化推理与慢快协同工作流程,通过代码级代理探索候选方案并经电路级评估反馈证据。贡献是发现的代码性能优且硬件友好,为大语言模型辅助量子纠错发现奠基。
Comments Comments are welcome
从零开始扩展原生多模态预训练
机构 * The Chinese University of Hong Kong(香港中文大学) ; LLM Department, Tencent(腾讯大语言模型部)
专题命中 效率与部署 :large language model(abstract);language model(abstract);foundation model(abstract);分类 cs.CL
AI总结 研究在固定计算预算下训练基于Transformer的视觉语言模型的最优模型大小和token数量,发现语言和多模态目标扩展行为不同,推导效率前沿,还表明原生多模态预训练能促进跨模态转移,为扩展多模态基础模型奠定基础。
增强小型语言模型以实现射电天文学中的可持续代码优化
专题命中 效率与部署 :large language model(abstract);language model(abstract);small language model(abstract);分类 cs.AI
AI总结 研究利用小型语言模型(SLMs)优化射电天文学代码,通过多采样生成策略和纳入编译器反馈两种方式增强SLMs,提高代码生成质量和性能,用更少计算资源匹配或超越大型单生成模型,且使所有测试模型持续改进。
HARP:人机人工智能研究平台
机构 * BTPX Innovation Lab(BTPX创新实验室)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究旨在设计人机人工智能研究平台(HARP),通过让参与者在可控模拟场景中与可配置实时人工智能代理互动,研究人员可控制多种因素并记录相关数据,能系统测试人工智能设计选择对用户的影响。
Comments 5 pages, 3 figures, SAP Academic Community Conference North America, 2026
孪生智能体:用于特权分离智能体的上下文残差压缩
机构 * University of California, Berkeley(加州大学伯克利分校) ; University of Chicago(芝加哥大学) ; University of Illinois, Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 针对大语言模型智能体易受安全风险问题,提出孪生智能体模式,由探索和安全智能体组成,通过探索智能体传递紧凑提示,减少信息需求,在保持高任务效用的同时防止提示注入攻击,优于其他基线。
用于跨语言立场检测的基于理由引导的知识蒸馏
机构 * School of Foreign Studies, Hefei University of Technology(合肥工业大学外国语学院) ; School of Computer Science and Information Engineering, Hefei University of Technology(合肥工业大学计算机与信息工程学院) ; Hefei Institute of Technology(合肥学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);prompting(abstract);分类 cs.CL
AI总结 针对跨语言立场检测中现有方法忽视推理过程及大语言模型存在局限性的问题,提出基于理由引导的知识蒸馏框架,用思维链提示引导大语言模型生成理由并提炼知识至学生模型,设计双路径蒸馏机制及对比学习策略,实验证明该方法优于基线。
Comments 23 pages, 7 figures, 3 tables
VDAR-Router:通过语言化查询难度分析检索实现自适应语言模型路由
机构 * National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对大语言模型路由中忽视查询潜在难度问题,提出VDAR-Router框架,通过生成难度分析、检索相似示例来估计模型适用性,经实验验证该方法能实现更好成本性能权衡,明确查询分析有助于做出更可靠路由决策。
基于仿真推理的程序合成:联合模型选择与参数估计
机构 * Anthropic
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究提出结合大语言模型与神经仿真推理的框架,用于联合模型选择与参数估计。给定自然语言描述,大语言模型提出候选程序,经反馈驱动变异和神经密度估计评估,能在一组模型上推理,在多基准测试中可从提示识别合理模型族。
Comments 15+7 pages, 4+2 figures
无线通信算法的自主发现
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究旨在探索大语言模型驱动的进化搜索在无线通信算法自主发现中的应用,通过AITE框架解决复杂通信问题,在两个物理层任务中取得成果,展现了该方法在发现下一代无线通信算法上的潜力。
D-cut:用于批量推测解码的自适应验证深度剪枝
机构 * Tencent(腾讯)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 研究针对高并发下推测解码中长草稿浪费计算资源问题,提出D-Cut自适应剪枝方法,跨批次联合选草稿令牌,依接受长度差异和运行时成本模型自适应调整,实验表明该方法能显著提升加速比。
ExaGEMM:通过用于低位GEMM的关联寄存器内计算实现CPU驱动的ML推理的探索框架
机构 * University of California, Irvine(加州大学伊文斯分校)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.LG
AI总结 研究低位GEMM在CPU上的适配问题,提出ExaGEMM框架,通过寄存器驻留查找表执行及分析模型共同探索参数化内核和SIMD ISA支持,缩减候选空间,经验证可大幅提升推理延迟,凸显工作负载感知前沿选择对混合精度LLM工作负载的重要性。
Comments Accepted to ICCAD 2026
WaterMoE:基于专家路由的高保真高效水印技术
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Innovation Institute(上海创新研究院) ; Tianjin University(天津大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对大型语言模型水印技术实践中模型性能下降和推理开销大的问题,提出WaterMoE方案,通过在专家选择中嵌入水印信号,在推理循环中实现水印嵌入,实验证明其保真性能好、优于现有方法且开销小,可用于实际任务。
Comments 21 page
HCRMap:用于3.5D MoE小芯片推理的压力感知热专家驻留映射
机构 * Nanjing Vocational College of Information Technology(南京信息技术职业学院)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对3.5D MoE推理中专家热度偏差问题,提出HCRMap框架,基于专家热度等因素动态管理专家副本,映射令牌组,有效缓解通信、内存和队列瓶颈,实验显示其能显著降低端到端延迟。
Comments 15 pages, 8 figures, 2 tables