Search Your Block Floating Point Scales!
在浮点尺度中搜索!
机构 * NVIDIA ; vLLM ; AI & vLLM Project ; Dao et al.
AI总结 本文提出ScaleSearch方法,通过细粒度搜索优化量化误差,提升模型性能,并引入ScaleSearchAttention加速语言模型。
大厂专区
在浮点尺度中搜索!
机构 * NVIDIA ; vLLM ; AI & vLLM Project ; Dao et al.
AI总结 本文提出ScaleSearch方法,通过细粒度搜索优化量化误差,提升模型性能,并引入ScaleSearchAttention加速语言模型。
SmellBench:评估LLM代理在建筑代码异味修复上的表现
机构 * University of Craiova(克劳索瓦大学) ; NVIDIA(NVIDIA公司) ; University Politehnica of Bucharest(布加勒斯特理工大学)
AI总结 本文提出SmellBench框架,用于评估LLM代理在修复建筑代码异味方面的性能,通过专家验证发现最佳代理修复率为47.7%,但修复 aggressiveness 与代码库质量呈负相关。
DWDP:分布式权重数据并行用于NVL72上的高性能LLM推理
机构 * NVIDIA
AI总结 本文提出DWDP,一种无需层间同步的分布式权重数据并行策略,通过跨peer GPU卸载MoE权重和按需获取缺失专家,提升LLM推理性能,实测在8K输入和1K输出序列长度下,端到端TPS/GPU提升8.8%。
Comments Technical Report. 17 pages. 8 figures
Tacmap: 通过几何一致的穿透深度图弥合触觉仿真到现实的差距
机构 * Sharpa ; HKUST(香港科技大学) ; NVIDIA(英伟达)
AI总结 Tacmap通过统一的变形地图表示弥合触觉仿真与现实的差距,利用体积穿透深度实现高保真且高效的触觉仿真,验证了在抓取任务中仿真政策的零样本迁移能力。
Comments 8 pages
通过上下文学习检测大语言模型中的数据污染
机构 * NVIDIA
AI总结 本文提出CoDeC方法,通过测量上下文学习对模型性能的影响,检测并量化大语言模型训练数据污染,揭示开放权重模型中的记忆现象。
混沌背后的模式:为高效大规模MoE LLM推理预测数据移动
机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) ; Columbia University(哥伦比亚大学) ; NVIDIA
AI总结 研究通过分析大规模MoE模型的数据移动模式,提出优化方法,提升大规模LLM推理效率,实现6.6倍平均加速和1.25倍速度提升。
ShardTensor:用于科学机器学习的领域并行
机构 * NVIDIA Santa Clara, CA, USA(NVIDIA 圣克拉拉加州 USA)
AI总结 本文提出ShardTensor,一种领域并行新范式,通过解耦输入数据的空间维度与硬件限制,实现输入数据灵活扩展,提升科学机器学习的训练和推理精度与效率。
Comments 10 pages, 7 figures, 2 tables
训练用于KV缓存压缩性的Transformer
机构 * University of Oxford(牛津大学) ; Technion – Israel Institute of Technology(技术ion理工学院) ; AITHYRA ; NVIDIA
AI总结 本文提出KV-CAT训练方法,通过训练时的KV稀疏化策略,引导模型学习可压缩的表示,提升下游压缩方法的质量-预算权衡。
Comments 32 pages, 4 figures