arXivDaily arXiv每日学术速递 周一至周五更新

大厂专区

NVIDIA(英伟达)

2026-05-13 至 2026-05-13 共收录 8
2605.12464 2026-05-13 cs.LG cs.AR cs.PF

Search Your Block Floating Point Scales!

在浮点尺度中搜索!

Tanmaey Gupta, Hayden Prairie, Xiaoxia Wu, Reyna Abhyankar, Qingyang Wu, Austin Silveria, Pragaash Ponnusamy, Jue Wang, Ben Athiwaratkun, Leon Song, Tri Dao, Daniel Y. Fu, Chris De Sa

机构 * NVIDIA vLLM AI & vLLM Project Dao et al.

AI总结 本文提出ScaleSearch方法,通过细粒度搜索优化量化误差,提升模型性能,并引入ScaleSearchAttention加速语言模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07001 2026-05-13 cs.SE cs.CL

SmellBench: Evaluating LLM Agents on Architectural Code Smell Repair

SmellBench:评估LLM代理在建筑代码异味修复上的表现

Ion George Dinu, Marian Cristian Mihăescu, Traian Rebedea

机构 * University of Craiova(克劳索瓦大学) NVIDIA(NVIDIA公司) University Politehnica of Bucharest(布加勒斯特理工大学)

AI总结 本文提出SmellBench框架,用于评估LLM代理在修复建筑代码异味方面的性能,通过专家验证发现最佳代理修复率为47.7%,但修复 aggressiveness 与代码库质量呈负相关。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01621 2026-05-13 cs.DC cs.AI

DWDP: Distributed Weight Data Parallelism for High-Performance LLM Inference on NVL72

DWDP:分布式权重数据并行用于NVL72上的高性能LLM推理

Wanqian Li, Jintao Peng, Zongfei Jing, Tianyu Zhang, Ze Long, Xianjie Qiao, Xiaoming Chen, Dongxu Yang, Kefeng Duan, June Yang

机构 * NVIDIA

AI总结 本文提出DWDP,一种无需层间同步的分布式权重数据并行策略,通过跨peer GPU卸载MoE权重和按需获取缺失专家,提升LLM推理性能,实测在8K输入和1K输出序列长度下,端到端TPS/GPU提升8.8%。

Comments Technical Report. 17 pages. 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21625 2026-05-13 cs.RO

Tacmap: Bridging the Tactile Sim-to-Real Gap via Geometry-Consistent Penetration Depth Map

Tacmap: 通过几何一致的穿透深度图弥合触觉仿真到现实的差距

Lei Su, Zhijie Peng, Renyuan Ren, Shengping Mao, Juan Du, Kaifeng Zhang, Xuezhou Zhu

机构 * Sharpa HKUST(香港科技大学) NVIDIA(英伟达)

AI总结 Tacmap通过统一的变形地图表示弥合触觉仿真与现实的差距,利用体积穿透深度实现高保真且高效的触觉仿真,验证了在抓取任务中仿真政策的零样本迁移能力。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27055 2026-05-13 cs.CL cs.AI

Detecting Data Contamination in LLMs via In-Context Learning

通过上下文学习检测大语言模型中的数据污染

Michał Zawalski, Meriem Boubdir, Klaudia Bałazy, Besmira Nushi, Pablo Ribalta

机构 * NVIDIA

AI总结 本文提出CoDeC方法,通过测量上下文学习对模型性能的影响,检测并量化大语言模型训练数据污染,揭示开放权重模型中的记忆现象。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.05497 2026-05-13 cs.DC cs.AI cs.AR cs.LG

Patterns behind Chaos: Forecasting Data Movement for Efficient Large-Scale MoE LLM Inference

混沌背后的模式:为高效大规模MoE LLM推理预测数据移动

Zhongkai Yu, Yue Guan, Zihao Yu, Chenyang Zhou, Zhengding Hu, Shuyi Pei, Yangwook Kang, Yufei Ding, Po-An Tsai

机构 * Indiana University Bloomington(印第安纳大学布卢明顿分校) Columbia University(哥伦比亚大学) NVIDIA

AI总结 研究通过分析大规模MoE模型的数据移动模式,提出优化方法,提升大规模LLM推理效率,实现6.6倍平均加速和1.25倍速度提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11111 2026-05-13 cs.DC cs.LG

ShardTensor: Domain Parallelism for Scientific Machine Learning

ShardTensor:用于科学机器学习的领域并行

Corey Adams, Peter Harrington, Akshay Subramaniam, Mohammad Shoaib Abbas, Jaideep Pathak, Mike Pritchard, Sanjay Choudhry

机构 * NVIDIA Santa Clara, CA, USA(NVIDIA 圣克拉拉加州 USA)

AI总结 本文提出ShardTensor,一种领域并行新范式,通过解耦输入数据的空间维度与硬件限制,实现输入数据灵活扩展,提升科学机器学习的训练和推理精度与效率。

Comments 10 pages, 7 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05971 2026-05-13 cs.LG

Training Transformers for KV Cache Compressibility

训练用于KV缓存压缩性的Transformer

Yoav Gelberg, Yam Eitan, Michael Bronstein, Yarin Gal, Haggai Maron

机构 * University of Oxford(牛津大学) Technion – Israel Institute of Technology(技术ion理工学院) AITHYRA NVIDIA

AI总结 本文提出KV-CAT训练方法,通过训练时的KV稀疏化策略,引导模型学习可压缩的表示,提升下游压缩方法的质量-预算权衡。

Comments 32 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏