Flash-GMM: A Memory-Efficient Kernel for Scalable Soft Clustering
Flash-GMM:一种用于可扩展软聚类的内存高效内核
机构 * IBM Research(IBM研究院)
AI总结 提出Flash-GMM融合Triton内核,在单GPU通次中高效计算高斯混合模型,通过避免实例化完整责任矩阵,实现20倍加速并支持比先前大100倍的数据集训练,集成到IVF粗量化器中提升ANN搜索性能。
大厂专区
Flash-GMM:一种用于可扩展软聚类的内存高效内核
机构 * IBM Research(IBM研究院)
AI总结 提出Flash-GMM融合Triton内核,在单GPU通次中高效计算高斯混合模型,通过避免实例化完整责任矩阵,实现20倍加速并支持比先前大100倍的数据集训练,集成到IVF粗量化器中提升ANN搜索性能。
插入语言模型的连续时间马尔可夫链框架
机构 * UMass Amherst(马萨诸塞大学阿默斯特分校) ; IBM Research(IBM研究院) ; University of Toronto(多伦多大学) ; Vijil(维吉尔)
AI总结 提出基于连续时间马尔可夫链的插入语言模型去噪框架,统一现有方法,在规划任务中优于自回归和掩码扩散模型,语言建模中与现有方法竞争且采样更灵活。
Comments Accepted at AISTATS 2026. Code is available at https://github.com/dhruvdcoder/ctmc_dilm
CodeAlchemy:大规模合成代码重写
机构 * MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究院)
AI总结 提出CodeAlchemy框架,通过5种策略生成超过500B token的合成代码数据,引入DevEval和TraceEval基准,3B模型在多项任务上超越10倍大小的前沿模型。