IBM让大模型给数据库写GPU算子,22条查询全通过并加速2.11倍
数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内
数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内
机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。
输入一句文字,同时生成画面和匹配的声音,省掉了视频生成后再配音的串联步骤,但联合模型也把两种模态的计算成本叠到一起。浙江大学、清华大学、新加坡国立大学等机构提出TurboT2VA,用蒸馏与推理优化加速190亿参数的LTX-2音视频模型。
一个完整神经语音合成系统,从音素ID一路生成22.05kHz波形,部署图只有567008个参数,两个int8数据块合计679832字节。Ampixa Labs提出sanoTTS,在不使用神经加速器的ESP32-S3上,生成4.54秒语音耗时
智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。
编程智能体在真实仓库里会压缩上下文、反复调用工具、重启环境,训练器很难精确知道哪些Token由当前策略生成。华为、香港中文大学提出LEGO-RL,在不改动Agent内部控制流的前提下,把OpenHands SDK、Claude Code和O
训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型
扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。
自动驾驶模型如果每次思考要717毫秒,车辆一秒只能更新约1.4次决策。普林斯顿大学与加州大学圣迭戈分校提出FlashDrive,把Alpamayo 1.5-10B视觉—语言—动作模型在单张GPU上的端到端延迟压到151毫秒,频率升至6.6H
复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。
Meta AI、普林斯顿和MIT提出Gambit,把大模型的测试时推理改成“思维层面的束搜索”。它不再让大量推理轨迹各自跑到底,而是周期性砍掉低质量路径,把释放的算力立即用来复制更好的思路前缀。
把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力
扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量
处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。
腾讯、帝国理工学院、密歇根大学等机构的研究人员提出LoCA。它先用一次反向传播完成校准,后续适配只运行前向计算和局部闭式求解。包含校准在内,全程GPU峰值内存比LoRA低26%至29%。
复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。
英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Toke
清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7
视频生成正在变成一道长序列题:一段高分辨率视频摊成 token 后动辄十几万,扩散 Transformer 里的全注意力显存随帧数平方膨胀,训练账单越来越贵。Adobe Research 提出 Chimera,一套混合视觉扩散 Transf
中国农业大学、北京师范大学和新加坡国立大学联合提出了TIDE(Tracking Identities with Dual-branch Elasticity),一种用于密集同质目标跟踪的双分支弹性框架。在MFT-Edge基准上,轻量L分支仅