数字人动画快13倍!苹果把建脸和动脸分开算
苹果研究团队提出GHARP,用少量人物照片建立数字人,再用表情信号驱动脸部动画。它把一次性的建脸与持续的动脸分开计算。在论文的A100测试中,动画阶段相对对照方法最高快约13倍,输入照片增多时,每帧动画开销仍保持固定。
苹果研究团队提出GHARP,用少量人物照片建立数字人,再用表情信号驱动脸部动画。它把一次性的建脸与持续的动脸分开计算。在论文的A100测试中,动画阶段相对对照方法最高快约13倍,输入照片增多时,每帧动画开销仍保持固定。
谷歌、伊利诺伊大学厄巴纳香槟分校等机构提出BudgetPix,把生成图像的计算按细节复杂度分配。背景用较大的图块,复杂纹理保留细小图块。在论文的两组文本生图测试中,模型使用约25%的计算预算,仍得到接近完整预算的图像保真度。
亚利桑那州立大学、约翰斯·霍普金斯大学提出TileSkipper,为已经训练好的3D高斯场景预先分配不同渲染阈值。在3840像素宽的固定策略扫描中,数据集宏平均加速达到1.238倍,平均PSNR变化为负0.023分贝。导出策略每个高斯只增加
阿里巴巴、中科大、香港中文大学、浙江大学提出VisionWeave,让看图模型根据内容决定哪里细看、哪里用粗块表示。在Qwen3.8-27B的八项基准上,它平均减少43%的视觉Token,保留约98.9%的原生表现。接入SGLang后,论文
高通AI研究院、密歇根大学等机构提出DyRA,在压缩矩阵计算之后,按当前输入补偿输出误差。DINOv3实测端到端GPU加速1.5倍,相比只压缩权重的对照,精度退化减少超过3倍。视觉、语音和语言实验显示,省计算时检查实际输出,比只追求权重接近
Magiclab Robotics、浙江大学与东南大学研究视觉—语言—动作模型的实时执行,把10步去噪压到非均匀两步,并搭建端到端诊断框架。论文报告模型推理由61.557毫秒降至21.956毫秒,但同时强调通信、调度、平滑与机械响应也会决定
Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到
英伟达团队提出SoL-Refiner,把低分辨率视频升级到4K所需的扩散精修压缩为一次去噪。它在约2K设置中同时领先多种外部精修器,并凭完整加速栈把相对三步基线的精修延迟缩短到原来的约九分之一。
加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。
巴塞罗那超级计算中心、加泰罗尼亚理工大学系统测试了13种混合精度量化敏感度指标。梯度方法在8个模型-硬件配置中4个发生灾难性失败,Jensen-Shannon散度则为零;再配合K-Means分组,方案在近乎无精度损失下平均加速1.81倍。
英伟达、麻省理工学院与南洋理工大学等机构联合推出高效率编程智能体框架SoL-Pi,攻克了自主软件工程中的Token与成本激增难题。研究团队构建自动化研究循环,由AI智能体自主探索并提炼出四项底层交互压缩机制,在不损伤任务解决率的前提下将To
北京大学、清华大学与阿里巴巴集团等机构联合推出视频扩散加速方案SparkDiffusion,攻克了长视频生成中的计算瓶颈。研究团队针对Wan2.1开源大模型设计动态稀疏路由与误差自校准机制,在保持画面完整的前提下剔除多达97%的冗余计算。单
处理数十万字超长上下文时,传统的全注意力计算开销随长度呈二次方暴涨,导致首字延迟与算力成本难以承受。清华大学联合阿里巴巴、中国科学技术大学与上海人工智能实验室等机构推出了免训练的解耦块稀疏注意力机制BSA。该机制将稀疏路由计算耗时压缩至3.
投机解码能大幅加快大模型推理,但传统方案中草稿模型保留的KV缓存占据了宝贵显存,在高并发服务下极易引发显存枯竭。哈佛大学联合第一资本、红帽公司与英伟达等机构推出了全新投机解码框架H-Spec。该架构将草稿模型的KV缓存彻底归零,同时将平均T
线性注意力与RNN模型在长序列处理中具备恒定推理显存优势,但其隐藏状态更新受限于标量衰减,在复杂状态追踪上明显逊色于Transformer。弗莱堡大学联合微软研究院、图宾根大学与洛桑联邦理工学院等机构推出了复数域增量更新架构Complex
北京大学、清华大学、阿里巴巴等机构提出SparkDiffusion,把视频扩散的稠密注意力改成97%稀疏,并把50步生成压到3步。在Wan2.1 14B的720P测试中,单张RTX 5090端到端最高加速265倍,1.3B模型生成480P视
东京大学团队推出LunaDrive,把基于氮化镓器件的高压驱动器装到扁平无刷电机背部。系统在96伏下实现连续30安、峰值80安和最高3110赫兹电频率,并用100伏电池完成高速负载举升,验证高压关节的短时动态能力。
论文公开页面未披露作者机构。研究重新检查AI生成GPU内核的正确性和真实工作负载占比:一个曾被计为283倍加速的内核只写入0.3%输出;即使替换可优化算子,Transformer端到端现实改善也约为1%,局部跑分不能直接代表整机收益。
一位法国分析师的热文,让内蒙古乌兰察布在海外刷屏:这座150万人口的草原小城,签约标准机架已超500万架,将成为全球规模最大的数据中心集群,签约总投资超5000亿元,华为、阿里、字节、百度都在此训练大模型。冷风、绿电,加上距北京毫秒级直达光
英伟达、南洋理工大学和麻省理工学院团队提出SoL-Pi,让自动研究循环直接优化Coding Agent外层框架。在51项EdgeBench任务上,它与Pi表现相近,却把记录到的Token流量减少44.7%—49.0%,API成本约降三分之一