arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

芯片、算力、部署、推理效率与系统优化。

2610.10945 视觉与生成

数字人动画快13倍!苹果把建脸和动脸分开算

苹果研究团队提出GHARP,用少量人物照片建立数字人,再用表情信号驱动脸部动画。它把一次性的建脸与持续的动脸分开计算。在论文的A100测试中,动画阶段相对对照方法最高快约13倍,输入照片增多时,每帧动画开销仍保持固定。

苹果等
文章封面
2610.12307 视觉与生成

画图只用25%算力,谷歌等把预算花在复杂细节上

谷歌、伊利诺伊大学厄巴纳香槟分校等机构提出BudgetPix,把生成图像的计算按细节复杂度分配。背景用较大的图块,复杂纹理保留细小图块。在论文的两组文本生图测试中,模型使用约25%的计算预算,仍得到接近完整预算的图像保真度。

谷歌、伊利诺伊大学厄巴纳香槟分校等
文章封面
2610.09343 AI基础设施

4K场景渲染快23.8%,TileSkipper给每个高斯只加1字节

亚利桑那州立大学、约翰斯·霍普金斯大学提出TileSkipper,为已经训练好的3D高斯场景预先分配不同渲染阈值。在3840像素宽的固定策略扫描中,数据集宏平均加速达到1.238倍,平均PSNR变化为负0.023分贝。导出策略每个高斯只增加

亚利桑那州立大学、约翰斯·霍普金斯大学等
文章封面
2610.07987 AI基础设施

阿里、中科大等让AI挑着细看,省43%视觉Token保留98.9%表现

阿里巴巴、中科大、香港中文大学、浙江大学提出VisionWeave,让看图模型根据内容决定哪里细看、哪里用粗块表示。在Qwen3.8-27B的八项基准上,它平均减少43%的视觉Token,保留约98.9%的原生表现。接入SGLang后,论文

阿里巴巴、中科大、香港中文大学、浙江大学等
文章封面
2610.02882 AI基础设施

高通&密歇根大学给压缩计算补误差,DINOv3跑快1.5倍

高通AI研究院、密歇根大学等机构提出DyRA,在压缩矩阵计算之后,按当前输入补偿输出误差。DINOv3实测端到端GPU加速1.5倍,相比只压缩权重的对照,精度退化减少超过3倍。视觉、语音和语言实验显示,省计算时检查实际输出,比只追求权重接近

高通AI研究院、密歇根大学等
文章封面
2609.39822 具身智能与机器人

机器人思考从10步砸到2步,推理时间61.557ms降到21.956ms

Magiclab Robotics、浙江大学与东南大学研究视觉—语言—动作模型的实时执行,把10步去噪压到非均匀两步,并搭建端到端诊断框架。论文报告模型推理由61.557毫秒降至21.956毫秒,但同时强调通信、调度、平滑与机械响应也会决定

Magiclab Robotics、浙江大学、东南大学等
文章封面
2609.39223 AI基础设施

H100没有FP4核心也能训,QATFactory把9B模型NVFP4准确率拉到68.9%

Together AI、伊利诺伊大学香槟分校与得克萨斯大学奥斯汀分校提出QATFactory,让没有原生FP4训练单元的H100也能模拟NVFP4和MXFP4量化感知训练。在9B模型的论文设定中,NVFP4准确率达68.9%;框架覆盖8B到

Together AI、伊利诺伊大学香槟分校、得克萨斯大学奥斯汀分校等
文章封面
2609.37969 视觉与生成

英伟达把4K视频精修压成一步:延迟直接加速8.91倍

英伟达团队提出SoL-Refiner,把低分辨率视频升级到4K所需的扩散精修压缩为一次去噪。它在约2K设置中同时领先多种外部精修器,并凭完整加速栈把相对三步基线的精修延迟缩短到原来的约九分之一。

英伟达等
文章封面
2609.38166 AI基础设施

大模型长文本卡在“状态读写”:8比特量化把内核提速3.7倍

加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等机构提出LeapQuant,专门压缩线性注意力反复读写的状态。它无需重新训练,在接近FP32精度时把相关内核平均加速2.05至3.70倍,并在多款GPU上获得1.47倍端到端加速。

加州大学伯克利分校、华盛顿大学、麻省理工学院、英伟达等
文章封面
2609.28262 AI基础设施

边缘CPU跑视觉模型,近乎不掉精度平均快1.81倍

巴塞罗那超级计算中心、加泰罗尼亚理工大学系统测试了13种混合精度量化敏感度指标。梯度方法在8个模型-硬件配置中4个发生灾难性失败,Jensen-Shannon散度则为零;再配合K-Means分组,方案在近乎无精度损失下平均加速1.81倍。

巴塞罗那超级计算中心、加泰罗尼亚理工大学等
文章封面
2609.20519 Agent

英伟达MIT联手造出SoL-Pi:AI写代码Token直降49%,成本暴砍三分之一

英伟达、麻省理工学院与南洋理工大学等机构联合推出高效率编程智能体框架SoL-Pi,攻克了自主软件工程中的Token与成本激增难题。研究团队构建自动化研究循环,由AI智能体自主探索并提炼出四项底层交互压缩机制,在不损伤任务解决率的前提下将To

英伟达、麻省理工学院、南洋理工大学等
文章封面
2609.23153 AI基础设施

单卡加速265倍!北大清华阿里打造SparkDiffusion,5090秒级跑Wan2.1

北京大学、清华大学与阿里巴巴集团等机构联合推出视频扩散加速方案SparkDiffusion,攻克了长视频生成中的计算瓶颈。研究团队针对Wan2.1开源大模型设计动态稀疏路由与误差自校准机制,在保持画面完整的前提下剔除多达97%的冗余计算。单

北京大学、清华大学、阿里巴巴集团等
文章封面
2609.22884 AI基础设施

128K长文本加速5倍还不掉点!清华阿里解耦注意力,路由开销仅3.4ms

处理数十万字超长上下文时,传统的全注意力计算开销随长度呈二次方暴涨,导致首字延迟与算力成本难以承受。清华大学联合阿里巴巴、中国科学技术大学与上海人工智能实验室等机构推出了免训练的解耦块稀疏注意力机制BSA。该机制将稀疏路由计算耗时压缩至3.

清华大学、阿里巴巴、中国科学技术大学、上海人工智能实验室等
文章封面
2609.24197 AI基础设施

小模型KV缓存直接砍掉!哈佛英伟达推出H-Spec,投机解码显存归零

投机解码能大幅加快大模型推理,但传统方案中草稿模型保留的KV缓存占据了宝贵显存,在高并发服务下极易引发显存枯竭。哈佛大学联合第一资本、红帽公司与英伟达等机构推出了全新投机解码框架H-Spec。该架构将草稿模型的KV缓存彻底归零,同时将平均T

哈佛大学、第一资本、红帽公司、英伟达等
文章封面
2609.24797 AI基础设施

解密并增强Kimi线性注意力:欧洲团队推出Complex KDA,外推能力大涨

线性注意力与RNN模型在长序列处理中具备恒定推理显存优势,但其隐藏状态更新受限于标量衰减,在复杂状态追踪上明显逊色于Transformer。弗莱堡大学联合微软研究院、图宾根大学与洛桑联邦理工学院等机构推出了复数域增量更新架构Complex

弗莱堡大学、微软研究院、图宾根大学、洛桑联邦理工学院等
文章封面
2609.23153 AI基础设施

单卡视频生成暴增265倍,北大清华阿里把50步压到3步

北京大学、清华大学、阿里巴巴等机构提出SparkDiffusion,把视频扩散的稠密注意力改成97%稀疏,并把50步生成压到3步。在Wan2.1 14B的720P测试中,单张RTX 5090端到端最高加速265倍,1.3B模型生成480P视

北京大学、清华大学、阿里巴巴等
文章封面
2609.21818 AI基础设施

48伏不够快,东京大学把机器人电机推到100伏、峰值80安

东京大学团队推出LunaDrive,把基于氮化镓器件的高压驱动器装到扁平无刷电机背部。系统在96伏下实现连续30安、峰值80安和最高3110赫兹电频率,并用100伏电池完成高速负载举升,验证高压关节的短时动态能力。

东京大学等
文章封面
2609.21058 AI基础设施

AI写GPU内核快283倍?放进真实大模型,端到端只快约1%

论文公开页面未披露作者机构。研究重新检查AI生成GPU内核的正确性和真实工作负载占比:一个曾被计为283倍加速的内核只写入0.3%输出;即使替换可优化算子,Transformer端到端现实改善也约为1%,局部跑分不能直接代表整机收益。

论文公开页面未披露作者机构
文章封面
Arnaud Bertrand(Substack)热文,科技日报、光明日报、新华网数据核验 AI基础设施

“最接近世界大脑的地方” !一座没名气的内蒙古小城,签下5000亿建全球最大AI机房

一位法国分析师的热文,让内蒙古乌兰察布在海外刷屏:这座150万人口的草原小城,签约标准机架已超500万架,将成为全球规模最大的数据中心集群,签约总投资超5000亿元,华为、阿里、字节、百度都在此训练大模型。冷风、绿电,加上距北京毫秒级直达光

文章封面
2609.20519 Agent

英伟达让Coding Agent少烧近一半Token,API成本再降三分之一

英伟达、南洋理工大学和麻省理工学院团队提出SoL-Pi,让自动研究循环直接优化Coding Agent外层框架。在51项EdgeBench任务上,它与Pi表现相近,却把记录到的Token流量减少44.7%—49.0%,API成本约降三分之一

英伟达、南洋理工大学、麻省理工学院等
文章封面
↑