DeepSeek新模型把KV缓存压到1/4,百万Token智能体更省内存
DeepSeek推出多模态模型DeepSeek-V4.1-Flash,主干参数为552B,最长支持100万Token上下文。它把全局KV缓存降到每Token 890字节,约为DeepSeek-V4-Flash的1/4;持久缓存约降到1/8,
DeepSeek推出多模态模型DeepSeek-V4.1-Flash,主干参数为552B,最长支持100万Token上下文。它把全局KV缓存降到每Token 890字节,约为DeepSeek-V4-Flash的1/4;持久缓存约降到1/8,
中国科学技术大学与微软亚洲研究院提出PULSE,把学习型图像压缩的解码端压缩到5.2 kMAC/像素,并用整数线性CDF预测器实现跨平台逐比特一致的熵编码。论文测试中,单线程CPU解码一张1080p图像耗时126毫秒;该数字依赖具体硬件、图
凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学和德州大学奥斯汀分校提出OASIS,让传感器附近的小编码器先提取任务信息再传输。特定视觉唤醒模型配置把数据量压到原始8比特图像的1/18816,系统能耗降低约2至4.5倍;部分芯片结果来自仿
麻省理工学院与英伟达提出Lightning Weave,把“答得更准”和“用更少Token”两类后训练能力组合进同一个学生模型。Qwen3.5-4B在LiveCodeBench v5上从41.7%升至54.2%,响应Token同时少9.6%
Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只
AMD发布AMDKernelVault,把62153条执行验证的HIP内核、39893条Triton内核和2377条ROCm问答整理成训练资源,并用它训练本地8B模型智能体。它补上了GPU代码AI长期偏向CUDA的数据缺口;但正确性来自指定
洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。
英伟达、克莱姆森大学研究团队发布VANTAGE-Bench,用3346个媒体素材零样本评测17个视觉语言模型,场景覆盖仓库、交通和智慧空间。结果不是“工业视频全面更难”:视频问答和二维指点差距较小,缺口集中在事件验证、指代表达与时间定位;其
新加坡国立大学、Cardinal AI Lab、香港科技大学等机构提出VIP-Router,让多模态模型为每张图片单独选择视觉token剪枝策略,也可以判断这次不该剪。路由器新增参数仅占主干0.017%,在剪枝敏感的VTC-Bench Gr
香港科技大学、牛津大学联合检验一种省推理成本的做法:模型连续给出同一答案,就提前停止。团队预注册并回放3520条自共识规则,没有一条通过三项安全与节省门槛;在仍节省32% token的规则上,约九次停止有一次会截断模型后续改答。结论只针对单
Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等机构提出Osprey,把预训练小模型改造成可跨目标复用的推测解码草稿器。它在229B参数的MiniMax-M2.5上把吞吐提高17.5%,平均接受长度提高22.7%;提升来自论
上海交通大学、阿里云终端智能计算部、复旦大学联合提出GP-Refiner,为扩散Transformer缓存增加在线误差校正和不确定性开关。它与TaylorSeer组合后,在论文设置中减少19.3%计算量,PSNR提高0.9 dB,LPIPS
上海交通大学、上海人工智能实验室、阿里巴巴、清华大学联合提出MemForest,把智能体历史记忆按事件组织成树,再逐步合并重复节点。M3-Agent在两项多模态基准上压缩50%记忆后保留99.7%表现,检索加速2.24倍。比例是论文五套基准
清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院联合提出实用隐式神经图像编解码器PIC,用一次前向计算准备全部网络信息,把编码速度做到20 FPS,并用优化解码器达到2000 FPS。论文称其在相近率失真表现下超过JPEG解
杜克大学与清华大学团队提出PlaidQ,把连续扩散代码模型从512次去噪蒸馏到16步、少数步乃至一步。16步学生在HumanEval和MBPP+的pass@10超过教师;一步模型也能生成可执行程序,但HumanEval pass@1仅7.0
亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示
伊利诺伊大学厄巴纳-香槟分校、Meta联合提出PILL,让扩散语言模型补代码或文本时先预测缺口长度,再并行尝试附近候选。它在5种模型、8个基准上比最强基线快1.82倍,代码平均通过率提高4.8点、文本BLEU-2提高6.0点;结果不代表所有
巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数
清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来
视觉Transformer处理高分辨率图片时,全注意力要让每个图像Token与所有Token交互,计算量增长很快。北京大学、小米、香港大学等机构发现,全注意力中的不同注意力头会分别关注前景物体和背景,并据此设计Ariadne混合注意力。