arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

芯片、算力、部署、推理效率与系统优化。

2609.18602 AI基础设施

不用GPU也能跑神经压缩:中科大、微软把1080p解码压到126毫秒

中国科学技术大学与微软亚洲研究院提出PULSE,把学习型图像压缩的解码端压缩到5.2 kMAC/像素,并用整数线性CDF预测器实现跨平台逐比特一致的熵编码。论文测试中,单线程CPU解码一张1080p图像耗时126毫秒;该数字依赖具体硬件、图

中国科学技术大学、微软亚洲研究院等
文章封面
2609.13947 AI基础设施

视觉数据压低18816倍,传感器还没出片就先做计算

凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学和德州大学奥斯汀分校提出OASIS,让传感器附近的小编码器先提取任务信息再传输。特定视觉唤醒模型配置把数据量压到原始8比特图像的1/18816,系统能耗降低约2至4.5倍;部分芯片结果来自仿

凯斯西储大学、路易斯安那大学拉法叶分校、南加州大学、德州大学奥斯汀分校等
文章封面
2609.15810 AI基础设施

英伟达等把视频注意力压到低比特,工作站显卡最高快3.6倍

Nunchux AI、麻省理工学院、卡内基梅隆大学和英伟达提出无需训练的VC-Attention,专门压缩视频扩散模型最耗时的注意力计算。其内核在工作站GPU上比BF16 FlashAttention-4快2.3至3.6倍,但完整视频生成只

Nunchux AI、麻省理工学院、卡内基梅隆大学、英伟达等
文章封面
2609.12471 AI基础设施

AMD补齐CUDA之外的训练库:10万级内核数据喂给本地AI

AMD发布AMDKernelVault,把62153条执行验证的HIP内核、39893条Triton内核和2377条ROCm问答整理成训练资源,并用它训练本地8B模型智能体。它补上了GPU代码AI长期偏向CUDA的数据缺口;但正确性来自指定

AMD等
文章封面
2609.11382 具身智能与机器人

6架无人机高速互避,EPFL、港科大公开整套集群软硬件

洛桑联邦理工学院、香港科技大学提出SwarmNxt,把无人机硬件组装、批量软件部署、ROS 2导航、规划和深度估计整理成开放平台。6架无人机完成高速互避,4架在障碍环境集体飞行;两组实验都在8×8×4米室内运动捕捉场地进行。

洛桑联邦理工学院、香港科技大学等
文章封面
2609.09396 视觉与生成

英伟达测17个视觉模型:固定摄像头最难看懂时间

英伟达、克莱姆森大学研究团队发布VANTAGE-Bench,用3346个媒体素材零样本评测17个视觉语言模型,场景覆盖仓库、交通和智慧空间。结果不是“工业视频全面更难”:视频问答和二维指点差距较小,缺口集中在事件验证、指代表达与时间定位;其

英伟达、克莱姆森大学等
文章封面
2609.10346 AI基础设施

只加0.017%参数,多模态AI准确率相对涨26.9%

新加坡国立大学、Cardinal AI Lab、香港科技大学等机构提出VIP-Router,让多模态模型为每张图片单独选择视觉token剪枝策略,也可以判断这次不该剪。路由器新增参数仅占主干0.017%,在剪枝敏感的VTC-Bench Gr

新加坡国立大学、Cardinal AI Lab、香港科技大学等
文章封面
2609.09989 大模型

AI连续答对也别急停:3520条省token规则全军覆没

香港科技大学、牛津大学联合检验一种省推理成本的做法:模型连续给出同一答案,就提前停止。团队预注册并回放3520条自共识规则,没有一条通过三项安全与节省门槛;在仍节省32% token的规则上,约九次停止有一次会截断模型后续改答。结论只针对单

香港科技大学、牛津大学等
文章封面
2609.09338 AI基础设施

Together AI让229B大模型推理快17.5%

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等机构提出Osprey,把预训练小模型改造成可跨目标复用的推测解码草稿器。它在229B参数的MiniMax-M2.5上把吞吐提高17.5%,平均接受长度提高22.7%;提升来自论

Together AI、悉尼大学、伊利诺伊大学厄巴纳-香槟分校等
文章封面
2609.05981 AI基础设施

扩散模型少算19.3%画质还更稳,阿里云等用不确定性管缓存

上海交通大学、阿里云终端智能计算部、复旦大学联合提出GP-Refiner,为扩散Transformer缓存增加在线误差校正和不确定性开关。它与TaylorSeer组合后,在论文设置中减少19.3%计算量,PSNR提高0.9 dB,LPIPS

上海交通大学、阿里云终端智能计算部、复旦大学等
文章封面
2609.08273 Agent

阿里等把智能体记忆砍半,性能还留99.7%、检索快2.24倍

上海交通大学、上海人工智能实验室、阿里巴巴、清华大学联合提出MemForest,把智能体历史记忆按事件组织成树,再逐步合并重复节点。M3-Agent在两项多模态基准上压缩50%记忆后保留99.7%表现,检索加速2.24倍。比例是论文五套基准

上海交通大学、上海人工智能实验室、阿里巴巴、清华大学等
文章封面
2609.09020 AI基础设施

神经压缩跑过JPEG?PIC做到20 FPS编码、2000 FPS解码

清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院联合提出实用隐式神经图像编解码器PIC,用一次前向计算准备全部网络信息,把编码速度做到20 FPS,并用优化解码器达到2000 FPS。论文称其在相近率失真表现下超过JPEG解

清华大学、鹏城实验室、哈尔滨工业大学(深圳)、京东集团探索研究院等
文章封面
2609.04531 大模型

写代码从512步砍到1步,杜克清华让扩散模型极速出答案

杜克大学与清华大学团队提出PlaidQ,把连续扩散代码模型从512次去噪蒸馏到16步、少数步乃至一步。16步学生在HumanEval和MBPP+的pass@10超过教师;一步模型也能生成可执行程序,但HumanEval pass@1仅7.0

杜克大学、清华大学等
文章封面
2609.04540 大模型

只用5%参数追平16亿模型,亚马逊开源Mitra-v2

亚马逊团队开源Mitra-v2,一款7700万参数的表格基础模型。在TabArena协议下,它达到16亿参数TabFM的同级表现,参数量约为后者5%;预训练只用合成数据,再在300多个真实数据集上评估。结论限定于表格分类与回归基准,医疗等示

亚马逊等
文章封面
2609.02108 大模型

Meta等让扩散模型先猜长度再补代码:快1.82倍,通过率升4.8点

伊利诺伊大学厄巴纳-香槟分校、Meta联合提出PILL,让扩散语言模型补代码或文本时先预测缺口长度,再并行尝试附近候选。它在5种模型、8个基准上比最强基线快1.82倍,代码平均通过率提高4.8点、文本BLEU-2提高6.0点;结果不代表所有

伊利诺伊大学厄巴纳-香槟分校、Meta等
文章封面
2609.01683 AI基础设施

ESP32视觉模型也能现场适应:只多花8.3毫焦,恢复93%收益

巴基斯坦国立科技大学、FAST-NUCES大学联合提出FORGE,让已经量化并部署到微控制器的视觉模型只靠前向计算适应模糊、噪声和光照变化。适配21层中的3层即可恢复93%的收益,在ESP32-S3上额外耗能8.3毫焦、耗时21.9毫秒;数

巴基斯坦国立科技大学、FAST-NUCES大学等
文章封面
2609.02291 视觉与生成

清华等把生成式视频压缩做到实时:码率少58%,720p跑到13帧

清华大学、哈尔滨工业大学(深圳)、北京大学等机构联合提出VoRTeC,用Wan2.1流模型的生成先验做超低码率视频压缩。论文报告其相对既有扩散式方案减少58%比特消耗,720p解码达到13 FPS、480p达到32 FPS;速度与画质结论来

清华大学、哈尔滨工业大学(深圳)、北京大学等
文章封面
2608.28383 AI基础设施

小米北大把视觉注意力计算砍到约六分之一,效果只差0.52分

视觉Transformer处理高分辨率图片时,全注意力要让每个图像Token与所有Token交互,计算量增长很快。北京大学、小米、香港大学等机构发现,全注意力中的不同注意力头会分别关注前景物体和背景,并据此设计Ariadne混合注意力。

北京大学、小米、香港大学等
文章封面
↑