arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

行业趋势

芯片、算力、部署、推理效率与系统优化。

2608.25061 AI基础设施

IBM让大模型给数据库写GPU算子,22条查询全通过并加速2.11倍

数据库查询搬到GPU后,最慢的热点仍常靠工程师手写CUDA或Triton。IBM Research、维也纳工业大学提出DataKernelBench,把SQL先转成可验证的PyTorch张量计划,再让大模型在保持结果一致的前提下改写GPU内

IBM Research、维也纳工业大学等
文章封面
2608.24882 具身智能与机器人

清华等让机器人把“未来画面”压成潜动作,延迟降低42.9%

机器人世界动作模型常在执行动作前生成未来画面,用视觉预测帮助控制,但完整视频分支会拉高推理延迟。清华大学、中科院自动化所、TARS Robotics、复旦大学等机构提出LAWA,把未来变化压缩成离散潜动作,推理时不再重建未来像素。

清华大学、中科院自动化所、TARS Robotics、复旦大学等
文章封面
2608.24674 视觉与生成

浙大、清华等把190亿参数音视频生成提速54.67倍,单张H20从318秒降到5.83秒

输入一句文字,同时生成画面和匹配的声音,省掉了视频生成后再配音的串联步骤,但联合模型也把两种模态的计算成本叠到一起。浙江大学、清华大学、新加坡国立大学等机构提出TurboT2VA,用蒸馏与推理优化加速190亿参数的LTX-2音视频模型。

浙江大学、清华大学、新加坡国立大学等
文章封面
2608.21378 AI基础设施

不到68万字节,sanoTTS无需NPU在ESP32上实时生成语音

一个完整神经语音合成系统,从音素ID一路生成22.05kHz波形,部署图只有567008个参数,两个int8数据块合计679832字节。Ampixa Labs提出sanoTTS,在不使用神经加速器的ESP32-S3上,生成4.54秒语音耗时

Ampixa Labs等
文章封面
2608.19662 AI基础设施

上交大等提出ReCache,智能体工具调用KV内存减少92.43%

智能体每次回答前都要阅读天气、日历、搜索等工具Schema。工具组合或顺序一变,普通前缀缓存就难以复用之前的KV状态。上海交通大学、东方理工学院、西安交通大学提出ReCache,让每份资源独立编码,并只保留调用需要的字段与注意力路径。

上海交通大学、东方理工学院、西安交通大学等
文章封面
2608.17528 Agent

微软等发布Agent Lightning 1.0:6000条样本把编程智能体提升14.6个百分点

训练编程智能体时,真正执行工具、保存上下文和控制循环的往往是Agent框架,强化学习训练器却希望接管整条交互。微软、复旦大学、浙江大学、爱丁堡大学等机构发布Agent Lightning 1.0,让现有智能体继续掌管运行过程,训练侧通过模型

微软、复旦大学、浙江大学、爱丁堡大学等
文章封面
2608.17995 AI基础设施

阿里云&上交等提出AViTS:只放大关键Token,扩散模型最高加速14.76倍

扩散模型从低分辨率切到高分辨率时,通常会把所有潜在Token一起放大,即使大片背景已经稳定。上海交通大学、山东大学、阿里云、西安交通大学等机构提出AViTS,依据文本相关性和跨去噪步骤的特征变化,只优先细化真正重要的Token。

上海交通大学、山东大学、阿里云、西安交通大学等
文章封面
2608.12932 自动驾驶

自动驾驶大模型提速4.7倍!普林斯顿FlashDrive把10B VLA延迟压到151毫秒

自动驾驶模型如果每次思考要717毫秒,车辆一秒只能更新约1.4次决策。普林斯顿大学与加州大学圣迭戈分校提出FlashDrive,把Alpamayo 1.5-10B视觉—语言—动作模型在单张GPU上的端到端延迟压到151毫秒,频率升至6.6H

普林斯顿大学、加州大学圣迭戈分校等
FlashDrive自动驾驶大模型加速效果文章封面
2608.09771 具身智能与机器人

清华&北智院等提出SLIM-0.5B:小模型操控机器人,推理延迟压到60.6毫秒

复旦大学、北京智源人工智能研究院、清华大学和中国人民大学提出SLIM,一个只有0.47B参数的机器人操作策略。它不用大型多模态骨干每个控制步都重做开放域理解,而是学习与动作和状态变化紧密相关的紧凑潜表示。

复旦大学、清华大学、中国人民大学等
文章封面
2608.07003 视觉与生成

ECCV 2026|英伟达等提出HRDiT,现成DiT不重训也能生成8K图像

把FLUX、Stable Diffusion 3这类DiT直接拉到8K,常出现窗户错位、物体重复和整体结构散架,计算时间也陡增。兰卡斯特大学、华南理工大学与英伟达AI技术中心提出ECCV 2026论文HRDiT,通过空间位置重排和分层注意力

兰卡斯特大学、华南理工大学、英伟达AI技术中心等
HRDiT生成的高分辨率粉色玩具屋文章封面
2608.06628 AI基础设施

Apple&Google DeepMind改造16B扩散模型,换6层注意力吞吐提1.7倍

扩散语言模型可以并行修改多个词元,但长序列中的全注意力仍会吃掉大量计算。Apple、Google DeepMind与哈佛大学研究者在MIT开展的工作提出LLaDA-Hybrid:把16B模型20层中的6层换成块级混合注意力,再通过两阶段轻量

哈佛大学等
LLaDA-Hybrid两阶段注意力改造流程的文章封面
2608.06183 AI基础设施

让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍

处理器微架构要在性能、功耗和面积之间反复取舍,但一次PPA评估就可能需要昂贵仿真。东南大学、国家EDA技术创新中心、英伟达、复旦、中科院计算所和北大等团队提出MicroEvo,在论文设置下把搜索效率做到NSGA-II的10.6倍。

东南大学、国家EDA技术创新中心等
让大模型参与芯片微架构搜索:MicroEvo效率做到10.6倍文章封面
2608.03020 AI基础设施

大模型调优不再反复反传,LoCA把GPU峰值内存压低近三成

腾讯、帝国理工学院、密歇根大学等机构的研究人员提出LoCA。它先用一次反向传播完成校准,后续适配只运行前向计算和局部闭式求解。包含校准在内,全程GPU峰值内存比LoRA低26%至29%。

密歇根大学、腾讯等
大模型调优不再反复反传,LoCA把GPU峰值内存压低近三成文章封面
2608.02091 AI基础设施

复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步

复旦大学、哈尔滨工业大学和北京大学等团队复现了bfloat16 Transformer训练中的突然崩溃:模型可以正常运行很多步,注意力随后快速失控。研究发现,不同位置的低精度误差最终会汇入查询—键权重的共同通道。

哈尔滨工业大学、北京大学等
复旦北大找到低精度训练崩溃通道,QK-Guard守住6万步文章封面
2608.01078 AI基础设施

英特尔中国把推理模型压到1.58比特,校准数据少100万倍

英特尔中国研究院发布ScaleQ-1.58,把推理大模型权重压缩为三值表示。Qwen3-1.7B版本只使用400万校准Token,在4项数学和代码任务上的平均表现达到BitNet b1.58 2B4T的90.52%以上,量化所需校准Toke

英特尔中国研究院等
英特尔中国把推理模型压到1.58比特,校准数据少100万倍文章封面
2607.28263 AI基础设施

清华腾讯提出CoMem,128K上下文显存降至18.26GB

清华大学与腾讯提出长上下文记忆方法CoMem。在单张96GB英伟达H20上处理128K上下文时,一组不使用适配器的效率测试显示,峰值显存由完整上下文方案的89.36GB降至18.26GB,预填充时间由15.014秒缩短到1.917秒,加速7

清华大学、腾讯等
清华腾讯提出CoMem,128K上下文显存降至18.26GB文章封面
↑