GPU-to-Grid: Voltage Regulation via GPU Utilization Control
GPU到电网:通过GPU利用率控制实现电压调节
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 本文提出GPU到电网框架,通过控制GPU利用率实现分布级电压调节,发现减少GPU功率消耗可能缓解电压下限问题,而增加GPU功率可缓解电压上限问题,挑战传统观点。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
GPU到电网:通过GPU利用率控制实现电压调节
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 本文提出GPU到电网框架,通过控制GPU利用率实现分布级电压调节,发现减少GPU功率消耗可能缓解电压下限问题,而增加GPU功率可缓解电压上限问题,挑战传统观点。
酿造更强的特征:多光谱地球观测的双教师蒸馏
机构 * University of Ljubljana, Faculty of Computer and Information Science(卢布尔雅纳大学计算机与信息科学学院)
专题命中 效率与部署 :foundation model(abstract);pretraining(abstract)
AI总结 本文提出双教师对比蒸馏框架,用于多光谱地球观测,通过结合多光谱和光学教师,实现跨模态表示学习,提升多光谱和光学数据的性能。
Comments Accepted to CVPR 2026 as Highlight
Timeripple:通过理解潜在空间中的时空相关性加速视频扩散变换器
机构 * Shanghai Jiao Tong University(上海交通大学) ; Shanghai Qizhi Institute(上海启智研究院) ; Huawei Technologies Co.,Ltd(华为技术有限公司) ; Institute of Computing Technology, Chinese Academy of Science(中国科学院计算技术研究所)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 针对视频生成中vDiT模型推理延迟问题,利用潜在空间时空相关性,提出轻量级自适应重用策略,通过重用相关令牌部分注意力分数近似计算,相比现有技术计算节省85%,且视频质量损失小。
PrimitiveVLA:学习可复用的运动基元以实现高效且可泛化的机器人操作
机构 * State Key Lab of Processors, Institute of Computing Technology, CAS(处理器国家重点实验室,计算技术研究所,中国科学院) ; Jiangsu Key Laboratory of AI for Industries, Institute of AI for Industries, CAS(江苏人工智能工业重点实验室,人工智能工业研究所,中国科学院) ; University of Chinese Academy of Sciences(中国科学院大学) ; Cambricon Technologies(寒武科技) ; Intelligent Software Research Center, Institute of Software, CAS(软件研究所智能软件研究中心,中国科学院) ; University of Science and Technology of China(中国科学技术大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出PrimitiveVLA框架,通过将视觉-语言-动作模型从直接指令到控制映射转向以基元为中心的拆解与组装范式,利用多模态规范表示和自动化流水线,提升数据效率并实现零样本泛化。
Agent-OSI: 向去中心化的智能体互联网的分层协议栈
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 Agent-OSI提出了一种基于现有互联网的六层协议栈,旨在实现去中心化智能体网络的互操作性、信任和按使用付费结算。
Comments 8 pages, 3 figures
CHIA: 一个用于原则性、智能体AI驱动的硬件/软件协同设计研究的开源框架
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出CHIA开源框架,通过有向循环图表达智能体AI驱动的协同设计流程,支持多种工具集成,实现可扩展、容错的大规模协同设计研究。
三重提升的Baby-Step Giant-Step线性变换在CKKS同态加密与硬件加速器上
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出了一种三重提升的Baby-Step Giant-Step算法,用于减少CKKS同态加密中线性变换所需的密文旋转次数,并设计了优化的FPGA硬件加速器以降低离芯片内存访问和计算延迟。
Comments 11 pages, 6 figures, 7 tables, 34 refrences, and journal paper
并非所有标记都重要:面向高效代码摘要的数据导向优化
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本研究探讨了系统提示对代码生成任务中ILMs和CLMs性能的影响,发现模型规模越大影响越显著,少样本提示效果优于零样本提示,且Java对提示变化更敏感。
代理经济建模
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 本文提出代理经济建模(AEM),通过合成大语言模型选择与少量人类证据对齐,提升经济计量推断可靠性。方法生成任务条件合成选择,学习偏差修正映射,再用标准计量估计器恢复需求弹性。实验验证AEM在大规模联合研究和区域实地实验中有效,提升RCT效率。
Gefen: 优化随机优化器
机构 * Reichman University(赖希曼大学) ; Tel Aviv University(特拉维夫大学) ; Google Research(谷歌研究院)
专题命中 效率与部署 :pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出Gefen优化器,通过共享二阶矩估计和量化一阶矩,将AdamW内存占用减少约8倍,同时保持相同性能,支持更大批量和吞吐量。
递归多智能体系统
机构 * UIUC(伊利诺伊大学香槟分校) ; Stanford University(斯坦福大学) ; NVIDIA(英伟达) ; MIT(麻省理工学院)
专题命中 效率与部署 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出递归多智能体框架RecursiveMAS,通过递归计算提升多智能体协作效率,实验证明其在多个基准测试中准确率提升8.3%,推理速度提升1.2-2.4倍,token使用减少34.6%-75.6%。
Comments Project Website: https://recursivemas.github.io
SuperVoxelGPT: 自适应有序3D令牌化用于自回归形状生成
机构 * University of Texas at Dallas(德克萨斯大学达拉斯分校) ; Tencent America(腾讯美国)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出SuperVoxelGPT框架,通过自适应且有序的超体素令牌化解决自回归3D生成中序列长度与空间顺序的矛盾,实现高质量、高效率的形状生成。
重新思考多智能体系统的查询优化 [视觉]
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 研究多智能体系统的查询优化问题,提出NOMA框架,针对其面临的多维搜索等挑战,通过控制实验揭示差异,最优计划为异构配置,实际部署存在低效率,还提出集成优化循环设定研究议程。
WikiCLIP: 一种高效的开放领域视觉实体识别对比基线
机构 * ShanghaiTech University(上海科技大学) ; Shanghai Engineering Research Center of Intelligent Vision and Imaging(上海智能视觉与成像工程技术研究中心) ; Lingang Laboratory(临港实验室)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出WikiCLIP,通过结合大语言模型嵌入和视觉引导的知识适配器,高效解决开放领域视觉实体识别问题,在OVEN基准测试中显著超越现有基线。
Comments Accepted by CVPR26, codes and weights are publicly available
利用辅助AudioSet语义增强音频描述生成
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出一种资源高效的自动音频描述生成框架,通过ConvNeXt编码器提取帧级声学表示并融合AudioSet关键词语义,使用紧凑的六层BART解码器生成描述,在Clotho V2和AudioCaps上取得竞争性性能。
连续推测解码用于自回归图像生成
机构 * School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) ; MAIS, Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所多模态人工智能系统实验室) ; JD.COM Inc(京东集团股份有限公司) ; China Tower Corporation Limited(中国铁塔股份有限公司)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出连续推测解码方法,通过近似准则、去噪轨迹对齐和接受-拒绝采样,加速连续视觉自回归模型,实现2倍以上加速且保持生成质量。
Comments ECCV 2026
面向竞争性代码生成的迭代测试与修复框架
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 FixAudit通过迭代测试与修复循环改进代码生成,通过共享模型和专门角色联合训练,提升代码质量与测试覆盖率。
HunyuanImage 3.0 技术报告
专题命中 效率与部署 :foundation model(abstract);post-training(abstract)
AI总结 HunyuanImage 3.0是一种统一多模态理解与生成的自回归模型,通过精心数据整理、先进架构、原生思维链、渐进预训练和激进后训练,训练出超800亿参数MoE模型(推理时激活130亿),在文本-图像对齐和视觉质量上媲美最先进模型,并开源代码和权重。
ScalingAR: 自回归图像生成的置信度缩放
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出ScalingAR框架,通过令牌熵作为置信度信号,在轮廓级和策略级进行自适应轨迹剪枝和动态引导调度,无需早期解码或外部奖励,显著提升自回归图像生成性能。
Comments ICML 2026; Code: https://github.com/EnVision-Research/ScalingAR
MamTra:一种用于语音合成的混合Mamba-Transformer骨干网络
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出MamTra混合框架,结合Mamba的线性效率与Transformer的全局建模能力,通过知识迁移策略降低训练成本,在仅用2%数据时仍保持语音保真度并减少34%推理显存。
Comments Interspeech 2026
EchoingPixels: 抗混叠的音频-视觉联合令牌缩减方法
机构 * Fudan University(复旦大学)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 针对音频-视觉大语言模型中令牌冗余和位置混叠问题,提出EchoingPixels框架,通过跨模态语义筛和Sync-RoPE实现抗混叠的联合令牌缩减,仅用5-20%令牌达到全模型性能。
Comments ICML 2026
面向同步视听重建的语义卫星通信
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出自适应多模态语义传输系统,通过双流生成架构和动态关键帧更新机制,在带宽受限的卫星场景下实现高质量同步视听重建,显著降低带宽消耗并提升鲁棒性。
用于光学神经计算的量子非线性
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出嵌入量子发射体的逆向设计纳米光子结构,利用量子发射体的饱和特性实现强非线性,通过物理感知训练实现全光神经网络的非线性分类和强化学习,并建立量化非线性与网络表达能力的框架。
Comments Main text: 11 pages, 4 figures; Supplementary: 36 pages, 26 figures
MSpoofTTS:用于离散语音合成的多分辨率欺骗引导推理
机构 * School of Computing, National University of Singapore(新加坡国立大学计算机学院) ; Department of Statistics & Data Science, National University of Singapore(新加坡国立大学统计与数据科学系)
专题命中 效率与部署 :language model(abstract);preference optimization(abstract)
AI总结 提出MSpoof-TTS框架,通过多分辨率欺骗检测和分层解码策略,无需重新训练即可提升神经编解码语言模型的零样本语音合成质量。
Comments 7 pages, 3 figures, 3 tables, 2 algorithms. Accepted to Interspeech 2026
MIRAGE:基于层次分解的多向量图像检索运行时调度
机构 * School of Computer Science, Peking University(北京大学计算机科学学院) ; School of Electronics Engineering and Computer Science, Peking University(北京大学电子工程与计算机科学学院) ; School of Information, Renmin University of China(中国人民大学信息学院) ; School of Integrated Circuit Science and Engineering, Beihang University(北京航空航天大学集成电路科学与工程学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出MIRAGE框架,通过层次化分解和跨层次相似性一致性减少冗余计算,实现多向量图像检索的精度提升和3.5倍计算加速。
Comments Will appear in DAC'2026, camera ready
HeRo: 异构移动SoC上智能体RAG的自适应编排
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出HeRo框架,通过基于性能分析的在线调度器,结合形状感知子阶段划分、关键性加速器映射和带宽感知并发控制,在异构移动SoC上实现低延迟智能体RAG,端到端延迟降低达10.94倍。
Comments Will appear in DAC'2026, Camera Ready
展示chart-plot:弥合学术图表生成的最后一英里
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 提出chart-plot系统,通过风格感知代码生成、部署感知渲染循环和结构化编辑层,解决学术图表从代码到发表的质量差距问题。
Comments 7 pages, 6 figures. Submitted to the VLDB ADS 2026 Workshop: The Joint Workshop on Agentic Data Systems and Data-Centric AI
FalconGEMM:通过低复杂度矩阵乘法超越硬件极限
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 FalconGEMM通过自动化部署优化低复杂度矩阵乘法算法,实现DL性能提升,在GPU和CPU上均超越传统GEMM库和AlphaTensor等竞品。
FlashTTS: 基于MTP加速和X-pred均值流蒸馏的快速流式TTS
机构 * Huawei Technologies Co., Ltd(华为技术有限公司)
专题命中 效率与部署 :LLM(abstract,abstract_cn)
AI总结 提出FlashTTS框架,通过滞后多轨架构、并行多令牌预测和X-pred均值流匹配解码器,实现低延迟流式TTS,首包延迟降至325ms,保持零样本语音克隆和跨语言可懂度。
Comments Accepted to Interspeech 2026
EvoIR-Agent: 通过经验驱动学习实现自进化图像修复智能体
专题命中 效率与部署 :large language model(abstract);language model(abstract)
AI总结 本文提出EvoIR-Agent,通过经验驱动学习解决图像修复中经验不足导致的规划失败问题,通过构建分层经验池和自进化机制提升修复性能和效率,实验表明其在全参考指标上表现优异,且在性能与效率之间取得显著平衡。
Comments Temporarily withdrawn for institutional clearance and compliance review. A revised version will be uploaded once the process is finalized