A Biophysically-Inspired Feedback Controller for Multi-Class Cache Fairness
受生物物理启发的多类缓存公平性反馈控制器
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 针对多租户LLM服务的缓存公平性问题,提出受生物物理启发的多类缓存替换策略,在合成工作负载上缩小了LRU与Belady的未命中率差距,实现公平性与吞吐量的可调权衡。
Comments 24 pages, 1 figure
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
受生物物理启发的多类缓存公平性反馈控制器
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 针对多租户LLM服务的缓存公平性问题,提出受生物物理启发的多类缓存替换策略,在合成工作负载上缩小了LRU与Belady的未命中率差距,实现公平性与吞吐量的可调权衡。
Comments 24 pages, 1 figure
Graph-MambaNav:利用对象关系知识的时空图Mamba用于目标对象导航
机构 * School of Internet of Things Engineering, Wuxi University(无锡大学物联网工程学院) ; School of Communications and Information Engineering, Nanjing University of Posts and Telecommunications(南京邮电大学通信与信息工程学院)
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本研究提出Graph-MambaNav,一种结合LLM常识对象关系的目标感知时空图编码框架,通过节点排序与Mamba建模实现高效导航,在仿真环境表现优异且泛化性好,经真实机器人部署验证有效。
Comments Accepted by IEEE Robotics and Automation Letters (IEEE RA-L), will transfer to 2027 IEEE International Conference on Robotics & Automation (ICRA)
作为辅助监督的生成:通过解耦嵌入预测以零推理开销增强视觉理解
机构 * ByteDance(字节跳动)
专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本研究提出GAS框架,将视觉生成作为辅助监督,通过解耦MoT架构的NEP实现零推理开销,提升了多模态理解尤其是感知与空间理解能力。
TD-VAD:通过文本驱动学习打破视频异常检测中的视觉依赖
机构 * School of Intelligence Science and Technology, Nanjing University(南京大学智能科学与技术学院) ; School of Artificial Intelligence Engineering, Hefei Institute of Technology(合肥工业大学人工智能工程学院) ; China Mobile Zijin Innovation Institute(中国移动紫金创新研究院) ; School of Computer Science and Engineering, Nanjing University of Science and Technology(南京理工大学计算机科学与工程学院)
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 针对现有视频异常检测依赖视觉数据的问题,提出TD-VAD方法,利用LLM生成的文本描述训练模型,结合事件演化因果注意力模块与CLIP编码器,在XD-Violence和UCF-Crime上性能大幅优于现有方法。
Comments Accepted to ICML2026
用于统一且优化执行的AI查询编译
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 该研究提出统一编译执行架构范式,将SQL与LLM整合为张量计算图消除PCIe瓶颈,在SemBench数据集的TPU实验获最高5.3倍延迟、9.8倍吞吐量加速,还给出相关研究路线图。
Comments Proceedings of the VLDB Endowment, Vol. 14, No. 1 ISSN 2150-8097
SimP:统一语法与语义引导技术的高效程序缩减方法
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 SimP框架结合传统与LLM式缩减技术,兼顾缩减效率与质量,且LLM成本可忽略,解决编译器漏洞调试中测试程序过大的问题。
从解释到编译:面向语义算子系统的基于编译的执行引擎
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出SemBaker编译式执行引擎,通过生成Python函数本地执行替代逐项LLM调用,支持多工具,在200查询的问答工作负载中获4.8-6.3倍加速与5.4-10.7倍成本降低。
当预测成为回归元:针对下游推断偏差的拆分样本校正方法
专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 本文针对预测生成测度用作回归元的偏差问题,提出基于独立拆分样本构建工具变量的校正方法,经模拟及两个实证案例验证其有效性。
具有自提炼奖励塑造的智能体强化学习
专题命中 效率与部署 :LLM(abstract,abstract_cn);language agent(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 针对智能体强化学习中稀疏奖励无法分配中间决策信用的问题,提出ADRS框架,通过校准教师分数等提升多轮语言智能体在长时域任务的性能,且增益稳定。
Comments 17 pages,10 figures,11 tables
基于解析器栈分类的高效语法约束解码
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本文提出PSC方法,通过解析器栈分类实现高效语法约束解码,其计算掩码速度远快于基线,可提升LLM的端到端吞吐量。
Comments accepted by ISSTA 2026
面向智能体原生的任务导向通信:联合令牌压缩编码与调制
专题命中 效率与部署 :LLM(abstract_cn);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 该研究针对无线令牌通信系统的原生设计缺口,提出AI原生语义通信框架JTCM,通过两阶段训练实现任务导向的令牌传输,可降低传输开销并提升任务精度与鲁棒性。
Comments This paper is accepted by IEEE Globecom 2026, to appear
HorizonServe:面向全模态模型服务的请求调度与GPU共享协调系统
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 HorizonServe是一款单GPU全模态模型服务系统,通过协调请求准入与GPU分配,提升了SLO达成率并降低了首响应延迟,解决了全模态模型统一部署的调度问题。
基于Aries实验框架重新思考智能体服务系统的AI云基础设施
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 该研究针对自主智能体对传统LLM服务的挑战,提出Aries全栈实验框架,通过实验揭示服务系统的关键瓶颈,探讨智能体原生服务系统的设计愿景。
MRCoder:一种面向仓库级代码生成的高效上下文选择方法
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 MRCoder是一种基于Map-Reduce范式的仓库级代码生成上下文选择框架,通过SADGS策略和并行验证,在提升代码生成准确率的同时降低了token消耗与推理时间。
Comments Under review in TOSEM
从角色提示到无限思考:利用角色条件进行大语言模型推理成本攻击
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究LLMs推理成本问题,提出RolePlay框架利用角色条件诱导低效行为放大推理成本,实验证明该框架优于现有方法,为LLM推理效率攻击提供新视角。
Comments 17pages
多服务环境下基于规范驱动的DevOps
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究探讨前沿大语言模型能否利用存储库内容为多服务应用生成配置,通过对三个异构存储库评估发现生成环境虽能运行,但有遗漏,进而区分功能正确性与部署意图保真度并得出最小显式部署规范。
Comments 25 pages, 8 figures, 15 tables
SHIFT:自我重建利用隐式细粒度思维进行检索
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。
从解释到编译:基于编译的语义算子执行 [视觉]
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。
从以人类为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究不同代际生成式人工智能技术对代码审查质量的影响,通过分析102万条GitHub拉取请求,识别三种人工智能审查者采用模式,将审查讨论建模为交互序列,发现智能体协作模式虽能提高效率,但未提升质量,为设计高效代码审查过程提供实证指导。
Mosaic:运行时高效的多智能体实体规划
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。
Comments Accepted to ICML 2026
更好的框架,更小的模型:通过自动框架适配构建成本降低90%的智能体
专题命中 效率与部署 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)
AI总结 研究针对前沿语言模型智能体推理成本高的问题,提出通过自动框架适配让小语言模型智能体以低90%成本匹配语言模型性能,创建相关框架和优化器,经实验验证该方法能扩大小语言模型智能体在日常业务任务中的部署范围。
Log-Insight:通过神经符号日志分析实现微服务事件诊断自动化
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究针对大规模微服务系统生产事件诊断难题,提出Log-Insight系统,通过自动化SRE手动分类工作流程,经符号阶段处理后为LLM提供证据合成假设报告,六阶段管道减少大量原始事件,评估显示该系统能高效准确诊断根本原因,还报告了相关故障模式等内容。
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
MxGLUT:面向混合精度GEMM的可重构LUT中心广播数据流加速器
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出MxGLUT,一种基于可重构LUT中心广播数据流的混合精度GEMM加速器,通过统一LUT计算机制支持FP8-INT4和FP8-FP8,消除独立FP数据路径,在预填充和解码阶段分别实现2.16倍和1.49倍延迟加速,面积和能效显著提升。
SessionBound: 将企业任务审批转化为预算化的数据库会话
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出SessionBound框架,将审批的企业任务转化为短期、预算化、可审计的数据库会话,通过控制平面和SessionBoundDB实现安全边界,无需LLM判断查询安全性。
Comments 7 pages, research prototype. Code: https://github.com/SessionBound/sessionbound
Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。
Comments 19 pages
FastContext: 为编码智能体训练高效的仓库探索器
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。
Comments The current article involves some product IP issues and needs to be withdrawn and re-approved
ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计
机构 * University of Notre Dame(圣母大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。
FirmCure:面向基于Linux固件的自主自适应重托管
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出首个LLM驱动的全系统重托管框架FirmCure,通过自适应感知推理、反射合成和自主运行时干预,在10个厂商21个固件上实现100%端口开放率和90.5%服务交互性,显著优于现有方法。
无线个人代理:将无线智能从网络扩展到终端
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出WISPA框架,利用基于大语言模型的智能体实现终端侧资源自动化管理,通过解耦在线执行与离线反思克服终端资源限制,在校园通勤场景中验证了其学习用户偏好并自适应接入决策的能力。
Comments 7 pages, 5 figures, submit to a possible journal for publication