Beyond Tier Labels: Role- and Deployment-Dependent Model Substitution in Multi-Call LLM Workflows
超越层级标签:多调用大语言模型工作流中依赖角色与部署的模型替换
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究针对多调用LLM工作流的模型替换问题,通过谓词-动作分解分离决策,经多任务实验揭示模型价值依赖角色与部署,提出大规模工作流路由的实用序列。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
超越层级标签:多调用大语言模型工作流中依赖角色与部署的模型替换
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究针对多调用LLM工作流的模型替换问题,通过谓词-动作分解分离决策,经多任务实验揭示模型价值依赖角色与部署,提出大规模工作流路由的实用序列。
基于大语言模型的定向测试输入生成:通过运行时值反馈进行优化
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究针对基于LLM的定向测试输入生成技术的不足,提出ReDig框架,通过运行时反馈的控制循环优化测试输入生成,在Poppler和Libsndfile案例中验证了其诊断失败原因与优化测试脚本的有效性。
重新思考NPU-PIM系统的统一内存:面向大语言模型动态推理的双视图内存
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 针对NPU-PIM系统现有统一内存无法适配LLM动态推理导致的带宽浪费问题,提出双视图内存方案PFM,可将端到端吞吐量提升最高达2.32倍。
Comments Accepted by MICRO'26
拆分何时划算?智能体大语言模型推理的预填-解码-注意力-前馈网络专业化模拟
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究提出HeteroPanacea模拟框架,针对智能体LLM推理的预填-解码-注意力-前馈网络拆分,验证其可提升吞吐量,为异构智能体服务系统提供支撑。
批量提示中的安全性?理解并缓解批量提示中的安全故障
专题命中 效率与部署 :prompting(title,abstract);large language model(abstract);language model(abstract);preference optimization(abstract)
AI总结 该研究发现批量提示存在独特安全故障模式,可作为黑盒攻击实现高成功率,提出感知批量的偏好优化可缓解该漏洞,为大语言模型安全对齐提供了新方向。
Comments jailbreak, safety
大语言模型辅助的自动驾驶协同感知联盟形成
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究针对现有协同感知方法未优化车辆选择的问题,提出LLM辅助的联盟形成框架,结合DPP与ADMM优化,在OPV2V等数据集上实现更优性能与网络效率。
Comments Accepted for presentation at IEEE Global Communications Conference (GLOBECOM 2026), Cognitive Radio and AI-Enabled Networks Symposium
OwlPath:面向大语言模型漏洞修复的无损知识压缩
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 OwlPath是构建于CodeGraph之上的OWL2推理层,通过无损知识压缩将代码编码为OWL2本体,提升LLM漏洞修复的结构检索性能,在多组基准测试中实现了严格应用率、召回率等指标的显著提升。
DualDecoder:通过预测预取加速长上下文大语言模型推理
专题命中 效率与部署 :LLM(title,summary_cn)
AI总结 该研究针对长上下文LLM推理的内存墙瓶颈,提出轻量级服务系统DualDecoder,通过双token解码流水线预测预取关键KV条目,消除辅助状态开销,使解码吞吐量最高提升2.62倍且保留延迟与模型质量。
BaseRT:利用苹果M5神经加速器提升一流大语言模型推理性能
机构 * Base Compute
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 研究利用苹果M5神经加速器提升大语言模型推理性能,通过BaseRT无框架设计及添加特定内核,将计算密集型矩阵乘法经M5处理,大幅提升推理吞吐量及解码优势,确立了设备上大语言模型推理新性能上限。
用于高效能和低成本的大语言模型服务的异构神经处理单元自动缩放
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究如何利用异构神经处理单元为大语言模型服务实现能源和成本高效。提出NeuScale自动缩放框架,通过新vPod抽象管理资源,基于屋顶线分析分配,支持动态供应。经模拟器验证,可显著提升成本效率和SLO满意度。
Comments Accepted to MICRO'26
在神经处理单元中实现空间细粒度动态电压频率调节以实现高效节能的大语言模型服务
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 研究针对NPU服务LLMs时功耗问题,开发eNPU支持空间细粒度、组件级DVFS,通过重构流水线、引入通信机制、扩展ISA及采用编译器驱动搜索优化,实现能耗降低25.8% - 35.2%且保持SLO保证。
Comments Accepted by MICRO'26
探索V2X网络中的语义通信大语言模型
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出将大语言模型与图知识表示结合的语义通信框架,通过传输高级语义消息而非原始数据,在V2X网络中平均降低33.54%带宽消耗。
Comments Accepted at: IEEE 103rd Vehicular Technology Conference (VTC2026-Spring) 2026
CacheWise:理解工作负载并优化KVCache管理以高效服务LLM编码代理
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 针对编码代理会话中大量前缀复用导致KVCache压力的问题,提出CacheWise管理层,结合前缀感知调度和基于工具调用元数据的轻量级预测驱逐策略,减少KVCache驱逐并提升会话完成时间。
SwiftCache: 面向多轮对话的高效LLM服务与异构KV缓存共享
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 针对多轮对话中KV缓存占用显存导致推理延迟高、上下文受限的问题,提出SwiftCache系统,通过异构模型间共享空闲GPU内存和NVLink带宽,仅保留当前层KV缓存,降低延迟并扩展上下文长度。
Comments 15 pages
MoE大语言模型服务的协调调度
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract);language model(abstract)
AI总结 提出Gimbal,一种跨层协调调度系统,通过细粒度DP引擎调度和专家负载均衡,减少平均TTFT 42.9%和TPOT 33.3%。
超越按Token定价:一种考虑并发性的LLM基础设施成本估算方法
专题命中 效率与部署 :LLM(title,title_cn)
AI总结 针对现有成本计算器将GPU利用率作为固定输入导致严重误差的问题,提出一种基于测量请求率λ的并发感知成本估算方法,并开源vllm-cost-meter工具,验证了低负载下成本被低估2.5-36.3倍。
Comments 26 pages, 9 figures. Code: https://github.com/pChitral/vllm-cost-meter
SkillForge:面向项目特定问题解决的自蒸馏智能体
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 SkillForge是一种主动从代码库获取项目特定知识的自蒸馏框架,通过合成问题蒸馏技能,可提升LLM智能体解决特定代码库软件问题的性能。
Comments Our code and data are available at https://github.com/cslsolow/SkillForge
面向大语言模型的无训练推理时自我反思与成本受限早停机制
机构 * School of Digital Arts, Jiangxi Arts & Ceramics Technology Institute(江西工艺美术职业技术学院数字艺术学院) ; School of Computing, Universiti Sains Malaysia(马来西亚理科大学计算机学院)
专题命中 效率与部署 :large language model(title);language model(title);LLM(abstract);分类 cs.AI
AI总结 本文提出无训练的推理时协议EvoResearcher,通过成本受限的自我反思实现大语言模型早停,在多个推理基准上验证其成本受限自我验证的价值。
SIGMA:面向鲁棒可靠交通管理的感知对称性、智能型、几何化多目标自适应控制
机构 * Indian Statistical Institute(印度统计研究所) ; Sorbonne University Abu Dhabi(阿布扎比索邦大学) ; Sorbonne Center for Artificial Intelligence(索邦人工智能中心) ; SQC & OR(统计质量控制与运筹学研究室)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出SIGMA框架,结合LLM实现自适应交通信号多目标控制,在SUMO仿真中较基准控制器降低等待与排队时长、提升通行量,且具备鲁棒性与统计可靠性。
结合数字孪生验证攻击推理的分层智能体事件响应
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对网络事件响应效率低的问题,提出整合LLM攻击推理、滚动规划与数字孪生验证的分层智能体响应框架,在33组件企业网络测试台的多阶段攻击场景中,其恢复成功率较前沿LLM基线提升18%-31%。
Comments 2026 IEEE Conference on Communications and Network Security
BCIJelly:用于脑机接口研究的集成生态系统
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 BCIJelly是集成多类BCI数据集、解码器及工具的Python生态系统,可通过AAS与LLM支持多任务跨物种解码,经多范式多物种验证,为BCI研究提供统一可扩展的开发部署基础设施。
Comments 67 pages, 6 figures, 7 extended data figures, 20 supplementary tables
分辨率与压缩结合:面向3D放射报告生成的高效视觉上下文
机构 * German Cancer Research Center (DKFZ)(德国癌症研究中心)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对3D放射报告生成中视觉序列的计算瓶颈,通过实验评估不同视觉编码器、投影器和LLM,提出解剖学引导的ROI裁剪等策略,在两个数据集上取得最先进的临床macro F1结果。
SkillSmith:通过自动技能构建与演进增强本地部署智能体
专题命中 效率与部署 :SLM(summary_cn,abstract);LLM(abstract,abstract_cn);分类 cs.AI
AI总结 SkillSmith是云端-本地智能体协作框架,通过自动构建和演进技能增强本地智能体,使搭载Qwen3.6-27B的本地智能体任务有效性接近云端智能体,在AppWorld上平均动作数从36.1降至9.9且可泛化至其他SLM。
Comments 10 pages,8 figures
用于视觉令牌剪枝的AI4AI框架
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本研究提出AutoPrune框架,通过TPDSL让LLM自动设计视觉令牌剪枝策略,在14个多模态基准和3个MLLM主干上,剪枝94.4%视觉令牌仍保留超99%性能,大幅降低推理成本。
小芯片与大语言模型时代的硬件设计与安全
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本文针对小芯片与LLM时代的硬件安全问题,分析了小芯片系统及LLM驱动EDA流水线的各类攻击,提出基于2.5D拆分制造与主动中介层的防御方法,还探讨了LLM对硬件安全的推动作用。
IR2Solve:面向成本高效优化自动建模的结构化中间表示
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 IR2Solve以结构化中间表示为核心构建优化自动建模流水线,仅用1次LLM语义调用,在保证目标函数正确性的同时大幅降低推理成本,性能优于Chain-of-Experts和SAC-Opt等系统。
Comments 17 pages, 3 figures, 13 tables
FOCUS:通过耦合松弛与双粒度缩放实现FP4优化
机构 * Tencent(腾讯)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 FOCUS是一种后训练量化框架,通过耦合松弛与双粒度缩放优化FP4,在不增加推理开销的情况下,于MXFP4和NVFP4格式下实现了LLM的最优FP4精度。
RefactorAssist:用于可靠代码重构的智能体式优化工具
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 该研究针对LLM生成代码重构的错误问题,开发了RefactorAssist智能体,通过静态修复结合测试引导的智能体修复,将重构累计通过率提升至94.2%,提高了LLM重构代码的可靠性。
Comments 27 pages, 10 figures, submitting to ACM TOSEM
GGC:面向可靠Text-to-SPARQL生成的选择性查询修正
机构 * Nanyang Technological University(南洋理工大学) ; Institute of High Performance Computing, Agency for Science, Technology and Research (A*STAR)(新加坡科技研究局高性能计算研究所)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 该研究针对LLM生成Text-to-SPARQL查询不可靠的问题,提出GGC框架,通过选择性修正高风险查询,在MCQA数据集上提升准确率并降低推理开销。
Comments 18 pages, 1 figure
运行时拓扑上下文能否改进大语言模型生成的Kubernetes安全补丁?
专题命中 效率与部署 :LLM(title,abstract);large language model(abstract,comments);language model(abstract,comments);分类 cs.AI
AI总结 研究Kubernetes安全补丁问题,引入KuTIE利用实时集群上下文改进大语言模型生成补丁,通过在VulnCare平台试验,发现拓扑上下文可大幅提升拓扑相关补丁正确性,远超仅依赖扫描器上下文。
Comments Accepted at the Workshop on the Use of Large Language Models for Cybersecurity (LLMSec), co-located with ESORICS 2026