SHIFT: Self-reconstruction Harnesses Implicit Fine-grained Thinking for Retrieval
SHIFT:自我重建利用隐式细粒度思维进行检索
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SHIFT:自我重建利用隐式细粒度思维进行检索
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究针对基于LLM的检索器存在的问题,提出SHIFT框架。通过残差投影等转换LLM为高效检索器,利用细粒度重建缓解不匹配,经实验验证其性能优于其他检索器,为信息检索提供新方法。
从解释到编译:基于编译的语义算子执行 [视觉]
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究语义算子系统执行效率问题,提出基于编译的执行方法,在编译时调用LLM将算子规范转为可执行代码,本地运行减少调用次数,应用于多种算子并集成到系统,初步结果显示减少了执行时间和调用次数,还拓展了LLM在该领域的角色认知。
从以人类为中心到智能体代码审查:不同代际生成式人工智能技术对审查质量的影响
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究不同代际生成式人工智能技术对代码审查质量的影响,通过分析102万条GitHub拉取请求,识别三种人工智能审查者采用模式,将审查讨论建模为交互序列,发现智能体协作模式虽能提高效率,但未提升质量,为设计高效代码审查过程提供实证指导。
Mosaic:运行时高效的多智能体实体规划
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究基于LLM的多智能体实体规划执行延迟高问题,提出Mosaic框架,通过智能体中心语义内存和整数线性规划应对挑战,在多基准测试中执行更快、调用更少、步数更少且成功率更高,证明相关因素对多智能体规划的重要性。
Comments Accepted to ICML 2026
更好的框架,更小的模型:通过自动框架适配构建成本降低90%的智能体
专题命中 效率与部署 :LLM(abstract);language model(abstract);small language model(abstract);SLM(abstract)
AI总结 研究针对前沿语言模型智能体推理成本高的问题,提出通过自动框架适配让小语言模型智能体以低90%成本匹配语言模型性能,创建相关框架和优化器,经实验验证该方法能扩大小语言模型智能体在日常业务任务中的部署范围。
Log-Insight:通过神经符号日志分析实现微服务事件诊断自动化
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 研究针对大规模微服务系统生产事件诊断难题,提出Log-Insight系统,通过自动化SRE手动分类工作流程,经符号阶段处理后为LLM提供证据合成假设报告,六阶段管道减少大量原始事件,评估显示该系统能高效准确诊断根本原因,还报告了相关故障模式等内容。
不退化文本智能的统一音频智能
机构 * Nemotron-Labs(Nemotron实验室)
专题命中 效率与部署 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 本文提出统一音频-文本大语言模型Audex,通过单Transformer解码器架构与多阶段训练,在实现多音频任务SOTA性能的同时,几乎不损失骨干文本LLM的原有文本智能能力。
Comments We release the Audex models at https://huggingface.co/collections/nvidia/nemotron-labs-audex
MxGLUT:面向混合精度GEMM的可重构LUT中心广播数据流加速器
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出MxGLUT,一种基于可重构LUT中心广播数据流的混合精度GEMM加速器,通过统一LUT计算机制支持FP8-INT4和FP8-FP8,消除独立FP数据路径,在预填充和解码阶段分别实现2.16倍和1.49倍延迟加速,面积和能效显著提升。
SessionBound: 将企业任务审批转化为预算化的数据库会话
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出SessionBound框架,将审批的企业任务转化为短期、预算化、可审计的数据库会话,通过控制平面和SessionBoundDB实现安全边界,无需LLM判断查询安全性。
Comments 7 pages, research prototype. Code: https://github.com/SessionBound/sessionbound
Omni-Flow:面向多模态推理的统一工作流编排与分布式KV缓存共享框架
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出Omni-Flow框架,通过三层抽象(控制流、数据流、计算流)统一编排多模态推理工作流,实现异构单元协同、分布式KV缓存共享与高效传输,支持多种多模态场景。
Comments 19 pages
FastContext: 为编码智能体训练高效的仓库探索器
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出专用探索子智能体FastContext,通过并行工具调用和专注上下文生成,分离仓库探索与问题解决,在SWE-bench等任务上提升修复率达5.5%,降低编码智能体token消耗达60%。
Comments The current article involves some product IP issues and needs to be withdrawn and re-approved
ASAP: 面向ML实验的以挂钟时间为中心的自动HPO研究的智能体-系统协同设计
机构 * University of Notre Dame(圣母大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出ASAP框架,通过智能体集成多种优化器并利用系统级优化(前缀稳定提示、推测并行、自适应调优)减少端到端挂钟时间,在多样HPO任务中优于基线。
FirmCure:面向基于Linux固件的自主自适应重托管
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出首个LLM驱动的全系统重托管框架FirmCure,通过自适应感知推理、反射合成和自主运行时干预,在10个厂商21个固件上实现100%端口开放率和90.5%服务交互性,显著优于现有方法。
无线个人代理:将无线智能从网络扩展到终端
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出WISPA框架,利用基于大语言模型的智能体实现终端侧资源自动化管理,通过解耦在线执行与离线反思克服终端资源限制,在校园通勤场景中验证了其学习用户偏好并自适应接入决策的能力。
Comments 7 pages, 5 figures, submit to a possible journal for publication
推理即灵活性:面向输电连接AI数据中心的管理
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对AI数据中心快速爬坡等挑战,提出利用大语言模型推理作为内生灵活性资源,与电池储能协调控制,减少71%储能放电能量和51%峰值放电功率。
RTLScout:面向高效数字电路的联合智能体代码与综合优化
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出RTLScout系统,结合LLM驱动智能体设计与电路级综合优化及算术架构扫描,通过多轮精英池框架迭代优化RTL设计,在浮点乘法器上实现面积减少35%、延迟减少45%。
Comments Updated Appendix Table 4: corrected three Verilog baseline values. Conclusions unchanged
量化作为恶意任务:通过任务算术移除量化条件后门
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出QVec方法,通过将量化引起的权重变化视为恶意任务向量,在部署前进行参数校正,无需重训练或触发样本即可防御量化条件后门。
CodeSentinel:代码上下文中针对间接提示注入的三层防御
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对代码大语言模型在检索外部代码时面临的间接提示注入攻击,提出CodeSentinel三层推理时净化器,结合语法引导预过滤、CST引导动态Min-K%评分和节点扰动分析,实现0.80节点级F1,优于现有方法。
分布式多模态大模型推理框架上的图像提示重建攻击
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究分布式MLLM推理中中间嵌入泄露图像提示的风险,提出两种被动黑盒攻击方法MPAA和IEDA,实现像素级和语义级图像重建。
DeSRPA: 通过推理时干预的解耦语音角色扮演智能体
机构 * Nagoya University(名古屋大学) ; National Institute of Informatics(国立情报学研究所)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出DeSRPA框架,通过推理时干预冻结骨干模型,利用双层控制向量机制解耦认知推理与副语言表达,在语音角色扮演中实现个性与情感一致性,超越端到端微调方法。
Comments Accepted to INTERSPEECH 2026
微型纳秒脉冲氦等离子体射流中的电流体耦合与随机分支
专题命中 效率与部署 :SLM(summary_cn,abstract)
AI总结 通过实验与CFD模拟,研究微米级大气压氦等离子体射流中放电与流动的耦合,发现0.3 slm流量下放电能量最高、射流准直最佳,并首次定量分析了随机分支现象。
OSDAG: 面向高效多机器人协作的在线调度
机构 * Japan Advanced Institute of Science and Technology(日本北陆先端科学技术大学院大学) ; University of Engineering and Technology, Vietnam National University(越南国立大学工程技术大学) ; Hanyang University(汉阳大学)
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出OSDAG框架,结合LLM任务推理与DAG在线调度,通过一次性分解指令为依赖图并实时分配任务,相比对话式方法推理速度提升5-15倍,调度时间缩短38%。
云边连续体中多模态大模型的生成质量-延迟权衡感知推理卸载
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对云边协同多模态大模型推理,提出QLMIO框架以优化生成质量与响应延迟的权衡,并构建MIOBench基准,实验表明延迟降低58.14%且任务完成率不变。
Comments This manuscript was submitted to IEEE Transactions on Mobile Computing on June 3, 2026
使局部感知的GEMM与Chiplet GPU上的页粒度放置兼容
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对多芯片GPU非均匀内存系统中局部感知数据放置与固定页粒度交错不兼容的问题,提出Chiplet-Contiguous Layout,通过全局内存布局存储芯片局部连续数据,无需修改操作系统或硬件即可兼容页粒度放置,显著降低远程HBM流量。
低延迟口语对话的端点预测
机构 * Brno University of Technology(布拉格技术大学) ; Carnegie Mellon University(卡内基梅隆大学)
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 提出端点预测方法,通过提前预测对话结束信号实现低延迟,在部分上下文中投机执行LLM和TTS流水线,平均延迟降低505毫秒。
Comments Accepted at Interspeech 2026
代码审查的终结:编码代理取代人工审查
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文论证基于大型语言模型的编码代理已超越传统人工代码审查的能力阈值,能以更低成本、更高吞吐量实现审查目标,并指出人工审查与AI协作的路径不可持续。
电路近似的提示与模板多目标协同进化
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出一种协同进化算法,利用现成大语言模型自动设计优化的8位近似乘法器,无需领域特定训练,通过同时进化候选电路和提示模板,实现了比EvoApproxLib库更优的误差-面积权衡。
Comments To appear at Parallel Problem Solving From Nature (PPSN), Trento, IT, 2026
FlowBank: 通过预计算与复用实现查询自适应智能体工作流优化
机构 * University of Maryland, College Park(马里兰大学哥伦比亚公园分校) ; Amazon(亚马逊)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG
AI总结 提出FlowBank框架,通过预计算多样化工作流并压缩为紧凑组合,在推理时自适应选择最优工作流,平衡性能与成本,在五个基准上平均得分最高且成本可控。
语言驱动的自动驾驶成本优化
机构 * TU Delft(代尔夫特理工大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出语言驱动框架,利用大语言模型解释场景和用户查询,生成风险感知MPPI控制器的参数,并通过人机交互验证和反馈迭代优化自动驾驶行为。
Comments Paper accepted at IEEE Intelligent Transportation Systems Conference (ITSC) 2026
视觉-语言引导的高光谱目标跟踪:语义融合与上下文模板更新
机构 * China University of Mining and Technology(中国矿业大学) ; University of Ottawa(渥太华大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出VLHTrack框架,通过语言引导波段选择模块缓解光谱冗余,利用多模态融合模块整合视觉与语言特征,并采用动态模板更新策略应对目标形变,在HOT2023/2024上超越现有方法。
Comments 14 pages,8 figures