SpecBox: Speculative Sandbox Scheduling for Efficient LLM Agent Serving
SpecBox:用于高效大语言模型智能体服务的推测性沙盒调度
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体服务中沙盒部署的资源利用与延迟矛盾,提出SpecBox,通过推测性沙盒预分配、上下文感知随机预取及相关优化,有效降低端到端延迟并削减峰值内存消耗。
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
SpecBox:用于高效大语言模型智能体服务的推测性沙盒调度
专题命中 效率与部署 :LLM(title,abstract);分类 cs.AI、cs.LG
AI总结 研究大语言模型智能体服务中沙盒部署的资源利用与延迟矛盾,提出SpecBox,通过推测性沙盒预分配、上下文感知随机预取及相关优化,有效降低端到端延迟并削减峰值内存消耗。
学习从软提示到硬提示的翻译
机构 * Worcester Polytechnic Institute(沃斯特理工学院)
专题命中 效率与部署 :LLM(title);prompting(abstract);分类 cs.CL、cs.LG
AI总结 本文通过训练一个专用的软提示到自然语言翻译模型,提高了翻译质量,并展示了软提示可以转化为可移植的文本提示,在大型闭源模型上超越原软提示甚至少样本学习。
Comments 8 Pages, 11 tables, 4 Figures
语言模型输出分布中的尾部风险估计
机构 * Columbia University(哥伦比亚大学) ; Department of Computer Science, New York University(纽约大学计算机科学系) ; Center for Data Science, New York University(纽约大学数据科学中心)
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出一种基于重要性采样的方法,通过创建不安全版本来高效估计语言模型产生有害输出的尾部概率,在10-20倍更少样本下匹配蒙特卡洛估计,并揭示模型对输入的敏感性。
Comments Accepted to ICML 2026
专家选择路由使扩散语言模型实现自适应计算
机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) ; Scitix ; Cornell University(康奈尔大学) ; Duke University(杜克大学) ; UC Davis(加州大学戴维斯分校) ; Southern University of Science and Technology(南方科技大学)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文提出专家选择路由方法,通过确定性负载平衡提升扩散语言模型的吞吐量和收敛速度,并展示如何通过时间步依赖的专家容量优化计算分配,从而在匹配FLOPs下提升性能。
Comments Accepted at COLM 2026
SpecPrefetch:用于稀疏混合专家基础模型的参数高效专家预取
机构 * StepOs(未知) ; ShanghaiTech University(上海科技大学) ; Xiamen University(厦门大学) ; Chongqing University(重庆大学)
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 研究针对稀疏MoE模型在有限内存下部署及专家卸载的传输瓶颈问题,提出SpecPrefetch框架,通过分离传输预测与执行路由,结合窗口感知调度器,提升专家召回率和设备解码吞吐量。
Reverso:用于零样本预测的高效时间序列基础模型
机构 * Qube Research \& Technologies ; Allen Institute for AI ; Massachusetts Institute of Technology
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 Reverso通过高效的小型混合模型实现零样本时间序列预测,显著提升性能-效率平衡。
用于少步生成的多掩码扩散语言模型
机构 * ByteDance Seed(字节跳动种子) ; Princeton University(普林斯顿大学) ; Stanford University(斯坦福大学) ; UCLA(加州大学洛杉矶分校) ; UC Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :language model(title);pretraining(abstract);分类 cs.CL、cs.LG
AI总结 研究针对掩码扩散模型少步生成难的问题,提出多掩码扩散模型MultiMDM,通过特定前向过程使反向过程有起草能力,推导训练目标并制定蒸馏方案,经实验验证其为少步生成提供了有效基础。
Comments Needs corporate approval
Atlas 2 -- 临床应用的基础模型
机构 * Aignostics, Germany(德国Aignostics公司) ; Department of Laboratory Medicine and Pathology, Mayo Clinic, Rochester, MN, US(美国梅奥诊所实验室医学与病理学部门) ; Department of Radiology, Mayo Clinic, Rochester MN, US(美国梅奥诊所放射学部门) ; Department of Information Technology, Mayo Clinic, Rochester MN, US(美国梅奥诊所信息技术部门) ; Mayo Clinic, Rochester MN, US(美国梅奥诊所) ; Digital Pathology, Mayo Clinic, Rochester MN, US(美国梅奥诊所数字病理学部门) ; Machine Learning Group, Technische Universität Berlin, Germany(德国柏林技术大学机器学习小组) ; BIFOLD – Berlin Institute for the Foundations of Learning and Data, Germany(德国柏林学习与数据基础研究所) ; Department of Artificial Intelligence, Korea University, Republic of Korea(韩国韩国大学人工智能系) ; Max-Planck Institute for Informatics, Germany(德国马克斯·普朗克信息研究所) ; German Cancer Research Center (DKFZ) & German Cancer Consortium (DKTK), Berlin & Munich Partner Sites, Germany(德国癌症研究中心(DKFZ)及德国癌症联盟(DKTK)柏林与慕尼黑合作站点) ; Institute of Pathology, Ludwig-Maximilians-Universität München, Germany(德国慕尼黑路德维希-马克西米利安大学病理学研究所) ; Institute of Pathology, Charité – Universitätsmedizin Berlin, Germany(德国柏林夏里特大学医学中心病理学研究所) ; Bavarian Cancer Research Center (BZKF), Germany(德国巴伐利亚癌症研究中心(BZKF)) ; Helmholtz Munich, Germany(德国海德堡-慕尼黑亥姆霍兹中心) ; Technical University Munich, Germany(德国慕尼黑技术大学)
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 Atlas 2系列通过在80个公开基准测试中展现卓越的预测性能、鲁棒性和资源效率,为临床应用提供了先进的病理视觉基础模型。
StackingNet:跨独立AI基础模型的集体推理
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.CL、cs.AI
AI总结 StackingNet通过元集成框架整合独立模型输出,提升准确率并减少误差,无需内部参数或训练数据,有效识别和修剪退化模型,在语言理解、视觉属性估计和学术论文评分中优于单一模型和经典集成方法。
突破扩散语言模型的分解障碍
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 CoDD通过引入轻量级概率推理层,突破扩散语言模型的分解障碍,实现高效且连贯的生成性能。
在测试时学习:具有可学习适应策略的语言智能体
机构 * National University of Singapore(新加坡国立大学)
专题命中 效率与部署 :language agent(title,abstract);分类 cs.AI、cs.LG
AI总结 本文提出Meta-TTL框架,通过双层优化问题学习最优适应策略,提升语言智能体在不同分布下的表现。
注意力折扣自适应采样器用于掩码扩散语言模型
机构 * University of Bern(伯尔尼大学) ; EPFL(瑞士联邦理工学院洛桑分校)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.AI
AI总结 针对掩码扩散语言模型并行解码中候选词交互导致的不安全问题,提出训练无关的重排序规则ADAS,通过注意力折扣软惩罚改进子集构建,在多个基准上提升低NFE性能。
EEG基础模型的测试时间适应:在现实世界分布偏移下的系统研究
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 本文系统研究了EEG基础模型在现实分布偏移下的测试时间适应方法,发现标准方法效果不稳定且易退化,而无优化方法更稳定可靠。
Comments Accepted to MLHC 2026
熵感知的在线策略蒸馏语言模型
机构 * IBM Research, San Jose, CA, USA(IBM研究院,旧金山,加州,美国) ; University of Toronto, Ontario, Canada(多伦多大学,安大略,加拿大) ; Vector Institute, Ontario, Canada(向量研究所,安大略,加拿大)
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 针对在线策略蒸馏中反向KL导致生成多样性下降和教师高熵时学习信号不稳定的问题,提出熵感知的在线策略蒸馏方法,通过在高熵时引入前向KL平衡模式寻求与模式覆盖,提升了生成多样性和学生-教师对齐度。
Comments 18 pages, 11 figures, ICML 2026
MirrorCheck: 视觉-语言模型的高效对抗防御
机构 * Mohamed Bin Zayed University of Artificial Intelligence(莫扎伊德大学人工智能大学) ; NVIDIA ; École Polytechnique Fédérale de Lausanne(洛桑联邦理工学院) ; Michigan State University(密歇根州立大学)
专题命中 效率与部署 :language model(title,abstract);分类 cs.AI、cs.LG
AI总结 提出MirrorCheck框架,利用文本到图像模型和随机化策略检测并防御针对视觉-语言模型的自适应对抗攻击。
GOTabPFN: 从特征排序到高维表格基础模型的紧凑分词化
机构 * University of Cambridge(剑桥大学)
专题命中 效率与部署 :foundation model(title,abstract);分类 cs.AI、cs.LG
AI总结 针对高维小样本表格预测问题,提出GOTabPFN模型,通过图引导排序和神经启发子单元压缩实现紧凑表示,提升TabPFN在严格token预算下的稳定性和准确性。
Comments Accepted to the 43rd International Conference on Machine Learning (ICML 2026). Code and resources GitHub https://github.com/zadid6pretam/GOTabPFN PyPI https://pypi.org/project/gotabpfn Project webpage https://www.zadidhabib.com/gotabpfn.html Hugging Face ZeroGPU https://huggingface.co/spaces/zadid6pretam/GOTabPFN CPU backup https://huggingface.co/spaces/zadid6pretam/GOTabPFN_CPU
循环语言模型表达能力的代数视角
专题命中 效率与部署 :language model(title,abstract);分类 cs.CL、cs.LG
AI总结 本文通过代数统一框架分析循环神经网络在不同算术模型下的表达能力,将形式语言识别问题归结为语法幺半群是否划分特定圈积的代数问题。
Comments 28 pages, 2 figures, to be published at ICML 2026
智能体调控蒸馏:自主多智能体系统中的推理时调控提取与利用
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 本文提出AHD框架,将AMAS推理时调控提取形式化为新安全问题,实验证实其可提取调控致IP泄露,还提出对应欺骗防御,揭示AMAS新安全威胁。
五个查询就足够了:基于蕴含的查询高效且无替代模型的RAG成员推断攻击
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 提出MEntA攻击方法,利用自然语言蕴含在少量查询下高效推断RAG系统中的文档成员关系,无需替代模型,成本低且难以检测。
Comments Accepted by USENIX Security 2026
HieraSparse: 分层半结构化稀疏KV注意力
专题命中 效率与部署 :LLM(summary_cn);large language model(abstract);language model(abstract)
AI总结 本文提出HieraSparse,通过分层KV缓存压缩框架和GPU稀疏张量核心,提升LLM的KV缓存效率与注意力计算速度,实现稀疏性与效率的平衡。
SLAC:基于Apple Silicon系统级缓存的访问驱动CPU到GPU侧信道攻击
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本研究针对Apple Silicon异构SoC发现GPU内存访问会在共享SLC留下可被CPU观测的集合级足迹,提出CPrime+CProbe及加速变体GPrime+CProbe侧信道技术,实现GNN图边重构与LLM隐私攻击,揭示Apple Silicon的微架构漏洞。
Comments Accepted to ACM CCS 2026. 15 pages
OpenCodeReview:面向成本效益型智能体代码评审的非确定性转确定性方案
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 OpenCodeReview针对LLM代码评审智能体的非确定性与上下文局部性缺陷,通过在三个流水线节点注入确定性,在AACR-Bench上实现SEM-F1提升且大幅降低令牌消耗,性能优于主流编码智能体。
VisionSelector:用于高效多模态大语言模型的端到端可学习视觉令牌压缩
专题命中 效率与部署 :large language model(abstract,abstract_cn);language model(abstract,abstract_cn)
AI总结 针对多模态大语言模型的视觉令牌压缩瓶颈,提出端到端可学习的VisionSelector框架,通过可微Top-K与课程退火策略实现高效自适应令牌选择,在压缩时保持优异性能并提升预填充速度。
Comments Accepted by ACM Multimedia 2026
GenPage:面向Netflix主页的端到端生成式构建
专题命中 效率与部署 :LLM(abstract,abstract_cn);pretraining(abstract);post-training(abstract)
AI总结 提出GenPage,用单一Transformer替代传统多阶段推荐栈,通过自回归生成整个主页,结合预训练与后训练,在线A/B测试中核心指标提升0.24%,延迟降低20%。
Comments Accepted at ACM RecSys 2026. Author's accepted version
DiffAxE:扩散驱动的硬件加速器生成与设计空间探索
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 针对硬件加速器设计空间探索难题,传统方法有局限。本文提出生成方法,将硬件设计建模为基于目标性能的一维图像合成,能有效学习相关映射,在降低生成误差、提升性能及加速搜索等方面有显著贡献。
Comments Accepted at ICCAD 2026
AnnoRetrieve:面向无结构文档分析的高效结构化检索
专题命中 效率与部署 :LLM(summary_cn,abstract)
AI总结 本文提出AnnoRetrieve,通过结构化注释替代向量嵌入,实现高效精准的语义检索,降低LLM调用频率和成本,提升文档分析的准确性和可扩展性。
从回顾到前瞻:面向知识驱动视觉问答的自我鼓励回顾蒸馏
机构 * College of Computing and Data Science, Nanyang Technological University(南洋理工大学计算与数据科学学院)
专题命中 效率与部署 :large language model(abstract);language model(abstract);preference optimization(abstract);prompting(abstract)
AI总结 本文提出HinD框架,通过知识鼓励偏好优化提升多模态大语言模型的知识推理能力,实验表明其在OK-VQA和A-OKVQA上表现优异。
StreamVLN:通过快慢上下文建模实现流式视觉与语言导航
机构 * Shanghai AI Lab(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学) ; Shanghai Jiao Tong University(上海交通大学)
专题命中 效率与部署 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)
AI总结 研究现实世界中视觉与语言导航问题,提出StreamVLN框架,采用混合快慢上下文建模策略,通过快速流式对话上下文与缓慢更新内存上下文配合,实现实时对话,在VLN-CE基准实验中展现低延迟最优性能。
Comments Accepted to ICRA 2026
通过用密集CLIP泛化语义映射实现开放词汇目标导航
机构 * Shanghai AI Lab(上海人工智能实验室) ; The University of Hong Kong(香港大学) ; Zhejiang University(浙江大学)
专题命中 效率与部署 :LLM(abstract);large language model(abstract);language model(abstract);foundation model(abstract)
AI总结 研究面向对象的实体导航任务,提出OVExp框架,利用密集CLIP模型展示基于语义地图的目标预测网络泛化能力,设计跨模态转移策略解决训练成本高问题,在ObjectNav基准上对未知目标有强大泛化能力。
Comments Accepted by ICRA 2026
TIR-Agent:训练一个探索性且高效的图像修复代理
机构 * Tsinghua University(清华大学) ; China Unicom(中国联通) ; Hunan University(湖南大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)
专题命中 效率与部署 :SFT(abstract,abstract_cn);language model(abstract);language agent(abstract)
AI总结 本文提出TIR-Agent,通过监督微调和强化学习两阶段训练,解决图像修复中任务调度和工具组合的效率问题,实验表明其在多个基准上表现优异且推理速度提升显著。