Efficient and Personalized Mobile Health Event Prediction via Small Language Models
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments 6 pages, 3 figures
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 效率与部署 :language model(title,abstract);small language model(title,abstract);LLM(abstract);large language model(abstract)
Comments 6 pages, 3 figures
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);post-training(abstract)
Comments Accepted by 11th IEEE International Conference on Cybernetics and Intelligent Systems
LEAP:可学习的端到端无结构剪枝大型语言模型
机构 * University of Maryland(马里兰大学)
专题命中 效率与部署 :LLM(summary_cn,abstract);large language model(title);language model(title);分类 cs.AI、cs.LG
AI总结 本文提出LEAP,一种可学习的端到端无结构剪枝方法,通过伯努利-戈姆贝茨松弛替代传统参数化,提高了无结构剪枝的端到端准确率,实验表明在多个LLM家族上平均提升了零样本准确率。
Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference (AdaptFM)
IR3DE:面向大型语言模型的线性路由器
机构 * Gensyn
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract,abstract_cn);分类 cs.CL、cs.LG
AI总结 提出基于岭回归的线性路由器IR3DE,以低成本快速为每个提示选择最合适的领域专家大语言模型,在推理任务中超越基线方法,并支持动态添加或移除专家模型。
Comments Accepted at the ICML 2026 Workshop on Resource-Adaptive Foundation Model Inference
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);foundation model(abstract,comments);post-training(abstract)
Comments Work presented at the Efficient Systems for Foundation Models Workshop @ ICML2024
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);pretraining(abstract,comments);LLM(abstract)
Comments Update (arXiv-v2): continued pretraining for severe pruning ratios, compatibility with quantization, and enhanced baselines. Preliminary work (arXiv-v1) accepted at ICLR 2024 Workshop on ME-FoMo: https://openreview.net/forum?id=18VGxuOdpu
专题命中 效率与部署 :large language model(title,abstract);language model(title,abstract);LLM(abstract);RLHF(abstract)
Comments Accepted by Workshop on Instruction Tuning and Instruction Following at NeurIPS 2023, Submitted to AAAI 2024
范围缩小,威胁依旧:重新评估2026前沿模型队列上的LLM包幻觉
机构 * Anthropic ; OpenAI ; Google ; DeepSeek
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文重新评估了2026前沿模型队列上大型语言模型(LLM)的包幻觉现象,发现尽管幻觉率有所降低,但仍然存在威胁,识别出一组127个包名(109个在PyPI,18个在npm)被所有评估模型一致生成,构成一个跨模型的供应链攻击面,同时发现Python与JavaScript幻觉的不对称性以及DeepSeek V3.2和GPT-5.4-mini之间的高相似性。
Comments 13 pages, 3 figures, 4 tables. v2: incorporates coordinated-disclosure feedback from PyPI Security and Socket.dev; registrable attack surface refined to 53 names (41 PyPI, 12 npm). Headline rates unchanged. Replication of Spracklen et al. (USENIX Security 2025). Data and code: https://github.com/churik5/slopsquatting-replication-2026 and https://doi.org/10.5281/zenodo.19859120
SKILL-KD:面向大语言模型智能体的对比式技能蒸馏
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);prompting(abstract)
AI总结 SKILL-KD是面向LLM智能体的对比式技能蒸馏框架,通过将师生智能体的可操作差异蒸馏为技能补丁并迭代优化,结合感知漂移的技能整合,在五个智能体基准上提升了冻结学生智能体性能。
LLM量化几何学:GPTQ作为Babai最近平面算法
机构 * Institute of Science and Technology Austria (ISTA)(奥地利科学技术院) ; Red Hat, Inc.(红帽公司) ; ETH Zürich(苏黎世联邦理工学院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 本文将GPTQ与Babai最近平面算法等价,揭示其几何意义和误差上界,设计出无裁剪的量化方法并提供高效GPU内核,为大规模模型量化理论奠定基础。
Comments Published as a conference paper at the Fourteenth International Conference on Learning Representations (ICLR 2026): https://openreview.net/forum?id=NFB4QGGS65
Journal ref International Conference on Learning Representations, 2026, pp. 122653-122695
训练语言模型以与推理时控制器协作
专题命中 效率与部署 :LLM(summary_cn,abstract);language model(title,abstract);large language model(abstract);post-training(abstract)
AI总结 研究LLM性能依赖推理时控制器的问题,提出CALM框架,将其表述为多任务强化学习,通过模块级分解研究训练策略,评估显示该框架能提升推理时工作流程的泛化能力。
大规模LLM推理中具有可证明护栏的高效聚类
机构 * Amazon(亚马逊)
专题命中 效率与部署 :LLM(title,title_cn);foundation model(abstract);分类 cs.LG
AI总结 研究针对大规模LLM推理成本和延迟瓶颈,提出两阶段聚类算法,先用Mini-batch K-Means生成初始聚类,再在其中选代表,能保证逐样本质量控制,运行高效且可扩展,相比常见方法有显著优势,部署后大幅降低成本和延迟。
Comments Accepted for presentation at ICML HiLD workshop 2026 (non-archival)
本科写作者对LLM的四种依赖类型及其预测因素:一项在少数族裔服务R1大学的混合方法研究
机构 * School of Education, University of Maryland, Baltimore County(大学教育学院,马里兰大学巴尔的摩县分校)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 本研究在少数族裔服务大学通过混合方法识别出本科生的四种LLM依赖类型(策略型、工具型、对话型、依赖型),发现价值与成本信念预测依赖强度,AI素养预测依赖类型,且策略型用户在标准结果测量中得分最低。
Comments 18 pages, 5 figures
BayesBench: 评估多轮证据积累下LLM信念轨迹
机构 * Meta AI ; Columbia University(哥伦比亚大学) ; Meta Superintelligence Labs(Meta超级智能实验室) ; Tel Aviv University(特拉维夫大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出BayesBench基准,通过三个渐进复杂任务评估LLM在多轮证据积累中的信念更新是否接近贝叶斯理性,发现规模提升改善潜在推理但未可靠转化为预测。
优化训练策略的幻象:单调推理策略作为大语言模型强化学习的真正目标
机构 * Tianjin University(天津大学) ; Alibaba(阿里巴巴)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 针对LLM强化学习中训练-推理概率不一致导致的策略不稳定问题,提出单调推理策略改进(MIPI)目标及两阶段框架MIPU,通过推理侧间隙代理选择候选更新,提升推理性能与训练稳定性。
不要破坏我的LLM:剪枝注意力层对解释忠实性和置信度校准的影响
机构 * University of Copenhagen(哥本哈根大学) ; LUT University(拉赫蒂理工大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 研究剪枝LLM注意力层对解释忠实性和置信度校准的影响,发现尽管准确率保持,但忠实性和校准度常下降,表明模型置信度、可解释性与准确性之间存在错位。
Comments Accepted at TMLR
揭秘LLM推理中的数值不稳定性:使用HEAL实现关键任务的可复现推理
机构 * UCLA(加州大学洛杉矶分校) ; UC Berkeley(加州大学伯克利分校) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 针对LLM在关键任务中因16位精度导致输出不一致的问题,提出HEAL方法,通过INT16量化和代数误差补偿,在保持FP32精度的同时减少性能开销。
编排现实:从角色扮演到活生生的、可玩的游戏世界——作为参数化动作POMDP的LLM驱动世界模拟
机构 * The University of Tokyo(东京大学) ; Individual Researcher(个人研究员)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.AI
AI总结 提出编排现实框架,将LLM驱动的游戏世界形式化为参数化动作POMDP,通过单例编排代理维护规范JSON状态,实现数值状态、叙事声音和规则逻辑的统一协调。
Comments 9 pages, 2 figures. Work in progress. Yuhang Huang and Chenmiao Li contributed equall
迷失在妄想中:审视用户妄想与痛苦下的LLM安全性
机构 * University of Pittsburgh(匹兹堡大学) ; Carnegie Mellon University(卡内基梅隆大学) ; Fordham University(福特汉姆大学)
专题命中 效率与部署 :LLM(title,title_cn);prompting(abstract);分类 cs.CL
AI总结 本研究通过多轮对话模拟,发现LLM在检测用户痛苦时表现良好,但在痛苦嵌入妄想时干预行为显著减少(高达4.5倍),并提出针对性提示策略以缩小这一差距。
WINDQuant: 权重感知的全局混合精度大语言模型量化神经决策
机构 * CAIR, VinUniversity, Vietnam(越南 VinUniversity 的 CAIR) ; Ho Chi Minh City University of Technology (HCMUT), VNU-HCM, Ho Chi Minh City, Vietnam(越南胡志明市技术大学 (HCMUT)) ; CCDS, Nanyang Technological University, Singapore(新加坡南洋理工大学的 CCDS) ; School of Computing, National University of Singapore, Singapore(新加坡国立大学计算机学院)
专题命中 效率与部署 :LLM(title,summary_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 提出基于强化学习的WINDQuant控制器,在全局存储预算下为列块分配位宽和量化策略,实现超低位LLM量化的细粒度混合精度,性能优于传统方法。
识别和减轻生产级LLM推理基准中的系统性测量偏差
机构 * Google(谷歌)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 针对生产级LLM推理基准中因客户端排队导致的测量偏差,提出基于多进程的无偏评估框架和归一化输出令牌时间(NTPOT)指标,实现高并发下的准确性能评估。
基于不确定性感知的机会主义与压缩传输的通信高效混合语言模型
机构 * School of Electrical and Electronic Engineering, Yonsei University, South Korea(延世大学电气电子工程学院,韩国) ; Information Systems Technology and Design pillar, Singapore University of Technology and Design, Singapore 487372(新加坡科技设计大学信息系统技术与设计支柱,新加坡487372) ; Department of Smart Mobility Engineering, Inha University, South Korea(Inha大学智能移动工程系,韩国) ; School of Electrical and Mechanical Engineering, The University of Adelaide, Australia(阿德莱德大学电气与机械工程学院,澳大利亚) ; Singapore University of Technology and Design, Singapore 487372(新加坡科技设计大学,新加坡487372)
专题命中 效率与部署 :language model(title,abstract);LLM(abstract,abstract_cn);SLM(abstract,abstract_cn);large language model(abstract)
AI总结 提出通信高效的混合语言模型CU-HLM,通过不确定性感知的机会主义传输和词汇表压缩,在保持97.4%准确率的同时实现高达206倍的令牌吞吐量提升。
Comments 17 pages, 13 figures, 5 tables; This article has been accepted for publication in IEEE Transactions on Communications. This is the author's accepted version; the final published version will be available via IEEE Xplore
通过聊天模板的推理时后门:从LLM供应链到代理系统妥协
机构 * Fujitsu Research of Europe(富士通欧洲研究)
专题命中 效率与部署 :LLM(title,title_cn);language model(abstract);分类 cs.LG
AI总结 提出一种通过恶意修改聊天模板实现推理时后门攻击的方法,无需修改模型权重或训练数据,在LLM、代理和多代理系统层面均能成功攻击,且能绕过现有防御。
Comments V3: Accepted to ICLR 2026 Trustworthy AI Workshop, V4: Submitted to CCS 2026
超越沉没成本:通过专家混合的正交增长提升LLM预训练效率
机构 * ustc(中国科学技术大学) ; msra(微软亚洲研究院) ; stju(上海交通大学) ; xmu(厦门大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出正交增长策略,通过优化专家混合模型的深度和宽度,提升LLM预训练效率,实验证明在相同计算预算下,模型准确率提升10.6%。
Comments Accepted to ICML 2026
SparseForge:通过Hessian引导的软掩码退火实现高效的半结构化LLM稀疏化
机构 * Tsinghua University(清华大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);post-training(abstract)
AI总结 SparseForge通过优化稀疏掩码而非扩大重训练token数量,实现高效的半结构化LLM稀疏化,提升稀疏恢复效率,实验显示其在准确率与效率的权衡上优于现有方法。
Open-SAT: 一种基于LLM的查询嵌入细化方法用于卫星影像开放词汇物体检索
机构 * North South University(北南大学) ; NEC Laboratories America(NEC实验室)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 Open-SAT通过LLM引导在推理阶段优化查询与卫星影像内容的对齐,提升开放词汇检索性能,实验表明其F1分数提升达16.04%。
AHASD:异步异构架构用于移动设备上的LLM自适应草案推测解码
机构 * State Key Lab of Processors, Institute of Computing Technology, Chinese Academy of Sciences(中国科学院计算技术研究所处理器国家重点实验室) ; University of Chinese Academy of Sciences(中国科学院大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 AHASD提出一种异步异构架构,通过任务级DLM-TLM解耦和熵历史感知草案控制,提升移动设备上LLM自适应草案推测解码的吞吐量和能效。
Comments 7 pages, 9 figures, accepted by DAC 2026, repo: https://github.com/MAdrid1011/AHASD
FairyFuse:通过融合三进制内核实现CPU上的无乘法LLM推理
机构 * Peking University(北京大学)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 本文提出FairyFuse,通过融合三进制权重的八次实值子GEMV,实现CPU上的无乘法LLM推理,显著提升性能,单CPU达到32.4 tokens/s,质量接近FP16。
Comments 16 pages, 10 figures, 4 tables
SLO-Guard:面向SLO约束的LLM服务自动调优:崩溃感知、预算一致
机构 * Inland Norway University of Applied Sciences(内陆挪威应用科学大学) ; University of California, Berkeley(加州大学伯克利分校)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 SLO-Guard通过结合热预算退火与树结构帕泽估计器,实现崩溃感知的自动调优,提升LLM服务在SLO约束下的预算一致性与稳定性。
Comments 20 pages, 6 figures, 5 tables. Code and raw per-trial JSONL data: https://github.com/Chrislysen/SLO-Guard
PipeLive: 高效的动态LLM服务中实时管道并行性重新配置
机构 * DisNet Lab(DisNet实验室) ; University of Melbourne(墨尔本大学) ; IBM Research(IBM研究院)
专题命中 效率与部署 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.LG
AI总结 PipeLive通过实时在地管道并行性重新配置提升动态LLM服务效率,采用改进的KV缓存布局和PageAttention扩展,实现KV缓存动态调整与增量修补机制,显著降低TTFT和重新配置开销。