Benchmarking the Performance of Large Language Models on the Cerebras Wafer Scale Engine
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)
Comments IEEE HPEC 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)
Comments IEEE HPEC 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)
Comments Accepted in ESEM 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)
Comments Accepted by WWW 2024
专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract)
Comments 6 pages
专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);分类 cs.CL、cs.AI、cs.LG
Comments Fix template issues
FlashPrefill V2:面向长上下文大语言模型服务的块稀疏预填充注意力机制
机构 * MAIS&NLPR, CASIA(中国科学院自动化研究所多模态人工智能系统与国家重点实验室) ; UCAS(中国科学院大学) ; WeChat, Tencent(腾讯微信)
专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 FlashPrefill V2通过均值校正、适配FlashAttention-3/4的算子设计及原生支持分页KV缓存等,在128K上下文长度下为长上下文LLM服务提供了高效的块稀疏预填充注意力方案,加速比显著。
Comments FlashPrefill V2
HyperSkill:基于超图结构技能记忆的自进化大语言模型智能体
机构 * University of Southern California(南加州大学) ; University of Illinois at Chicago(伊利诺伊大学芝加哥分校) ; Northwestern University(西北大学)
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.CL
AI总结 本文提出HyperSkill超图记忆框架,解决LLM智能体记忆设计的存储、检索与进化问题,在多数据集上较10种基线取得显著性能提升。
Comments 25 pages
ε-MemEvo:面向大语言模型程序进化的自适应跨任务记忆迁移
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI
AI总结 ε-MemEvo是面向LLM程序进化的自适应跨任务记忆迁移框架,在8个优化基准上以GPT-5为主干,较AdaEvolve实现AUCC与早期收敛提升,且计算开销极低。
SCOUT:用于大语言模型预训练中故障定位的对称共识异常检测
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.LG
AI总结 SCOUT是用于LLM预训练故障定位的统一运行时框架,基于等价副本严格多数共识识别异常,可与主流大模型训练框架集成,解决现有诊断方法的局限。
Bayesian-Agent:面向LLM Agent框架的后验引导技能演化
机构 * IDEA Research(IDEA研究院) ; The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) ; DataArcTech Ltd.(DataArcTech有限公司)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.CL
AI总结 提出Bayesian-Agent框架,将可复用技能视为假设,通过后验分布指导技能演化(如修补、拆分、压缩等),在多个基准上显著提升性能,表明Agent技能演化应视为后验引导的框架优化。
Comments 20 pages, 11 figures
在大语言模型时代:在统一框架下的模块化架构与策略
机构 * Huawei Cloud(华为云)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 本文在统一框架下系统比较了多种记忆方法,设计出优于现有方法的新方法,并探讨了未来研究方向。
MAFIA:针对经审计的大语言模型智能体的、基于探测与事实注入的仅查询内存攻击
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI
AI总结 本研究针对经审计的LLM智能体,提出MAFIA攻击框架,通过放置策略与伪装有效载荷实现高攻击成功率,大幅降低审计检测率,揭示智能体内存系统的关键漏洞。
Comments 17 pages, 5 figures
TimeRLM:递归语言模型可实现长时序数据中的精准异常定位
专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.LG
AI总结 提出TimeRLM(基于递归语言模型的时序异常定位框架),结合强化学习后训练后,在合成基准AnomalyXL及真实世界数据上,均优于现有时序语言模型,可实现长时序数据的精准异常定位。
Comments Open source code and datasets: https://github.com/OpenTSLM/TimeRLM
Zero-Mem:面向大语言模型智能体的零令牌内存操作
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.CL
AI总结 Zero-Mem提出零令牌内存操作,以原始交互轨迹为记录来源,通过实体-上下文图与时间层次结构组织信息,仅在最终问答时调用LLM,在长记忆问答基准中实现性能与效率的平衡,降低内存操作时间成本57.6%。
MemLens:一种用于基于大语言模型的智能体的具有交互式分析的价值感知内存管理系统
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI
AI总结 研究针对基于LLM的智能体内存管理问题,提出价值感知内存管理系统MemLens,通过端到端交互式分析仪表板展示内存生命周期,经学习助手应用程序帮助用户比较策略,可实现高效、可解释和个性化的长期内存管理。
超越记忆:一种用于异构协作知识工作的带大语言模型代理的模板化基础架构
机构 * University of Notre Dame(圣母大学)
专题命中 长上下文与记忆 :LLM(title,summary_cn);分类 cs.AI
AI总结 研究指出知识工作成果难传承,大语言模型代理无持久记忆。提出llm-wiki-memory-template,它是异构协作知识工作基础架构,沿多人类、多代理、多领域三个轴,通过案例研究展示其能保留失败路径等,解决负面结果丢失问题。
Comments 15 pages, 3 figures, 1 table
重新审视现代端到端语音识别中语言模型困惑度与ASR单词错误率之间的关系
机构 * AppTek.ai GmbH ; Machine Learning and Human Language Technology Group, Faculty of Computer Science, RWTH Aachen University(机器学习与人类语言技术小组,计算机科学学院,亚琛工业大学)
专题命中 长上下文与记忆 :language model(title,abstract);LLM(abstract,abstract_cn);large language model(abstract);分类 cs.CL
AI总结 本文重新审视现代端到端ASR系统中语言模型困惑度与ASR单词错误率的关系,研究外部语言模型对系统的作用、PPL-WER关系及相关影响因素,还探讨内部语言建模,发现ILM减法改变关系,强调解释外部LM质量影响时要考虑解码器内部LM。
Comments Submitted to SLT 2026
你的智能体记忆并非其自身所有:针对大语言模型智能体记忆的伪造推理攻击及防御
机构 * The Pennsylvania State University(宾夕法尼亚州立大学)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 研究针对大语言模型智能体记忆伪造推理的攻击,提出FARMA攻击方法,通过规避语言伪造推理痕迹并强化,还引入SENTINEL防御管道,实验表明该防御能有效降低攻击成功率。
Comments Preprint. 10 pages, 2 figures, 4 tables
ReContext: 递归证据重放作为大语言模型的长上下文推理工具
机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)
专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出一种免训练推理方法ReContext,通过模型内部相关性信号构建查询条件证据池并在最终生成前重放,以提升长上下文推理中的证据利用,无需外部记忆或上下文剪枝。
MosaicKV: 通过动态二维KV缓存压缩服务长上下文LLM
机构 * Institute of Parallel and Distributed Systems, Shanghai Jiao Tong University(上海交通大学并行与分布式系统研究所)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG
AI总结 提出MosaicKV系统,利用动态二维KV缓存压缩解决长上下文服务中的内存瓶颈,通过细粒度稀疏性和压缩管理实现高吞吐和低延迟,在H800 GPU上取得最高16倍注意力加速和3倍内存节省。
Comments 15 pages, 10 figures
Self-GC:面向长周期LLM智能体的自管理上下文
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出Self-GC框架,通过将工具结果、文件等上下文对象索引化,并利用侧信道规划器进行折叠、掩码和剪枝操作,实现长周期智能体的上下文生命周期管理,显著减少前缀令牌且不影响未来延续。
预测、重用与修复:加速长上下文LLM解码的动态稀疏注意力
机构 * University of Pittsburgh(匹兹堡大学) ; HPE Labs(HPE实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.LG
AI总结 提出PRR运行时系统,利用动态稀疏注意力选择的时间局部性,通过预测、推测和增量修复来减少解码延迟,最高可降低40%的每令牌延迟,同时保持下游任务精度。
Comments 9 pages body plus 3 pages appendix, 13 pages total
假设驱动的技能优化用于LLM智能体
机构 * AI Lab, Qifu Technology(奇富科技人工智能实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出HDSO框架,通过可证伪假设与验证机制从稀疏轨迹中提取可靠技能,无需训练,在ALFWorld上提升平均成功率6.9-7.1个百分点。
CNnotator: LLM引导的内存安全注释合成
机构 * Carnegie Mellon University(卡内基梅隆大学) ; Galois, Inc.(Galois公司)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出CNnotator工具,利用大语言模型自动生成CN规范来标注C代码的内存使用模式,OpenAI o3模型首次尝试成功率达90%,表明AI辅助注释对实际C代码库可行。
Comments 6 pages. Published at ReCode 2026 (1st Workshop on Code Translation, Transformation, and Modernization), co-located with ICSE 2026. This version corrects the description of the property-based testing backend (Bennet, built on Fulminate) relative to the published version
Journal ref Proceedings of the 1st Workshop on Code Translation, Transformation, and Modernization (ReCode '26), April 12-18, 2026, Rio de Janeiro, Brazil. ACM, New York, NY, USA, 6 pages
SkillRevise: 通过轨迹条件技能修订改进LLM撰写的智能体技能
机构 * The Hong Kong University of Science and Technology(香港科学与技术大学) ; Harbin Institute of Technology(哈尔滨工业大学) ; Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) ; Nanjing University(南京大学) ; The University of Hong Kong(香港大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出SkillRevise框架,通过执行证据诊断、修复原则检索和执行锚定编辑,迭代优化初始技能,在SkillsBench上将基础智能体成功率从36.05%提升至61.63%,并展现跨模型迁移性。
Comments 15 pages, 4 figures
Shachi: 一种用于基于LLM的涌现集体行为建模的模块化、可控框架
机构 * Sakana AI, Japan(日本Sakana AI) ; The University of Tokyo, Japan(日本东京大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 提出Shachi框架,将智能体认知分解为配置、记忆和工具等独立可控组件,通过扰动实验研究微观认知特征如何影响宏观群体动态,并在10任务基准和关税冲击案例中验证其有效性。
Comments Accepted to ALIFE 2026
VikingMem:面向有状态LLM应用的记忆库管理系统
机构 * Zhejiang University(浙江大学)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.AI
AI总结 提出记忆库(Memory Base)数据管理范式,并基于VikingDB向量引擎实现VikingMem系统,通过事件与实体抽象、主题时间线压缩和时间加权召回,在长期记忆基准上提升检索效果达30%。
Comments Accepted by VLDB26
持续LLM升级:一种用于稠密到稀疏LLM的预测器门控银行级稀疏训练方案
机构 * Nanyang Technological University(南洋理工大学) ; Salesforce AI ; Huawei Noah's Ark Lab(华为诺亚方舟实验室)
专题命中 长上下文与记忆 :LLM(title,title_cn);large language model(abstract);language model(abstract);分类 cs.CL
AI总结 提出一种从稠密检查点构建通道稀疏大语言模型的持续训练方法,通过预测器门控稀疏SwiGLU FFN和银行级top-k规则实现4倍稀疏性,并修复长上下文失败模式。
面向目标的推理用于基于RAG的记忆在对话型代理LLM系统中
机构 * University of Toronto(多伦多大学) ; Vector Institute for Artificial Intelligence(向量人工智能研究所)
专题命中 长上下文与记忆 :LLM(title,title_cn);分类 cs.AI
AI总结 本文提出Goal-Mem框架,通过目标导向的推理提升RAG记忆在复杂任务中的表现,尤其在多跳推理和隐含推理中效果显著。