EVCap: Retrieval-Augmented Image Captioning with External Visual-Name Memory for Open-World Comprehension
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments CVPR 2024
AI 大模型
大语言模型、预训练、指令微调、后训练和语言模型应用。
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments CVPR 2024
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in the IEEE/ACM Transactions on Audio, Speech, and Language Processing. (Sourav Ghosh and Vibhav Agarwal contributed equally to this work.)
Journal ref IEEE/ACM Transactions on Audio, Speech, and Language Processing, vol. 32, pp. 1173-1184, 2024
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments Published in ICSE SRC 2024
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments 16 pages; Website: http://fingerrec.github.io/cosmo
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments EMNLP 2023 (20 pages)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments To appear at NeurIPS 2023, 10 pages (+ references and appendix), Code: https://github.com/ml-jku/helm
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments In Proceedings NCMA 2023, arXiv:2309.07333
Journal ref EPTCS 388, 2023, pp. 16-27
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments ICML 2023
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments accepted at AACL2022
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments NAACL 2022 (16 pages)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted to the 39th International Conference on Machine Learning (ICML'22)
专题命中 长上下文与记忆 :large language model(abstract);language model(abstract)
Comments 7 pages, 2 figures. Accepted to the ReNeuIR workshop at SIGIR 2022
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments the SIGNLL Conference on Computational Natural Language Learning (CoNLL, 2018)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published as a conference paper at ICLR 2022 (spotlight)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments 5 pages, 3 figures, 3 tables
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Accepted by AAAI 2021 main conference
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at NAACL 2019; This is camera Ready version; Code is available at https://github.com/Frozenmad/AMN_SRL
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published at ICLR 2019
专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI、cs.LG
Comments Published in ICLR 2018 ( the Sixth International Conference on Learning Representations)
Trellis: 在注意力模型中学习压缩键值记忆
机构 * Google Research(谷歌研究)
专题命中 长上下文与记忆 :language model(abstract,comments);分类 cs.CL、cs.LG
AI总结 Trellis通过动态压缩键值内存提升注意力模型的效率与长上下文处理能力
Comments In Second Conference on Language Modeling (COLM) (2025)
专题命中 长上下文与记忆 :language model(abstract,comments);分类 cs.CL、cs.AI
Comments This is an old and now obsolete draft. See arXiv:2109.14723 ("BeliefBank: Adding Memory to a Pre-Trained Language Model for a Systematic Notion of Belief") for the final paper
BF1:一种用于高效长上下文Transformer的因果二元稀疏注意力改造方案
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG
AI总结 本文提出BF1,一种结合局部邻域、全局首块与对数间隔历史块的稀疏注意力方案,改造Qwen3-0.6B部分注意力层后,在长上下文场景下显著降低模型延迟,且语言建模性能优于基线方法。
Perseus:基于状态记忆的稀疏监督交互式时间序列分割
机构 * Computer Science National Yang Ming Chiao Tung University(计算机科学 国立阳明交通大学) ; Control Engineering National Yang Ming Chiao Tung University(控制工程 国立阳明交通大学) ; National Yang Ming Chiao Tung University(国立阳明交通大学)
专题命中 长上下文与记忆 :prompting(abstract);分类 cs.AI、cs.LG
AI总结 针对现有交互式时间序列分割方法无法保留用户交互历史的问题,提出 Perseus 框架,通过写-读架构实现异步状态管理,在多粒度设置中准确率提升最高达 85%。
Comments Accepted at IEEE ICDM 2026
利用工具链持续学习:超越模型参数的持续适应
机构 * University of Wollongong(卧龙岗大学) ; Nanjing University(南京大学)
专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI、cs.LG
AI总结 该研究提出工具链持续学习(HCL)范式,围绕冻结基础模型演化工具链,通过受保护演化机制缓解工具链级遗忘,在多任务实验中相对基准增益超10%,可调整稳定性-可塑性权衡。
预测随机低维重参数化何时能训练神经网络
机构 * Tsinghua University(清华大学) ; The University of Manchester(曼彻斯特大学) ; University of Kentucky(肯塔基大学) ; Miami University(迈阿密大学) ; University of Dayton(代顿大学) ; Institute for Biomedical Informatics, University of Kentucky(肯塔基大学生物医学信息学研究所)
专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG
AI总结 该研究针对随机低维重参数化训练神经网络的潜在空间规模问题,提出取向分辨二次主公式,引入RaMaN模型,实现内存优化,实验验证其预测与转换跟踪性能优于取向无关近似。