arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4847 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4847 篇

2512.13564 2026-01-14 cs.CL cs.AI 73%

Memory in the Age of AI Agents

人工智能代理时代的记忆

Yuyang Hu, Shichun Liu, Yanwei Yue, Guibin Zhang, Boyang Liu, Fangyi Zhu, Jiahang Lin, Honglin Guo, Shihan Dou, Zhiheng Xi, Senjie Jin, Jiejun Tan, Yanbin Yin, Jiongnan Liu, Zeyu Zhang, Zhongxiang Sun, Yutao Zhu, Hao Sun, Boci Peng, Zhenrong Cheng, Xuanbo Fan, Jiaxin Guo, Xinlei Yu, Zhenhong Zhou, Zewen Hu, Jiahao Huo, Junhao Wang, Yuwei Niu, Yu Wang, Zhenfei Yin, Xiaobin Hu, Yue Liao, Qiankun Li, Kun Wang, Wangchunshu Zhou, Yixin Liu, Dawei Cheng, Qi Zhang, Tao Gui, Shirui Pan, Yan Zhang, Philip Torr, Zhicheng Dou, Ji-Rong Wen, Xuanjing Huang, Yu-Gang Jiang, Shuicheng Yan

机构 * Core Supervisors. 0.5em Affiliations: National University of Singapore, Renmin University of China, Fudan University, Peking University, Nanyang Technological University, Tongji University, University of California San Diego, Hong Kong University of Science Technology (Guangzhou), Griffith University, Georgia Institute of Technology, OPPO, Oxford University

专题命中 长上下文与记忆 :LLM(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 本文系统梳理了人工智能代理记忆的现状与分类,提出了记忆的三种形式、功能分类及动态分析,为未来智能设计提供理论基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.06966 2026-01-13 cs.CL cs.AI 73%

RealMem: Benchmarking LLMs in Real-World Memory-Driven Interaction

RealMem: 在真实世界中评估大语言模型的内存驱动交互

Haonan Bian, Zhiyuan Yao, Sen Hu, Zishan Xu, Shaolei Zhang, Yifu Guo, Ziliang Yang, Xueran Han, Huacan Wang, Ronghao Chen

机构 * Xidian University(西安电子科技大学) Zhejiang University(浙江大学) Peking University(北京大学) Shanghai Jiao Tong University(上海交通大学) Renmin University of China(中国人民大学) Sun Yat-sen University(中山大学) University of the Chinese Academy of Sciences(中国科学院大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 RealMem是一个基于真实项目场景的基准,评估大语言模型在长期项目导向交互中的记忆管理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.14086 2026-01-13 cs.CV cs.AI cs.LG 73%

Seg-LSTM: Performance of xLSTM for Semantic Segmentation of Remotely Sensed Images

Seg-LSTM:xLSTM在遥感图像语义分割中的性能

Qinfeng Zhu, Yuanzhi Cai, Lei Fan

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 Seg-LSTM首次评估了xLSTM在遥感图像语义分割中的性能,发现其表现逊于基于Transformer和Mamba的模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05589 2026-01-12 cs.CL cs.AI 73%

ACR: Adaptive Context Refactoring via Context Refactoring Operators for Multi-Turn Dialogue

ACR: 通过上下文重构运算符进行多轮对话的自适应上下文重构

Jiawei Shen, Jia Zhu, Hanghui Guo, Weijie Shi, Yue Cui, Qingyu Niu, Guoqing Ma, Yidan Liang, Jingjiang Liu, Yiling Wang, Shimin Di, Jiajie Xu

机构 * Zhejiang Normal University(浙江师范大学) Alibaba Group(阿里巴巴集团) Hong Kong University of Science and Technology(香港科学与技术大学) Southeast University(东南大学) Soochow University(苏州大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 ACR通过动态上下文重构运算符和教师指导的自我进化训练范式,有效缓解多轮对话中的上下文惯性和状态漂移问题,提升对话性能并降低令牌消耗。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02163 2026-01-12 cs.AI cs.CL 73%

EverMemOS: A Self-Organizing Memory Operating System for Structured Long-Horizon Reasoning

EverMemOS:一种用于结构化长时程推理的自组织记忆操作系统

Chuanrui Hu, Xingze Gao, Zuyi Zhou, Dannong Xu, Yi Bai, Xintong Li, Hui Zhang, Tong Li, Chong Zhang, Lidong Bing, Yafeng Deng

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 EverMemOS通过自组织记忆系统提升长时程推理能力,实现事件轨迹捕捉、语义整合与重构性回忆,有效增强记忆增强推理任务的性能。

Comments 16 pages, 7 figures, 12 tables. Code available at https://github.com/EverMind-AI/EverMemOS

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.01739 2026-01-12 cs.CL cs.AI 73%

K-EXAONE Technical Report

K-EXAONE 技术报告

Eunbi Choi, Kibong Choi, Seokhee Hong, Junwon Hwang, Hyojin Jeon, Hyunjik Jo, Joonkee Kim, Seonghwan Kim, Soyeon Kim, Sunkyoung Kim, Yireun Kim, Yongil Kim, Haeju Lee, Jinsik Lee, Kyungmin Lee, Sangha Park, Heuiyeen Yeen, Hwan Chang, Stanley Jungkyu Choi, Yejin Choi, Jiwon Ham, Kijeong Jeon, Geunyeong Jeong, Gerrard Jeongwon Jo, Yonghwan Jo, Jiyeon Jung, Naeun Kang, Dohoon Kim, Euisoon Kim, Hayeon Kim, Hyosang Kim, Hyunseo Kim, Jieun Kim, Minu Kim, Myoungshin Kim, Unsol Kim, Youchul Kim, YoungJin Kim, Chaeeun Lee, Chaeyoon Lee, Changhun Lee, Dahm Lee, Edward Hwayoung Lee, Honglak Lee, Jinsang Lee, Jiyoung Lee, Sangeun Lee, Seungwon Lim, Solji Lim, Woohyung Lim, Chanwoo Moon, Jaewoo Park, Jinho Park, Yongmin Park, Hyerin Seo, Wooseok Seo, Yongwoo Song, Sejong Yang, Sihoon Yang, Chang En Yea, Sihyuk Yi, Chansik Yoon, Dongkeun Yoon, Sangyeon Yoon, Hyeongu Yun

机构 * LG AI Research(LG人工智能研究所)

专题命中 长上下文与记忆 :language model(abstract);foundation model(abstract);分类 cs.CL、cs.AI

AI总结 K-EXAONE是一款由LG AI Research开发的大型多语言语言模型,基于专家混合架构,支持256K-token上下文窗口,具备多语言能力,其性能与同类开源模型相当,适用于多种工业和研究应用。

Comments 29 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.04726 2026-01-09 cs.AI cs.CL 73%

Memory Matters More: Event-Centric Memory as a Logic Map for Agent Searching and Reasoning

记忆更重要:以事件为中心的记忆作为智能体搜索和推理的逻辑图

Yuyang Hu, Jiongnan Liu, Jiejun Tan, Yutao Zhu, Zhicheng Dou

机构 * Gaoling School of Artificial Intelligence, Renmin University of China(中国人民大学北京校区人工智能学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出CompassMem,一种以事件为中心的记忆框架,通过构建事件图实现智能体的结构化记忆导航,提升长周期推理能力。

Comments 19 pages,6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI 73%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 73%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18773 2026-01-06 cs.AR cs.AI cs.CL cs.PF 73%

BitDecoding: Unlocking Tensor Cores for Long-Context LLMs with Low-Bit KV Cache

BitDecoding: 通过低精度KV缓存解锁Tensor Cores用于长上下文LLM

Dayou Du, Shijie Cao, Jianyi Cheng, Luo Mai, Ting Cao, Mao Yang

机构 * University of Edinburgh(爱丁堡大学) Microsoft Research(微软研究院) Institute for AI Industry Research (AIR), Tsinghua University(清华大学人工智能产业研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 BitDecoding通过协同利用CUDA核心和Tensor Core,实现低精度KV缓存的高效解码,提升长上下文LLM的解码速度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.15759 2025-12-30 cs.CL cs.AI cs.CV 73%

Vision Enhancing LLMs: Empowering Multimodal Knowledge Storage and Sharing in LLMs

视觉增强大语言模型:赋能大语言模型中的多模态知识存储与共享

Yunxin Li, Zhenyu Liu, Baotian Hu, Wei Wang, Yuxin Ding, Xiaochun Cao, Min Zhang

机构 * Research Institute of Computing and Intelligence(计算与智能研究 institute) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出MKS2方法,通过多模态知识存储与共享增强大语言模型的推理能力,提升其在物理和常识知识场景下的表现。

Comments 21 pages, 7 figures; Accepted by IEEE TIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.20920 2025-12-25 cs.LG cs.AI 73%

RevFFN: Memory-Efficient Full-Parameter Fine-Tuning of Mixture-of-Experts LLMs with Reversible Blocks

RevFFN: 一种内存高效的混合专家语言模型全参数微调方法,采用可逆块

Ningyuan Liu, Jing Yang, Kaitong Cai, Keze Wang

机构 * Sun Yat-sen University(中山大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 RevFFN通过可逆Transformer块实现混合专家语言模型的高效全参数微调,减少内存消耗,提升训练效率。

Comments Under submission

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19206 2025-12-23 cs.LG cs.AI 73%

MixKVQ: Query-Aware Mixed-Precision KV Cache Quantization for Long-Context Reasoning

MixKVQ: 为长上下文推理的查询感知混合精度KV缓存量化

Tao Zhang, Ziqian Zeng, Hao Peng, Huiping Zhuang, Cen Chen

机构 * South China University of Technology(南方科技大学) Beihang University(北航) Pazhou Laboratory(琶洲实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MixKVQ通过查询感知的混合精度量化策略,提升长上下文推理性能并降低内存开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.13109 2025-12-16 cs.CL cs.AI 73%

Uncovering the Role of Initial Saliency in U-Shaped Attention Bias: Scaling Initial Token Weight for Enhanced Long-Text Processing

揭示初始显著性在U形注意力偏差中的作用:通过缩放初始标记权重提升长文本处理

Zewen Qiang, Sendong Zhao, Haochun Wang, Bing Qin, Ting Liu

机构 * ir.hit.edu.cn(哈尔滨工业大学信息科学学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出通过缩放初始标记权重以提升长文本处理能力,发现初始显著性对U形注意力偏差有重要影响,并在多个任务中取得性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12008 2025-12-16 cs.CL cs.AI cs.PF 73%

Hold Onto That Thought: Assessing KV Cache Compression On Reasoning

Hold Onto That Thought: 评估KV缓存压缩在推理中的表现

Minghui Liu, Aadi Palnitkar, Tahseen Rabbani, Hyunwoo Jae, Kyle Rui Sang, Dixi Yao, Shayan Shabihi, Fuheng Zhao, Tian Li, Ce Zhang, Furong Huang, Kunpeng Zhang

机构 * University of Maryland(马里兰大学) University of Chicago(芝加哥大学) University of Utah(犹他大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究评估了多种KV缓存压缩策略在长推理任务中的表现,发现H2O和改进的SnapKV在推理模型中表现优异,揭示了重 hitter 跟踪的有效性及缓存大小与推理成本的权衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07011 2025-12-09 cs.LG cs.CL cs.PF 73%

Block Sparse Flash Attention

块稀疏Flash注意力

Daniel Ohayon, Itay Lamprecht, Itay Hubara, Israel Cohen, Daniel Soudry, Noam Elata

机构 * Technion -- Israel Institute of Technology, Haifa, Israel(技术离子-以色列理工学院, 海法, 以色列) Intel -- Habana Labs, Tel Aviv, Israel(英特尔 -- Habana实验室, 特拉维夫, 以色列)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 块稀疏Flash注意力通过精确计算查询-键相似性,提升长上下文推理效率并保持高准确性。

Comments 10 pages, 5 figures. Code: https://github.com/Danielohayon/Block-Sparse-Flash-Attention

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.20964 2025-12-09 cs.CL cs.AI cs.OS cs.PL cs.SE 73%

OSVBench: Benchmarking LLMs on Specification Generation Tasks for Operating System Verification

OSVBench:用于操作系统验证的大型语言模型规范生成基准测试

Shangyu Li, Juyong Jiang, Tiancheng Zhao, Jiasi Shen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 OSVBench通过长上下文任务评估LLMs在操作系统验证中的规范生成能力,揭示现有模型在复杂代码生成任务中的性能差异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01311 2025-12-04 cs.AI cs.LG 73%

CuES: A Curiosity-driven and Environment-grounded Synthesis Framework for Agentic RL

CuES: 一种基于好奇心和环境导向的代理强化学习合成框架

Shinji Mai, Yunpeng Zhai, Ziqian Chen, Cheng Chen, Anni Zou, Shuchang Tao, Zhaoyang Liu, Bolin Ding

机构 * Tongyi Lab , Alibaba Group(通义实验室,阿里巴巴集团)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 CuES通过好奇心驱动和环境导向的方法自动生成任务,提升代理强化学习的可扩展性和性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02720 2025-12-03 cs.AI cs.LG 73%

StockMem: An Event-Reflection Memory Framework for Stock Forecasting

StockMem: 一种用于股票预测的事件反射内存框架

He Wang, Wenyilin Xiao, Songqiao Han, Hailiang Huang

机构 * Shanghai University of Finance and Economics(上海金融学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 StockMem通过事件反射双层内存框架,有效整合事件信息与价格动态,提升股票预测的可解释性和透明度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02363 2025-12-03 cs.CL cs.AI 73%

Memory-Augmented Knowledge Fusion with Safety-Aware Decoding for Domain-Adaptive Question Answering

具有安全意识解码的记忆增强知识融合用于领域自适应问答

Lei Fu, Xiang Chen, Kaige Gao Xinyue Huang, Kejian Tong

机构 * Independent Researcher(独立研究者) Boston University(波士顿大学) Binghamton University(伯克利大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 KARMA通过记忆增强和安全意识解码提升领域自适应问答的准确性和安全性

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17775 2025-11-25 cs.MA cs.AI cs.LG 73%

Episodic Memory in Agentic Frameworks: Suggesting Next Tasks

代理框架中的事件记忆:建议下一步任务

Sandro Rama Fiorini, Leonardo G. Azevedo, Raphael M. Thiago, Valesca M. de Sousa, Anton B. Labate, Viviane Torres da Silva

机构 * IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出了一种基于事件记忆的代理框架,通过存储和检索历史工作流程来辅助推荐下一步任务,以提高人机协同创作的效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.01215 2025-11-18 cs.CL cs.LG 73%

Compress, Gather, and Recompute: REFORMing Long-Context Processing in Transformers

Woomin Song, Sai Muralidhar Jayanthi, Srikanth Ronanki, Kanthashree Mysore Sathyendra, Jinwoo Shin, Aram Galstyan, Shubham Katiyar, Sravan Babu Bodapati

机构 * KAIST(韩国科学技术院) Amazon AGI(亚马逊人工智能实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.20334 2025-11-18 cs.CL cs.AI 73%

Lookahead Q-Cache: Achieving More Consistent KV Cache Eviction via Pseudo Query

Yixuan Wang, Shiyu Ji, Yijun Liu, Yuzhuang Xu, Yang Xu, Qingfu Zhu, Wanxiang Che

机构 * Research Center for Social Computing and Interactive Robotics, Harbin Institute of Technology, China(社会计算与交互机器人研究院,哈尔滨工业大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments Accepted by EMNLP 2025 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09741 2025-11-14 cs.LG cs.AI cs.DC 73%

TawPipe: Topology-Aware Weight Pipeline Parallelism for Accelerating Long-Context Large Models Training

Houming Wu, Ling Chen

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

Comments Accepted by AAAI 2026, 9 pages, and 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.03866 2025-11-12 cs.DC cs.AI cs.LG cs.PF cs.PL 73%

OMPILOT: Harnessing Transformer Models for Auto Parallelization to Shared Memory Computing Paradigms

Arijit Bhattacharjee, Ali TehraniJamsaz, Le Chen, Niranjan Hasabnis, Mihai Capota, Nesreen Ahmed, Ali Jannesari

机构 * Department of Computer Science, Iowa State University, Ames, IA, USA(伊阿华州立大学计算机科学系) Mako AI, USA(Mako AI公司) Argonne National Laboratory, USA(阿贡国家实验室) Code Metal, USA(Code Metal公司) Intel Labs, USA(英特尔实验室) Cisco Outshift, USA(Cisco Outshift公司)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.13757 2025-11-11 cs.MA cs.AI cs.CL cs.HC 73%

MobA: Multifaceted Memory-Enhanced Adaptive Planning for Efficient Mobile Task Automation

Zichen Zhu, Hao Tang, Yansi Li, Dingye Liu, Hongshen Xu, Kunyao Lan, Danyang Zhang, Yixuan Jiang, Hao Zhou, Chenrun Wang, Situo Zhang, Liangtai Sun, Yixiao Wang, Yuheng Sun, Lu Chen, Kai Yu

机构 * Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

Comments NAACL 2025 Demo Track [code] https://github.com/OpenDFM/MobA [dataset] https://huggingface.co/datasets/OpenDFM/MobA-MobBench

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22968 2025-11-07 cs.CL cs.AI cs.CY 73%

Measuring Teaching with LLMs

Michael Hardy

机构 * Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21908 2025-11-06 cs.NE cs.AI cs.LG 73%

Enabling Robust In-Context Memory and Rapid Task Adaptation in Transformers with Hebbian and Gradient-Based Plasticity

Siddharth Chaudhary

机构 * St Paul’s School(圣保罗学校)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.27400 2025-11-03 cs.CL cs.AI 73%

Balancing Knowledge Updates: Toward Unified Modular Editing in LLMs

Jiahao Liu, Zijian Wang, Kuo Zhao, Dong Hu

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.22752 2025-10-28 cs.CL cs.AI 73%

Beyond Semantics: How Temporal Biases Shape Retrieval in Transformer and State-Space Models

Anooshka Bajaj, Deven Mahesh Mistry, Sahaj Singh Maini, Yash Aggarwal, Zoran Tiganj

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏