arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4822 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4822 篇

1909.09482 2019-09-23 cs.CL cs.LG stat.ML 81%

Language models and Automated Essay Scoring

Pedro Uria Rodriguez, Amir Jafari, Christopher M. Ormerod

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1907.00455 2019-07-02 cs.LG cs.CL stat.ML 81%

Multiplicative Models for Recurrent Language Modeling

Diego Maupomé, Marie-Jean Meurs

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments 10 pages, pre-print from Proceedings of CICLing 2019: 20th International Conference on Computational Linguistics and Intelligent Text Processing

详情

展开后加载摘要…

URL PDF HTML 收藏
1906.05664 2019-06-14 cs.CL cs.LG stat.ML 81%

Calibration, Entropy Rates, and Memory in Language Models

Mark Braverman, Xinyi Chen, Sham M. Kakade, Karthik Narasimhan, Cyril Zhang, Yi Zhang

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1904.08936 2019-04-22 cs.CL cs.LG stat.ML 81%

Language Modeling through Long Term Memory Network

Anupiya Nugaliyadde, Kok Wai Wong, Ferdous Sohel, Hong Xie

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments The paper is accepted to be published in IJCNN 2019

详情

展开后加载摘要…

URL PDF HTML 收藏
1811.06477 2018-11-19 cs.NE cs.CL cs.LG 81%

Multi-cell LSTM Based Neural Language Model

Thomas Cherian, Akshay Badola, Vineet Padmanabhan

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments 7 pages including 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.05448 2017-11-16 stat.ML cs.CL cs.LG 81%

Lattice Rescoring Strategies for Long Short Term Memory Language Models in Speech Recognition

Shankar Kumar, Michael Nirschl, Daniel Holtmann-Rice, Hank Liao, Ananda Theertha Suresh, Felix Yu

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted at ASRU 2017

Journal ref Proceedings of ASRU 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1711.02604 2017-11-08 cs.LG cs.CL 81%

Unbounded cache model for online language modeling with open vocabulary

Edouard Grave, Moustapha Cisse, Armand Joulin

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Accepted to NIPS 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.06555 2017-08-23 cs.CL cs.LG 81%

Long-Short Range Context Neural Networks for Language Modeling

Youssef Oualil, Mittul Singh, Clayton Greenberg, Dietrich Klakow

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Published at EMNLP'16

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.02182 2017-08-09 cs.CL cs.LG cs.NE 81%

Regularizing and Optimizing LSTM Language Models

Stephen Merity, Nitish Shirish Keskar, Richard Socher

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
1708.00781 2017-08-03 cs.CL cs.LG 81%

Dynamic Entity Representations in Neural Language Models

Yangfeng Ji, Chenhao Tan, Sebastian Martschat, Yejin Choi, Noah A. Smith

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments EMNLP 2017 camera-ready version

详情

展开后加载摘要…

URL PDF HTML 收藏
1612.04426 2016-12-15 cs.CL cs.LG 81%

Improving Neural Language Models with a Continuous Cache

Edouard Grave, Armand Joulin, Nicolas Usunier

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments Submitted to ICLR 2017

详情

展开后加载摘要…

URL PDF HTML 收藏
1610.03950 2016-10-14 cs.CL cs.LG 81%

Compressing Neural Language Models by Sparse Word Representations

Yunchuan Chen, Lili Mou, Yan Xu, Ge Li, Zhi Jin

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

Comments ACL-16, pages 226--235

详情

展开后加载摘要…

URL PDF HTML 收藏
1602.01576 2016-02-05 cs.CL cs.AI 81%

A Factorized Recurrent Neural Network based architecture for medium to large vocabulary Language Modelling

Anantharaman Palacode Narayana Iyer

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.AI

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
1502.00512 2015-02-03 cs.CL cs.LG 81%

Scaling Recurrent Neural Network Language Models

Will Williams, Niranjani Prasad, David Mrva, Tom Ash, Tony Robinson

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05803 2026-08-14 cs.CL 版本更新 80%

Human-like fleeting memory improves language learning but impairs reading time prediction in transformer language models

类人短暂记忆提升语言学习但损害变压器语言模型的阅读时间预测

Abishek Thamma, Micha Heilbron

机构 * University of Amsterdam, Amsterdam Brain and Cognition(阿姆斯特丹大学,阿姆斯特丹脑与认知中心) Vrije Universiteit Amsterdam, Department of Informatics(阿姆斯特丹自由大学,信息学院) Max Planck Institute for Psycholinguistics(马克斯·普朗克心理学语言学研究所)

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL;LLM(comments)

AI总结 研究探讨了短暂记忆对语言学习和阅读时间预测的影响,发现短暂记忆提升语言学习但损害阅读时间预测,挑战了传统认知科学观点。

Comments v2: Revised after peer review. Accepted for publication in Transactions of the Association for Computational Linguistics v3: Added link to code repository. Code: https://github.com/drhanjones/fmt-llm

Journal ref Transactions of the Association for Computational Linguistics 14 (2026) 877-892

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.15656 2026-06-16 cs.AI 新提交 80%

Overcoming the Impedance Mismatch: A Theoretical Roadmap for Fusing Foundation Models and Knowledge Graphs

克服阻抗不匹配:融合基础模型与知识图谱的理论路线图

Sahil Rajesh Dhayalkar

机构 * Arizona State University(亚利桑那州立大学)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.AI

AI总结 本文提出“阻抗不匹配”概念,形式化分析基础模型与知识图谱的结构与几何摩擦,通过三级层次分类揭示现有方法的局限,并给出理论路线图实现真正的语义融合。

Comments 12 pages. Accepted at the ACL 2026 4th Workshop on Towards Knowledgeable Foundation Models (https://openreview.net/forum?id=hXDYsNAq8m)

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00742 2025-10-08 cs.LG 80%

How Foundational are Foundation Models for Time Series Forecasting?

Nouha Karaouli, Denis Coquenet, Elisa Fromont, Martial Mermillod, Marina Reyboz

机构 * Univ. Rennes(里昂大学) CNRS(法国国家科学研究中心) Inria(法国国家信息与自动化技术研究所) IRISA - UMR 6074(国际信息与自动化研究所) Univ. Grenoble Alpes(格勒诺布尔阿尔卑斯大学) Univ. Savoie Mont Blanc(萨瓦伊-蒙布莱大学) LPNC(实验室) CEA(法国原子能委员会) LIST(法国国家信息与自动化技术研究所)

专题命中 长上下文与记忆 :foundation model(title,abstract);分类 cs.LG

Comments Typo rectified in this v3 version. Accepted at NeurIPS 2025 Workshop on Recent Advances in Time Series Foundation Models (BERT2S)

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04422 2025-08-27 cs.CL 80%

Long-context Language Models Fail in Basic Retrieval Tasks Without Sufficient Reasoning Steps

Yijiong Yu, Yongfeng Huang, Zhixiao Qi, Wei Wang, Weifeng Liu, Ran Chen, Ji Pei

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL;LLM(comments)

Comments Our code is publicly available at https://github.com/yuyijiong/hard_retrieval_for_llm and the datasets is at https://huggingface.co/datasets/yuyijiong/difficult_retrieval

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.15867 2024-10-22 cs.AI 80%

In-Context Ensemble Learning from Pseudo Labels Improves Video-Language Models for Low-Level Workflow Understanding

Moucheng Xu, Evangelos Chatzaroulas, Luc McCutcheon, Abdul Ahad, Hamzah Azeem, Janusz Marecki, Ammar Anwar

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.AI

Comments To appear in NeurIPS Workshop on Video-Language Models 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.08825 2026-08-20 econ.GN q-fin.EC 版本更新 80%

Is Bitcoin A Hedge Against Central Banking? Evidence from AI-Driven Monetary Policy Expectations

比特币是否是中央银行的对冲工具?来自AI驱动的货币政策预期的证据

Maxime L. D. Nicolas, François Sicard, Marion Laboure, Zixin Sun, Anahí Rodríguez-Martínez

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文研究货币政策叙事对比特币价格的传导作用,区分前瞻性预期与事后利率实施的影响。通过高频率货币政策预期指数揭示比特币对央行信号的敏感性,显示前瞻性鹰派叙事对价格有持续负面影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13216 2026-08-14 cs.HC 新提交 80%

CogChat: Knowledge Graph-Augmented Conversational AI with Heterogeneous Graph Transformer for Cognitive Grounding in Design Generation

CogChat:结合知识图谱与异构图变换器的对话式人工智能,用于设计生成中的认知接地

Jiin Choi, Kyung Hoon Hyun

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 本研究提出结合异构图变换器的CogChat框架,以设计师专属动态知识图谱为基础,提升设计对话的上下文保留度与意图解读效果,降低认知负荷,为LLM交互的长期上下文管理提供新方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07009 2026-08-10 cs.DC 新提交 80%

HiSparse: Scaling Sparse-Attention Decoding with Hierarchical KV Cache Management

HiSparse:通过分层KV缓存管理扩展稀疏注意力解码

Zhiqiang Xie, Zhangheng Huang, Tingwei Huang, Ziyi Xu, Ruiyang Ma, Christos Kozyrakis

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 HiSparse是一种分层KV缓存,通过将KV历史存主机、GPU设固定缓存等方式,提升长上下文稀疏注意力LLM解码吞吐量达4.7倍,未增加每token成本,已集成到SGLang并在多平台验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03911 2026-08-05 cs.CV 新提交 80%

UniEvo-RS: Omni-Prompt Unified Remote Sensing Segmentation with Representative Exemplar-Driven Prototype Evolution

UniEvo-RS:基于代表性示例驱动原型演化的全提示统一遥感分割

Kunquan Zhang, Peilang Li, Xikun Hu, Yunkai Yang, Yushan Zou, Zhiwei Zhang, Runmin Dong

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);prompting(abstract)

AI总结 UniEvo-RS是配备代表性示例驱动原型演化的全提示统一遥感分割框架,通过多指令提示数据集与原型演化机制,在批量标注中对未见过的类别实现无需训练的精度提升,性能达当前最优。

Comments 18 pages, 8 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01561 2026-08-04 cs.HC 新提交 80%

FedWorld: Scope-Aware Federation of Agent World Models

FedWorld:感知范围的智能体世界模型联邦

Yuchao Hou

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 FEDWORLD是一种感知范围的智能体世界模型联邦协议,通过交换结构化抽象转移规则,减少冲突动态下的负迁移,提升智能体任务成功率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.26335 2026-07-30 cs.DC 新提交 80%

The Fabric Is the Cluster Driver: Cross-Layer eBPF Policies for GPU-CXL Fabrics

Fabric 是集群驱动:面向 GPU-CXL Fabric 的跨层 eBPF 策略

Yiwei Yang, Andi Quinn

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 该研究提出 fabric_ext 中间件编译器与运行时,通过语义移动图实现跨 GPU-CXL Fabric 多层的 eBPF 策略,以处理 LLM 预填充等场景下的跨岛数据流需求。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.01194 2026-07-28 cs.CR 版本更新 80%

AgentWatcher: A Rule-based Prompt Injection Monitor

AgentWatcher: 一种基于规则的提示注入监控

Yanting Wang, Wei Zou, Runpeng Geng, Jinyuan Jia

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 本文提出AgentWatcher,通过聚焦短文本片段和定义明确的规则,解决提示注入检测中上下文长度影响和规则不明确的问题,实现可扩展且可解释的检测方法。

Comments The code is available at https://github.com/wang-yanting/AgentWatcher

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13612 2026-07-28 cs.CR 80%

PINA: Prompt Injection Attack against Navigation Agents

PINA:针对导航代理的提示注入攻击

Jiani Liu, Yixin He, Lanlan Fan, Qidi Zhong, Yushi Cheng, Meng Zhang, Yanjiao Chen, Wenyuan Xu

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 PINA提出了一种针对导航代理的提示注入攻击检测框架,通过实验展示了其高攻击成功率和稳健性,揭示了导航代理在安全方面的关键漏洞。

Comments Accepted at ICASSP 2026

Journal ref 2026 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22030 2026-07-17 cs.AI cs.CL cs.IR cs.LG 版本更新 80%

When Does Belief-Based Agent Memory Help? Reliability-Conditional Updating and Provenance-Capped Poisoning Defense

Nous:一种用于长期智能体记忆的预测世界模型

Pranav Singh

机构 * Indian Institute of Technology Ropar(印度理工学院罗巴尔分校)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出Nous记忆架构,基于知识即预测而非存储的原则,通过贝叶斯更新维护概率分布,以信息论惊喜度评分并记录信念变化,在LoCoMo基准上取得优于对比方法的F1分数。

Comments Preprint. 10 pages, 1 figure, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04031 2026-07-07 cs.AR 新提交 80%

TileLens: Efficiently Using Large-Granularity Memory Systems with Transparent Two-Dimensional Memory Layout

TileLens:通过透明二维内存布局高效使用大粒度内存系统

Jae Hyung Ju, Euijun Chung, Hritvik Taneja, Anish Saxena, Shinnung Jeong, Hyesoon Kim, Moinuddin K. Qureshi

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract)

AI总结 研究大语言模型推理受GPU高带宽内存限制问题,指出大粒度内存系统致 tiled 矩阵乘法性能降。提出用 tile-major 布局缓解读放大,介绍TileLens软硬件扩展,评估显示其能在特定条件下接近HBM性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02517 2026-07-03 cs.CV 新提交 80%

WorldDirector: Building Controllable World Simulators with Persistent Dynamic Memory

WorldDirector: 构建具有持久动态记忆的可控世界模拟器

Hanlin Wang, Hao Ouyang, Qiuyu Wang, Wen Wang, Qingyan Bai, Ka Leong Cheng, Yue Yu, Yixuan Li, Yihao Meng, Zichen Liu, Yanhong Zeng, Yujun Shen, Qifeng Chen

机构 * HKUST(香港科技大学) Ant Group(蚂蚁集团) ZJU(浙江大学) CUHK(香港中文大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract)

AI总结 提出WorldDirector框架,通过LLM协调3D轨迹与相机运动作为视频生成控制信号,解耦语义运动编排与视觉生成,实现持久动态对象记忆和自由视角探索。

Comments Project Page: https://worlddirector.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏