arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-01-08 至 2026-01-08 共收录 8 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 8 篇

2601.03417 2026-01-08 cs.CL 88%

Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models

隐式图,显式检索:迈向高效且可解释的长周期记忆 для 大语言模型

Xin Zhang, Kailai Yang, Hao Li, Chenyue Li, Qiyu Wei, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LatentGraphMem结合隐式图记忆与显式子图检索,实现高效且可解释的长周期记忆,提升大语言模型的推理能力与可解释性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.24067 2026-01-08 cs.LG 83%

TransMamba: A Sequence-Level Hybrid Transformer-Mamba Language Model

TransMamba: 一种序列级混合Transformer-Mamba语言模型

Yixing Li, Ruobing Xie, Zhen Yang, Xingwu Sun, Shuaipeng Li, Weidong Han, Zhanhui Kang, Yu Cheng, Chengzhong Xu, Di Wang, Jie Jiang

机构 * Tencent Hunyuan(腾讯文英) The Chinese University of Hong Kong(香港中文大学) University of Macau(澳门大学)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(abstract);分类 cs.LG

AI总结 TransMamba通过共享参数矩阵统一Transformer和Mamba,实现序列级动态切换注意力与SSM机制,提升训练效率和性能。

Comments Accepted by AAAI 2026. Code: https://github.com/Yixing-Li/TransMamba

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02659 2026-01-08 cs.CL cs.LG 81%

Empirical Comparison of Encoder-Based Language Models and Feature-Based Supervised Machine Learning Approaches to Automated Scoring of Long Essays

基于编码器的语言模型与基于特征的监督机器学习方法在长作文自动评分中的实证比较

Kuo Wang, Haowei Hua, Pengfei Yan, Hong Jiao, Dan Song

专题命中 长上下文与记忆 :language model(title,abstract);分类 cs.CL、cs.LG

AI总结 本研究比较了基于编码器的语言模型与基于特征的监督机器学习方法在长作文自动评分中的表现,发现嵌入集成模型在评分效果上优于单一语言模型。

Comments 22 pages, 5 figures, 3 tables, presented at National Council on Measurement in Education 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03515 2026-01-08 cs.CL cs.AI 73%

Mem-Gallery: Benchmarking Multimodal Long-Term Conversational Memory for MLLM Agents

Mem-Gallery: 多模态长时对话记忆的基准测试用于 MLLM 代理

Yuanchen Bei, Tianxin Wei, Xuying Ning, Yanjun Zhao, Zhining Liu, Xiao Lin, Yada Zhu, Hendrik Hamann, Jingrui He, Hanghang Tong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) MIT-IBM Watson AI Lab, IBM Research(MIT-IBM沃森人工智能实验室,IBM研究) Stony Brook University(石溪大学) Brookhaven National Laboratory(布鲁赫斯国家实验室)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem-Gallery 是一个用于评估多模态长时对话记忆的基准测试,通过多会话对话数据集和系统评估框架,揭示了记忆提取、推理和知识管理的关键发现。

Comments 34 pages, 18 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05509 2026-01-08 cs.CL cs.AI 73%

LAG: Logic-Augmented Generation from a Cartesian Perspective

LAG: 从笛卡尔视角出发的逻辑增强生成

Yilin Xiao, Chuang Zhou, Yujing Zhang, Qinggang Zhang, Su Dong, Shengyuan Chen, Chang Yang, Xiao Huang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 LAG通过系统的问题分解、原子记忆库和逻辑感知推理,提升知识密集型任务的准确性和减少幻觉。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13197 2026-01-08 cs.CL 70%

Text Anomaly Detection with Simplified Isolation Kernel

基于简化隔离核的文本异常检测

Yang Cao, Sikun Yang, Yujiu Yang, Lianyong Qi, Ming Liu

机构 * School of Computing and Information Technology, Great Bay University(大湾大学计算机与信息科技学院) Great Bay Institute for Advanced Study, Great Bay University(大湾大学先进研究学院) Guangdong Provincial Key Laboratory of Mathematical and Neural Dynamical Systems(广东省数学与神经动力系统重点实验室) Dongguan Key Laboratory for Intelligence and Information Technology, China(东莞智能与信息技术重点实验室) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) China University of Petroleum (East China), China(中国石油大学(华东)) School of IT, Deakin University(德肯大学信息科技学院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 本研究提出简化隔离核(SIK)方法,通过将高维嵌入转换为低维稀疏表示,提升文本异常检测的性能与效率。

Comments EMNLP Findings 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03618 2026-01-08 cs.DB 67%

The Pneuma Project: Reifying Information Needs as Relational Schemas to Automate Discovery, Guide Preparation, and Align Data with Intent

Pneuma项目:将信息需求作为关系模式来自动化发现、指导准备并使数据与意图一致

Muhammad Imam Luthfi Balaka, Raul Castro Fernandez

专题命中 长上下文与记忆 :LLM(abstract);language model(abstract)

AI总结 Pneuma项目通过将信息需求转化为关系模式,利用语言模型实现自动化发现与文档生成,提升数据与意图的一致性。

Comments CIDR 2026 Paper

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07782 2026-01-08 cs.LG 57%

GatedFWA: Linear Flash Windowed Attention with Gated Associative Memory

带有门控关联记忆的线性滑动窗口注意力

Jiaxu Liu, Yuhe Bai, Xiangyu Yin, Christos-Savvas Bouganis

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 GatedFWA是一种通过门控关联记忆机制提升滑动窗口注意力稳定性和梯度流动的高效注意力机制,适用于自回归模型和语言建模任务。

详情

展开后加载摘要…

URL PDF HTML 收藏