arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-18 至 2025-12-18 共收录 6 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 6 篇

2505.22657 2025-12-18 cs.CV cs.AI cs.CL cs.LG 89%

3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model

3DLLM-Mem: 长期空间-时间记忆用于具身3D大语言模型

Wenbo Hu, Yining Hong, Yanjun Wang, Leison Gao, Zibu Wei, Xingcheng Yao, Nanyun Peng, Yonatan Bitton, Idan Szpektor, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 3DLLM-Mem通过引入动态内存管理和融合模型,提升LLMs在复杂3D环境中的长期空间-时间记忆推理与行动能力。

Comments demos at: https://3dllm-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18148 2025-12-18 cs.CL cs.AI cs.LG 80%

Hidden in the Haystack: Smaller Needles are More Difficult for LLMs to Find

haystack中隐藏的针:更小的针对LLM来说更难找到

Owen Bianchi, Mathew J. Koretsky, Maya Willey, Chelsea X. Alvarado, Tanay Nayak, Adi Asija, Nicole Kuznetsov, Mike A. Nalls, Faraz Faghri, Daniel Khashabi

机构 * Center for Alzheimer’s Disease and Related Dementias, NIA, NIH(阿尔茨海默病及相关痴呆症研究中心,国家老龄化研究所,国家卫生研究院) DataTecnica LLC(DataTecnica公司) Johns Hopkins University(约翰霍普金斯大学) Laboratory of Neurogenetics, NIA, NIH(神经遗传学实验室,国家老龄化研究所,国家卫生研究院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文研究了黄金上下文大小对LLM长上下文问答性能的影响,发现较短的黄金上下文会显著降低模型性能,揭示了上下文长度对模型表现的关键作用。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14762 2025-12-18 cs.SE cs.AI 77%

Workflows vs Agents for Code Translation

工作流与代理在代码翻译中的比较

Henry Gray, Tom Yotam, Octavian Udrea

机构 * Code Metal

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 研究比较了工作流与代理方法在MATLAB到HDL代码翻译中的效果,发现代理方法在语法修复和提升模拟覆盖率方面表现更优。

Journal ref NeurIPS 2025 Fourth Workshop on Deep Learning for Code

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15653 2025-12-18 cs.CL 70%

Characterizing Mamba's Selective Memory using Auto-Encoders

利用自编码器表征Mamba的选择性记忆

Tamanna Hossain, Robert L. Logan, Ganesh Jagadeesan, Sameer Singh, Joel Tetreault, Alejandro Jaimes

机构 * University of California, Irvine(加州大学尔湾分校) Dataminr Inc.(Dataminr公司)

专题命中 长上下文与记忆 :language model(abstract);pretraining(abstract);分类 cs.CL

AI总结 本文通过自编码器研究Mamba模型在处理长序列时对特定类型信息的遗忘特性,发现数学相关和组织实体等标记更易被遗忘。

Comments AACL 2025. Oral Presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.15550 2025-12-18 cs.CL 70%

CTkvr: KV Cache Retrieval for Long-Context LLMs via Centroid then Token Indexing

CTkvr: 通过聚类然后标记索引实现长上下文LLM的KV缓存检索

Kuan Lu, Shuhang Lin, Sai Wu, Yichen Yao, Junhan Yang, Huan Li, Wei Chu, Xu Yinghui, Yuan Qi, Gang Chen

机构 * Zhejiang University(浙江大学) Rutgers University(罗格斯大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 CTKVR通过聚类和标记索引方法提升长上下文LLM的KV缓存检索效率与准确性,实现性能优化和吞吐量提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.17083 2025-12-18 cs.CL cs.LG stat.ML 62%

Scale-invariant Attention

尺度不变注意力

Ben Anson, Xi Wang, Laurence Aitchison

机构 * School of Mathematics University of Bristol(布里斯托大学数学学院) Department of Computer Science Johns Hopkins University(约翰霍普金斯大学计算机科学系) School of Computer Science University of Bristol(布里斯托大学计算机科学学院)

专题命中 长上下文与记忆 :LLM(abstract);分类 cs.CL、cs.LG

AI总结 本文提出了一种尺度不变的注意力机制,通过简单的位置依赖变换实现总注意力和稀疏性的尺度不变性,提升了长上下文推理和检索性能。

Comments Accepted at Neurips 2025

详情

展开后加载摘要…

URL PDF HTML 收藏