arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 12698 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 665 篇

2606.23382 2026-06-23 cs.CL cs.AI 新提交 62%

Energy-Based Transformers as Predictors of Reading Difficulty

基于能量的Transformer作为阅读难度预测器

Jakub Dotlacil, Ece Takmaz

机构 * Utrecht University(乌得勒支大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 研究提出基于能量的Transformer模型中的能量度量作为阅读时间预测器,在三个语料库上显著优于惊奇度,并在关系从句处理中捕捉主/宾语不对称,可能统一多个互补度量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.22874 2026-06-23 cs.LG cs.AI 新提交 62%

SpotAttention: Plug-In Block-Sparse Routing for Pretrained Long-Context Transformers

SpotAttention: 面向预训练长上下文Transformer的即插即用块稀疏路由

Huzama Ahmad, Se-Young Yun

机构 * KAIST(韩国科学技术院)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI、cs.LG

AI总结 提出SpotAttention,一种轻量级选择器,通过KL蒸馏学习估计注意力分布,实现块稀疏路由,在长上下文任务中匹配密集注意力精度并显著加速解码。

Comments 24 pages, 10 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09751 2026-06-23 cs.AI cs.CL cs.HC 新提交 62%

Collaborative Human-Agent Protocol (CHAP)

协作式人机协议 (CHAP)

Arsalan Shahid, Gordon Suttie, Philip Black

机构 * Brightbeam AI

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.CL、cs.AI

AI总结 提出CHAP协议,通过结构化事件记录(差异、理由、哈希)和可组合配置文件,解决多人类多智能体协作中人类判断信号丢失的问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.18587 2026-06-18 cs.CL cs.AI 新提交 62%

Dual Dimensionality for Local and Global Attention

局部与全局注意力的双重维度

Zhiyuan Wang, Xuan Luo, Sirui Zeng, Xifeng Yan

机构 * UC Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.CL、cs.AI

AI总结 提出距离自适应表示(DAR),对局部上下文保留全维度表示,对远距离token使用低维表示,在保持性能的同时减少KV缓存。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.16093 2026-06-16 cs.CL cs.AI 新提交 62%

Long-Context Modeling via GSS-Transformer Hybrid Architecture with Learnable Mixing

基于可学习混合的GSS-Transformer混合架构的长上下文建模

Kuzey Torlak, Hüseyin Arda Arslan, Anıl Dervişoğlu, Beyza Nur Deniz, Onur Boyar

机构 * Kadıköy Anadolu High School(卡德柯伊安纳多卢高中) Politecnico di Torino(都灵理工大学) Istanbul Technical University(伊斯坦布尔理工大学) Boğaziçi University(博阿齐奇大学) IBM Research - Tokyo(IBM 东京研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出并行混合架构PHA,通过可学习混合机制融合GSS、GQA和FFN,在长上下文建模中实现Transformer级困惑度与更高效率。

Comments 16 pages, 9 tables, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09862 2026-06-10 cs.LG cs.AI 新提交 62%

Blurry Window Attention

模糊窗口注意力

Axel Laborieux, Christos Sourmpis, Juan Gabriel Kostelec, Qinghai Guo

机构 * Huawei, Zurich, Switzerland(华为技术有限公司(苏黎世)) Huawei Advanced Computing and Storage Lab, Shenzhen, China(华为先进计算与存储实验室(深圳))

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI、cs.LG

AI总结 提出模糊窗口注意力(BLA),一种基于Dirichlet核插值重构模糊KV历史的有界记忆控制方法,在合成任务中状态效率比滑动窗口注意力高8倍,且随状态增大性能提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.08347 2026-06-09 cs.CL cs.LG 新提交 62%

Tensorizing Engram: Sharing Latents Across N-Gram Embeddings is Beneficial in LLMs

张量化Engram:在N-gram嵌入中共享潜在变量对大型语言模型有益

Wuyang Zhou, Yuxuan Gu, Giorgos Iacovides, Yuning Qiu, Qibin Zhao, Danilo Mandic

机构 * University of California, Berkeley(加州大学伯克利分校) University of Cambridge(剑桥大学) University of Toronto(多伦多大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.LG

AI总结 提出张量化Engram(TN-gram),通过CP分解共享因子压缩n-gram嵌入,减少参数并避免哈希冲突,在多个任务上匹配或超越现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.06906 2026-06-08 cs.CL cs.AI 新提交 62%

EASE-TTT: Evidence-Aligned Selective Test-Time Training for Long-Context Question Answering

EASE-TTT: 面向长上下文问答的基于证据对齐的选择性测试时训练

Xiaopeng Yuan, Zebin Wang, Suwen Wang, Zongxin Yang, Haohan Wang, Yushun Dong

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Harvard University(哈佛大学) Brion, ASML US LP Florida State University(佛罗里达州立大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出EASE-TTT框架,通过将检索到的证据块转化为软注意力监督目标,指导查询侧参数适应,从而在保留完整上下文的情况下提升小模型的长上下文问答性能。

Comments 13 pages, 4 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26983 2026-08-28 cs.AI 新提交 57%

GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory

GraphMemix:面向多模态智能体长期记忆的查询感知证据森林

Geng Li, Yuhao Wang, Dong Li, Jianye Hao, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) MemoraX AI(MemoraX人工智能公司)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 GraphMemix作为组合优化图记忆框架,通过三个关键组件构建查询感知证据森林,在四个多模态记忆基准上提升了准确率并建立了新的帕累托前沿。

Comments Project page with code: https://github.com/ligeng0197/graphmemix

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23920 2026-08-26 cs.IR cs.CL cs.CV 新提交 57%

Wontopos Tablet 2: Measuring Multilingual and Multimodal Memory Retrieval Without Lexical Matching

Wontopos Tablet 2:无需词汇匹配的多语言多模态记忆检索测量

Sunwoo Kim

机构 * Wontopos L.L.C.(万托波斯有限责任公司)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文测量Wontopos Tablet 2的多语言多模态记忆检索性能,其无需词汇匹配,在文本、跨语言及多模态基准上表现优于BM25等方法,但存在低资源语言性能下降等问题。

Comments 42 pages, 8 figures. Harness and per-question records released

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23818 2026-08-26 cs.CL 新提交 57%

Beyond Static and Linear: What Attention Constraints Best Fit Human Reading Times?

超越静态与线性:哪种注意力约束最符合人类阅读时间规律?

Lanni Bu, Xiulin Yang, Christian Clark, Alex Warstadt, Ethan Gotlieb Wilcox

机构 * Georgetown University(乔治城大学) The Ohio State University(俄亥俄州立大学) UC San Diego(加州大学圣迭戈分校)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 该研究在不同模型规模与训练语料下系统比较多种注意力记忆机制,发现对中间词元内容敏感的约束与人类阅读时间匹配度最高,且动态记忆课程下心理测量拟合度与语法能力存在分离,提示Transformer无法作为通用认知模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.23463 2026-08-25 cs.LG 新提交 57%

ProxyFormer: A Dual-Stream Proxy Architecture for Ultra-Long Context and High-Resolution Generation

ProxyFormer:用于超长上下文和高分辨率生成的双流代理架构

Zhongpan Tang

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 ProxyFormer通过双流代理架构缓解超长上下文与高分辨率生成的注意力二次增长瓶颈,可扩展可训练序列长度至0.7M,在多针检索任务中保持高准确率,初步验证了其在图像生成中的可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22310 2026-08-25 cs.AI 新提交 57%

HERO: Human-profile Enhanced Retrieval Optimization Framework for Long-term Agent Memory

HERO:面向智能体长期记忆的人像增强检索优化框架

Yuanhua Lin, Yile Li, Zhiyuan Zhao, Jing Shang, Jian Sun

机构 * China Mobile Information Technology Co., Ltd.(中国移动信息技术有限公司)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI

AI总结 本研究提出HERO框架,通过异构记忆图保留原始对话文本,结合人像优化检索,在两个基准数据集上提升了智能体的事实与个性化推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22214 2026-08-25 cs.AI cs.MM 新提交 57%

Query-Driven Multimodal Information Extraction from Long Documents

面向长文档的查询驱动多模态信息抽取

Yikai Gao, Ding Xia, Xi Yang

机构 * School of Artificial Intelligence, Jilin University(吉林大学人工智能学院) Graduate School of Information Science and Technology, The University of Tokyo(东京大学信息科学与技术研究生院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 针对现有多模态长文档信息抽取范式的不足,本文提出查询驱动的图像-文本联合抽取任务,构建基准ITJoint并设计多智能体框架Q2IT,实验显示Q2IT性能显著优于独立VLMs但仍有提升空间。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.22137 2026-08-25 cs.AI 新提交 57%

MegaMem: A Retrieval Solution for Ultra-Large Context Windows

MegaMem:面向超大规模上下文窗口的检索解决方案

Xinyuan Song, Bowen Zhu, Hasibul Haque, Liang Zhao

机构 * Emory University(埃默里大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 MegaMem是一种双视图检索系统,可在有限生成上下文下实现数亿至10亿token的超大规模内存检索,在EnterpriseRAG-Bench上总体指标达82.26、正确性达86.50。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19920 2026-08-21 cs.CL 新提交 57%

Learning how to Forget: Fine-tuning for Long-Context Sparse Attention

学习如何遗忘:面向长上下文稀疏注意力的微调

Matthias Seeger, Zeyu Zhang, Vihang Patil, Konstantinos Benidis, Sebastian Schelter

机构 * Amazon Web Services(亚马逊网络服务) University of Amsterdam(阿姆斯特丹大学) Amazon(亚马逊) Technical University Berlin(柏林工业大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本文提出一种适配任意KV缓存策略的稀疏注意力模型微调方法,仅需中等硬件预算,性能优于精确注意力训练模型,还提供H2O稀疏注意力高效实现及开源库KeysAndValues支持。

Comments 39 pages, no figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19723 2026-08-21 cs.CV cs.CL 新提交 57%

StreamSoccer: Event-Driven Memory for Streaming Soccer Commentary

StreamSoccer:用于流式足球解说的事件驱动记忆

Chenxi Shao, Bozhong Wang, Jiaxin Huang, Zhao Liu, Sunwei Zhu, Tianxin Hang, Gaoqi He, Yang Li, Changbo Wang

机构 * Migu Video Technology Co., Ltd.(咪咕视讯科技有限公司) South China University of Technology(华南理工大学) East China Normal University(华东师范大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本研究提出StreamSoccer,一种用于流式足球解说的事件驱动系统,通过建模事件生命周期实现多时间范围解说,在数据集评估中取得优异性能且计算开销可控。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.18592 2026-08-20 cs.LG 新提交 57%

Infrared Universality of Collective Dynamics across Transformer and State-Space Architectures

Transformer与状态空间架构间集体动力学的红外普适性

Byung Gyu Chae

机构 * Electronics and Telecommunications Research Institute(电子通信研究院)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.LG

AI总结 本研究发现Transformer与Mamba架构虽微观机制不同,却存在相近的近边际慢模动力学,其集体红外组织具有普适性,为认知场理论提供了独立验证。

Comments 31 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17288 2026-08-19 cs.CL 新提交 57%

Q-Interference: Memory-Efficient Phase-Aware Quantum-Inspired Attention

Q-干涉:内存高效的相位感知量子启发注意力机制

Emama Nahid, Tahmid Imtiaz Imu, Huayue Gu, Liran Ma, Zhipeng Cai, Honghui Xu

机构 * Kennesaw State University(肯尼索州立大学) Miami University(迈阿密大学) Georgia State University(佐治亚州立大学)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 本研究提出Q-Interference,一种内存高效的相位感知量子启发注意力机制,通过精确三角分解避免大型中间张量,适配GPT架构,在基准实验中训练稳定且内存优势显著。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.17148 2026-08-19 cs.CR cs.AI 新提交 57%

Authorization Before Context: A Model-Neutral Audience Boundary Against Cross-Audience Memory Leakage in Agentic Systems

上下文之前的授权:一种针对智能体系统中跨受众记忆泄露的模型无关受众边界

Sibo Liu

专题命中 长上下文与记忆 :language agent(abstract);分类 cs.AI

AI总结 本研究针对智能体系统的跨受众记忆泄露问题,提出模型无关的受众边界方法,通过反单调授权规则确保未授权事实不进入上下文,在合成数据集上验证了其有效性。

Comments 13 pages, 3 figures. Author preprint. Accepted for presentation at AdvML-Frontiers x CoTMA, a non-archival workshop at COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16681 2026-08-18 cs.CV cs.AI 新提交 57%

Bridging the Gap between Labeled and Unlabeled Data via Unified Flow with Feature Memory Bank

通过带特征记忆库的统一流缩小标注数据与未标注数据之间的差距

Shanwen Wang, Xin Sun, Danfeng Hong, Junyu Dong, Patrick Le Callet

机构 * City University of Macau(澳门城市大学) Southeast University(东南大学) Ocean University of China(中国海洋大学) Nantes Université(南特大学) Ecole Centrale Nantes(南特中央理工学院) CAPACITES SAS CNRS(法国国家科学研究中心) LS2N(南特数字科学实验室)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 针对半监督语义分割中伪标签质量差的问题,提出带特征记忆库的统一流方法,结合视觉基础模型与遥感领域教师优化标注与未标注数据,在遥感数据集上优于当前最优方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15844 2026-08-18 cs.CL 新提交 57%

MicroVerse: An Instrument for Measuring Self-Authored Identity Drift in Long-Horizon Multi-Agent Language-Model Simulations

MicroVerse:用于测量长 horizon 多智能体语言模型模拟中自我构建身份漂移的工具

Sky Ng, Brihi Joshi, Ishan Gupta, Shirley Huang, Zonglin Di, Yun Shen, Qianfeng Wen, Yifan Simon Liu, Ruoqi Gao, Yilan, Fan, Zhiwei Zhang, Muhammad Ahmed Mohsin, Yucheng Lu, Xiaoyi Liu, Heming Liu, Qianyu Zhu, Hanwen Xing, Zhengyang Shan, My Chiffon Nguyen, Guanghui Min, Jianheng, Hou, Yunze, Xiao, Keyang Xuan, Hannah Collison, Jintao Huang, Jiatong Li, Sankalp Jajee, Yunhan Zhao, Bing Hu, Xupeng Chen, Binghang Lu, Weihang Xiao, Aravind Mohan, Bolun Sun, Yunshu Wu, Yuanda Xu, Runyu Zhang, Zheyuan Deng, Xinchen, Tan, Dianzhuo Wang, Yijun Wang, Yixuan He, Koutian Wu, Cheng Cheng, Xiaomin Li, Yuexing Hao

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL

AI总结 MicroVerse 是测量长 horizon 多智能体 LM 模拟中身份漂移的工具,通过 50×50 环境等设计开展实验,发现反自我欺骗自发出现且系统对阈值鲁棒。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15755 2026-08-18 cs.AI 新提交 57%

Intent-Driven Situation Tracking for User-Centric Multi-Turn Agents

面向以用户为中心的多轮智能体的意图驱动情境跟踪

Meiling Tao, Yiling Tao, Peng Wang

机构 * University of Electronic Science and Technology of China(电子科技大学) Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.AI

AI总结 该研究针对以用户为中心的多轮智能体,提出无需训练的IDSS框架,通过维护明确情境状态提升任务完成度等性能,为智能体情境跟踪提供有效方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15056 2026-08-18 cs.AI 新提交 57%

GraphLoom: Reliability-Calibrated Graph Evidence Routing for Multimodal KG-RAG

GraphLoom:面向多模态KG-RAG的可靠性校准图证据路由

Zafar Ali, Asad Khan, Aalia Malik, Pavlos Kefalas

机构 * School of Computer Science and Engineering, Southeast University(东南大学计算机科学与工程学院) Aristotle University(亚里士多德大学) Dashub(达舒布)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 提出GraphLoom框架,通过可靠性校准的图证据路由实现多模态KG-RAG,在ScienceQA等数据集上提升了答案质量与证据忠实度。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16760 2026-08-18 cs.LG math.OC 新提交 57%

On the Principles Behind Neural Network Optimizers

神经网络优化器背后的原理

Yushun Zhang

机构 * School of Data Science, The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)数据科学学院)

专题命中 长上下文与记忆 :LLM(abstract_cn);分类 cs.LG

AI总结 本论文为优化器Adam建立了有原则的基础,通过海森矩阵结构分析其在Transformer上优于SGD的原因,提出内存减半且性能不变的新优化器Adam-mini,还为其他NN优化器提供了新见解。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13365 2026-08-14 cs.LG 新提交 57%

When Local Variance Optimality Is Not Enough: RoPE-Aligned Q/K Rotations for Dynamic 4-Bit Quantisation

当局部方差最优性不足时:用于动态4比特量化的RoPE对齐Q/K旋转

Shuhan Wang, Yilin Luo, Nan Xu, Chi Wang Cheung

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.LG

AI总结 本文针对动态4比特量化,研究RoPE对齐的Q/K旋转,推导了相关旋转角度,发现结构化代理最优性在与量化器尺度统计量不匹配时无法降低量化误差。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12743 2026-08-14 cs.AI 新提交 57%

Spatial Memory Agent: Experience-Grounded Procedure Memory for Spatial Intelligence

空间记忆智能体:用于空间智能的基于经验的过程记忆

Haokai Zhang, Yuhang Ding, Yunshu Zhou, Xinze Du, Shengtao Zhang, Zhiyue Zhao, Yuling Xi, Hao Chen

机构 * Zhejiang University(浙江大学) Shanghai Jiao Tong University(上海交通大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :post-training(abstract);分类 cs.AI

AI总结 该研究提出SMA框架,让冻结VLM智能体无需外部空间工具,通过无参数更新自进化提升空间推理,在多基准和模型上表现最优,提供了空间自进化的实用路径。

Comments Under Review

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.12435 2026-08-14 cs.LG 新提交 57%

MARCH: Scaling Recurrent Memory with Content-Routed State Anchors

MARCH:通过内容路由状态锚点扩展循环记忆

Ming Zhang, Kaisen Yang, Shu Yu, Ermo Hua, Ning Ding, Xia Hu, Bowen Zhou, Chaochao Lu, Youbang Sun

机构 * Shanghai AI Laboratory(上海人工智能实验室) Tsinghua University(清华大学) Fudan University(复旦大学)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.LG

AI总结 本文提出MARCH架构,通过内容路由状态锚点扩展循环记忆,在长序列上保持计算效率,经预训练后在多个长程任务中优于线性注意力变体,增强了循环长程记忆能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11239 2026-08-13 cs.DB cs.AI 新提交 57%

Reinforcement Learning based DBMS Buffer Pool Auto-Tuning for Optimal Memory Utilization

基于强化学习的数据库管理系统缓冲池自动调优以实现最优内存利用

Yifan Wang, Patrick Royer, Raphaël Féraud, David Delande

机构 * Orange(奥兰治公司) Inria(法国国家信息与自动化研究所) Université de Lille(里尔大学)

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.AI

AI总结 该研究提出基于强化学习的MicroTune系统,用于DBMS缓冲池自动调优,可在保障SLA合规的同时减少内存浪费,性能优于基线方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.10296 2026-08-12 cs.CL 新提交 57%

Cracks in the Foundation: Seemingly Minor Architectural Choices Impact Long Context Extension

基础的裂痕:看似微小的架构选择会影响长上下文扩展

Amanda Bertsch, Luca Soldaini, Matthew R. Gormley, Graham Neubig, Hannaneh Hajishirzi, Kyle Lo, Dirk Groeneveld

机构 * Ai2 Carnegie Mellon University(卡内基梅隆大学) University of Washington(华盛顿大学)

专题命中 长上下文与记忆 :pretraining(abstract);分类 cs.CL

AI总结 该研究发现,Olmo、Llama、Qwen等稠密模型系列的四个微小架构决策会复合降低长上下文性能,结合三个及以上选择可使性能降47%,经17万余GPU小时训练发布OlmPool,其部分模型长上下文性能优于Llama 3。

Comments 29 pages; accepted to COLM 2026

详情

展开后加载摘要…

URL PDF HTML 收藏