arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4822 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4822 篇

2512.04868 2026-05-27 cs.CL cs.AI 82%

SEAL: Self-Evolving Agentic Learning for Conversational Question Answering over Knowledge Graphs

SEAL: 面向知识图谱对话问答的自我演进智能体学习

Hao Wang, Jialun Zhong, Changcheng Wang, Zhujun Nie, Zheng Li, Shunyu Yao, Yanzeng Li, Xinchi Li

机构 * Institute of Big Data and Artificial Intelligence, China Telecom Research Institute(大数据与人工智能研究院,中国电信研究院) Wangxuan Institute of Computer Technology, Peking University(王宣计算机技术研究所,北京大学) School of Artificial Intelligence, China University of Geosciences (Beijing)(人工智能学院,中国地质大学(北京)) Center for Cognition and Neuroergonomics, State Key Laboratory of Cognitive Neuroscience and Learning, Beijing Normal University(认知与神经工效学中心,认知神经科学与学习国家重点实验室,北京师范大学) Institute of Artificial Intelligence and Future Networks, Beijing Normal University(人工智能与未来网络研究院,北京师范大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出SEAL两阶段语义解析框架,通过自我演进智能体学习解决知识图谱对话问答中的指代消解、上下文依赖和复杂逻辑推理问题,在SPICE基准上达到最先进性能。

Comments Accept by NeuroComputing

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08426 2026-05-26 cs.CL cs.AI cs.CV 82%

Prism: Spectral-Aware Block-Sparse Attention

Prism: 频谱感知的块稀疏注意力

Xinghao Wang, Pengyu Wang, Xiaoran Liu, Fangxu Liu, Jason Chu, Kai Song, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院) ByteDance Inc.(字节跳动公司) OpenMOSS Team(OpenMOSS团队)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 针对长上下文LLM预填充中块稀疏注意力的块选择效率瓶颈,提出无训练频谱感知方法Prism,通过高低频分支分解和能量温度校准恢复位置信号,实现纯块级重要性估计,在保持精度同时实现高达5.1倍加速。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21270 2026-05-25 cs.CL cs.AI cs.CV 82%

Sparser Block-Sparse Attention via Token Permutation

通过令牌置换实现更稀疏的块稀疏注意力

Xinghao Wang, Pengyu Wang, Dong Zhang, Chenkun Tan, Shaojun Zhou, Zhaoxiang Liu, Shiguo Lian, Fangxu Liu, Kai Song, Xipeng Qiu

机构 * Fudan University(复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 提出一种基于令牌置换的块稀疏注意力方法(PBS-Attn),通过利用注意力的置换性质增加块级稀疏性,在长上下文预填充中实现高达2.75倍的端到端加速,同时保持模型精度接近全注意力基线。

Comments ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.22786 2026-05-22 cs.AI cs.ET cs.LG cs.MA 82%

LCGuard: Latent Communication Guard for Safe KV Sharing in Multi-Agent Systems

LCGuard: 多智能体系统中安全KV共享的潜在通信守护者

Sadia Asif, Mohammad Mohammadi Amiri, Momin Abbas, Prasanna Sattigeri, Karthikeyan Natesan Ramamurthy

机构 * Rensselaer Polytechnic Institute(伦斯勒理工学院) IBM Research(IBM研究院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出LCGuard框架,通过在智能体间共享KV缓存前学习表示层面的转换,以防止敏感信息泄露,同时在多个模型家族和多智能体基准测试中验证了其在减少重建攻击成功率和保持任务性能方面的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.21463 2026-05-21 cs.CL cs.AI 82%

Mem-$π$: Adaptive Memory through Learning When and What to Generate

Mem-$π$: 通过学习何时以及生成什么来实现自适应记忆

Xiaoqiang Wang, Chao Wang, Hadi Nekoei, Christopher Pal, Alexandre Lacoste, Spandana Gella, Bang Liu, Perouz Taslakian

机构 * ServiceNow AI Research(ServiceNow AI研究院) Mila -- Quebec AI Institute(魁北克AI研究所) McGill University(麦吉尔大学) CIFAR AI Chair(CIFAR人工智能主席)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 Mem-$π$ 通过学习在何时以及生成什么来实现自适应记忆,利用专门的语言或视觉-语言模型生成上下文特定的指导,从而在多种代理任务中优于基于检索和先前RL优化的记忆基线。

Comments Work in progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17757 2026-05-19 cs.LG cs.AI cs.DC cs.PF 82%

OSCAR: Offline Spectral Covariance-Aware Rotation for 2-bit KV Cache Quantization

OSCAR: 2位KV缓存量化中的离线频谱协方差感知旋转

Zhongzhu Zhou, Donglin Zhuang, Jisen Li, Ziyan Chen, Shuaiwen Leon Song, Ben Athiwaratkun, Xiaoxia Wu

机构 * Together AI University of Sydney(悉尼大学) University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 本文提出OSCAR方法,通过离线估计注意力感知的协方差结构,实现2位KV缓存量化的高效和准确,同时开发了可部署的系统,提升了LLM服务框架的性能和效率。

Comments 35 pages, 10 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.17444 2026-05-19 cs.SE cs.AI cs.CL 82%

MemRepair: Hierarchical Memory for Agentic Repository-Level Vulnerability Repair

MemRepair:用于代理级漏洞修复的分层内存

Simiao Liu, Li Zhang, Fang Liu, Xiaoli Lian, Yang Liu, Yinghao Zhu

机构 * Beihang University(北京航空航天大学) The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出MemRepair,一种增强记忆的代理框架,通过分层记忆和动态反馈循环提高漏洞修复的可靠性,实现了在多个仓库级别的漏洞修复基准上的高修复率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.15701 2026-05-18 cs.CL cs.AI 82%

H-Mem: A Novel Memory Mechanism for Evolving and Retrieving Agent Memory via a Hybrid Structure

H-Mem: 一种通过混合结构进化和检索智能体记忆的新型记忆机制

Jiawei Yu, Yixiang Fang, Xilin Liu, Yuchi Ma

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Huawei Cloud Computing Technologies CO., LTD.(华为云计算技术有限公司)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 H-Mem通过混合结构有效建模智能体记忆的长期演化并高效检索记忆数据,提升问答任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.14401 2026-05-18 cs.CL cs.AI 82%

Agentic Recommender System with Hierarchical Belief-State Memory

具有分层信念状态记忆的代理推荐系统

Xiang Shen, Yuhang Zhou, Yifan Wu, Zhuokai Zhao, Siyu Lin, Lei Huang, Qianqian Zhong, Lizhu Zhang, Benyu Zhang, Xiangjun Fan, Hong Yan

机构 * Meta Recommendation Systems (MRS)(Meta推荐系统)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出MARS框架,通过分层信念状态记忆提升推荐系统,采用LLM规划器动态调度六种操作,实验显示在四个基准领域中实现SOTA性能。

Comments 4 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11800 2026-05-13 cs.LG cs.CL 82%

ROMER: Expert Replacement and Router Calibration for Robust MoE LLMs on Analog Compute-in-Memory Systems

ROMER:专家替换与路由校准以实现鲁棒的MoE大语言模型在模拟计算-内存系统中的应用

Wenyong Zhou, Yuannuo Feng, Yizhe Chen, Taiqiang Wu, Wendong Xu, Wenbo Qi, Zhengwu Liu, Wang Kang, Ngai Wong

机构 * The Department of Electrical and Computer Engineering, The University of Hong Kong(香港大学电子与计算机工程系) The School of Integrated Circuit Science and Engineering, Beihang University(北航集成电路科学与工程学院)

专题命中 长上下文与记忆 :LLM(abstract_cn);large language model(abstract);language model(abstract);post-training(abstract)

AI总结 ROMER通过专家替换和路由校准缓解模拟计算-内存系统中MoE大语言模型的噪声影响,显著降低困惑度。

Comments 11 pages, 5 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.11744 2026-05-13 cs.CL cs.LG 82%

Training-Inference Consistent Segmented Execution for Long-Context LLMs

长上下文LLM的训练-推理一致分段执行

Xianpeng Shang, Jiang Li, Zehua Duo, Qianyi Cai, Xiangdong Su

机构 * College of Computer Science, Inner Mongolia University, Hohhot 010021, China National \& Local Joint Engineering Research Center of Intelligent Information Processing Technology for Mongolian, Hohhot 010021, China Inner Mongolia Key Laboratory of Multilingual Artificial Intelligence Technology, Hohhot 010021, China Thrust of Artificial Intelligence, The Hong Kong University of Science

专题命中 长上下文与记忆 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出训练-推理一致的分段生成框架,通过统一训练和推理的分段前向执行语义,实现长上下文生成的高效与可扩展性。

Comments Accepted by ICML 2026. 19 pages, 6 figures, 3 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.06313 2026-05-08 cs.IR cs.AI cs.CL 82%

Beyond Chunking: Discourse-Aware Hierarchical Retrieval for Long Document Question Answering

超越分块:面向长文档问答的篇章意识层次检索

Huiyao Chen, Yi Yang, Yinghui Li, Meishan Zhang, Baotian Hu, Min Zhang

机构 * Institute of Computing and Intelligence, Harbin Institute of Technology (Shenzhen)(计算与智能研究院,哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute (SLAI)(深圳环形区研究院(SLAI))

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 本文提出一种篇章意识层次检索框架,利用修辞结构理论处理长文档问答,通过 discourse parsing 和 LLM 增强实现结构与语义信息的融合,实验表明在多种语言和文档类型上均取得显著提升。

Comments 21 pages, 9 figures. Accepted at ACL 2026 Main conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.05794 2026-05-08 cs.LG cs.AI 82%

Revealing Modular Gradient Noise Imbalance in LLMs: Calibrating Adam via Signal-to-Noise Ratio

揭示大语言模型中模块梯度噪声不平衡:通过信噪比校准Adam

Ziqing Wen, Zhouyang Liu, Jiahuan Wang, Ping Luo, Li Shen, Dongsheng Li, Tao Sun

机构 * College of Computer Science and Technology, National University of Defense Technology(国防科技大学计算机科学与技术学院)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文研究大语言模型中模块梯度噪声不平衡问题,提出基于信噪比的模块学习率校准方法,提升收敛速度和泛化能力,兼容高效内存训练算法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.01567 2026-05-05 cs.SE cs.CL cs.LG 82%

Feedback-Normalized Developer Memory for Reinforcement-Learning Coding Agents: A Safety-Gated MCP Architecture

反馈归一化的开发者内存用于强化学习编码代理:一种安全门控MCP架构

Mehmet Iscan

机构 * PythaLab, Yildiz Technical University, Istanbul, Türkiye(PythaLab,伊兹密尔技术大学,伊斯坦布尔,土耳其)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.LG

AI总结 本文提出RL Developer Memory架构,通过归一化反馈和安全门控机制提升强化学习编码代理的内存管理,实验证明其在确定性任务中的有效性。

Comments 25 pages, 5 figures, 7 tables. Preprint. Implementation and supplementary artifacts are available at the project repository

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.19771 2026-04-23 cs.CL cs.AI cs.IR 82%

Cognis: Context-Aware Memory for Conversational AI Agents

Cognis:面向对话AI代理的上下文感知内存

Parshva Daftari, Khush Patel, Shreyas Kapale, Jithin George, Siva Surendira

机构 * Lyzr Research(Lyzr研究)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Cognis通过多阶段检索管道解决LLM代理缺乏持久记忆的问题,结合双存储后端和向量相似性搜索,实现智能版本追踪和时间敏感查询增强,展现先进性能。

Comments 30 pages, 8 figures, 11 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.11913 2026-04-22 cs.CL cs.AI 82%

LSTM-MAS: A Long Short-Term Memory Inspired Multi-Agent System for Long-Context Understanding

LSTM-MAS:一种受长短期记忆启发的多智能体系统用于长上下文理解

Yichen Jiang, Jiakang Yuan, Chongjun Tu, Peng Ye, Tao Chen

机构 * Fudan University(复旦大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Innovation Institute(上海创新研究院) The Chinese University of Hong Kong(香港中文大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出LSTM-MAS多智能体系统,通过模仿LSTM的层次信息流和门控机制,解决长上下文处理中的误差累积和幻觉传播问题,实验表明在多个问答数据集上取得显著提升。

Comments 12 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.18137 2026-04-21 cs.AR cs.AI cs.LG 82%

AQPIM: Breaking the PIM Capacity Wall for LLMs with In-Memory Activation Quantization

AQPIM: 突破LLM的PIM容量墙:基于内存激活量化

Kosuke Matsushima, Yasuyuki Okoshi, Masato Motomura, Daichi Fujiki

机构 * Institute of Science Tokyo(东京科学研究院)

专题命中 长上下文与记忆 :LLM(title_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出AQPIM,一种基于内存激活量化的PIM框架,通过聚类向量量化提升带宽和计算效率,显著减少内存占用和计算开销。

Comments Accepted to HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.00131 2026-04-21 cs.CL cs.AI 82%

Oblivion: Self-Adaptive Agentic Memory Control through Decay-Driven Activation

遗忘:通过衰减驱动的激活实现自适应的代理记忆控制

Ashish Rana, Chia-Chien Hung, Qumeng Sun, Julian Martin Kunkel, Carolin Lawrence

机构 * NEC Laboratories Europe(NEC欧洲实验室) GWDG, Georg-August-Universität Göttingen(GWDG与哥廷根亚利桑德罗大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI

AI总结 Oblivion通过衰减驱动的激活机制实现自适应的记忆控制,平衡学习与遗忘,提升LLM代理推理效果。

Comments 30 pages, 6 figures, and 17 tables. The source code is available at https://github.com/nec-research/oblivion

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.10696 2026-04-16 cs.AI cs.CL 82%

Remember Me, Refine Me: A Dynamic Procedural Memory Framework for Experience-Driven Agent Evolution

记住我,精进我:一种面向经验驱动代理进化的动态过程记忆框架

Zouying Cao, Jiaji Deng, Li Yu, Weikang Zhou, Zhaoyang Liu, Bolin Ding, Hai Zhao

机构 * AGI Institute, School of Computer Science, Shanghai Jiao Tong University(AGI研究院,计算机科学学院,上海交通大学) Tongyi Lab, Alibaba Group(通义实验室,阿里巴巴集团) Key Laboratory of Shanghai Education Commission for Intelligent Interaction and Cognitive Engineering, Shanghai Jiao Tong University(上海市教育委员会智能交互与认知工程重点实验室,上海交通大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本文提出ReMe框架,通过多维蒸馏、情境适应重用和基于效用的精炼机制,解决传统静态记忆存储的不足,实验证明其在BFCL-V3和AppWorld上达到新状态,展示了自进化记忆在终身学习中的高效性。

Comments 20 pages, 10 figures, 15 tables, ACL'26-Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16713 2026-02-17 cs.RO cs.AI cs.CL 82%

A Pragmatist Robot: Learning to Plan Tasks by Experiencing the Real World

务实型机器人:通过体验现实世界学习任务规划

Kaixian Qu, Guowei Lan, René Zurbrügg, Changan Chen, Christopher E. Mower, Haitham Bou-Ammar, Marco Hutter

机构 * Robotic Systems Lab, ETH Zürich(瑞士联邦理工学院机器人系统实验室) ETH AI Center, ETH Zürich(瑞士联邦理工学院人工智能中心) Huawei Noah’s Ark Lab, London, UK(华为诺亚实验室,伦敦,英国) UCL Centre for AI, London, UK(伦敦大学学院人工智能中心)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

AI总结 PragmaBot 通过现实世界经验学习任务规划,利用 STM 自我反思和 RAG 提高任务成功率

Comments Accepted to RA-L

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04763 2025-12-05 cs.LG cs.CL cs.CV 82%

MemLoRA: Distilling Expert Adapters for On-Device Memory Systems

MemLoRA: 通过专家适配器实现设备端记忆系统

Massimo Bini, Ondrej Bohdal, Umberto Michieli, Zeynep Akata, Mete Ozay, Taha Ceritli

机构 * Samsung R&D Institute UK(三星英国研发中心) Technical University of Munich(慕尼黑技术大学) Helmholtz Munich(慕尼黑海德堡研究所)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

AI总结 MemLoRA通过为小型语言模型添加专用记忆适配器,实现设备端记忆系统的本地部署,并扩展至视觉理解任务,提升多模态场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17800 2025-10-22 cs.CV cs.CL cs.LG 82%

Glyph: Scaling Context Windows via Visual-Text Compression

Jiale Cheng, Yusen Liu, Xinyu Zhang, Yulin Fei, Wenyi Hong, Ruiliang Lyu, Weihan Wang, Zhe Su, Xiaotao Gu, Xiao Liu, Yushi Bai, Jie Tang, Hongning Wang, Minlie Huang

机构 * The Conversational Artificial Intelligence (CoAI) Group, Tsinghua University(清华大学对话人工智能(CoAI)小组) Zhipu AI(智谱AI) The Knowledge Engineering Group (KEG), Tsinghua University(清华大学知识工程小组(KEG))

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);SFT(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15113 2025-08-05 cs.NE cs.AI cs.CL 82%

Associative memory inspires improvements for in-context learning using a novel attention residual stream architecture

Thomas F Burns, Tomoki Fukai, Christopher J Earls

机构 * SciAI Center, Cornell University, USA(SciAI中心,康奈尔大学,美国) Neural Coding and Brain Computing Unit, OIST, Japan(神经编码与脑计算单元,海洋研究所,日本) SciAI Center, Center for Applied Mathematics, School of Civil and Environmental Engineering, Cornell University, USA(SciAI中心,应用数学中心,土木与环境工程学院,康奈尔大学,美国)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);small language model(abstract)

Comments 35 pages, 14 figures, 6 tables; accepted and published in TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.21349 2025-06-23 cs.LG cs.AI cs.PF 82%

FALCON: Feedback-driven Adaptive Long/short-term memory reinforced Coding Optimization system

Zeyuan Li, Yangfan He, Lewei He, Jianhui Wang, Tianyu Shi, Bin Lei, Yuchen Li, Qiuwu Chen

机构 * School of Software, South China Normal University(南方科技大学软件学院) University of Minnesota - Twin Cities(明尼苏达大学双城分校) University of Electronic Science and Technology of China(电子科技大学) University of Toronto(多伦多大学) University of Connecticut(康涅狄格大学) AI center, AIGCode Inc.(AIGCode公司人工智能中心)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);SFT(abstract);RLHF(abstract)

Comments 20 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.12637 2025-04-18 cs.CL cs.AI 82%

Scaling Instruction-Tuned LLMs to Million-Token Contexts via Hierarchical Synthetic Data Generation

Linda He, Jue Wang, Maurice Weber, Shang Zhu, Ben Athiwaratkun, Ce Zhang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);instruction tuning(abstract);post-training(abstract)

Comments 26 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22036 2025-04-04 cs.CL cs.AI 82%

Cognitive Prompts Using Guilford's Structure of Intellect Model

Oliver Kramer

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.09597 2025-02-14 cs.LG cs.CL 82%

Do LLMs Recognize Your Preferences? Evaluating Personalized Preference Following in LLMs

Siyan Zhao, Mingyi Hong, Yang Liu, Devamanyu Hazarika, Kaixiang Lin

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Accepted at ICLR 2025 as oral presentation. Code and data at: https://prefeval.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.04139 2025-01-03 cs.CL cs.AI 82%

From Reading to Compressing: Exploring the Multi-document Reader for Prompt Compression

Eunseong Choi, Sunkyung Lee, Minjin Choi, June Park, Jongwuk Lee

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments Findings of the Association for Computational Linguistics: EMNLP 2024; 21 pages; 10 figures and 7 tables. Code available at https://github.com/eunseongc/R2C

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.15274 2024-12-23 cs.CL cs.AI 82%

Memory-Augmented Agent Training for Business Document Understanding

Jiale Liu, Yifan Zeng, Malte Højmark-Bertelsen, Marie Normann Gadeberg, Huazheng Wang, Qingyun Wu

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);prompting(abstract)

Comments 11 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.05317 2024-10-29 cs.LG cs.CL 82%

LoCoCo: Dropping In Convolutions for Long Context Compression

Ruisi Cai, Yuandong Tian, Zhangyang Wang, Beidi Chen

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);post-training(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏