arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4797 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4797 篇

2605.21539 2026-05-22 cs.LG 88%

DualOptim+: Bridging Shared and Decoupled Optimizer States for Better Machine Unlearning in Large Language Models

DualOptim+: 联合与解耦优化器状态的桥梁以提升大语言模型中的机器反遗忘

Xuyang Zhong, Qizhang Li, Yiwen Guo, Chen Liu

机构 * Department of Computer Science, City University of Hong Kong(香港城市大学计算机科学系) Independent Researcher(独立研究者)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 本文提出DualOptim+,一种改进大语言模型中机器反遗忘的新优化框架,通过引入基础状态和delta状态,有效平衡遗忘与保留目标,同时提出8位量化变体以减少内存开销,实验表明其在多个任务中均表现出色。

Comments Accepted by ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08437 2026-05-19 cs.CL 88%

Large Language Models and Impossible Language Acquisition: "False Promise" or an Overturn of our Current Perspective towards AI

大语言模型与不可能的语言习得:"虚假承诺"或对当前人工智能观点的颠覆

Ziyan Wang, Longlong Ma

机构 * New Talent Academy(新人才学院) Institute of Software, University of Chinese Academy of Sciences(中国科学院软件研究所)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文通过实验探讨大语言模型学习可能与不可能语言的能力,发现GPT-2模型在自然语言任务上表现优于不可能语言任务,而LSTM模型则无显著差异,挑战了Chomsky对AI的理性主义基础观点。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.12357 2026-05-13 cs.AI 88%

$δ$-mem: Efficient Online Memory for Large Language Models

$δ$-mem: 高效的大型语言模型在线内存

Jingdi Lei, Di Zhang, Junxian Li, Weida Wang, Kaixuan Fan, Xiang Liu, Qihan Liu, Xiaoteng Ma, Baian Chen, Soujanya Poria

机构 * Nanyang Technological University(南洋理工大学) Fudan University(复旦大学) Mind Lab Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州))

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出$δ$-mem机制,通过紧凑的在线状态与注意力计算直接耦合,提升模型在长文本任务中的表现,无需全微调或替换backbone。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02757 2026-04-21 cs.LG math.OC stat.ML 88%

ConMeZO: Adaptive Descent-Direction Sampling for Gradient-Free Finetuning of Large Language Models

ConMeZO:适应性下降方向采样用于大语言模型的梯度自由微调

Lejs Deen Behric, Liang Zhang, Bingcong Li, Kiran Koshy Thekumparampil

机构 * Department of Computer Science, ETH Zurich(苏黎世联邦理工学院计算机科学系) Amazon AGI Labs(亚马逊人工智能实验室)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 ConMeZO通过适应性方向采样加速大语言模型微调的收敛速度,保留低内存足迹,比MeZO快2倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17377 2026-04-21 cs.CL 88%

AnchorMem: Anchored Facts with Associative Contexts for Building Memory in Large Language Models

AnchorMem: 基于关联上下文的锚定事实用于构建大语言模型的记忆

Zhanyu Shen, Sijie Cheng, Zhicheng Guo, Weiqin Wang, Yile Wang, Hui Huang

机构 * College of Computer Science and Software Engineering, Shenzhen University(深圳大学计算机科学与软件工程学院) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出AnchorMem,通过锚定事实与关联上下文构建大语言模型的记忆系统,解决传统方法依赖总结导致信息丢失的问题,实验表明其在LoCoMo基准上表现优异。

Comments ACL 2026 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.16734 2026-04-21 cs.CV cs.AI 88%

Reducing Peak Memory Usage for Modern Multimodal Large Language Model Pipelines

降低现代多模态大语言模型流水线的峰值内存使用

Junwan Kim, Hyunkyung Bae

机构 * New York University(纽约大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出一种顺序输入压缩机制,在预填充阶段通过结构感知的键值缓存压缩,降低多模态大语言模型的峰值内存使用,同时保持生成性能。

Comments ACL 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05091 2026-04-08 cs.CL cs.DC cs.OS 88%

MegaTrain: Full Precision Training of 100B+ Parameter Large Language Models on a Single GPU

MegaTrain:在单块GPU上以全精度训练1000亿参数以上的大型语言模型

Zhengqing Yuan, Hanchi Sun, Lichao Sun, Yanfang Ye

机构 * University of Notre Dame(圣母大学) Lehigh University(里海大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 MegaTrain通过在主机内存中存储参数和优化器状态,利用GPU作为临时计算引擎,实现了在单块GPU上以全精度训练超大规模语言模型,并在120B参数模型训练中表现出色。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.29252 2026-04-01 cs.CV cs.AI 88%

Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism

通过视觉记忆机制扩展多模态大语言模型的长视频理解

Tao Chen, Kun Zhang, Qiong Wu, Xiao Chen, Chao Chang, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(厦门大学多媒体可信感知与高效计算教育部重点实验室) National University of Defense Technology(国防科技大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出FlexMem方法,通过视觉记忆机制实现长视频理解,有效提升多模态大语言模型处理无限长视频的能力,实验显示其在单块3090 GPU上能处理超1000帧视频并优于现有方法。

Comments CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.15800 2026-03-18 cs.CV cs.CL cs.CR 88%

Evolving Contextual Safety in Multi-Modal Large Language Models via Inference-Time Self-Reflective Memory

通过推理时的自我反思记忆在多模态大语言模型中实现上下文安全演化

Ce Zhang, Jinxi He, Junyi He, Katia Sycara, Yaqi Xie

机构 * Robotics Institute, Carnegie Mellon University(卡内基梅隆大学机器人研究所)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出MM-SafetyBench++基准和EchoSafe框架,通过自反思记忆实现多模态大语言模型的上下文安全演化,实验表明其在安全性能上表现优异。

Comments Accepted at CVPR 2026. Project page: https://echosafe-mllm.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09981 2026-03-12 cs.CL 88%

Large Language Models and Book Summarization: Reading or Remembering, Which Is Better?

大语言模型与书籍摘要:阅读还是记忆,哪个更好?

Tairan Fu, Javier Conde, Pedro Reviriego, Javier Coronado-Blázquez, Nina Melero, Elena Merino-Gómez

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本研究比较了大语言模型在使用内部知识和完整文本生成书籍摘要的效果,发现完整文本通常能生成更详细的摘要,但某些情况下内部知识摘要表现更优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.19747 2026-03-10 cs.CL cs.AR 88%

HaLoRA: Hardware-aware Low-Rank Adaptation for Large Language Models Based on Hybrid Compute-in-Memory Architecture

HaLoRA: 基于混合计算-内存架构的硬件感知低秩适应法用于大型语言模型

Taiqiang Wu, Chenchen Ding, Wenyong Zhou, Yuxin Cheng, Xincheng Feng, Shuqi Wang, Wendong Xu, Chufan Shi, Zhengwu Liu, Ngai Wong

机构 * The University of Hong Kong(香港大学) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 HaLoRA通过在混合计算-内存架构中部署低秩适应,利用RRAM和SRAM实现高效能和高精度的LLM微调。

Comments 22 pages, Accepted by TODAES (ACM Transactions on Design Automation of Electronic Systems)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04412 2026-03-06 cs.CL 88%

Additive Multi-Step Markov Chains and the Curse of Dimensionality in Large Language Models

加性多步马尔可夫链与大语言模型中维度灾难

O. V. Usatenko, S. S. Melnyk, G. M. Pritula

机构 * A. Ya. Usikov Institute for Radiophysics and Electronics Ukrainian Academy of Science(A. Ya. Usikov 无线电物理与电子研究所 乌克兰科学院)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.CL

AI总结 本文提出加性多步马尔可夫链模型,用于近似大语言模型动态,通过分解条件概率减少高阶马尔可夫过程的组合爆炸问题。

Comments 10 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21862 2026-02-26 cs.CL 88%

Personalized Graph-Empowered Large Language Model for Proactive Information Access

面向主动信息获取的个性化图增强大语言模型

Chia Cheng Chang, An-Zi Yen, Hen-Hsen Huang, Hsin-Hsi Chen

机构 * Department of Computer Science(计算机科学系) Information Engineering National Taiwan University Taipei, Taiwan(信息工程国立台湾大学台北市) Department of Computer Science National Yang Ming Chiao Tung University Hsinchu, Taiwan(计算机科学国立阳明交通大学新竹市) Institute of Information Science Academia Sinica Taipei, Taiwan(信息科学研究所台湾学术院台北市) Information Engineering AI Research Center (AINTU) National Taiwan University Taipei, Taiwan(信息工程人工智能研究中心(AINTU)国立台湾大学台北市)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出一种基于大语言模型和个性化知识图谱的主动信息获取框架,通过精炼决策过程提升用户对遗忘事件的识别能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17183 2026-02-20 cs.SE cs.AI 88%

Robustness and Reasoning Fidelity of Large Language Models in Long-Context Code Question Answering

大语言模型在长上下文代码问答中的鲁棒性与推理可信度

Kishan Maharaj, Nandakishore Menon, Ashita Saxena, Srikanth Tamilselvam

机构 * IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本研究评估了大语言模型在长上下文代码问答中的鲁棒性和推理可信度,通过不同设置测试发现模型在面对干扰信息时表现脆弱,揭示了现有评估的局限性。

Comments 11 pages, 4 Figures, 5 Tables, Work in Progress

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15344 2026-02-18 cs.LG 88%

ER-MIA: Black-Box Adversarial Memory Injection Attacks on Long-Term Memory-Augmented Large Language Models

ER-MIA:针对长时记忆增强大语言模型的黑盒对抗性记忆注入攻击

Mitchell Piehl, Zhaohan Xi, Zuobin Xiong, Pan He, Muchao Ye

机构 * Department of Computer Science, The University of Iowa(爱荷华大学计算机科学系) School of Computing, State University of New York at Binghamton(纽约州立大学布法罗分校计算机学院) Department of Computer Science, University of Nevada, Las Vegas(内华达大学拉斯维加斯分校计算机科学系) Department of Computer Science(计算机科学系) Software Engineering, Auburn University(阿伯茨罕大学软件工程系)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.LG

AI总结 ER-MIA针对长时记忆增强LLM的基于相似性的检索机制提出黑盒对抗性记忆注入攻击,揭示了系统层面的安全漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08294 2026-02-10 cs.CL 88%

When Does Context Help? Error Dynamics of Contextual Information in Large Language Models

何时上下文有助于?大型语言模型中上下文信息的误差动态

Dingzirui Wang, Xuanliang Zhang, Keyan Xu, Qingfu Zhu, Wanxiang Che, Yang Deng

机构 * Harbin Institute of Technology(哈尔滨工业大学) Singapore Management University(新加坡管理大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出统一理论框架,分析上下文信息对Transformer模型误差动态的影响,通过几何条件和范数约束揭示上下文校正的必要条件,并通过实验验证提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.17098 2026-02-03 cs.CR cs.AI 88%

Can Transformer Memory Be Corrupted? Investigating Cache-Side Vulnerabilities in Large Language Models

Transformer记忆能否被破坏?调查大型语言模型中的缓存侧漏洞

Elias Hossain, Swayamjit Saha, Somshubhra Roy, Ravi Prasad

机构 * College of Engineering and Computer Science, University of Central Florida(中央佛罗里达大学工程与计算机科学学院) Department of Computer Science and Engineering, Mississippi State University(密苏里州立大学计算机科学与工程系) Department of Electrical and Computer Engineering, North Carolina State University(北卡罗来纳州立大学电子与计算机工程系)

专题命中 长上下文与记忆 :language model(title,abstract);large language model(title);LLM(abstract);分类 cs.AI

AI总结 本文提出恶意令牌注入框架,揭示了大型语言模型缓存中的安全漏洞,通过扰动缓存关键向量影响模型输出和任务性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.21744 2026-01-30 cs.CL 88%

Temporal Guidance for Large Language Models

时间指导用于大语言模型

Hong-Kai Zheng, Piji Li

机构 * College of Artificial Intelligence, MIIT Key Laboratory of Pattern Analysis(人工智能学院,模式分析与机器智能关键实验室) The Key Laboratory of Brain-Machine Intelligence Technology, Ministry of Education, Nanjing University of Aeronautics(脑机智能技术关键实验室,教育部,南京航空航天大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 本文提出时间指导策略,通过多令牌预测和轻量级投影器提升大语言模型生成质量,同时保持低计算开销。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19828 2026-01-15 cs.CL cs.MA 88%

Memory-R1: Enhancing Large Language Model Agents to Manage and Utilize Memories via Reinforcement Learning

Memory-R1: 通过强化学习增强大语言模型代理以管理并利用记忆

Sikuan Yan, Xiufeng Yang, Zuchao Huang, Ercong Nie, Zifeng Ding, Zonggen Li, Xiaowen Ma, Jinhe Bi, Kristian Kersting, Jeff Z. Pan, Hinrich Schütze, Volker Tresp, Yunpu Ma

机构 * Ludwig Maximilian University of Munich(慕尼黑路德维希-马克西米利安大学) Munich Center for Machine Learning(慕尼黑机器学习中心) Technical University of Munich(慕尼黑技术大学) University of Cambridge(剑桥大学) University of Hong Kong(香港大学) Technical University of Darmstadt(达姆施塔特技术大学) University of Edinburgh(爱丁堡大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 Memory-R1通过强化学习框架,使大语言模型具备主动管理与利用外部记忆的能力,有效提升长跨度推理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.07403 2026-01-13 cs.CL 88%

LongEmotion: Measuring Emotional Intelligence of Large Language Models in Long-Context Interaction

LongEmotion: 测量大语言模型在长上下文交互中的情感智能

Weichu Liu, Jing Xiong, Yuxuan Hu, Zixuan Li, Minghuan Tan, Ningning Mao, Hui Shen, Wendong Xu, Chaofan Tao, Min Yang, Chengming Li, Lingpeng Kong, Ngai Wong

机构 * Shenzhen MSU-BIT University(深圳MSU-BIT大学) The University of Hong Kong(香港大学) City University of Hong Kong(香港城市大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Shenzhen Institute of Advanced Technology, Chinese Academy of Sciences(中国科学院深圳先进技术研究所) Beijing Normal University(北京师范大学) University of Michigan, Ann Arbor(密歇根大学安娜堡分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LongEmotion是一个评估大语言模型在长上下文交互中情感智能的基准,通过多任务和协作框架提升模型在情绪识别与共情生成中的表现。

Comments Technical Report

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.03417 2026-01-08 cs.CL 88%

Implicit Graph, Explicit Retrieval: Towards Efficient and Interpretable Long-horizon Memory for Large Language Models

隐式图,显式检索:迈向高效且可解释的长周期记忆 для 大语言模型

Xin Zhang, Kailai Yang, Hao Li, Chenyue Li, Qiyu Wei, Sophia Ananiadou

机构 * University of Manchester(曼彻斯特大学) Imperial College London(伦敦帝国学院) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 LatentGraphMem结合隐式图记忆与显式子图检索,实现高效且可解释的长周期记忆,提升大语言模型的推理能力与可解释性。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.02819 2026-01-07 cs.CL 88%

Punctuation-aware Hybrid Trainable Sparse Attention for Large Language Models

具有标点意识的混合可训练稀疏注意力机制用于大语言模型

Junxiang Qiu, Shuo Wang, Zhengsu Chen, Hengheng Zhang, Jinda Lu, Changcheng Li, Qi Tian

机构 * University of Science and Technology of China(中国科学技术大学) Huawei Inc.(华为公司)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 PHSA通过利用标点符号作为语义边界锚点,提出了一种混合可训练稀疏注意力机制,有效减少信息损失并提升大语言模型的长上下文处理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24969 2026-01-01 cond-mat.stat-mech cs.CL physics.bio-ph q-bio.NC 88%

Large language models and the entropy of English

大语言模型与英语的熵

Colin Scheibner, Lindsay M. Smith, William Bialek

机构 * Joseph Henry Laboratories of Physics(乔赛亚·亨利物理实验室) Princeton Center for Theoretical Science(普林斯顿理论科学中心) Lewis--Sigler Institute for Integrative Genomics(刘易斯-西格尔整合基因组学研究所) Princeton University(普林斯顿大学) Initiative for the Theoretical Sciences(理论科学倡议) The CUNY Graduate Center(纽约市立大学研究生中心)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

AI总结 通过大语言模型揭示英语文本中长程结构的熵特性及依赖关系

Comments 8 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20719 2025-11-27 cs.AI cs.IT eess.SP math.IT 88%

Learning Multi-Access Point Coordination in Agentic AI Wi-Fi with Large Language Models

在基于大语言模型的代理AI无线局域网中学习多接入点协调

Yifan Fan, Le Liang, Peng Liu, Xiao Li, Ziyang Guo, Qiao Lan, Shi Jin, Wen Tong

机构 * School of Information Science and Engineering(信息科学与工程学院) Purple Mountain Laboratories(紫金山实验室) Wireless Technology Lab, 2012 Labs, Huawei Technologies Co., Ltd(无线技术实验室,2012实验室,华为技术有限公司)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

AI总结 本文提出基于大语言模型的代理AI无线局域网框架,通过动态协作实现多接入点协调,提升无线网络性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.00489 2025-11-04 cs.CL 88%

ToM: Leveraging Tree-oriented MapReduce for Long-Context Reasoning in Large Language Models

Jiani Guo, Zuchao Li, Jie Wu, Qianren Wang, Yun Li, Lefei Zhang, Hai Zhao, Yujiu Yang

机构 * School of Computer Science, Wuhan University, Wuhan, China(武汉大学计算机学院) School of Artificial Intelligence, Wuhan University, Wuhan, China(武汉大学人工智能学院) Tsinghua University(清华大学) Cognitive AI Lab(认知人工智能实验室) School of Computer Science, Shanghai Jiao Tong University, Shanghai, China(上海交通大学计算机学院)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments EMNLP 2025 Main Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.18395 2025-10-22 cs.AI 88%

Memory-Augmented State Machine Prompting: A Novel LLM Agent Framework for Real-Time Strategy Games

Runnan Qi, Yanan Ni, Lumin Jiang, Zongyuan Li, Kuihua Huang, Xian Guo

机构 * National University of Defense Technology(国防科技大学) Nankai University(南开大学)

专题命中 长上下文与记忆 :LLM(title,abstract);prompting(title,abstract);分类 cs.AI

Comments 10 pages, 4 figures, 1 table, 1 algorithm. Submitted to conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.06436 2025-10-22 cs.AI 88%

Tree of Agents: Improving Long-Context Capabilities of Large Language Models through Multi-Perspective Reasoning

Song Yu, Xiaofei Xu, Ke Deng, Li Li, Lin Tian

机构 * School of Computer and Information Science, Southwest University(西南大学计算机与信息科学学院) School of Information Technology, Murdoch University(默多克大学信息科技学院) School of Computing Technologies, RMIT University(皇家墨尔本理工大学计算技术学院) University of Technology Sydney(悉尼技术大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.AI

Comments 19 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.13349 2025-10-20 cs.CL 88%

Event Segmentation Applications in Large Language Model Enabled Automated Recall Assessments

Ryan A. Panela, Alex J. Barnett, Morgan D. Barense, Björn Herrmann

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments 35 pages, 8 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17670 2025-08-28 cs.CL 88%

CoCoA: Confidence and Context-Aware Adaptive Decoding for Resolving Knowledge Conflicts in Large Language Models

Anant Khandelwal, Manish Gupta, Puneet Agrawal

机构 * Microsoft(微软)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL

Comments Accepted to EMNLP'25, Main. 21 pages, 17 tables, 3 Figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.09071 2025-08-25 cs.CL 88%

Exploration of Plan-Guided Summarization for Narrative Texts: the Case of Small Language Models

Matt Grenander, Siddharth Varia, Paula Czarnowska, Yogarshi Vyas, Kishaloy Halder, Bonan Min

机构 * AWS AI Labs(AWS人工智能实验室) School of Informatics, University of Edinburgh(信息学院,爱丁堡大学)

专题命中 长上下文与记忆 :language model(title,abstract);small language model(title,abstract);分类 cs.CL

Comments Accepted to the 7th Workshop on Narrative Understanding (WNU), co-located with NAACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏