arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2026-08-28 至 2026-08-28 共收录 15 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 15 篇

2608.26295 2026-08-28 cs.CL cs.AI cs.MA cs.SE 新提交 92%

MemToC: Benchmarking Memory-Tool Conflict Resolution in Large Language Models

MemToC:大型语言模型中记忆-工具冲突解决的基准测试

Arseniy Varlamov, Rishat Zinnatullin, Elisei Rykov, Alexander Panchenko, Ilseyar Alimova

机构 * Central University(中央大学) Ural Federal University(乌拉尔联邦大学) Skolkovo Institute of Science and Technology(斯科尔科沃科学技术研究院) AIRI(人工智能研究院(AIRI))

专题命中 长上下文与记忆 :LLM(summary_cn,abstract_cn);large language model(title);language model(title);SFT(abstract,abstract_cn)

AI总结 该研究提出MemToC基准,测试工具增强型LLM在记忆与工具返回冲突时的仲裁能力,发现指令调优模型在多数情况遵循工具,微调可改善仲裁但需兼顾工具使用与弃权表现。

Comments 26 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.06270 2026-08-28 cs.LG cs.AI 版本更新 90%

MCCE: A Framework for Multi-LLM Collaborative Search in Discrete Spaces with Similarity-Filtered Preference Learning

MCCE:基于相似度过滤偏好学习的离散空间多大语言模型协同搜索框架

Nian Ran, Zhongzheng Li, Yue Wang, Qingsong Ran, Xiaoyuan Zhang, Shikun Feng, Richard Allmendinger, Xiaoguang Zhao

机构 * Zhongguancun Academy(中关村学院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) University of Manchester(曼彻斯特大学) Tongji University(同济大学)

专题命中 长上下文与记忆 :LLM(title,summary_cn);large language model(abstract);language model(abstract);分类 cs.AI、cs.LG

AI总结 MCCE是结合冻结闭源LLM与轻量可训练模型的混合框架,通过轨迹记忆与强化学习优化小型模型,在多目标药物设计基准上实现最优帕累托前沿质量,优于基线方法,为混合LLM系统提供持续演化新范式。

Comments Accepted at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26895 2026-08-28 cs.IR cs.AI 新提交 86%

When Memory Takes Gradients: Collaborative Vector Memory for Agentic Recommender Systems

当记忆获取梯度:面向智能体推荐系统的协同向量记忆

Hanchong Chen, Xing Tang, Lingjie Li, Xiongfeng Shan, Xiuqiang He

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究针对智能体推荐系统中文本记忆的局限,提出CoVeMem协同向量记忆方法,在四个推荐基准上多数指标优于现有文本记忆智能体,无需额外LLM调用即可利用完整交互历史优化模型。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26849 2026-08-28 cs.AI cs.CY cs.MA 新提交 86%

LiveSim: Simulating Environment-Shaped Users in Multi-Agent Live-Stream Ecosystems

LiveSim:在多智能体直播生态系统中模拟环境塑造的用户

Jiaqi Xu, Yiran Qiao, Jing Chen, Qiwei Zhong, Xiang Ao, Xueqi Cheng

机构 * University of Chinese Academy of Sciences(中国科学院大学) ByteDance China(字节跳动中国)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);large language model(abstract);language model(abstract);分类 cs.AI

AI总结 该研究提出基于LLM的LiveSim框架,通过环境塑造的动态用户行为模拟,在真实直播风控数据实验中验证其可提升用户级行为保真度并支持生态系统级分析。

Comments 20 pages, 8 figures, 7 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26152 2026-08-28 cs.CL cs.AI cs.HC 新提交 85%

Artificial Intelligence Models Can Predict and Collaboratively Modulate Human Memory Search

人工智能模型可预测并协同调节人类的记忆搜索

Eric Lacosse, Mariana Duarte, Graham Todd, Peter M. Todd, Daniel C. McNamee

机构 * Champalimaud Research(尚帕利莫德研究院) Champalimaud Centre for Restorative Neurotechnology(尚帕利莫德修复神经技术中心) New York University Tandon(纽约大学坦登工程学院) Indiana University(印第安纳大学)

专题命中 长上下文与记忆 :SFT(abstract,abstract_cn);LLM(abstract);large language model(abstract);language model(abstract)

AI总结 该研究探索LLMs在语义记忆搜索中追踪增强人类心理轨迹的能力,通过语义流畅性任务验证,发现LLMs追踪预测人类记忆轨迹的能力优于其他人类。

Comments 18 pages, 5 figures; includes Supplementary Information

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26480 2026-08-28 cs.MA cs.AI cs.CL cs.SE 新提交 84%

Zero-Shot Self-Orchestration with Ledger-Based Control for Improved LLM Coding Performance

基于账本控制的零样本自编排提升大语言模型的代码生成性能

Victor Gao, Vida Khosrowshahi, Ali Khosrowshahi, Xihao Sun, Juhyun Lee, Simon (Sang Won)Lee

专题命中 长上下文与记忆 :LLM(title);large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究提出基于账本控制的管理者-工作者零样本自编排架构,在9个模型的100个困难代码问题上验证其可提升大语言模型代码生成性能,且成本低于改用更大模型。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.25061 2026-08-28 cs.CL cs.AI cs.DB cs.LG cs.PL 版本更新 83%

DataKernelBench: Can LLMs Optimize Database Queries on GPUs?

DataKernelBench:大语言模型能否在GPU上优化数据库查询?

Gokul Karthik Kumar, Yotam Perlitz, Corey Lammie, Andrea Giovannini, Katja Hose

机构 * IBM Research(IBM研究院) TU Wien(维也纳技术大学)

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出DataKernelBench基准,评估LLM在GPU上优化数据库查询内核的能力,实验显示最强模型配置在TPC-H数据集上实现2.11倍加速,工作负载上下文对性能影响大于硬件上下文。

Comments Accepted at EMNLP 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.24060 2026-08-28 cs.IR 版本更新 82%

Same Ranking, Different Winner: How Scoring Targets Shape LLM Memory Benchmarks

相同排名,不同赢家:评分目标如何塑造LLM记忆基准

Sugam Panthi, Rabab Abdelfattah

专题命中 长上下文与记忆 :LLM(title,title_cn)

AI总结 本文揭示对话记忆评估中评分目标选择(原始、来源、规范)的隐含性,通过TIAP审计发现目标切换会显著改变基准结论,并建议明确报告评分目标。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04893 2026-08-28 cs.CR cs.AI cs.LG 版本更新 79%

When Does Latent Communication Pay? A Causal Audit of Relayed KV Caches in Multi-Agent LLMs

何时潜在通信能发挥作用?多智能体大语言模型中中继键值缓存的因果审计

Jiaming Cheng, Subhransu Das, Rajiv Ramnath

专题命中 长上下文与记忆 :LLM(summary_cn,abstract);分类 cs.AI、cs.LG

AI总结 该研究通过因果审计多智能体LLM的中继KV缓存,发现仅当接收方需要发送方私有信息时,潜在通信才会发挥作用,且不匹配缓存审计是验证潜在想法传输的必要手段。

Comments v2: metadata only, fixed abstract formatting

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.26678 2026-08-28 cs.CL 版本更新 77%

NestedKV: Nested Memory Routing for Long-Context KV Cache Compression

NestedKV: 用于长上下文KV缓存压缩的嵌套内存路由

Hong Chen, Xiang Liu, Yubo Gao, Yuxuan Fan, Bo Wang, Yuanlin Chu, Yuanguo Lin, Xuming Hu

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科学与技术大学(广州)) Jimei University(集美大学)

专题命中 长上下文与记忆 :LLM(abstract,abstract_cn);language model(abstract);分类 cs.CL

AI总结 提出NestedKV方法,通过多时间尺度余弦异常评分和头自适应混合的免训练键缓存压缩,在长上下文任务中优于现有方法。

Comments EMNLP 2026 Main

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.27442 2026-08-28 cs.SE cs.AI cs.CL 新提交 73%

From Static to Dynamic: Benchmarking Real-World Code Review with MCR-Bench

从静态到动态:基于MCR-Bench的真实世界代码审查基准测试

Dewu Zheng, Yanlin Wang, Xiwen Wang, Kefeng Duan, Hongyu Zhang, Xilin Liu, Yuchi Ma, Zibin Zheng

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI

AI总结 本研究推出首个面向真实多轮代码审查的缺陷状态感知基准MCR-Bench,通过实验发现主流LLMs在该任务中存在整体能力有限、缺陷敏感性性能差异大及存在跨轮次时间错位等失效机制的问题。

Comments Accepted at ISSTA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26145 2026-08-28 cs.AI cs.HC cs.IR 新提交 70%

LLMs for Academic Workflows: An Evaluation of Literature Reviews Generated with Short and Long Context Windows of LLMs

用于学术工作流的大语言模型:对使用大语言模型短、长上下文窗口生成的文献综述的评估

Muhammad Ali Chaudhry, Xinyuan Hao, Haifa Alwahaby

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本研究评估LLMs短、长上下文窗口生成的文献综述,发现长上下文LLMs虽能纳入更多信息但存在重复等问题,AI生成综述需人工完善,未来应采用人机结合混合方法解决局限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07440 2026-08-28 cs.AI 版本更新 70%

Blast Radius

爆炸半径

MY Pitsane, Hope Mogale

机构 * Algorithm Reconnaissance Division(算法侦察部) Mankind Research Labs(人类研究实验室) North-West University(西北大学) University of Pretoria(比勒陀利亚大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 针对智能体编码的令牌浪费问题,提出Blast Radius内存管理层,结合NECROPHORESIS与RDM实现可逆上下文驱逐,在7个OpenAI模型上降低令牌消耗17%-26%,提升编码可持续性。

Comments major revisions are needed and this will be restored later on

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.21891 2026-08-28 cs.AI cs.CL 版本更新 62%

Learning the ARTS of Search for Automated Discovery

学习搜索的艺术以实现自动发现

Gurusha Juneja, Arnav Kumar Jain, Deepak Nathani, William Yang Wang, Xin Eric Wang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校) Université de Montréal and Mila- Quebec AI Institute(蒙特利尔大学和Mila-魁北克人工智能研究所)

专题命中 长上下文与记忆 :language model(abstract);分类 cs.CL、cs.AI

AI总结 提出ARTS方法,利用推理语言模型在假设与实验空间中迭代搜索,通过测试时训练解决上下文长度问题,在22个任务上优于现有算法,相对提升超15.3%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.26983 2026-08-28 cs.AI 新提交 57%

GraphMemix: Query-Aware Evidence Forests for Long-Term Multimodal Agent Memory

GraphMemix:面向多模态智能体长期记忆的查询感知证据森林

Geng Li, Yuhao Wang, Dong Li, Jianye Hao, Yuxin Peng

机构 * Wangxuan Institute of Computer Technology, Peking University(北京大学王选计算机研究所) MemoraX AI(MemoraX人工智能公司)

专题命中 长上下文与记忆 :foundation model(abstract);分类 cs.AI

AI总结 GraphMemix作为组合优化图记忆框架,通过三个关键组件构建查询感知证据森林,在四个多模态记忆基准上提升了准确率并建立了新的帕累托前沿。

Comments Project page with code: this https URL (https://github.com/ligeng0197/graphmemix)

详情

展开后加载摘要…

URL PDF HTML 收藏