arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2512.21280 2025-12-25 cs.CL cs.AI 89%

SMART SLM: Structured Memory and Reasoning Transformer, A Small Language Model for Accurate Document Assistance

SMART SLM:结构记忆与推理变换器,一种用于准确文档辅助的小语言模型

Divij Dudeja, Mayukha Pal

机构 * ABB Ability Innovation Center(ABB能力创新中心) Indian Institute of Information Technology(印度信息科技学院)

专题命中 长上下文与记忆 :language model(title);small language model(title);SLM(title);分类 cs.CL、cs.AI

AI总结 SMART SLM通过结构化记忆与推理变换器,提升工程文档处理的准确性与效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.05232 2024-11-11 cs.CL cs.AI 89%

Abstract2Appendix: Academic Reviews Enhance LLM Long-Context Capabilities

Shengzhi Li, Kittipat Kampa, Rongyu Lin, Bohang Li, Shichao Pei

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract);SFT(abstract)

Comments We share our latest dataset on https://github.com/findalexli/Abstract2Appendix

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07387 2026-07-09 cs.MA cs.SI physics.soc-ph 新提交 89%

A Large Language Model-Driven Agent-Based Modeling Framework with Multi-Round Communication for Simulating Vaccine Opinion Dynamics

一种用于模拟疫苗舆论动态的基于多轮通信的大语言模型驱动的基于代理的建模框架

Bo Zhang, Na Jiang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 该研究引入大语言模型(Qwen3-8B)集成到基于代理的建模框架,以疫苗接种舆论动态为例,通过启用不同认知模块模拟舆论动态,发现不同模块对突发舆论有相反影响,再现了社会影响的非线性行为模式,证明框架有效性和潜力。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02716 2026-07-07 cs.MA 新提交 89%

Evaluating Large Language Models for Decision-Making in Agent-Based Urban Mobility Simulations

在基于代理的城市交通模拟中评估用于决策的大语言模型

Bruno Cascaes Alves, Míriam Blank Born, Ulisses Gilioli Francescatto Júnior, Felipe Moura Goulart, Letícia Brandão Caldas, Marilton Sanchotene de Aguiar

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 研究在多智能体模拟中集成大语言模型作为决策组件,提出混合架构,通过API连接GAMA平台与外部基于大语言模型的模块,能指导智能体重规划行为,比较不同场景下效果,显示其可丰富行为表示。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.12313 2026-06-16 cs.CR 版本更新 89%

Taint-Based Code Slicing for LLMs-based Malicious NPM Package Detection

基于污点的代码切片用于基于LLM的恶意NPM包检测

Dang-Khoa Nguyen, Gia-Thang Ho, Quang-Minh Pham, Tuyet A. Dang-Thi, Minh-Khanh Vu, Thanh-Cong Nguyen, Phat T. Tran-Truong, Duc-Ly Vu

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 提出基于污点代码切片的LLM框架,通过隔离安全相关数据流,将输入token数平均减少99.75%,在2537个包上达到87.04%的检测准确率,优于基线方法。

Comments 18 pages, 1 figure, 5 tables, 2 algorithms

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.05250 2026-06-05 cs.SE 89%

Towards Persistent Case-Based Memory for Autonomous Data Science: A CBR-Augmented R&D-Agent with a Locally Deployable Small Language Model

面向自主数据科学的持久化案例记忆:一种CBR增强的R&D-Agent与本地可部署的小语言模型

Felix Stocker

专题命中 长上下文与记忆 :language model(title,abstract);small language model(title,abstract);SLM(abstract_cn)

AI总结 本文提出一种CBR增强的R&D-Agent,通过持久化案例库和小语言模型Gemma 4 31B Dense,在Kaggle竞赛中实现方向性精度提升和方差降低。

Comments 14 pages, 8 figures, 8 tables; preprint, not submitted to any venue; code available at https://github.com/stofe94/cbr-rd-agent

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.11683 2026-06-01 cs.LG cs.AI cs.CL 89%

Boundary-Guided Policy Optimization for Memory-efficient RL of Diffusion Large Language Models

边界引导策略优化:面向扩散大语言模型的内存高效强化学习

Nianyi Lin, Jiajie Zhang, Lei Hou, Juanzi Li

机构 * Tsinghua University(清华大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 针对扩散大语言模型中似然函数难以处理导致强化学习内存开销大的问题,提出边界引导策略优化(BGPO),通过构造满足线性和等价性的下界实现内存高效训练,在数学求解、代码生成和规划任务中显著优于现有方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28009 2026-05-28 cs.CL cs.AI cs.LG 89%

MemGuard: Preventing Memory Contamination in Long-Term Memory-Augmented Large Language Models

MemGuard:防止长期记忆增强型大语言模型中的记忆污染

Hyeonjeong Ha, Jeonghwan Kim, Cheng Qian, Jiayu Liu, William M. Campbell, Yue Wu, Yuji Zhang, Kathleen McKeown, Dilek Hakkani-Tur, Heng Ji

机构 * University of Illinois Urbana-Champaign(伊利诺伊大学厄巴纳-香槟分校) Columbia University(哥伦比亚大学) Capital One

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 提出MemGuard,一种类型感知的记忆框架,通过显式分配功能角色、维护类型隔离记忆间的关联并选择性组合必要类型的证据,防止异构记忆污染,提升记忆可靠性最高28.27%并减少检索token数最高5.8倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.17265 2026-05-13 cs.IR 89%

MemSearch-o1: Empowering Large Language Models with Reasoning-Aligned Memory Growth in Agentic Search

MemSearch-o1:通过基于推理的内存增长增强大语言模型的代理搜索

Sheng Zhang, Junyi Li, Yingyi Zhang, Pengyue Jia, Yichao Wang, Xiaowei Qian, Wenlin Zhang, Maolin Wang, Yong Liu, Xiangyu Zhao

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract_cn)

AI总结 MemSearch-o1通过基于推理的内存增长和回溯机制,解决代理搜索中的内存稀释问题,提升大语言模型的推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.07569 2026-05-11 cs.DC 89%

HexiSeq: Accommodating Long Context Training of LLMs over Heterogeneous Hardware

HexiSeq: 适配长上下文训练的LLM异构硬件支持

Yan Liang, Youhe Jiang, Ran Yan, Binhang Yuan, Wei Wang, Chuan Wu

专题命中 长上下文与记忆 :LLM(title_cn,summary_cn);large language model(abstract);language model(abstract)

AI总结 HexiSeq通过异构GPU集群的计算、内存和通信能力分配,实现非对称CP-HP分区,提升长上下文LLM训练吞吐量,实验显示在混合H100-A100和模拟集群中性能提升达1.11至1.72倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08875 2026-04-09 q-fin.GN 89%

Utilizing Pre-trained and Large Language Models for 10-K Items Segmentation

利用预训练和大语言模型进行10-K文件分段

Hsin-Min Lu, Yu-Tai Chien, Huan-Hsun Yen, Yen-Hsiu Chen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);prompting(abstract)

AI总结 本文提出两种先进分段方法,BERT4ItemSeg与GPT4ItemSeg,通过预训练模型与Bi-LSTM结合或大语言模型,提升10-K报告分段性能,核心指标达到宏F1值0.9825。

Comments Accepted for publication in the Journal of Information Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2604.05114 2026-04-08 cs.CL cs.AI cs.LG 89%

$π^2$: Structure-Originated Reasoning Data Improves Long-Context Reasoning Ability of Large Language Models

$π^2$:结构起源的推理数据提升大语言模型的长上下文推理能力

Quyet V. Do, Thinh Pham, Nguyen Nguyen, Sha Li, Pratibha Zunjare, Tu Vu

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 本文提出$π^2$方法,通过结构化数据生成高质量推理数据,提升大语言模型的长上下文推理能力,在四个基准测试中取得显著改进。

Comments Our structured analytical reasoning data, which originates from Wikipedia tables, significantly improves long-context reasoning capability of LLMs

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01154 2026-03-05 cs.CR 89%

vEcho: A Paradigm Shift from Vulnerability Verification to Proactive Discovery with Large Language Models

vEcho:从漏洞验证到大语言模型主动发现的范式转变

Mingcheng Jiang, Jiancheng Huang, Jiangfei Wang, Zhengzhu Xie, Nan Fang, Guang Cheng, Xiaoyan Hu, Hua Wu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 vEcho利用大语言模型主动发现漏洞,显著提升检测率并降低误报率,同时发现新的0日漏洞。

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01255 2026-01-28 cs.SE 89%

TestWeaver: Execution-aware, Feedback-driven Regression Testing Generation with Large Language Models

TestWeaver: 基于执行意识和反馈驱动的回归测试生成方法

Cuong Chi Le, Cuong Duc Van, Tung Duy Vu, Thai Minh Pham Vu, Hoang Nhat Phan, Huy Nhat Phan, Tien N. Nguyen

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 TestWeaver通过整合轻量级程序分析和针对性执行上下文,提升LLM在回归测试生成中的覆盖率和效率。

Comments Accepted in ICSE 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03356 2026-01-13 cs.CR 89%

From static to adaptive: immune memory-based jailbreak detection for large language models

从静态到适应性:基于免疫记忆的大型语言模型 jailbreak 检测

Jun Leng, Yu Liu, Litian Zhang, Ruihan Hu, Zhuting Fang, Xi Zhang

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 基于免疫记忆的框架,通过动态记忆更新和主动免疫机制,提升大型语言模型对 jailbreak 攻击的检测准确率至 94%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.19854 2025-12-30 cs.RO cs.HC 89%

Think, Act, Learn: A Framework for Autonomous Robotic Agents using Closed-Loop Large Language Models

思考、行动、学习:一种利用闭环大语言模型的自主机器人代理框架

Anjali R. Menon, Rohit K. Sharma, Priya Singh, Chengyu Wang, Aurora M. Ferreira, Mateja Novak

机构 * Dept. of Electronics & Comm. Eng.(电子与通信工程系) Government Engineering College(政府工程学院) Dept. of Electrical & Electronics Eng.(电气与电子工程系) Poornima College of Engineering(波奥尼玛工程学院) Dept. of Electronics & Telecom. Eng.(电子与电信工程系) Shivaji University College of Eng.(希瓦吉大学工程学院) Department of Computer Science(计算机科学系) San Francisco State University(旧金山州立大学) Dept. of Electrical Eng.(电气工程系) Instituto Federal do Maranhão(马里兰联邦学院) Dept. of Electrical & Computer Eng.(电气与计算机工程系) Technical University of Košice(科希丘夫技术大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出T-A-L框架,通过闭环大语言模型实现机器人自主学习与策略优化,显著提升复杂任务的成功率和泛化能力。

Comments 13 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.22657 2025-12-18 cs.CV cs.AI cs.CL cs.LG 89%

3DLLM-Mem: Long-Term Spatial-Temporal Memory for Embodied 3D Large Language Model

3DLLM-Mem: 长期空间-时间记忆用于具身3D大语言模型

Wenbo Hu, Yining Hong, Yanjun Wang, Leison Gao, Zibu Wei, Xingcheng Yao, Nanyun Peng, Yonatan Bitton, Idan Szpektor, Kai-Wei Chang

机构 * University of California, Los Angeles(加州大学洛杉矶分校)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 3DLLM-Mem通过引入动态内存管理和融合模型,提升LLMs在复杂3D环境中的长期空间-时间记忆推理与行动能力。

Comments demos at: https://3dllm-mem.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10506 2025-12-11 cs.SE 89%

SmartC2Rust: Iterative, Feedback-Driven C-to-Rust Translation via Large Language Models for Safety and Equivalence

SmartC2Rust: 基于大语言模型的迭代反馈驱动C到Rust翻译用于安全性和等价性

Momoko Shiraishi, Yinzhi Cao, Takahiro Shinagawa

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 SmartC2Rust通过迭代反馈机制利用大语言模型实现C到Rust的翻译,提升内存安全性和语义等价性。

Journal ref ICSE '26: Proceedings of the 48th International Conference on Software Engineering, April 12-18, 2026, Rio de Janeiro, Brazil

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01541 2025-12-02 cs.AR 89%

RoMe: Row Granularity Access Memory System for Large Language Models

RoMe:面向大语言模型的行粒度访问内存系统

Hwayong Nam, Seungmin Baek, Jumin Kim, Michael Jaemin Kim, Jung Ho Ahn

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 RoMe通过行粒度访问DRAM并移除冗余结构,简化内存调度并提升带宽,适用于大语言模型的高效内存系统。

Comments 15 pages, 14 figures, accepted at HPCA 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17194 2025-11-24 cs.CR 89%

Steering in the Shadows: Causal Amplification for Activation Space Attacks in Large Language Models

在阴影中引导:大型语言模型中激活空间攻击的因果放大

Zhiyuan Xu, Stanislav Abaimov, Joseph Gardiner, Sana Belguith

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

AI总结 本文提出通过因果放大效应,利用激活空间攻击实现对大型语言模型行为的可控引导,展示了其在安全性和有效性上的贡献。

Comments 31 pages, 5 figures, 9 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.24037 2025-11-17 cs.CR 89%

Automated Vulnerability Validation and Verification: A Large Language Model Approach

Alireza Lotfi, Charalampos Katsis, Elisa Bertino

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.17138 2025-10-23 q-bio.NC 89%

Analyzing Memory Effects in Large Language Models through the lens of Cognitive Psychology

Zhaoyang Cao, Lael Schooler, Reza Zafarani

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.00270 2025-09-19 physics.comp-ph physics.bio-ph 89%

Large Language Models as AI Agents for Digital Atoms and Molecules: Catalyzing a New Era in Computational Biophysics

Yijie Xia, Xiaohan Lin, Zicheng Ma, Jinyuan Hu, Yanheng Li, Zhaoxin Xie, Hao Li, Li Yang, Zhiqiang Zhao, Lijiang Yang, Zhenyu Chen, Yi Qin Gao

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 26 pages, 3 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01463 2025-09-03 cs.CR 89%

LLMHoney: A Real-Time SSH Honeypot with Large Language Model-Driven Dynamic Response Generation

Pranjay Malhotra

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments 7 Pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13413 2025-08-20 cs.HC cs.SE 89%

Large Language Models as Visualization Agents for Immersive Binary Reverse Engineering

Dennis Brown, Samuel Mulder

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted to IEEE VISSOFT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.16450 2025-06-23 cs.CV 89%

How Far Can Off-the-Shelf Multimodal Large Language Models Go in Online Episodic Memory Question Answering?

Giuseppe Lando, Rosario Forte, Giovanni Maria Farinella, Antonino Furnari

机构 * Department of Mathematics and Computer Science(数学与计算机科学系)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.08466 2025-06-10 cs.CV 89%

Weakly Supervised Temporal Action Localization via Dual-Prior Collaborative Learning Guided by Multimodal Large Language Models

Quan Zhang, Jinwei Fang, Rui Yuan, Xi Tang, Yuxin Qi, Ke Zhang, Chun Yuan

机构 * Tsinghua University(清华大学) University of Science and Technology of China(中国科学技术大学) Shanghai Jiao Tong University(上海交通大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);foundation model(abstract)

Comments Accepted to CVPR

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02252 2025-04-28 cs.CV 89%

StoryGPT-V: Large Language Models as Consistent Story Visualizers

Xiaoqian Shen, Mohamed Elhoseiny

机构 * KAUST(卡塞姆大学)

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

Comments Accepted to CVPR 2025; Project page: https://xiaoqian-shen.github.io/StoryGPT-V

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14845 2025-04-22 cs.IR 89%

Enhancing the Patent Matching Capability of Large Language Models via the Memory Graph

Qiushi Xiong, Zhipeng Xu, Zhenghao Liu, Mengjia Wang, Zulong Chen, Yue Sun, Yu Gu, Xiaohua Li, Ge Yu

专题命中 长上下文与记忆 :large language model(title,abstract);language model(title,abstract);LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.06214 2025-04-09 cs.CL cs.AI cs.LG 89%

From 128K to 4M: Efficient Training of Ultra-Long Context Large Language Models

Chejian Xu, Wei Ping, Peng Xu, Zihan Liu, Boxin Wang, Mohammad Shoeybi, Bo Li, Bryan Catanzaro

专题命中 长上下文与记忆 :large language model(title);language model(title);instruction tuning(abstract);pretraining(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏