arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

2025-12-01 至 2025-12-01 共收录 10 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 10 篇

2511.23319 2025-12-01 cs.CL cs.AI 85%

Every Token Counts: Generalizing 16M Ultra-Long Context in Large Language Models

每个token都重要:在大语言模型中推广1600万超长上下文

Xiang Hu, Zhanchao Zhou, Ruiqi Liang, Zehuan Li, Wei Wu, Jianguo Li

机构 * Ant Group(蚂蚁集团) Westlake University(西湖大学)

专题命中 长上下文与记忆 :large language model(title);language model(title);分类 cs.CL、cs.AI

AI总结 本文提出了一种新型的分层稀疏注意力机制,用于在大语言模型中实现对超长上下文的有效建模,并在多个任务中展示了其处理1600万长度上下文的能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22530 2025-12-01 cs.SE 85%

Boosting Pointer Analysis With LLM-Enhanced Allocation Function Detection

通过LLM增强的分配函数检测提升指针分析

Baijun Cheng, Kailong Wang, Ling Shi, Haoyu Wang, Peng Di, Ding Li, Xiangqun Chen, Yao Guo

专题命中 长上下文与记忆 :LLM(title,abstract);large language model(abstract);language model(abstract)

AI总结 本文提出CAFD技术,通过LLM增强的分配函数检测提升指针分析精度,有效识别CAFs并减少别名集大小,提升分析效率和准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23436 2025-12-01 cs.AI 77%

Towards Continuous Intelligence Growth: Self-Training, Continual Learning, and Dual-Scale Memory in SuperIntelliAgent

迈向持续智能增长:在SuperIntelliAgent中实现自我训练、持续学习和双尺度记忆

Jianzhe Lin, Zeyu Pan, Yun Zhu, Ruiqi Song, Jining Yang

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);preference optimization(abstract);分类 cs.AI

AI总结 SuperIntelliAgent通过自我训练和双尺度记忆实现持续智能增长,利用可训练学习者与推理验证者配对,提升偏好对齐和学习效果。

Comments 15 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.04388 2025-12-01 cs.CL 77%

More Documents, Same Length: Isolating the Challenge of Multiple Documents in RAG

更多文档,相同长度:隔离多文档在RAG中的挑战

Shahar Levy, Nir Mazor, Lihi Shalmon, Michael Hassid, Gabriel Stanovsky

机构 * School of Computer Science and Engineering(计算机科学与工程学院)

专题命中 长上下文与记忆 :LLM(abstract);large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现RAG中增加文档数量显著降低LLM性能,但Qwen2.5表现出更强的多文档处理能力。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21726 2025-12-01 cs.CL cs.AI cs.LG 75%

Goal-Directed Search Outperforms Goal-Agnostic Memory Compression in Long-Context Memory Tasks

目标导向搜索在长上下文记忆任务中优于目标无关的记忆压缩

Yicong Zheng, Kevin L. McKee, Thomas Miconi, Zacharie Bugaud, Mick van Gelderen, Jed McCaleb

机构 * Astera Institute(Astera研究所)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL、cs.AI、cs.LG

AI总结 SUMER通过目标导向搜索在长上下文记忆任务中超越传统记忆压缩方法,达到SOTA性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22729 2025-12-01 cs.AI cs.MA 70%

Solving Context Window Overflow in AI Agents

解决AI代理中的上下文窗口溢出

Anton Bulle Labate, Valesca Moura de Sousa, Sandro Rama Fiorini, Leonardo Guerreiro Azevedo, Raphael Melo Thiago, Viviane Torres da Silva

机构 * IBM Research(IBM研究院)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.AI

AI总结 本文提出了一种方法,使LLMs能够处理任意长度的工具响应,避免上下文窗口溢出问题,减少令牌使用并提升执行效率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.02789 2025-12-01 cs.CL 70%

Strong Memory, Weak Control: An Empirical Study of Executive Functioning in LLMs

强记忆,弱控制:对大语言模型执行功能的实证研究

Karin de Langis, Jong Inn Park, Bin Hu, Khanh Chi Le, Andreas Schramm, Michael C. Mensink, Andrew Elfenbein, Dongyeop Kang

机构 * Department of Computer Science and Engineering, University of Minnesota(计算机科学与工程系,明尼苏达大学) Department of Linguistics, Hamline University(语言学系,哈姆林大学) Department of Psychology, University of Wisconsin-Stout(心理学系,威斯尼斯托大学) Department of English, University of Minnesota(英语系,明尼苏达大学)

专题命中 长上下文与记忆 :large language model(abstract);language model(abstract);分类 cs.CL

AI总结 研究发现大语言模型在工作记忆方面表现优异,但执行功能和问题解决能力存在不足,提示需进一步改进注意力控制和认知灵活性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22030 2025-12-01 cs.LG 57%

Calibration-Free EEG-based Driver Drowsiness Detection with Online Test-Time Adaptation

无需校准的基于EEG的驾驶员困倦检测与在线测试时适应

Geun-Deok Jang, Dong-Kyun Han, Seo-Hyeon Park, Seong-Whan Lee

机构 * Department of Artificial Intelligence, Korea University(人工智能系,韩国大学) Department of Brain and Cognitive Engineering, Korea University(脑科学与认知工程系,韩国大学)

专题命中 长上下文与记忆 :prompting(abstract);分类 cs.LG

AI总结 本文提出一种无需校准的EEG困倦检测方法,通过在线测试时适应技术提升模型对不同主体的适应能力,实验表明其在非独立同分布场景中性能优越。

Comments 10 pages, Submitted to IEEE Transactions on Human-Machine Systems

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 57%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 长上下文与记忆 :language model(abstract);分类 cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22850 2025-12-01 cs.CV 50%

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

解决证据稀疏性:面向长文档理解的代理情境工程

Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 长上下文与记忆 :language model(abstract)

AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏