arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2601.23211 2026-02-02 cs.MA 50%

Multi-Agent Systems Should be Treated as Principal-Agent Problems

多智能体系统应被视为委托-代理问题

Paulius Rauba, Simonas Cepenas, Mihaela van der Schaar

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出将多智能体系统视为委托-代理问题,探讨信息不对称和目标不一致对系统行为的影响,并通过谋略现象分析其缓解策略。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.22630 2026-02-02 cs.CV 50%

LINA: Linear Autoregressive Image Generative Models with Continuous Tokens

LINA: 基于连续令牌的线性自回归图像生成模型

Jiahao Wang, Ting Pan, Haoge Deng, Dongchen Han, Taiqiang Wu, Xinlong Wang, Ping Luo

机构 * The University of Hong Kong(香港大学) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing Academy of Artificial Intelligence(北京人工智能研究院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 LINA是一种基于线性注意力的高效文本到图像生成模型,通过改进归一化和门控机制,在计算效率和生成质量上取得平衡。

Comments 20 pages, 9 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01774 2026-01-30 cs.CV 50%

Evaluating SAM2 for Video Semantic Segmentation

评估SAM2用于视频语义分割

Syed Hesham Syed Ariff, Yun Liu, Guolei Sun, Jing Yang, Henghui Ding, Xue Geng, Xudong Jiang

机构 * School of EEE(电子工程系) Nanyang Technological University(南洋理工大学) Institute for Infocomm Research(信息通信研究所) A*STAR College of Computer Science(计算机科学学院) Nankai University(南开大学) State Key Laboratory of Public Big Data(公共大数据国家重点实验室) Guizhou University(贵州大学) Fudan Vision and Learning Lab(复旦大学视觉与学习实验室)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文评估了SAM2在视频语义分割中的应用,通过两种方法提升分割性能,利用SAM2的精确边界预测增强整体效果。

Comments 17 pages, 3 figures and 7 tables

Journal ref Machine Intelligence Research (2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16872 2026-01-27 cs.IR 50%

From Atom to Community: Structured and Evolving Agent Memory for User Behavior Modeling

从原子到社区:结构化和演化的代理记忆用于用户行为建模

Yuxin Liao, Le Wu, Min Hou, Yu Wang, Han Wu, Meng Wang

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 STEAM通过结构化和演化的代理记忆框架,提升用户行为建模的准确性与多样性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.16973 2026-01-26 cs.CV 50%

VisGym: Diverse, Customizable, Scalable Environments for Multimodal Agents

VisGym: 多模态代理的多样化、可定制化、可扩展环境

Zirui Wang, Junyi Zhang, Jiaxin Ge, Long Lian, Letian Fu, Lisa Dunlap, Ken Goldberg, XuDong Wang, Ion Stoica, David M. Chan, Sewon Min, Joseph E. Gonzalez

专题命中 长上下文与记忆 :language model(abstract)

AI总结 VisGym通过多样化环境评估多模态代理在多步视觉决策中的表现,揭示模型在长上下文处理和视觉化任务中的局限性。

Comments Project page: https://visgym.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.10253 2026-01-16 cs.HC cs.SE 50%

Developer Interaction Patterns with Proactive AI: A Five-Day Field Study

开发者与前瞻性AI的交互模式:一项为期五天的实地研究

Nadine Kuo, Agnia Sergeyuk, Valerie Chen, Maliheh Izadi

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本研究通过五天实地观察,揭示开发者对前瞻性AI建议的接受模式,发现干预时机和上下文对使用效果有显著影响。

Comments 14 pages, 6 figures, accepted to IUI'26

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09663 2026-01-15 cs.CV 50%

Self-Supervised Animal Identification for Long Videos

长时间视频中的自监督动物识别

Xuyang Fang, Sion Hannuna, Edwin Simpson, Neill Campbell

机构 * University of Bristol(布里斯托大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本研究提出了一种高效的自监督方法,通过全局聚类任务实现长时间视频中动物个体的高精度识别,准确率超过97%,且内存消耗低,适用于资源受限环境。

Comments 11 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.05246 2026-01-09 cs.CV 50%

Pixel-Perfect Visual Geometry Estimation

像素级视觉几何估计

Gangwei Xu, Haotong Lin, Hongcheng Luo, Haiyang Sun, Bing Wang, Guang Chen, Sida Peng, Hangjun Ye, Xin Yang

机构 * School of Electronic Information and Communications, Huazhong University of Science and Technology(华中科技大学电子信息与通信学院) College of Computer Science and Technology, Zhejiang University(浙江大学计算机科学与技术学院) Xiaomi EV(小米电动车)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出像素级视觉几何模型,通过生成建模技术实现高质量无飞像素点云,提升单目和视频深度估计的性能和准确性。

Comments Code: https://github.com/gangweix/pixel-perfect-depth

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.07554 2026-01-06 cs.IR 50%

A Multi-Task Embedder For Retrieval Augmented LLMs

为检索增强型大语言模型提供多任务嵌入器

Peitian Zhang, Shitao Xiao, Zheng Liu, Zhicheng Dou, Jian-Yun Nie

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 LLM-Embedder通过引入排名感知奖励和分级蒸馏,统一多任务检索增强,提升大语言模型在多种下游任务中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.24637 2026-01-05 cs.OS 50%

Towards Fully-fledged GPU Multitasking via Proactive Memory Scheduling

通过主动内存调度实现全面的GPU多任务处理

Weihang Shen, Yinqiu Chen, Rong Chen, Haibo Chen

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 MSched通过主动内存调度技术,提升GPU多任务处理效率,显著减少页面故障,优化内存使用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.22624 2025-12-30 cs.CV 50%

Rethinking Memory Design in SAM-Based Visual Object Tracking

重新思考基于SAM的视觉目标跟踪中的记忆设计

Mohamad Alansari, Muzammal Naseer, Hasan Al Marzouqi, Naoufel Werghi, Sajid Javed

机构 * Department of Computer Science, Khalifa University(计算机科学系,卡利法大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出了一种统一的混合记忆框架,通过分解记忆为短期外观记忆和长期干扰解决记忆,提升基于SAM的视觉目标跟踪在复杂场景下的鲁棒性。

Comments \textbf{This is a preprint. Some results are being finalized and may be updated in a future revision.}

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.19090 2025-12-23 cs.SD eess.AS 50%

JoyVoice: Long-Context Conditioning for Anthropomorphic Multi-Speaker Conversational Synthesis

JoyVoice: 长上下文条件生成用于拟人化多说话人对话合成

Fan Yu, Tao Wang, You Wu, Lin Zhu, Wei Deng, Weisheng Han, Wenchao Wang, Lin Hu, Xiangyu Liang, Xiaodong He, Yankun Huang, Yu Gu, Yuan Liu, Yuxuan Wang, Zhangyu Xiao, Ziteng Wang, Boya Dong, Feng Dang, Jinming Chen, Jingdong Li, Jun Wang, Yechen Jin, Yuan Zhang, Zhengyan Sheng, Xin Wang

机构 * SpeechTeam(语音团队)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 JoyVoice通过统一的E2E-Transformer-DiT架构实现多说话人长对话合成,取得多语言生成和零样本语音克隆的先进成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.16285 2025-12-19 cs.HC 50%

Machines, AI and the past//future of things

机器、人工智能与事物的过去//未来

Karola Köpferl, Albrecht Kurze

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过重新激活1980年代东德打字机,探讨人工智能与历史技术的交互,挑战进步叙事,强调慢速与物质性在设计中的价值。

Comments State of Responsible Technology 2025 - Generative Things. pp 13-19. Stichting ThingsCon Amsterdam

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.15309 2025-12-19 cs.RO 50%

DynamicGSG: Dynamic 3D Gaussian Scene Graphs for Environment Adaptation

DynamicGSG: 动态3D高斯场景图用于环境适应

Luzhou Ge, Xiangyu Zhu, Zhuo Yang, Xuesong Li

机构 * School of Computer Science, Beijing Institute of Technology, China(计算机学院,北京理工大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 DynamicGSG通过动态高斯场景图实现环境适应,利用高斯溅射技术构建层次化场景图,提升环境理解和适应能力。

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.14313 2025-12-17 cs.IR 50%

Dynamic Context Selection for Retrieval-Augmented Generation: Mitigating Distractors and Positional Bias

动态上下文选择用于检索增强生成:缓解干扰项和位置偏差

Malika Iratni, Mohand Boughanem, Taoufiq Dkaki

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出动态上下文选择方法,通过优化检索文档数量和位置以提升RAG生成质量。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04540 2025-12-17 cs.CV 50%

VideoMem: Enhancing Ultra-Long Video Understanding via Adaptive Memory Management

VideoMem: 通过自适应内存管理增强超长视频理解

Hongbo Jin, Qingyuan Wang, Wenhao Zhang, Yang Liu, Sijie Cheng

机构 * School of Electronic and Computer Engineering, Peking University(电子与计算机工程学院,北京大学) Department of Computer Science and Technology, Tsinghua University(计算机科学与技术系,清华大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 VideoMem通过自适应内存管理框架,有效提升超长视频理解任务的性能,采用PRPO算法和两个核心模块实现高效训练和长期记忆保留。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08648 2025-12-16 cs.CV 50%

Repulsor: Accelerating Generative Modeling with a Contrastive Memory Bank

Repulsor:利用对比记忆库加速生成建模

Shaofeng Zhang, Xuanqi Chen, Ning Liao, Haoxiang Zhao, Xiaoxing Wang, Haoru Tan, Sitong Wu, Xiaosong Jia, Qi Fan, Junchi Yan

机构 * School of Artificial Intelligence and Data Science, University of Science and Technology of China(人工智能与数据科学学院,中国科学技术大学) Shanghai Jiao Tong University(上海交通大学) HKU(香港大学) CUHK(香港大学) Fudan University(复旦大学) Nanjing University(南京大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 Repulsor通过对比记忆库机制,无需外部编码器,实现高效的生成建模,显著提升收敛速度和生成质量。

Comments 19 pages, 19 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07128 2025-12-16 cs.CV 50%

MulCLIP: A Multi-level Alignment Framework for Enhancing Fine-grained Long-context CLIP

MulCLIP: 一种多级对齐框架,用于增强细粒度长上下文CLIP

Chau Truong, Hieu Ta Quang, Dung D. Le

机构 * FPT Software AI Center(FPT软件人工智能中心) VinUniversity(文大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 MulCLIP通过多级对齐框架提升细粒度长上下文CLIP的性能,采用标记重建和子描述聚合策略增强语义连接与上下文提取。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.20991 2025-12-16 cs.CV 50%

MR-COSMO: Visual-Text Memory Recall and Direct CrOSs-MOdal Alignment Method for Query-Driven 3D Segmentation

MR-COSMO:一种用于查询驱动3D分割的视觉-文本记忆召回与直接跨模态对齐方法

Chade Li, Pengju Zhang, Yihong Wu

专题命中 长上下文与记忆 :language model(abstract)

AI总结 MR-COSMO通过视觉-文本记忆召回与直接跨模态对齐方法,在查询驱动的3D分割中实现几何与语义特征的精确融合,提升点云分割性能。

Comments Accepted by AAAI 2026. Copyright (c) 2026, Association for the Advancement of Artificial Intelligence (www.aaai.org). All rights reserved

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.00843 2025-12-09 cs.CV 50%

VLM-Assisted Continual learning for Visual Question Answering in Self-Driving

基于视觉语言模型的持续学习用于自动驾驶中的视觉问答

Yuxin Lin, Mengshi Qi, Liang Liu, Huadong Ma

机构 * State Key Laboratory of Networking and Switching Technology(网络与交换技术国家重点实验室) Beijing University of Posts and Telecommunications(北京邮电大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出结合视觉语言模型与持续学习的方法,以提升自动驾驶中视觉问答系统的性能和可靠性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.14257 2025-12-08 cs.SE 50%

C2SaferRust: Transforming C Projects into Safer Rust with NeuroSymbolic Techniques

C2SaferRust:利用神经符号技术将C项目转化为更安全的Rust

Vikram Nitin, Rahul Krishna, Luiz Lemos do Valle, Baishakhi Ray

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 C2SaferRust结合规则系统和LLMs,将C代码转换为更安全的Rust,减少指针和unsafe代码,提升安全性与性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.04515 2025-12-05 cs.CV 50%

EgoLCD: Egocentric Video Generation with Long Context Diffusion

EgoLCD:基于长上下文扩散的自体视频生成

Liuzhou Zhang, Jiarui Ye, Yuanlei Wang, Ming Zhong, Mingju Cao, Wanke Xia, Bowen Zeng, Zeyu Zhang, Hao Tang

机构 * Peking University(北京大学) Sun Yat-sen University(中山大学) Zhejiang University(浙江大学) Chinese Academy of Sciences(中国科学院) Tsinghua University(清华大学)

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 EgoLCD通过结合长时稀疏KV缓存和LoRA扩展的注意力机制,实现了高效稳定的自体长上下文视频生成,提升了感知质量和时间一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05661 2025-12-04 cs.CV 50%

Language-Driven Object-Oriented Two-Stage Method for Scene Graph Anticipation

基于语言的面向对象两阶段方法用于场景图预见

Xiaomeng Zhu, Changwei Wang, Haozhe Wang, Xinyu Liu, Fangzhen Lin

机构 * Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(计算机科学与工程系,香港科学与技术大学) Key Laboratory of Computing Power Network and Information Security, Ministry of Education, Shandong Computer Science Center, Qilu University of Technology(计算能力网络与信息安全重点实验室,教育部,山东计算机科学中心,齐鲁大学) Academy of Interdisciplinary Studies, The Hong Kong University of Science and Technology(跨学科研究学院,香港科学与技术大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出基于语言的面向对象两阶段方法,通过时间一致性正则化预测对象集动态和关系轨迹,显著提升视频场景图预见性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11165 2025-12-02 cs.CV 50%

Explainable Deep Convolutional Multi-Type Anomaly Detection

可解释的深度卷积多类型异常检测

Alex George, Lyudmila Mihaylova, Sean Anderson

机构 * School of Electrical and Electronic Engineering(电子工程学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出 MultiTypeFCDD 框架,通过图像级别标签生成多通道热图,实现多类型异常检测,有效解决传统方法的计算和内存限制问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22850 2025-12-01 cs.CV 50%

Resolving Evidence Sparsity: Agentic Context Engineering for Long-Document Understanding

解决证据稀疏性:面向长文档理解的代理情境工程

Keliang Liu, Zizhi Chen, Mingcheng Li, Jingqun Tang, Dingkang Yang, Lihua Zhang

专题命中 长上下文与记忆 :language model(abstract)

AI总结 SLEUTH通过多代理框架解决长文档理解中的证据稀疏问题,提升多模态文档处理性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18386 2025-11-25 cs.CV 50%

SegSplat: Feed-forward Gaussian Splatting and Open-Set Semantic Segmentation

SegSplat: 用于快速前馈3D重建与丰富开放词汇语义理解的框架

Peter Siegel, Federico Tombari, Marc Pollefeys, Daniel Barath

机构 * ETH Zürich(苏黎世联邦理工学院) Google(谷歌) Microsoft(微软)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 SegSplat通过单次传递实现高效3D重建与开放集语义分割,无需每场景优化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14004 2025-11-24 cs.RO 50%

Searching in Space and Time: Unified Memory-Action Loops for Open-World Object Retrieval

在空间和时间中搜索:统一的记忆-动作循环用于开放世界物体检索

Taijing Chen, Sateesh Kumar, Junhong Xu, Georgios Pavlakos, Joydeep Biswas, Roberto Martín-Martín

机构 * Department of Computer Science, The University of Texas at Austin(计算机科学系,德克萨斯大学奥斯汀分校)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 STAR框架通过统一记忆查询和具身动作,提升开放世界中时空物体检索的效率与准确性。

Comments https://amrl.cs.utexas.edu/STAR/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.08521 2025-11-12 cs.CV 50%

UniVA: Universal Video Agent towards Open-Source Next-Generation Video Generalist

Zhengyang Liang, Daoan Zhang, Huichi Zhou, Rui Huang, Bobo Li, Yuechen Zhang, Shengqiong Wu, Xiaohan Wang, Jiebo Luo, Lizi Liao, Hao Fei

机构 * Singapore Management University(新加坡管理大学) University of Rochester(罗切斯特大学) University College London(伦敦大学学院) National University of Singapore(新加坡国立大学) The Chinese University of Hong Kong(香港中文大学) Stanford University(斯坦福大学)

专题命中 长上下文与记忆 :language model(abstract)

Comments Technical Report. 24 figures, 37 pages. Website: https://univa.online/

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02609 2025-11-12 cs.SE 50%

RedCodeAgent: Automatic Red-teaming Agent against Diverse Code Agents

Chengquan Guo, Chulin Xie, Yu Yang, Zhaorun Chen, Zinan Lin, Xander Davies, Yarin Gal, Dawn Song, Bo Li

专题命中 长上下文与记忆 :LLM(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.04595 2025-11-07 cs.CV 50%

UniSplat: Unified Spatio-Temporal Fusion via 3D Latent Scaffolds for Dynamic Driving Scene Reconstruction

Chen Shi, Shaoshuai Shi, Xiaoyang Lyu, Chunyang Liu, Kehua Sheng, Bo Zhang, Li Jiang

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Voyager Research, Didi Chuxing The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :foundation model(abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏