arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 285 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 285 篇

2607.08448 2026-07-16 cs.RO 版本更新 50%

Harness VLA: Steering Frozen VLAs into Reliable Manipulation Primitives via Memory-Guided Agents

利用VLA:通过记忆引导智能体将冻结的视觉语言动作模型转化为可靠的操作原语

Yixian Zhang, Huanming Zhang, Feng Gao, Xiao Li, Zhihao Liu, Chunyang Zhu, Jiaxing Qiu, Yuchen Yan, Jiyuan Liu, Wenhao Tang, Zhengru Fang, Yi Nie, Changxu Wei, Yu Wang, Wenbo Ding, Chao Yu

机构 * Tsinghua University(清华大学) Striding AI(驰行人工智能公司) Purdue University(普渡大学) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) Infinigence AI(英飞智研人工智能公司) Zhongguancun Academy(中关村学院) Hong Kong University of Science and Technology(香港科技大学)

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 研究语言条件下操作问题,提出Harness VLA框架,将冻结VLA与分析原语库结合,通过学习操作范围扩展预训练VLA,在多种扰动操作任务中相比基线有大幅提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21309 2026-07-13 cs.CV 版本更新 50%

Test-Time Adaptation via Cache Personalization for Facial Expression Recognition in Videos

基于缓存个性化的时间测试适应用于视频面部表情识别

Masoumeh Sharafi, Muhammad Osama Zeeshan, Soufiane Belharbi, Alessandro Lameiras Koerich, Marco Pedersoli, Eric Granger

机构 * LIVIA, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA系统工程系,蒙特利尔工程学院,加拿大) LIVIA, Dept. of Software and IT Engineering, ETS Montreal, Canada(LIVIA软件与信息工程系,蒙特利尔工程学院,加拿大)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出TTA-CaP方法,通过缓存实现高效视频面部表情识别的模型个性化,减少计算开销并提升跨主体和环境变化的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.13744 2026-07-13 math.ST stat.TH 版本更新 50%

A Note on k-NN Gating in RAG

关于检索增强生成(RAG)中k近邻门控的一个注释

Gérard Biau, Claire Boyer

专题命中 长上下文与记忆 :language model(abstract)

AI总结 为检索增强生成(RAG)提出统计代理框架,推导出最优查询级门控,通过检索不一致性分析幻觉并建模查询-内存不匹配,还进行了数值验证。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20644 2026-07-10 cs.CV 版本更新 50%

Vision-Language Memory for Spatial Reasoning

用于空间推理的视觉语言记忆

Zuntao Liu, Yi Du, Taimeng Fu, Shaoshu Su, Cherie Ho, Chen Wang

专题命中 长上下文与记忆 :language model(abstract)

AI总结 研究针对当前视觉语言模型在视频空间推理中未达人类水平的问题,提出VLM²,通过双记忆模块,即工作记忆和情景记忆,实现固定成本下的高效空间推理,在多基准测试中取得最优性能,推动视觉空间智能发展。

Comments Accepted to European Conference on Computer Vision (ECCV), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.27318 2026-07-07 cs.CV 版本更新 50%

Q-GeoMem: Question-Guided Geometric Memory for Video Spatial Reasoning

Q-GeoMem:面向视频空间推理的问题引导几何记忆

Xianqiang Gao, Qizhi Chen, Delin Qu, Haoming Song, Zhigang Wang, Bin Zhao, Dong Wang, Xuelong Li

机构 * University of Science and Technology of China(中国科学技术大学) Shanghai AI Lab(上海人工智能实验室) Northwestern Polytechnical University(西北工业大学) TeleAI

专题命中 长上下文与记忆 :language model(abstract)

AI总结 提出Q-GeoMem框架,通过问题引导的几何记忆机制,结合细粒度上下文库和语义几何证据库,在视频空间推理任务中实现最先进性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15706 2026-07-07 cs.CV 版本更新 50%

RoMa v2: Harder Better Faster Denser Feature Matching

RoMa v2:更优更快更密集的特征匹配

Johan Edstedt, David Nordström, Yushan Zhang, Georg Bökman, Jonathan Astermark, Viktor Larsson, Anders Heyden, Fredrik Kahl, Mårten Wadenbäck, Michael Felsberg

机构 * Linköping University(_linköping大学) Chalmers University of Technology(_chalmers技术大学) University of Amsterdam(_阿姆斯特丹大学) Centre for Mathematical Sciences, Lund University(_数学科学中心,吕勒奥大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 研究针对现有密集匹配器在复杂场景中表现不佳及高精度模型慢等弱点,通过系列改进构建新架构与损失函数,采用解耦管道加速训练、减少内存使用,利用基础模型提升鲁棒性,新匹配器达新的技术水平。

Comments ECCV 2026 camera ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.11330 2026-07-07 physics.optics 版本更新 50%

Quantitative Decomposition of Speckle Decorrelation for Inverse Problems in Complex Wave Scattering

复波散射反问题中散斑去相关的定量分解

Qihang Zhang, Haoyu Yue, Ninghe Liu, Danlin Xu, Renjie Zhou, Liangcai Cao, George Barbastathis

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 研究复波散射反问题,揭示反向散射去相关可量化为两项,分别源于表面和体积散射,通过实验验证理论预测,为反问题提供先进正向模型并举例验证。

Comments 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06845 2026-07-01 cs.CV 版本更新 50%

PA-VAD: Diffusion-Based Pseudo-Only Video Anomaly Detection via Domain-Aligned Memory Updates

PA-VAD: 基于扩散的伪异常视频异常检测通过域对齐记忆更新

Satoshi Hashimoto, Yanan Wang, Hitoshi Nishimura, Mori Kurokawa

机构 * KDDI Research, Inc.(KDDI研究所)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 提出PA-VAD框架,仅用真实正常视频和扩散合成伪异常视频训练检测器,通过域对齐正则化模块(DARM)消除伪异常特征偏差,在多个基准上超越使用真实异常视频的方法。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04560 2026-06-24 cs.RO 版本更新 50%

From Local Corrections to Generalized Skills: Improving Neuro-Symbolic Policies with MEMO

从局部修正到通用技能:利用MEMO改进神经符号策略

Benjamin A. Christie, Yinlong Dai, Mohammad Bararjanianbahnamiri, Simon Stepputtis, Dylan P. Losey

机构 * Collab Dept. of Mechanical Engineering, Virginia Tech, Blacksburg, USA.(机械工程系,弗吉尼亚理工学院,黑斯堡,美国) TEA Lab(TEA实验室)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 针对机器人神经符号策略中技能不足的问题,提出MEMO框架,通过收集、聚类和改写多用户自然语言修正,构建检索增强的技能手册,动态扩展技能库,实现新任务泛化。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07690 2026-06-23 cs.CV 版本更新 50%

FrameVGGT: Coherence-Preserving Memory for Bounded Streaming Geometry

FrameVGGT:几何对齐的帧级内存用于有界流式VGGT

Zhisong Xu, Takeshi Oishi

机构 * Institute of Industrial Science(工业科学研究所) The University of Tokyo(东京大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 FrameVGGT从几何支持角度重新审视有界内存流式处理,通过组织帧级增量KV贡献为连贯段,实现稳定几何支持与内存平衡。

Comments 23pages including appendix checklist

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.07236 2026-06-19 cs.CV 版本更新 50%

HY-WU (Part I): An Extensible Functional Neural Memory Framework and An Instantiation in Text-Guided Image Editing

HY-WU (第一部分): 一种可扩展的功能性神经记忆框架及其在文本引导图像编辑中的应用

Mengxuan Wu, Xuanlei Zhao, Ziqiao Wang, Ruicheng Feng, Zhangyang Wang, Kai Wang

机构 * Tencent HY Team(腾讯 HY 团队)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 提出HY-WU框架,通过功能性神经记忆模块即时生成实例特定权重更新,避免共享权重覆盖导致的干扰,解决持续学习与个性化中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.01621 2026-06-12 cs.CV cs.RO 版本更新 50%

Goal2Pixel: Grounding Goals to Pixels for Vision-Language Navigation

Goal2Pixel: 将目标锚定到像素以实现视觉语言导航

Muyi Bao, Yuxin Cai, Hang Xu, Zongtai Li, Jinxi He, Jingfan Tang, Chen Lv, Ji Zhang, Yaqi Xie, Wenshan Wang

机构 * Carnegie Mellon University(卡内基梅隆大学) Nanyang Technological University(南洋理工大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 提出Goal2Pixel范式,通过将连续环境中的视觉语言导航(VLN-CE)重新定义为可导航像素锚定,利用图像平面作为统一空间接口,预测可见导航像素并反投影为3D航点,结合可见性感知关键帧记忆和坐标感知辅助损失,在减少VLM调用次数的同时实现竞争性性能。

Comments 8 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17221 2026-06-12 cs.CV cs.RO 版本更新 50%

QueryOcc: Query-based Self-Supervision for 3D Semantic Occupancy

QueryOcc:基于查询的3D语义占据自监督方法

Adam Lilja, Ji Lan, Junsheng Fu, Lars Hammarstrand

机构 * Chalmers University of Technology(查尔姆斯理工大学) Zenseact

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 提出QueryOcc,一种基于查询的自监督框架,通过相邻帧的4D时空查询直接学习连续3D语义占据,利用视觉基础模型或激光雷达数据提供监督,并引入收缩场景表示以在恒定内存下实现远程监督,在Occ3D-nuScenes基准上语义RayIoU提升26%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.22815 2026-06-12 cs.HC 版本更新 50%

Memory as a Service (MaaS): Purpose-Bound Memory Mediation for Cooperative Agents

记忆即服务 (MaaS):面向合作智能体的目的绑定记忆中介

Haichang Li

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 提出记忆即服务 (MaaS) 框架,通过目的绑定的记忆中介机制,在合作编程智能体间平衡记忆共享效用与隐私泄露风险,实验表明现有检索方法存在严重隐私泄露。

Comments Accepted to the KDD 2026 Workshop on Agentic Software Engineering (AgenticSE @ KDD 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08081 2026-06-09 cs.AR 版本更新 50%

Investigating Energy Bounds of Analog Compute-in-Memory with Local Normalization

局部归一化的模拟存内计算的能量界研究

Brian Rojkov, Shubham Ranjan, Derek Wright, Manoj Sachdev

专题命中 长上下文与记忆 :LLM(abstract_cn)

AI总结 针对模拟存内计算中动态范围导致ADC能耗高的问题,提出增益范围MAC(GR-MAC)实现局部归一化,在35 dB SQNR下将输入动态范围提升4位而不增加能耗,并降低ADC分辨率需求1.5位。

详情

展开后加载摘要…

URL PDF HTML 收藏