arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

语言大模型 / LLM

大语言模型、预训练、指令微调、后训练和语言模型应用。

共收录 4789 信号源:cs.CL, cs.AI, cs.LG

1. 长上下文与记忆 4789 篇

2603.19137 2026-03-20 cs.CV cs.RO 50%

GSMem: 3D Gaussian Splatting as Persistent Spatial Memory for Zero-Shot Embodied Exploration and Reasoning

GSMem: 3D高斯溅射作为持久空间记忆用于零样本具身探索与推理

Yiren Lu, Yi Du, Disheng Liu, Yunlai Zhou, Chen Wang, Yu Yin

机构 * Case Western Reserve University(凯斯西储大学) Spatial AI & Robotics (SAIR) Lab, University at Buffalo(布法罗大学空间人工智能与机器人实验室)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出GSMem框架,利用3D高斯溅射构建持久空间记忆,解决具身探索中空间知识遗忘问题,通过检索机制与混合探索策略提升视觉语言模型推理效果。

Comments Project page at https://vulab-ai.github.io/GSMem/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.09513 2026-03-19 cs.RO 50%

Beyond Short-Horizon: VQ-Memory for Robust Long-Horizon Manipulation in Non-Markovian Simulation Benchmarks

超越短时间 horizon:VQ-记忆用于非马尔可夫仿真基准中的鲁棒长时间 manipulation

Honghui Wang, Zhi Jing, Jicong Ao, Shiji Song, Xuelong Li, Gao Huang, Chenjia Bai

机构 * Tsinghua University(清华大学) Fudan University(复旦大学) Institute of Artificial Intelligence (TeleAI)(人工智能研究院(TeleAI))

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出 RuleSafe 基准,通过 LLM 辅助仿真框架构建非马尔可夫任务,引入 VQ-Memory 以提升长时间规划和泛化能力。

Comments 9 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00512 2026-03-18 cs.CV 50%

Wavelet-based Frame Selection by Detecting Semantic Boundary for Long Video Understanding

基于语义边界的小波帧选择用于长视频理解

Wang Chen, Yuhui Zeng, Yongdong Luo, Tianyu Xie, Luojun Lin, Jiayi Ji, Yan Zhang, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出WFS-SB方法,通过小波变换检测语义边界,提升长视频中大视觉语言模型的性能,实验显示在多个基准上均优于现有方法。

Comments Accepted at CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.16443 2026-03-17 cs.CV 50%

VGGT-Long: Chunk it, Loop it, Align it -- Pushing VGGT's Limits on Kilometer-scale Long RGB Sequences

VGGT-Long:分块、循环、对齐——在千米级长RGB序列上推动VGGT的极限

Kai Deng, Zexin Ti, Jiawei Xu, Jian Yang, Jin Xie

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出VGGT-Long,通过分块处理、重叠对齐和轻量循环闭合优化,解决现有模型的可扩展性瓶颈,实现千米级户外环境的单目3D重建。

Comments IEEE International Conference on Robotics & Automation (ICRA 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14002 2026-03-17 cs.HC cs.SD 50%

LightBeam: An Accurate and Memory-Efficient CTC Decoder for Speech Neuroprostheses

LightBeam: 一种准确且内存高效的CTC解码器用于语音神经假体

Ebrahim Feghhi, Junlin Hu, Nima Hadidi, Jonathan C. Kao

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出LightBeam,一种无需WFST的CTC解码器,仅需10GB内存即可在Brain-to-Text'24和'25基准上实现最佳性能,通过延迟融合集成LLM,无需大N-gram语言模型。

Comments 4 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12759 2026-03-16 cs.CV 50%

SAP: Segment Any 4K Panorama

SAP: 4K全景任意分割

Lutao Jiang, Zidong Cao, Weikai Chen, Xu Zheng, Yuanhuiyi Lyu, Zhenyang Li, Zeyu HU, Yingda Yin, Keyang Luo, Runze Zhang, Kai Yan, Shengju Qian, Haidi Fan, Yifan Peng, Xin Wang, Hui Xiong, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology (Guangzhou)(香港科技大学(广州)) LIGHTSPEED The Hong Kong University of Science and Technology(香港科技大学) The University of Hong Kong(香港大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出SAP模型,通过将全景分割转化为固定轨迹视角视频分割,实现4K高分辨率全景实例分割,合成183440张4K全景图像并提升零样本mIoU性能。

Comments Project Page: https://lutao2021.github.io/SAP_Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.12608 2026-03-16 cs.IR cs.HC 50%

InterDeepResearch: Enabling Human-Agent Collaborative Information Seeking through Interactive Deep Research

InterDeepResearch:通过交互式深度研究实现人机协作的信息检索

Bo Pan, Lunke Pan, Yitao Zhou, Qi Jiang, Zhen Wen, Minfeng Zhu, Wei Chen

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出InterDeepResearch系统,通过交互式深度研究框架提升人机协作信息检索效率,实验证明其在性能和用户研究支持方面具有竞争力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11073 2026-03-13 cs.SE 50%

Context Before Code: An Experience Report on Vibe Coding in Practice

上下文在代码之前:关于在实践中使用Vibe编码的经验报告

Md Nasir Uddin Shuvo, Md Aidul Islam, Md Mahade Hasan, Muhammad Waseem, Pekka Abrahamsson

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 本文报告了一个全栈团队在实践中应用Vibe编码构建多项目代理学习平台和学术检索增强生成系统,并探讨了生成代码在隔离约束和架构设计上的不足。

Comments 6 Pages, 1 Figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10747 2026-03-12 cs.DB 50%

Pneuma-Seeker: A Relational Reification Mechanism to Align AI Agents with Human Work over Relational Data

Pneuma-Seeker: 一种关系重构机制,用于将AI代理与关系数据上的人类工作对齐

Muhammad Imam Luthfi Balaka, John Hillesland, Kemal Badur, Raul Castro Fernandez

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 Pneuma-Seeker通过关系重构机制,将AI代理与人类工作对齐,提升数据处理的准确性和可信赖性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.10231 2026-03-12 cs.CV 50%

OilSAM2: Memory-Augmented SAM2 for Scalable SAR Oil Spill Detection

OilSAM2: 用于可扩展SAR油污检测的内存增强型SAM2

Shuaiyu Chen, Ming Yin, Peng Ren, Chunbo Luo, Zeyu Fu

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 OilSAM2通过引入分层特征感知多尺度内存库和结构语义一致的内存更新策略,实现了对无序SAR图像中油污的高效分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.04826 2026-03-06 cs.DC 50%

The Semantic Arrow of Time, Part V: The Leibniz Bridge -- Toward a Unified Theory of Semantic Time

时间的语义箭头,第五部分:莱布尼茨桥——语义时间的统一理论

Paul Borrill

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文通过构建莱布尼茨桥,提出一个连接哲学、协议工程和物理的统一框架,解决FITO系统中的分布式计算难题。

Comments 6 figures. Part V of V in "The Semantic Arrow of Time" series

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.04336 2026-03-05 cs.CV 50%

Building a Mind Palace: Structuring Environment-Grounded Semantic Graphs for Effective Long Video Analysis with LLMs

构建一个思维宫殿:为有效长视频分析构建基于环境的语义图谱

Zeyi Huang, Yuyang Ji, Xiaofang Wang, Nikhil Mehta, Tong Xiao, Donghyun Lee, Sigmund Vanvalkenburgh, Shengxin Zha, Bolin Lai, Yiqiu Ren, Licheng Yu, Ning Zhang, Yong Jae Lee, Miao Liu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Meta UIUC(伊利诺伊大学香槟分校)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 VideoMindPalace通过构建环境基础的语义图谱,提升长视频分析中空间-时间连贯性和类人推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26645 2026-03-04 cs.CV 50%

TTT3R: 3D Reconstruction as Test-Time Training

TTT3R: 3D重建作为测试时训练

Xingyu Chen, Yue Chen, Yuliang Xiu, Andreas Geiger, Anpei Chen

机构 * Zhejiang University(浙江大学) Westlake University(西湖大学) Uni of Tübingen, Tübingen AI Center(图宾根大学,图宾根人工智能中心)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 TTT3R通过测试时训练方法提升3D重建的长度泛化能力,实现全局姿态估计性能提升2倍,运行效率高且内存消耗低。

Comments Page: https://rover-xingyu.github.io/TTT3R/ Code: https://github.com/Inception3D/TTT3R

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20160 2026-03-03 cs.CV 50%

tttLRM: Test-Time Training for Long Context and Autoregressive 3D Reconstruction

tttLRM:面向长上下文和自回归3D重建的测试时间训练

Chen Wang, Hao Tan, Wang Yifan, Zhiqin Chen, Yuheng Liu, Kalyan Sunkavalli, Sai Bi, Lingjie Liu, Yiwei Hu

机构 * University of Pennsylvania(宾夕法尼亚大学) Adobe Research(Adobe 研究) UCI(加州大学欧文分校)

专题命中 长上下文与记忆 :pretraining(abstract)

AI总结 tttLRM通过测试时间训练实现长上下文自回归3D重建,提升重建质量和收敛速度。

Comments Accepted by CVPR 2026. Project Page: https://cwchenwang.github.io/tttLRM

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01813 2026-03-03 cs.RO 50%

SSMG-Nav: Enhancing Lifelong Object Navigation with Semantic Skeleton Memory Graph

SSMG-Nav: 通过语义骨架记忆图增强终身物体导航

Haochen Niu, Lantao Zhang, Xingwu Ji, Rendong Ying, Peilin Liu, Fei Wen

机构 * Brain-Inspired Application Technology Center (BATC), Shanghai Jiao Tong University(脑启发应用技术中心(BATC),上海交通大学)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 SSMG-Nav通过语义骨架记忆图提升终身物体导航,整合多模态信息与持久记忆,优化路径效率与任务成功率。

Comments Accepted by 2026 ICRA

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.02701 2026-03-03 stat.CO 50%

MPCR: Multi-Precision Computations Package in R

MPCR:R中的多精度计算包

Mary Lai O. Salvana, Sameh Abdulah, Minwoo Kim, David Helmy, Ying Sun, Marc G. Genton

专题命中 长上下文与记忆 :prompting(abstract)

AI总结 MPCR是R语言中用于支持16位、32位和64位精度计算的新包,旨在提升统计计算中的性能与精度平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00983 2026-03-03 cs.CV 50%

Event-Anchored Frame Selection for Effective Long-Video Understanding

基于事件的帧选择用于有效长视频理解

Wang Chen, Yongdong Luo, Yuhui Zeng, Luojun Lin, Tianyu Xie, Fei Chao, Rongrong Ji, Xiawu Zheng

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(教育部多媒体可信感知与高效计算重点实验室,厦门大学) College of Computer and Data Science, Fuzhou University(福州大学计算机与数据科学学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出基于事件的帧选择方法,通过分层事件感知流程提升长视频理解的效率和效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23962 2026-03-02 eess.IV cs.CV 50%

Extending 2D foundational DINOv3 representations to 3D segmentation of neonatal brain MR images

将2D基础DINOv3表示扩展到新生儿脑部MRI图像的3D分割

Annayah Usman, Behraj Khan, Tahir Qasim Syed

机构 * Institute of Business Administration Karachi(卡拉奇商业管理学院)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出了一种基于结构化窗口分解-重组机制的方法,利用冻结的2D基础表示扩展到3D分割,实现了对新生儿脑部MRI图像的高精度分割。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21053 2026-02-25 cs.CV 50%

OCR-Agent: Agentic OCR with Capability and Memory Reflection

OCR-Agent: 具有能力和记忆反思的代理OCR

Shimin Wen, Zeyu Zhang, Xingdou Bian, Hongjie Zhu, Lulu He, Layi Shama, Daji Ergu, Ying Cai

机构 * Southwest Minzu University(西南民族大学) AI Geeks

专题命中 长上下文与记忆 :language model(abstract)

AI总结 OCR-Agent通过能力反思和记忆反思机制,提升VLMs的推理鲁棒性,实现更稳定的答案质量改进。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.20478 2026-02-25 cs.SE 50%

Codified Context: Infrastructure for AI Agents in a Complex Codebase

编译上下文:复杂代码库中AI代理的基础设施

Aristidis Vasilopoulos

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出了一种编译上下文基础设施,通过编码约定、领域专家代理和知识库,提升大规模多代理项目中的代码一致性与可靠性。

Comments 9 pages, 4 figures, companion repository: https://github.com/arisvas4/codified-context-infrastructure, code DOI: 10.5281/zenodo.18746623

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16493 2026-02-19 cs.CV 50%

MMA: Multimodal Memory Agent

MMA:多模态记忆代理

Yihao Lu, Wanru Cheng, Zeyu Zhang, Hao Tang

机构 * School of Computer Science, Peking University(北京大学计算机学院)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 MMA通过动态可靠性评分和冲突感知网络共识,提升多模态代理在长horizon任务中的记忆检索与决策能力,同时在多个基准测试中展现优越性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15516 2026-02-18 cs.CV 50%

Semantic-Guided 3D Gaussian Splatting for Transient Object Removal

语义引导的3D高斯点云对瞬态物体去除

Aditi Prabakaran, Priyesh Shukla

专题命中 长上下文与记忆 :language model(abstract)

AI总结 本文提出基于语义分类的3D高斯点云瞬态去除方法,通过CLIP相似度分数和阈值校准提升重建质量,减少内存开销并保持实时渲染性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.11622 2026-02-13 cs.IR 50%

Evolutionary Router Feature Generation for Zero-Shot Graph Anomaly Detection with Mixture-of-Experts

进化路由器特征生成用于混合专家的零样本图异常检测

Haiyang Jiang, Tong Chen, Xinyi Gao, Guansong Pang, Quoc Viet Hung Nguyen, Hongzhi Yin

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文提出EvoFG框架,通过进化特征生成和增强记忆路由器,解决零样本图异常检测中的分布偏移问题,提升模型泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06620 2026-02-12 cs.RO cs.SY eess.SY 50%

Force Generative Imitation Learning: Bridging Position Trajectory and Force Commands through Control Technique

力生成模仿学习:通过控制技术弥合位置轨迹与力命令之间的鸿沟

Hiroshi Sato, Sho Sakaino, Toshiaki Tsuji

机构 * Graduate School of Systems and Information Engineering, University of Tsukuba(东京大学系统与信息工程研究生院) Graduate School of Science and Engineering, Saitama University(埼玉大学科学与工程研究生院) Department of Intelligent Interaction Technologies, Institute of Systems and Information Engineering, University of Tsukuba(东京大学系统与信息工程研究所智能交互技术系)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本文提出一种力生成模型,通过无记忆反馈控制机制提升机器人在未见过位置轨迹下的力命令生成能力,以改善现实任务中的泛化性能。

Comments Accepted for IEEE Access

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.08625 2026-02-11 cs.CV 50%

OpenMonoGS-SLAM: Monocular Gaussian Splatting SLAM with Open-set Semantics

OpenMonoGS-SLAM: 单目高斯点云SLAM与开放语义结合

Jisang Yoo, Gyeongjin Kang, Hyun-kyu Ko, Hyeonwoo Yu, Eunbyung Park

机构 * Sungkyunkwan University(成均馆大学) Yonsei University(延世大学)

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 OpenMonoGS-SLAM通过结合3DGS与开放集语义,实现无需深度输入的单目SLAM,提升开放世界环境下的感知与建图性能。

Comments Work in progress. Project page: https://jisang1528.github.io/OpenMonoGS-SLAM/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05132 2026-02-06 cs.CV 50%

ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation

ARGaze:用于在线第一人称注视估计的自回归变换器

Jia Li, Wenjie Zhao, Shijian Deng, Bolin Lai, Yuheng Wu, RUijia Chen, Jon E. Froehlich, Yuhang Zhao, Yapeng Tian

机构 * Department of Computer Science, University of Texas at Dallas, Richardson, TX, USA.(德克萨斯大学达拉斯分校计算机科学系) College of Computing, Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院计算机学院) Department of Computer Science, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系) Allen School of Computer Science, University of Washington, USA(华盛顿大学阿伦计算机科学学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 ARGaze通过自回归变换器模型,利用时间连续性提升在线第一人称注视估计的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04517 2026-02-05 cs.CV cs.RO 50%

S-MUSt3R: Sliding Multi-view 3D Reconstruction

S-MUSt3R:滑动多视角三维重建

Leonid Antsfeld, Boris Chidlovskii, Yohann Cabon, Vincent Leroy, Jerome Revaud

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 S-MUSt3R通过序列分割和轻量级优化实现高效单目三维重建,利用MUSt3R模型在大规模RGB流中实现高精度重建。

Comments 8 pages, 5 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02798 2026-02-04 cs.CV 50%

No time to train! Training-Free Reference-Based Instance Segmentation

没有时间训练!基于参考的实例分割(无需训练)

Miguel Espinosa, Chenhongyi Yang, Linus Ericsson, Steven McDonagh, Elliot J. Crowley

机构 * School of Engineering, University of Edinburgh, Scotland, UK(爱丁堡大学工程学院) School of Computing Science, University of Glasgow, Scotland, UK(格拉斯哥大学计算科学学院) Meta

专题命中 长上下文与记忆 :foundation model(abstract)

AI总结 本研究提出一种无需训练的实例分割方法,利用语义先验和多阶段流程,通过参考图像生成分割掩码,提升分割性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00840 2026-02-03 cs.SE 50%

Code Quality Analysis of Translations from C to Rust

从C到Rust的代码质量分析

Biruk Tadesse, Vikram Nitin, Mazin Salah, Baishakhi Ray, Marcelo d'Amorim, Wesley Assunção

专题命中 长上下文与记忆 :LLM(abstract)

AI总结 本文研究了三种C到Rust翻译器的代码质量,发现尽管新技术减少了部分问题,但引入了新的问题,揭示了翻译质量的多维挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.00522 2026-02-03 cs.CV 50%

MRAD: Zero-Shot Anomaly Detection with Memory-Driven Retrieval

MRAD: 无监督异常检测中的记忆驱动检索

Chaoran Xu, Chengkan Lv, Qiyu Chen, Feng Zhang, Zhengtao Zhang

机构 * Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院)

专题命中 长上下文与记忆 :language model(abstract)

AI总结 MRAD通过记忆驱动检索实现无监督异常检测,利用记忆库提升异常分类和分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏