Continual Learning for VLMs: A Survey and Taxonomy Beyond Forgetting
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
AI 大模型
跨文本、图像、视频、音频等模态的大模型与学习方法。
视觉语言模型的持续学习:超越遗忘的综述与分类
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 本文综述了视觉语言模型的持续学习挑战,提出四种核心范式以解决跨模态特征漂移和灾难性遗忘问题,强调零样本学习和智能体生态系统的发展。
Fly0: 解耦语义定位与几何规划以实现零样本空中导航
机构 * National Key Laboratory of Big Data and Decision(大数据与决策国家重点实验室) ; National University of Defense Technology(国防科技大学) ; State Key Laboratory of Digital Intelligent Modeling and Simulation(数字智能建模与仿真国家重点实验室) ; Information Support Force Engineering University(信息支援力量工程大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 Fly0通过解耦语义推理与几何规划,实现零样本空中导航,提升导航成功率和减少导航误差。
显式逻辑通道用于验证和增强用于零样本任务的前沿多模态大语言模型
机构 * Institute for Infocomm Research (I$^2$R)(信息通信研究所) ; Agency for Science, Technology and Research (A*STAR)(科技研究局) ; Singapore(新加坡)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.AI
AI总结 本文提出显式逻辑通道用于验证和增强多模态大语言模型在零样本任务中的性能,通过显式逻辑推理提高模型的可解释性和可信度。
Comments Accepted to ECCV 2026
T-QPM:面向开放世界视觉语言模型的时间分布外检测与域泛化
机构 * San Diego State University(圣地亚哥州立大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出T-QPM框架,通过时间四元模式匹配和轻量级融合权重学习,增强视觉语言模型在动态环境下的分布外检测和协变量偏移鲁棒性。
KITE:一种融合文本、图像和知识图谱的三模态假新闻检测Transformer
机构 * Department of Computer Science, University of West Florida(威斯福大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 提出三模态假新闻检测框架KITE,联合建模文本、视觉和知识表示,利用跨模态注意力整合特征,在基准数据集上显著优于单双模态基线。
AnomalyAgent: 用于零样本/少样本异常检测的无训练智能体模型
机构 * Singapore Management University(新加坡国立管理学院) ; Sun Yat-sen University(中山大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 提出一种基于多模态大语言模型的无训练智能体框架AnomalyAgent,通过定制工具集和记忆模块实现零样本/少样本异常检测,在逻辑/上下文异常等复杂场景中优于现有方法。
通过可微渲染和大语言模型实现通用骨架理解
机构 * State Key Laboratory of General Artificial Intelligence, Peking University, Shenzhen Graduate School, China(人工智能通用基础理论国家重点实验室,北京大学深圳研究生院,中国) ; Tencent(腾讯) ; Nanjing University of Aeronautics(南京航空航天大学)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出SkeletonLLM,通过可微渲染将任意骨架序列转换为大语言模型的视觉模态,实现通用骨架理解,同时引入协同训练策略提升推理能力,展示了在开放词汇动作识别中的强泛化能力,并扩展到异构骨架格式的运动描述和问答任务。
Comments Accepted by ICML 2026
OpenTrack3D: 向准确且通用的开放词汇3D实例分割迈进
机构 * PICO, ByteDance, Beijing(字节跳动北京研究院)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multi-modal(abstract);分类 cs.CV
AI总结 本文提出OpenTrack3D框架,通过在线构建跨视角一致的对象提案和多模态大语言模型提升开放词汇3D实例分割的准确性和泛化能力。
大-小模型协作用于耕地语义变化检测
机构 * College of Information Science and Technology, Hangzhou Normal University(杭州师范大学信息科学与技术学院)
专题命中 图文多模态 :cross-modal(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出大-小协作框架,通过细粒度差分感知Mamba和CLIP文本先验实现耕地变化检测,提升精度与鲁棒性。
VPTracker: 基于多模态大语言模型的全局视觉-语言跟踪
机构 * School of Data Science and Engineering, East China Normal University, Shanghai 200062, China(数据科学与工程学院,华东师范大学,上海200062,中国) ; Medical Artificial Intelligence Laboratory, Westlake University, Hangzhou 310024, China(医学人工智能实验室,西湖大学,杭州310024,中国)
专题命中 图文多模态 :MLLM(abstract,abstract_cn);multimodal(abstract);分类 cs.CV
AI总结 本文提出VPTracker,首个基于多模态大语言模型的全局视觉-语言跟踪框架,通过引入位置感知的视觉提示机制,提升跟踪鲁棒性和稳定性,有效抑制干扰。
Comments 7 pages
FiLo++: 通过融合细粒度描述和变形定位实现零/少样本异常检测
机构 * Foundation Model Research Center, Institute of Automation, Chinese Academy of Sciences(基础模型研究中心,自动化研究所,中国科学院) ; School of Artifcial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) ; Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ; Wuhan AI Research(武汉AI研究所) ; Peng Cheng Laboratory(鹏城实验室) ; Guangdong Provincial Key Laboratory of Intellectual Property & Big Data, Guangdong Polytechnic Normal University(广东省知识产权与大数据重点实验室,广东工业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 FiLo++通过融合细粒度描述和变形定位技术,提升零/少样本异常检测的准确性和鲁棒性。
基于图像的可靠思考
机构 * College of Computer Science, Sichuan University(四川大学计算机科学学院) ; Southwest China Institute of Electronic Technology(西南中国电子技术研究所) ; National Key Laboratory of Fundamental Algorithms(国家基础算法重点实验室) ; Models for Engineering Simulation, Sichuan University(工程模拟模型研究所,四川大学)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出RTWI方法,通过估计视觉提示和文本Co T的可靠性,以解决多模态推理中噪声思考问题,提升多模态大语言模型的性能。
Comments 26 pages, 19 figures
AdaptInfer: 用于视觉-语言模型推理的自适应令牌剪枝与动态文本引导
机构 * Global Innovation Exchange, Tsinghua University(清华大学全球创新交流中心) ; Department of Automation, Tsinghua University(清华大学自动化系) ; School of Computer Science, Peking University(北京大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
AI总结 AdaptInfer通过动态文本引导和自适应令牌剪枝,有效降低视觉-语言模型推理成本,提升推理效率与准确性。
一次扰动就足够:针对视觉-语言预训练模型生成通用对抗扰动
机构 * Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院,清华大学) ; Harbin Institute of Technology(哈尔滨工业大学)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
AI总结 本文提出C-PGC方法,通过对比学习生成通用对抗扰动,攻击视觉-语言预训练模型的多模态对齐能力。
Comments Accepted by ICCV-2025
多选式视觉问答评估中的未探索缺陷
机构 * Technical University of Munich(慕尼黑技术大学) ; Volkswagen AG(大众集团) ; Munich Data Science Institute(慕尼黑数据科学研究所)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
AI总结 本文揭示了多选式视觉问答评估中因提示格式变化导致的未探索偏差,指出其对MLLM评估结果的显著影响,并表明现有缓解策略无法有效应对这些新发现的偏见。
机构 * ByteDance Inc.(字节跳动公司)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);分类 cs.CV、cs.AI、cs.MM
机构 * Intelligent Control \& Smart Energy (ICSE) Research Group, School of Engineering, University of Warwick, Coventry, CV4 7AL, UK
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
机构 * Huazhong Agricultural University(华中农业大学) ; Shenzhen University(深圳大学) ; The University of Hong Kong(香港大学) ; University of Louisville(路易斯安那大学) ; ByteDance(字节跳动) ; Huazhong University of Science and Technology(华中科技大学)
专题命中 图文多模态 :multi-modal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments Accepted to ICCV 2025
机构 * Beihang University(北航) ; Zhongguancun Laboratory(中关村实验室) ; Hefei Comprehensive National Science Center(合肥综合性国家科学中心) ; ETH Zürich(苏黎世联邦理工学院) ; Pengcheng Laboratory(鹏城实验室) ; Tsinghua University(清华大学) ; University of California, Berkeley(加州大学伯克利分校) ; Johns Hopkins University(约翰霍普金斯大学) ; University of Oxford(牛津大学) ; Meta ; Google Brain(谷歌脑) ; Nanyang Technological University(南洋理工大学) ; Aarhus University(哥本哈根大学) ; China University of Mining(中国矿业大学) ; University of Electronic Science(电子科学大学) ; School of Electronic, Electrical(电子、电气与通信工程学院) ; Key Laboratory of Intelligent Information Processing, Institute of Computing Technology, CAS(智能信息处理国家重点实验室) ; School of Computer Science(计算机科学学院) ; Key Laboratory of Big Data Mining(大数据挖掘国家重点实验室) ; Zhejiang Gongshang University(浙江工商大学) ; Binjiang Institute of Zhejiang University(浙江大学滨江学院) ; Zhejiang University(浙江大学) ; The Chinese University of Hong Kong(香港中文大学)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments AdvML@CVPR Challenge Report
机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) ; Tencent Youtu Lab(腾讯优图实验室) ; Nanjing University(南京大学)
专题命中 图文多模态 :multimodal(abstract);multi-modal(abstract);cross-modal(abstract);分类 cs.CV
机构 * Faculty of Engineering, Monash University, Melbourne, Australia(墨尔本大学工程学院) ; AIM for Health Lab, Monash University, Victoria, Australia(墨尔本大学健康人工智能实验室)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments MICCAI2025 early acceptance; First two authors contribute equally
机构 * College of Computer Science and Technology, Nanjing University of Aeronautics and Astronautics(南京航空航天大学计算机科学与技术学院) ; MIIT Key Laboratory of Pattern Analysis and Machine Intelligence(信息产业部模式分析与机器智能重点实验室) ; Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系)
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
机构 * Singapore-ETH Centre, Future Cities Lab Global Programme, CREATE campus(新加坡-ETH中心,未来城市实验室全球计划,CREATE校区) ; National University of Singapore(新加坡国立大学) ; Takenaka Corporation(Takenaka公司) ; Department of Architecture, National University of Singapore(新加坡国立大学建筑系)
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);cross-modal(abstract);分类 cs.CV
专题命中 图文多模态 :multimodal(abstract);image-text(abstract);分类 cs.CV、cs.CL、cs.AI
Comments CVPR 2025
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);image-text(abstract);分类 cs.CV
Comments Accepted by AAAI 2025
专题命中 图文多模态 :multimodal(abstract);MLLM(abstract);分类 cs.CV、cs.CL、cs.AI
Comments Accepted by CVPR 2024. Code: https://github.com/csuhan/OneLLM
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments 9 pages, 4 figures
专题命中 图文多模态 :multimodal(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
专题命中 图文多模态 :MLLM(abstract);cross-modal(abstract);image-text(abstract);分类 cs.CV
Comments 12 pages