arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2603.05384 2026-03-06 cs.CV 57%

ORMOT: A Dataset and Framework for Omnidirectional Referring Multi-Object Tracking

ORMOT: 一个用于全方位参照多目标跟踪的数据集和框架

Sijia Chen, Zihan Zhou, Yanqiu Yu, En Yu, Wenbing Tao

机构 * State Key Laboratory of Multispectral Information Intelligent Processing Technology, School of Artificial Intelligence and Automation, Huazhong University of Science and Technology(多谱信息智能处理技术国家重点实验室,人工智能与自动化学院,华中科技大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 提出ORMOT任务,构建ORSet数据集和ORTrack框架,解决传统数据集视野限制问题,提升模型对长周期语言描述的理解能力。

Comments https://github.com/chen-si-jia/ORMOT

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.02138 2026-03-03 cs.CV 57%

OmniLottie: Generating Vector Animations via Parameterized Lottie Tokens

OmniLottie:通过参数化Lottie令牌生成向量动画

Yiying Yang, Wei Cheng, Sijin Chen, Honghao Fu, Xianfang Zeng, Yujun Cai, Gang Yu, Xingjun Ma

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

AI总结 OmniLottie通过参数化Lottie令牌生成高质量向量动画,结合多模态指令与大规模数据集提升动画生成能力。

Comments Accepted by CVPR 2026. Project Page: https://openvglab.github.io/OmniLottie/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01725 2026-03-03 cs.CV 57%

Learning Domain-Aware Task Prompt Representations for Multi-Domain All-in-One Image Restoration

学习多领域任务提示表示以实现多领域一体化图像修复

Guanglu Dong, Chunlei Li, Chao Ren, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * Sichuan University(四川大学) MedAI Technology (Wuxi) Co. Ltd.(MedAI技术(无锡)有限公司) Technical University of Munich(慕尼黑技术大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 提出DATPRL-IR,通过多领域任务提示表示学习实现多领域一体化图像修复,优于现有方法并具备强泛化能力

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.01590 2026-03-03 cs.IR cs.LG 57%

IDProxy: Cold-Start CTR Prediction for Ads and Recommendation at Xiaohongshu with Multimodal LLMs

IDProxy:小红书广告与推荐中基于多模态大语言模型的冷启动CTR预测

Yubin Zhang, Haiming Xu, Guillaume Salha-Galvan, Ruiyan Han, Feiyang Xiao, Yanhua Huang, Li Lin, Yang Luo, Yao Hu

机构 * Xiaohongshu Inc.(小红书公司) Shanghai Jiao Tong University(上海交通大学) Fudan University(复旦大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 IDProxy通过多模态大语言模型生成代理嵌入,解决广告和推荐系统中物品冷启动的CTR预测问题,实现与现有嵌入空间的对齐和端到端优化,已在小红书大规模应用。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00854 2026-03-03 cs.LG cs.IR 57%

GeMi: A Graph-based, Multimodal Recommendation System for Narrative Scroll Paintings

GeMi:基于图的多模态推荐系统用于叙事卷轴绘画

Haimonti Dutta, Pruthvi Moluguri, Jin Dai, Saurabh Amarnath Mahindre

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 GeMi是一种基于图的多模态推荐系统,专门用于叙事卷轴绘画,结合多模态内容和用户偏好,为艺术保护和数据存储提供解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.00490 2026-03-03 cs.AI 57%

LifeEval: A Multimodal Benchmark for Assistive AI in Egocentric Daily Life Tasks

LifeEval: 一种面向日常生活中自体视角的多模态基准,用于辅助AI

Hengjian Gao, Kaiwei Zhang, Shibo Wang, Mingjie Chen, Qihang Cao, Xianfeng Wang, Yucheng Zhu, Xiongkuo Min, Wei Sun, Dandan Zhu, Guangtao Zhai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) Shanghai Jiao Tong University(上海交通大学) East China Normal University(华东师范大学) Shanghai University of Electric Power(上海电力大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 LifeEval 是一个面向日常生活中自体视角的多模态基准,用于评估实时任务导向的人机协作,揭示了在动态环境中实现有效交互的挑战。

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21029 2026-03-03 cs.LG 57%

FORCE: Transferable Visual Jailbreaking Attacks via Feature Over-Reliance CorrEction

FORCE:通过特征过度依赖校正实现可转移的视觉劫持攻击

Runqi Lin, Alasdair Paren, Suqin Yuan, Muyang Li, Philip Torr, Adel Bibi, Tongliang Liu

机构 * Sydney AI Centre, The University of Sydney(悉尼人工智能中心,悉尼大学) Department of Engineering Science, University of Oxford(工程科学系,牛津大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 FORCE方法通过校正特征过度依赖,提升视觉劫持攻击的跨模型可转移性。

Comments Accepted by CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.23292 2026-02-27 cs.CV 57%

PGVMS: A Prompt-Guided Unified Framework for Virtual Multiplex IHC Staining with Pathological Semantic Learning

PGVMS: 一种基于提示的统一框架用于虚拟多色IHC染色与病理语义学习

Fuqiang Chen, Ranran Zhang, Wanming Hu, Deboch Eyob Abera, Yue Peng, Boyun Zheng, Yiwen Sun, Jing Cai, Wenjian Qin

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences and University of Chinese Academy of Sciences, Beijing, China(深圳先进技术研究院,中国科学院和中国科学院大学,北京,中国) Department of Pathology, Sun Yat-sen University Cancer Center, State Key Laboratory of Oncology in South China, Guangzhou, China(中山大学肿瘤中心病理科,南方肿瘤临床研究中心,广州,中国) Hong Kong Polytechnic University, Hong Kong SAR, China(香港理工大学,香港特别行政区,中国) Department of Electronic Engineering, The Chinese University of Hong Kong, Hong Kong SAR 999077, China(电子工程系,香港中文大学,香港特别行政区,中国) Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences, Shenzhen, China(深圳先进技术研究院,中国科学院,深圳,中国)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

AI总结 PGVMS提出了一种基于提示的统一框架,利用单染训练数据解决虚拟多色IHC染色中的语义指导、染色分布不一致和空间错位问题。

Comments Accepted by TMI

Journal ref IEEE Transactions on Medical Imaging, 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.21058 2026-02-27 cs.CV 57%

Beyond Pixel Simulation: Pathology Image Generation via Diagnostic Semantic Tokens and Prototype Control

超越像素模拟:通过诊断语义标记和原型控制生成病理图像

Minghao Han, Yichen Liu, Yizhou Liu, Zizhi Chen, Jingqun Tang, Xuecheng Wu, Dingkang Yang, Lihua Zhang

机构 * College of Intelligent Robotics and Advanced Manufacturing(智能机器人与先进制造学院) Fudan University(复旦大学) Fysics Intelligence Technologies Co., Ltd.(Fysics智能科技有限公司) University of Science and Technology Beijing(北京科技大学) ByteDance(字节跳动) School of Computer Science and Technology(计算机科学与技术学院) Xi’an Jiaotong University(西安交通大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 UniPath通过诊断语义标记和原型控制实现可控的病理图像生成,取得SOTA性能,包括Patho-FID 80.9和98.7%的细粒度语义控制。

Comments accepted by CVPR 2026; 32 pages, 17 figures, and 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22120 2026-02-26 cs.CV 57%

GeoDiv: Framework For Measuring Geographical Diversity In Text-To-Image Models

GeoDiv:文本到图像模型中地理多样性测量的框架

Abhipsa Basu, Mohana Singh, Shashank Agnihotri, Margret Keuper, R. Venkatesh Babu

机构 * Vision and AI Lab, Indian Institute of Science, Bangalore, India(印度科学院视觉与人工智能实验室) Chair for Machine Learning, University of Mannheim(曼海姆大学机器学习主任) Max Planck Institute for Informatics, Saarland Informatics Campus, Saarbrücken, Germany(马克斯·普朗克信息研究所,萨尔兰州信息学院,萨尔布吕肯,德国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 GeoDiv通过评估文本到图像模型中的地理多样性,揭示模型在描绘地区时的偏见问题,提出可解释的度量框架以促进公平生成系统。

Comments ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.21175 2026-02-25 cs.CV 57%

Seeing Through Words: Controlling Visual Retrieval Quality with Language Models

通过文字看见:利用语言模型控制视觉检索质量

Jianglin Lu, Simon Jenni, Kushal Kafle, Jing Shi, Handong Zhao, Yun Fu

机构 * Adobe Research(Adobe研究部) Northeastern University(东北大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 通过生成语言模型扩展短查询并控制图像质量,提升视觉检索效果和可控性

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09609 2026-02-24 cs.CV 57%

Tele-Omni: a Unified Multimodal Framework for Video Generation and Editing

Tele-Omni: 一种用于视频生成与编辑的统一多模态框架

Jialun Liu, Tian Li, Xiao Cao, Yukuo Ma, Gonghu Shang, Haibin Huang, Chi Zhang, Xiangzhen Chang, Zhiyong Huang, Jiakui Hu, Zuoxin Li, Yuanzhi Liang, Cong Liu, Junqi Liu, Robby T. Tan, Haitong Tang, Qizhen Weng, Yifan Xu, Liying Yang, Xiaoyan Yang, Peng Yu, Shiwen Zhang, Xuelong Li

机构 * TeleAI

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 Tele-Omni是一种统一多模态框架,通过解析文本、图像和参考视频指令,实现视频生成与编辑的灵活控制,提升时间一致性和视觉一致性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04587 2026-02-23 cs.CL cs.AI cs.CY 57%

VILLAIN at AVerImaTeC: Verifying Image-Text Claims via Multi-Agent Collaboration

VILLAIN 在 AVerImaTeC 上:通过多智能体协作验证图像-文本声明

Jaeyoon Jung, Yejun Yoon, Kunwoo Park

机构 * School of AI Convergence, Soongsil University(人工智能融合学院,顺世大学) MAUM AI Inc.(MAUM人工智能公司) Department of Intelligent Semiconductors, Soongsil University(智能半导体系,顺世大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 VILLAIN 通过多智能体协作验证图像-文本声明,实现事实核查系统的高效准确验证。

Comments A system description paper for the AVerImaTeC shared task at the Ninth FEVER Workshop (co-located with EACL 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.17594 2026-02-20 cs.AI 57%

AI Gamestore: Scalable, Open-Ended Evaluation of Machine General Intelligence with Human Games

AI 游戏商店:通过人类游戏评估机器通用智能的可扩展性和开放性

Lance Ying, Ryan Truong, Prafull Sharma, Kaiya Ivy Zhao, Nathan Cloos, Kelsey R. Allen, Thomas L. Griffiths, Katherine M. Collins, José Hernández-Orallo, Phillip Isola, Samuel J. Gershman, Joshua B. Tenenbaum

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

AI总结 通过AI GameStore评估机器通用智能,利用人类游戏测试AI在游戏中的表现,发现其在复杂游戏任务中表现不佳。

Comments 29 pages, 14 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16006 2026-02-19 cs.CV 57%

BTReport: A Framework for Brain Tumor Radiology Report Generation with Clinically Relevant Features

BTReport: 一种用于脑肿瘤放射学报告生成的框架,结合临床相关特征

Juampablo E. Heras Rivera, Dickson T. Chen, Tianyi Ren, Daniel K. Low, Asma Ben Abacha, Alberto Santamaria-Pang, Mehmet Kurt

机构 * University of Washington(华盛顿大学) University of Washington School of Medicine(华盛顿大学医学院) Microsoft Health AI(微软健康人工智能) Johns Hopkins School of Medicine(约翰霍普金斯医学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 BTReport通过确定性特征提取和大语言模型结合,生成可解释的脑肿瘤放射学报告,并提供配套数据集提升临床应用

Comments Accepted to Medical Imaging with Deep Learning (MIDL) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.15010 2026-02-19 cs.RO cs.LG 57%

BPP: Long-Context Robot Imitation Learning by Focusing on Key History Frames

BPP: 通过聚焦关键历史帧实现长上下文机器人模仿学习

Max Sobol Mark, Jacky Liang, Maria Attarian, Chuyuan Fu, Debidatta Dwibedi, Dhruv Shah, Aviral Kumar

机构 * Carnegie Mellon University(卡内基梅隆大学) Google DeepMind(谷歌DeepMind)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 BPP通过聚焦关键历史帧,提升机器人模仿学习在长上下文任务中的表现,成功率达70%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.14172 2026-02-19 cs.SD cs.CL cs.LG 57%

Investigation for Relative Voice Impression Estimation

相对语音印象估计研究

Kenichi Fujita, Yusuke Ijima

机构 * NTT, Inc., Japan(日本NTT公司)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 本研究探讨了相对语音印象估计方法,发现自监督语音模型在捕捉复杂感知差异方面表现更优,而多模态大语言模型在此任务中效果不佳。

Comments 5 pages,3 figures, Accepted to Speech Prosody 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.14902 2026-02-17 cs.IR cs.CV 57%

U-MARVEL: Unveiling Key Factors for Universal Multimodal Retrieval via Embedding Learning with MLLMs

通过嵌入学习与大语言模型揭示通用多模态检索的关键因素:U-MARVEL

Xiaojie Li, Chu Li, Shi-Zhe Chen, Xi Chen

机构 * Tencent PCG(腾讯PCG) Nanjing University(南京大学) ByteDance(字节跳动)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 U-MARVEL通过嵌入学习与大语言模型揭示通用多模态检索的关键因素,实现超越现有方法的性能。

Comments Accepted to ICLR 2026

Journal ref International Conference on Learning Representations (ICLR), 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12533 2026-02-16 cs.LG 57%

AMPS: Adaptive Modality Preference Steering via Functional Entropy

AMPS: 通过功能熵实现自适应模态偏好引导

Zihan Huang, Xintong Li, Rohan Surana, Tong Yu, Rui Wang, Julian McAuley, Jingbo Shang, Junda Wu

机构 * University of California, San Diego(加州大学圣地亚哥分校) Adobe Research(Adobe研究)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

AI总结 AMPS通过实例感知的诊断度量和可学习模块,实现对多模态大语言模型模态偏好的自适应引导,有效调节偏好并降低生成错误率。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12302 2026-02-16 cs.CL cs.CV 57%

Grandes Modelos de Linguagem Multimodais (MLLMs): Da Teoria à Prática

大规模多模态语言模型(MLLMs):从理论到实践

Neemias da Silva, Júlio C. W. Scholz, John Harrison, Marina Borges, Paulo Ávila, Frances A Santos, Myriam Delgado, Rodrigo Minetto, Thiago H Silva

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

AI总结 本文介绍了多模态大语言模型(MLLMs)的理论基础和实践方法,探讨了预处理、提示工程及多模态管道构建技术,并提供了补充材料供进一步研究。

Comments in Portuguese language. Accepted book chapter - Webmedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09523 2026-02-13 cs.CV 57%

Singpath-VL Technical Report

Singpath-VL 技术报告

Zhen Qiu, Kaiwen Xiao, Zhengwei Lu, Xiangyu Liu, Lei Zhao, Hao Zhang

机构 * LBP Singpath AI Lab(LBP Singpath人工智能实验室)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

AI总结 Singpath-VL通过合成数据集和多阶段微调,提升宫颈细胞学中的细粒度形态感知与诊断分类能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09531 2026-02-11 cs.CV 57%

DR.Experts: Differential Refinement of Distortion-Aware Experts for Blind Image Quality Assessment

DR.Experts: 基于失真感知专家的差分细化方法用于盲图像质量评估

Bohan Fu, Guanyi Qin, Fazhan Zhang, Zihao Huang, Mingxuan Li, Runze Hu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 DR.Experts通过引入失真感知专家和差分细化方法,有效整合失真先验知识,提升盲图像质量评估的准确性与泛化能力。

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.09521 2026-02-11 cs.CV 57%

Attention to details, logits to truth: visual-aware attention and logits enhancement to mitigate hallucinations in LVLMs

关注细节,logits到真相:视觉感知注意力与logits增强以减轻LVLMs中的幻觉

Jingyi Wang, Fei Li, Rujie Liu

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种无需训练的注意力干预算法,通过增强任务相关token的注意力和改进解码过程,有效减少LVLMs中的幻觉问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07608 2026-02-10 cs.CV 57%

HistoMet: A Pan-Cancer Deep Learning Framework for Prognostic Prediction of Metastatic Progression and Site Tropism from Primary Tumor Histopathology

HistoMet:一种跨癌症深度学习框架,用于从原发肿瘤组织病理学预测转移进展和转移部位

Yixin Chen, Ziyu Su, Lingbin Meng, Elshad Hasanov, Wei Chen, Anil Parwani, M. Khalid Khan Niazi

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 HistoMet通过双模块预测流程,利用预训练的病理学视觉-语言模型,实现了从原发肿瘤组织病理学中预测转移进展和转移部位的稳健预测。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.10852 2026-02-09 cs.CV 57%

Enhancing Features in Long-tailed Data Using Large Vision Model

利用大视觉模型增强长尾数据特征

Pengxiao Han, Changkun Ye, Jinguang Tong, Cuicui Jiang, Jie Hong, Li Fang, Xuesong Li

机构 * Australian National University Canberra, Australia The University of Hong Kong Hong Kong SAR Chinese Academy of Sciences China Australian National University\&CSIRO Canberra, Australia

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 本研究提出利用大视觉模型增强长尾数据特征,通过特征融合和原型损失函数提升模型性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.06197 2026-02-09 cs.HC cs.AI 57%

Personagram: Bridging Personas and Product Design for Creative Ideation with Multimodal LLMs

Personagram: 通过多模态大语言模型连接人设与产品设计以促进创意构思

Taewook Kim, Matthew K. Hong, Yan-Ying Chen, Jonathan Q. Li, Monica P Van, Shabnam Hakimi, Matthew Kay, Matthew Klenk

机构 * Toyota Research Institute(丰田研究院) Northwestern University(西北大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 Personagram利用多模态大语言模型帮助设计师探索基于人口普查的人设,提取并重新组合产品特征,提升创意构思的可行性和参与度。

Comments 22 pages, 10 figures, 4 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.19755 2026-02-06 cs.AI 57%

Can MLLMs generate human-like feedback in grading multimodal short answers?

大型语言模型能否在评估多模态简答时生成类人反馈?

Pritam Sil, Pushpak Bhattacharyya, Pawan Goyal, Ganesh Ramakrishnan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本文研究了多模态简答评分与反馈问题,通过生成数据集评估了四种多模态大语言模型,展示了其在正确性预测和图像相关性评估中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05132 2026-02-06 cs.CV 57%

ARGaze: Autoregressive Transformers for Online Egocentric Gaze Estimation

ARGaze:用于在线第一人称注视估计的自回归变换器

Jia Li, Wenjie Zhao, Shijian Deng, Bolin Lai, Yuheng Wu, RUijia Chen, Jon E. Froehlich, Yuhang Zhao, Yapeng Tian

机构 * Department of Computer Science, University of Texas at Dallas, Richardson, TX, USA.(德克萨斯大学达拉斯分校计算机科学系) College of Computing, Georgia Institute of Technology, Atlanta, GA, USA(佐治亚理工学院计算机学院) Department of Computer Science, University of Wisconsin-Madison, Madison, WI, USA(威斯康星大学麦迪逊分校计算机科学系) Allen School of Computer Science, University of Washington, USA(华盛顿大学阿伦计算机科学学院)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 ARGaze通过自回归变换器模型,利用时间连续性提升在线第一人称注视估计的鲁棒性与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.01059 2026-02-03 cs.CV cs.MM 57%

DRFormer: A Dual-Regularized Bidirectional Transformer for Person Re-identification

DRFormer: 一种双正则化双向变换器用于人重识别

Ying Shu, Pujian Zhan, Huiqi Yang, Hehe Fan, Youfang Lin, Kai Lv

机构 * Institute of Network Science and Intelligent Systems, Beijing Jiaotong University, Beijing, China(网络科学与智能系统研究所,北京交通大学,北京,中国) Zhejiang University, Hangzhou, Zhejiang, China(浙江大学,杭州,浙江,中国)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 DRFormer通过双正则化双向变换器融合视觉基础模型和视觉-语言模型的优势,提升人重识别的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.13653 2026-02-03 cs.LG 57%

Dual-Phase Continual Learning: Supervised Adaptation Meets Unsupervised Retention

双相持续学习:监督适应与无监督保留的结合

Vaibhav Singh, Rahaf Aljundi, Eugene Belilovsky

机构 * Mila, Concordia University(蒙特利尔大学米尔人工智能实验室) Concordia University(蒙特利尔大学) Toyota Motor Europe(丰田欧洲公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

AI总结 本文提出了一种基于无监督方法的双相持续学习框架,通过利用测试时间数据提升先前任务性能,无需存储或重播数据,有效缓解VLMs中的遗忘问题。

Comments 10 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏