arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-09 至 2025-12-09 共收录 68 信号源:cs.CV, cs.AI, cs.LG

1. 视觉定位与Grounding 14 篇

2506.01946 2025-12-09 cs.CV 77%

3DRS: MLLMs Need 3D-Aware Representation Supervision for Scene Understanding

3DRS: MLLMs 需要 3D 意识表示监督以实现场景理解

Xiaohu Huang, Jingjing Wu, Qunyi Xie, Kai Han

机构 * Visual AI Lab, The University of Hong Kong(香港大学视觉人工智能实验室) Department of Computer Vision Technology (VIS), Baidu Inc.(百度公司计算机视觉技术部)

专题命中 视觉定位与Grounding :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 3DRS 通过引入预训练 3D 基础模型的监督,提升 MLLM 的 3D 表示能力,从而增强场景理解性能

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16412 2025-12-09 cs.CV cs.CE 77%

A Survey on Industrial Anomalies Synthesis

工业异常合成方法综述

Yanshu Wang, Xichen Xu, Jiaqi Liu, Xiaoning Lei, Guoyang Xie, Guannan Jiang, Zhichao Lu

机构 * Shanghai Jiao Tong University(上海交通大学) City University of Hong Kong(香港城市大学) Department of Intelligent Manufacturing, CATL(CATL智能制造部门)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV

AI总结 本文提出工业异常合成方法的统一综述,引入首个分类法并探讨多模态学习的应用,为未来研究提供框架和路线图。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.04002 2025-12-09 cs.CL 75%

AgriGPT-VL: Agricultural Vision-Language Understanding Suite

AgriGPT-VL:农业视觉-语言理解套件

Bo Yang, Yunkui Chen, Lanfei Feng, Yu Zhang, Xiao Xu, Jianyu Zhang, Nueraili Aierken, Runhe Huang, Hongjian Lin, Yibin Ying, Shijian Li

机构 * Zhejiang University(浙江大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);grounding(abstract);multimodal large language model(abstract)

AI总结 AgriGPT-VL通过构建农业专用的视觉-语言模型和评估套件,提升了农业领域的多模态理解和推理能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07687 2025-12-09 cs.CL cs.CV 70%

HalluShift++: Bridging Language and Vision through Internal Representation Shifts for Hierarchical Hallucinations in MLLMs

HalluShift++: 通过内部表示转移弥合语言与视觉,解决多模态大语言模型中的层级幻觉

Sujoy Nath, Arkaprabha Basu, Sharanya Dasgupta, Swagatam Das

机构 * Netaji Subhash Engineering College (NSEC)(奈尔贾伊·萨布哈工程学院) TCG Crest Electronics and Communication Sciences Unit (ECSU)(电子与通信科学单位) Indian Statistical Institute(印度统计研究所)

专题命中 视觉定位与Grounding :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 HalluShift++通过分析MLLM内部表示转移,解决多模态大语言模型中的层级幻觉问题,提升幻觉检测的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06376 2025-12-09 cs.CV 70%

Are AI-Generated Driving Videos Ready for Autonomous Driving? A Diagnostic Evaluation Framework

AI生成的驾驶视频是否准备好用于自动驾驶?一种诊断评估框架

Xinhao Xiang, Abhijeet Rastogi, Jiawei Zhang

机构 * IFM Lab, University of California, Davis(加州大学戴维斯分校IFM实验室)

专题命中 视觉定位与Grounding :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种诊断评估框架,系统研究AI生成驾驶视频在自动驾驶训练和评估中的可靠性,通过分析失败模式和构建基准测试,验证了过滤AIGVs可提升性能并补充现实数据。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07360 2025-12-09 cs.CV cs.AI 62%

Structure-Aware Feature Rectification with Region Adjacency Graphs for Training-Free Open-Vocabulary Semantic Segmentation

基于区域邻接图的结构感知特征校正用于无训练开放词汇语义分割

Qiming Huang, Hao Ai, Jianbo Jiao

机构 * The MIx Group, School of Computer Science University of Birmingham(米克集团,计算机科学学院,伯明翰大学)

专题命中 视觉定位与Grounding :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出基于区域邻接图的结构感知特征校正方法,通过增强局部辨别能力来提升开放词汇语义分割的性能。

Comments Accepted to WACV2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20993 2025-12-09 cs.LG cs.AI 62%

Subgoal Graph-Augmented Planning for LLM-Guided Open-World Reinforcement Learning

子目标图增强的规划用于LLM引导的开放世界强化学习

Shanwei Fan, Bin Zhang, Zhiwei Xu, Yingxuan Teng, Siqi Dai, Lin Cheng, Guoliang Fan

机构 * The Key Laboratory of Cognition and Decision Intelligence for Complex Systems, Institute of Automation, Chinese Academy of Sciences(认知与决策智能复杂系统重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(中国科学院大学人工智能学院) School of Artificial Intelligence, Shandong University(山东大学人工智能学院)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI、cs.LG

AI总结 本文提出SGA-ACR框架,通过整合环境特定的子目标图和多LLM规划流程,解决LLM在开放世界强化学习中的规划-执行对齐问题,提升子目标的可行性和可验证性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06032 2025-12-09 cs.CV cs.AI 62%

The SAM2-to-SAM3 Gap in the Segment Anything Model Family: Why Prompt-Based Expertise Fails in Concept-Driven Image Segmentation

在Segment Anything模型家族中SAM2到SAM3之间的鸿沟:基于提示的专家知识为何在概念驱动的图像分割中失效

Ranjan Sapkota, Konstantinos I. Roumeliotis, Manoj Karkee

机构 * Cornell University(康奈尔大学) University of the Peloponnese(希腊皮洛斯大学)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV、cs.AI

AI总结 本文分析了SAM2到SAM3在分割模型中的断层,指出基于提示的分割方法在概念驱动分割中失效的原因,并探讨了SAM3的多模态架构与评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06862 2025-12-09 cs.CV 57%

Omni-Referring Image Segmentation

多模态指引用图像分割

Qiancheng Zheng, Yunhang Shen, Gen Luo, Baiyang Song, Xing Sun, Xiaoshuai Sun, Yiyi Zhou, Rongrong Ji

机构 * Key Laboratory of Multimedia Trusted Perception and Efficient Computing, Ministry of Education of China, Xiamen University(中国教育部多媒体可信感知与高效计算重点实验室,厦门大学) Youtu Lab, Tencent, P.R. China(腾讯视频实验室,中国) OpenGVLab, Shanghai AI Laboratory(上海AI实验室)

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.CV

AI总结 本文提出多模态指引用图像分割任务,通过OmniRIS框架实现高度通用的图像分割,结合文本和视觉模态,构建了OmniRef数据集和OmniSegNet基线模型,验证了其在多模态提示下的分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.21615 2025-12-09 cs.CL cs.AI cs.IR 57%

Refine Medical Diagnosis Using Generation Augmented Retrieval and Clinical Practice Guidelines

通过生成增强检索和临床实践指南提升医学诊断

Wenhao Li, Hongkuan Zhang, Hongwei Zhang, Zhengxu Li, Zengjie Dong, Yafan Chen, Niranjan Bidargaddi, Hong Liu

专题命中 视觉定位与Grounding :grounding(abstract);分类 cs.AI

AI总结 本研究提出GARMLE-G框架,通过生成增强检索和临床指南整合,提升医学诊断的准确性和临床实用性。

Journal ref Journal of Biomedical and Health Informatics (JBHI) 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 文档图表理解 1 篇

2512.07186 2025-12-09 cs.CV cs.AI 79%

START: Spatial and Textual Learning for Chart Understanding

START: 空间与文本学习用于图表理解

Zhuoming Liu, Xiaofeng Gao, Feiyang Niu, Qiaozi Gao, Liu Liu, Robinson Piramuthu

机构 * University of Wisconsin-Madison(威斯康星大学麦迪逊分校) Amazon AGI(亚马逊人工智能实验室) MIT(麻省理工学院)

专题命中 文档图表理解 :grounding(abstract);multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI

AI总结 START通过空间与文本学习提升图表理解能力,引入图表元素定位和图表到代码生成,增强多模态大语言模型对图表结构和数据细节的理解。

Comments WACV2026 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏

3. GUI与屏幕智能体 3 篇

2508.05731 2025-12-09 cs.AI cs.CL 83%

InfiGUI-G1: Advancing GUI Grounding with Adaptive Exploration Policy Optimization

InfiGUI-G1: 通过自适应探索策略优化推进GUI接地

Yuhang Liu, Zeyu Liu, Shuanghe Zhu, Pengxiang Li, Congkai Xie, Jiasheng Wang, Xavier Hu, Xiaotian Han, Jianbo Yuan, Xinyao Wang, Shengyu Zhang, Hongxia Yang, Fei Wu

机构 * Amazon(亚马逊)

专题命中 GUI与屏幕智能体 :grounding(title,abstract);multimodal large language model(abstract);分类 cs.AI

AI总结 InfiGUI-G1通过自适应探索策略优化改进GUI接地,实现显著的语义对齐和性能提升。

Comments Accepted to AAAI 2026 (Oral Presentation)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.03724 2025-12-09 cs.CV cs.RO 57%

PosA-VLA: Enhancing Action Generation via Pose-Conditioned Anchor Attention

PosA-VLA: 通过姿态条件化锚点注意力增强动作生成

Ziwen Li, Xin Wang, Hanlue Zhang, Runnan Chen, Runqi Lin, Xiao He, Han Huang, Yandong Guo, Fakhri Karray, Tongliang Liu, Mingming Gong

机构 * MBZUAI AI2 Robotics The University of Sydney(悉尼大学) The University of Melbourne(墨尔本大学)

专题命中 GUI与屏幕智能体 :grounding(abstract);分类 cs.CV

AI总结 PosA-VLA通过姿态条件化锚点注意力机制提升动作生成的精度和效率,适用于多样化的机器人任务和复杂环境。

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18229 2025-12-09 cs.RO cs.AI 57%

BEDI: A Comprehensive Benchmark for Evaluating Embodied Agents on UAVs

BEDI:一种用于无人机上具身智能体评估的综合基准

Mingning Guo, Mengwei Wu, Jiarun He, Shaoxian Li, Haifeng Li, Chao Tao

专题命中 GUI与屏幕智能体 :vision-language model(abstract);分类 cs.AI

AI总结 BEDI提出了一种标准化的无人机具身智能体评估基准,通过动态任务范式和混合测试平台,全面评估UAV-EAs的六个核心技能,并揭示现有VLMs在具身任务中的局限性。

详情

展开后加载摘要…

URL PDF HTML 收藏

4. 幻觉与鲁棒性 5 篇

2511.22019 2025-12-09 cs.CV 83%

Intra-Class Probabilistic Embeddings for Uncertainty Estimation in Vision-Language Models

类内概率嵌入用于视觉-语言模型中的不确定性估计

Zhenxiang Lin, Maryam Haghighat, Will Browne, Dimity Miller

机构 * Queensland University of Technology(昆士兰理工大学)

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本研究提出一种无需训练的后处理方法,通过类内概率嵌入提升视觉-语言模型的不确定性估计,有效检测错误预测。

Comments Accepted at the IEEE/CVF Winter Conference on Applications of Computer Vision 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.03209 2025-12-09 cs.CV cs.AI 81%

GeoShield: Safeguarding Geolocation Privacy from Vision-Language Models via Adversarial Perturbations

GeoShield: 通过对抗扰动保护视觉语言模型中的地理隐私

Xinwei Liu, Xiaojun Jia, Yuan Xun, Simeng Qin, Xiaochun Cao

专题命中 幻觉与鲁棒性 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 GeoShield通过对抗扰动有效保护视觉语言模型中的地理隐私,提出三个核心模块实现稳健的隐私防护。

Comments AAAI2026 Poster

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07141 2025-12-09 cs.CV cs.CL 79%

Think-Reflect-Revise: A Policy-Guided Reflective Framework for Safety Alignment in Large Vision Language Models

思考-反思-修订:一种基于策略的反思框架,用于大型视觉语言模型的安全对齐

Fenghua Weng, Chaochao Lu, Xia Hu, Wenqi Shao, Wenjie Wang

机构 * Shanghaitech University(上海科技大学) Shanghai Artificial Intelligence Laboratory(上海人工智能实验室)

专题命中 幻觉与鲁棒性 :vision language model(title,abstract);分类 cs.CV

AI总结 TRR通过策略引导的反思框架提升大型视觉语言模型的安全对齐,显著提高安全响应率至87.7%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.02324 2025-12-09 cs.CL cs.AI 57%

Hallucination reduction with CASAL: Contrastive Activation Steering For Amortized Learning

通过CASAL减少幻觉:对比激活引导用于近似学习

Wannan, Yang, Xinchi Qiu, Lei Yu, Yuchen Zhang, Aobo Yang, Narine Kokhlikyan, Nicola Cancedda, Diego Garcia-Olano

机构 * Meta Superintelligence Labs(Meta超级智能实验室) New York University(纽约大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract);分类 cs.AI

AI总结 CASAL通过对比激活引导减少LLM幻觉,提升模型可解释性和实用性,适用于多种模型架构。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06017 2025-12-09 cs.RO eess.IV 50%

Training-Free Robot Pose Estimation using Off-the-Shelf Foundational Models

无需训练的机器人姿态估计使用现成的基础模型

Laurence Liang

机构 * McGill University(麦吉尔大学)

专题命中 幻觉与鲁棒性 :vision-language model(abstract)

AI总结 本文提出利用现成的基础模型无需训练即可估计机器人关节角度,通过实验验证了模型性能基准及测试扩展对预测效果的影响。

Comments Accepted at CVIS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏

5. VLM训练与架构 15 篇

2507.14997 2025-12-09 cs.CV cs.LG 84%

Language Integration in Fine-Tuning Multimodal Large Language Models for Image-Based Regression

基于图像回归的多模态大语言模型微调中的语言整合

Roy H. Jennings, Genady Paikin, Roy Shaul, Evgeny Soloveichik

机构 * Samsung Israel R&D Center(三星以色列研发中心)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);MLLM(abstract);分类 cs.CV、cs.LG

AI总结 本文提出RvTC方法,通过灵活的区间法替代传统词汇受限分类,提升多模态大语言模型在图像回归任务中的性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06811 2025-12-09 cs.CV cs.AI cs.LG cs.MM 82%

RMAdapter: Reconstruction-based Multi-Modal Adapter for Vision-Language Models

RMAdapter: 基于重建的多模态适配器用于视觉-语言模型

Xiang Lin, Weixin Li, Shu Guo, Lihong Wang, Di Huang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 RMAdapter通过双分支架构平衡通用与任务特定知识,提升视觉-语言模型在多模态迁移学习中的性能。

Comments Accepted by AAAI 2026(Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.07234 2025-12-09 cs.CV cs.AI 81%

Dropout Prompt Learning: Towards Robust and Adaptive Vision-Language Models

Dropout Prompt Learning: 向稳健和适应性强的视觉-语言模型迈进

Biao Chen, Lin Zuo, Mengmeng Jing, Kunbin He, Yuchen Wang

机构 * Biao Chen, Lin Zuo, Mengmeng Jing, Kunbin He, Yuchen Wang(作者)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 Dropout Prompt Learning通过在视觉-语言模型中应用Dropout技术,提升模型的鲁棒性和适应性,实验表明其在低样本学习、长尾分类和分布外泛化等任务中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.13515 2025-12-09 cs.CV cs.AI 81%

UniME-V2: MLLM-as-a-Judge for Universal Multimodal Embedding Learning

UniME-V2:基于大规模语言模型的通用多模态嵌入学习判别器

Tiancheng Gu, Kaicheng Yang, Kaichen Zhang, Xiang An, Ziyong Feng, Yueyi Zhang, Weidong Cai, Jiankang Deng, Lidong Bing

专题命中 VLM训练与架构 :MLLM(title,abstract);分类 cs.CV、cs.AI

AI总结 UniME-V2利用大规模语言模型提升通用多模态嵌入学习的判别能力,通过引入MLLM-as-a-Judge机制和重排序模型实现更高效的负样本挖掘和语义匹配。

Comments AAAI2026 Oral, Webpage:https://garygutc.github.io/UniME-v2/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06281 2025-12-09 cs.CV cs.AI 81%

Unleashing the Intrinsic Visual Representation Capability of Multimodal Large Language Models

释放多模态大语言模型的内在视觉表示能力

Hengzhuang Li, Xinsong Zhang, Qiming Peng, Bin Luo, Han Hu, Dengyang Jiang, Han-Jia Ye, Teng Zhang, Hai Jin

机构 * HUST(华中科技大学) Tencent Hunyuan Research(腾讯混元研究) HKUST(香港科技大学) NJU(南京大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV、cs.AI

AI总结 本文提出LaVer框架,通过掩码图像建模提升多模态大语言模型的视觉表示能力,实验表明其在需要密集视觉能力的场景中表现优异。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13036 2025-12-09 cs.CV 79%

uCLIP: Parameter-Efficient Multilingual Extension of Vision-Language Models with Unpaired Data

uCLIP: 无配对数据下多语言视觉语言模型的参数高效扩展

Dahyun Chung, Donghyun Shin, Yujin Sung, Seunggi Moon, Jinwoo Jeon, Byung-Jun Lee

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 uCLIP通过无需配对数据的轻量级框架,在低资源语言中实现高效多语言视觉语言对齐。

Comments Our project page can be found at https://dinyudin203.github.io/uCLIP-project/

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06750 2025-12-09 cs.CV 79%

UARE: A Unified Vision-Language Model for Image Quality Assessment, Restoration, and Enhancement

UARE:面向图像质量评估、修复和增强的统一视觉-语言模型

Weiqi Li, Xuanyu Zhang, Bin Chen, Jingfen Xie, Yan Wang, Kexin Zhang, Junlin Li, Li Zhang, Jian Zhang, Shijie Zhao

机构 * School of Electronic and Computer Engineering, Peking University, 2 ByteDance Inc(1 电子与计算机工程学院,北京大学,2 字节跳动公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 UARE是首个统一视觉-语言模型,通过统一训练框架提升图像质量评估、修复和增强性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.17432 2025-12-09 cs.CV 70%

Breaking the Modality Barrier: Universal Embedding Learning with Multimodal LLMs

突破模态壁垒:基于多模态大语言模型的通用嵌入学习

Tiancheng Gu, Kaicheng Yang, Ziyong Feng, Xingjun Wang, Yanzhao Zhang, Dingkun Long, Yingda Chen, Weidong Cai, Jiankang Deng

机构 * The University of Sydney(悉尼大学) DeepGlint Tongyi Lab, Alibaba Group(阿里云实验室) Imperial College London(伦敦帝国理工学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 UniME通过两阶段框架提升多模态表示学习,利用知识蒸馏和硬负样本微调增强判别能力与指令遵循性能。

Comments 13 pages, 8 figures, Accepted by ACM MM2025, Project page: https://garygutc.github.io/UniME

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06447 2025-12-09 cs.CV 70%

Towards Stable Cross-Domain Depression Recognition under Missing Modalities

迈向稳定跨领域抑郁识别下的缺失模态

Jiuyi Chen, Mingkui Tan, Haifeng Lu, Qiuna Xu, Zhihua Wang, Runhao Zeng, Xiping Hu

机构 * School of Future Technology, South China University of Technology(未来技术学院,华南理工大学) PengCheng Laboratory(鹏城实验室) School of Software Engineering, South China University of Technology(软件工程学院,华南理工大学) Artificial Intelligence Research Institute, Shenzhen MSU-BIT University(人工智能研究院,深圳MSU-BIT大学) Guangdong-Hong Kong-Macao Joint Laboratory for Emotional Intelligence and Pervasive Computing(粤港澳大湾区情感智能与泛在计算联合实验室) School of Computer Science and Technology, Guangdong University of Technology(计算机科学与技术学院,广东工业大学) Department of Computer Science, City University of Hong Kong(计算机科学系,香港城市大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 本文提出SCD-MLLM框架,通过多源数据适配器和模态感知自适应融合模块,实现稳定跨领域抑郁症识别,提升多模态数据处理的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06255 2025-12-09 cs.CV 70%

Language-driven Fine-grained Retrieval

基于语言的细粒度检索

Shijie Wang, Xin Yu, Yadan Luo, Zijian Wang, Pengfei Zhang, Zi Huang

机构 * The University of Queensland(昆士兰大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 LaFG通过将类别名称转换为属性级监督,利用语言模型和视觉-语言模型生成属性描述并聚类属性词汇,以提升细粒度图像检索的性能和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.06866 2025-12-09 cs.CV cs.AI cs.CL cs.LG 67%

Less Is More, but Where? Dynamic Token Compression via LLM-Guided Keyframe Prior

少即是多,但在哪里?通过LLM引导的关键帧先验实现动态令牌压缩

Yulin Li, Haokun Gui, Ziyang Fan, Junjie Wang, Bin Kang, Bin Chen, Zhuotao Tian

机构 * Harbin Institute of Technology (Shenzhen)(哈尔滨工业大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院) University of Chinese Academy of Sciences(中国科学院大学) The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出DyToK方法,通过LLM引导的关键帧先验实现动态令牌压缩,提升视频处理效率和准确性。

Comments Accepted by NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏