arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2603.27900 2026-03-31 cs.CV 57%

Rényi Entropy: A New Token Pruning Metric for Vision Transformers

瑞尼熵:一种新的token剪枝度量标准用于视觉变换器

Wei-Yuan Su, Ruijie Zhang, Zheng Zhang

机构 * University of California, Santa Barbara(加州大学圣塔芭芭拉分校)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出基于瑞尼熵的无训练token重要性度量Col-Ln,用于改进视觉变换器中早期层的token剪枝,提升推理效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27744 2026-03-31 cs.CV 57%

Data Organization Matters in Multimodal Instruction Tuning: A Controlled Study of Capability Trade-offs

多模态指令微调中数据组织的重要性:能力取舍的受控研究

Guowei Tang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 研究探讨了数据组织对多模态指令微调中通用理解、结构化推理和细粒度OCR文档理解能力取舍的影响,发现课程训练在整体表现和结构推理上最佳,平衡采样更利于OCR能力但削弱整体平衡。

Comments 12 pages, 2 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.27531 2026-03-31 cs.CV 57%

OmniColor: A Unified Framework for Multi-modal Lineart Colorization

OmniColor: 一种多模态线稿上色的统一框架

Xulu Zhang, Haoqian Du, Xiaoyong Wei, Qing Li

机构 * The Hong Kong Polytechnic University(香港理工大学) Sichuan University(四川大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 OmniColor提出一种统一框架,通过空间对齐和语义参考信号分类,提升线稿上色的可控性、视觉质量和时间稳定性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.22419 2026-03-31 cs.CV 57%

CLIP Is Shortsighted: Paying Attention Beyond the First Sentence

CLIP存在短视:超越第一句话的注意力分配

Marc-Antoine Lavoie, Anas Mahmoud, Aldo Zaimi, Arsene Fansi Tchango, Steven L. Waslander

机构 * University of Toronto Robotics Institute(多伦多大学机器人研究所) Mila - Quebec AI Institute(Mila - 魁北克人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIP模型在大规模数据上通过图像-文本对比学习获取可迁移的多模态特征,但其预训练过程偏向于短描述,导致复杂场景对齐不足。本文提出DeBias-CLIP,通过去除摘要句和子采样提升对齐效果,实现更优的长文本检索和鲁棒性。

Comments 20 pages, 15 figures, to be published in the CVPR 2026 proceedings

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26365 2026-03-30 cs.CV 57%

Dynamic Token Compression for Efficient Video Understanding through Reinforcement Learning

通过强化学习实现高效的视频理解动态令牌压缩

Shida Wang, YongXiang Hua, Zhou Tao, Haoyu Cao, Linli Xu

机构 * University of Science and Technology of China(中国科学技术大学) State Key Laboratory of Cognitive Intelligence(认知智能国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出SCORE框架,通过强化学习学习自适应令牌压缩策略,有效解决视频理解中的计算成本和上下文旋转问题,实现16倍的预填充加速且性能损失仅0.5%。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.26128 2026-03-30 cs.CV 57%

TaxaAdapter: Vision Taxonomy Models are Key to Fine-grained Image Generation over the Tree of Life

TaxaAdapter:视觉分类模型是生命树上细粒度图像生成的关键

Mridul Khurana, Amin Karimi Monsefi, Justin Lee, Medha Sawhney, David Carlyn, Julia Chae, Jianyang Gu, Rajiv Ramnath, Sara Beery, Wei-Lun Chao, Anuj Karpatne, Cheng Zhang

机构 * Virginia Tech(弗吉尼亚理工大学) The Ohio State University(俄亥俄州立大学) MIT(麻省理工学院) Boston University(波士顿大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TaxaAdapter,通过整合视觉分类模型提升细粒度物种生成的精度与一致性,实验表明其在形态学和物种识别准确性上优于现有方法,且具备良好的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.13239 2026-03-30 cs.CY cs.CV cs.IR 57%

CrisiSense-RAG: Crisis Sensing Multimodal Retrieval-Augmented Generation for Rapid Disaster Impact Assessment

CrisiSense-RAG:面向快速灾害影响评估的多模态检索增强生成系统

Yiming Xiao, Kai Yin, Ali Mostafavi

机构 * Zachry Department of Civil Environmental Engineering, Texas A\&M University Department of Computer Science Engineering, Texas A\&M University

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV

AI总结 本文提出CrisiSense-RAG系统,通过多模态检索增强生成技术,解决灾害影响评估中时空不对齐问题,实现零样本设置下的高精度灾害评估。

Comments 27 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.25072 2026-03-27 cs.CV 57%

GIFT: Global Irreplaceability Frame Targeting for Efficient Video Understanding

GIFT:全局不可替代性帧目标用于高效视频理解

Junpeng Ma, Sashuai Zhou, Guanghao Li, Xin Gao, Yue Cao, Hengyu Zeng, Yuxiang Yan, Zhibin Wang, Jun Song, Bo Zheng, Shanghang Zhang, Jian Pu

机构 * Institute of Science and Technology for Brain-inspired Intelligence, Fudan University(复旦大学类脑智能科学与技术研究院) State Key Laboratory of Multimedia Information Processing, School of Computer Science, Peking University(北京大学计算机学院多媒体信息处理国家重点实验室) Zhejiang University(浙江大学) Alibaba Group Holding Limited(阿里巴巴集团控股有限公司) Future Living Lab of Alibaba(阿里巴巴未来生活实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 GIFT通过评估帧的内在不可替代性选择关键帧,解决视频理解中处理密集帧的高计算成本问题,提升视频分析效率。

Comments 11 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.24528 2026-03-26 cs.CV 57%

Cross-Modal Prototype Alignment and Mixing for Training-Free Few-Shot Classification

跨模态原型对齐与混合用于无训练少样本分类

Dipam Goswami, Simone Magistri, Gido M. van de Ven, Bartłomiej Twardowski, Andrew D. Bagdanov, Tinne Tuytelaars, Joost van de Weijer

机构 * Department of Computer Science, Universitat Autònoma de Barcelona, Spain(巴塞罗那自治大学计算机科学系) Computer Vision Center, Barcelona, Spain(巴塞罗那计算机视觉中心) Media Integration and Communication Center, University of Florence, Italy(佛罗伦萨大学媒体整合与传播中心) Bernoulli Institute, University of Groningen, the Netherlands(格罗宁根大学伯努利学院) IDEAS Research Institute, Poland(波兰IDEAS研究所) ESAT-PSI, KU Leuven, Belgium(比利时KU莱顿大学ESAT-PSI)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文研究了直接混合图像与文本原型对少样本分类的影响,提出通过投影获取语义对齐的图像子空间,结合文本嵌入和图像特定LDA分类器提升性能。

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19775 2026-03-26 cs.CV 57%

Evaluating Image Editing with LLMs: A Comprehensive Benchmark and Intermediate-Layer Probing Approach

基于大语言模型的图像编辑评估:一个全面的基准和中间层探针方法

Shiqi Gao, Zitong Xu, Kang Fu, Huiyu Duan, Xiongkuo Min, Jia wang

机构 * Institute of Image Communication and Network Engineering, Shanghai Jiao Tong University(图像通信与网络工程研究所,上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出TIEdit基准和EditProbe方法,通过5120张编辑图像和专家评分,评估文本引导图像编辑方法的感知质量、对齐性和内容保真度,同时利用大语言模型中间层探针提升评估准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22855 2026-03-25 cs.AR cs.LG 57%

TorR: Towards Brain-Inspired Task-Oriented Reasoning via Cache-Oriented Algorithm-Architecture Co-design

TorR: 向基于大脑的面向任务推理迈进:通过面向缓存的算法-架构联合设计

Hyunwoo Oh, SungHeon Jeong, Suyeon Jang, Hanning Chen, Sanggeon Yun, Tamoghno Das, Mohsen Imani

机构 * Department of Computer Science, University of California, Irvine(加州大学尔湾分校计算机科学系)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 TorR通过将CLIP式的密集对齐替换为超维(HDC)关联推理,实现了高效的实时推理。在算法层面引入部分相似性重用,在架构层面设计了可扩展的位切内存和轻量控制器,以满足实时性需求,同时在能耗和精度上优于现有基线。

Comments Accepted to DAC 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22304 2026-03-25 cs.LG 57%

Mitigating Premature Discretization with Progressive Quantization for Robust Vector Tokenization

通过渐进量化缓解早期内离散化以实现鲁棒的向量标记化

Wenhao Zhao, Qiran Zou, Zhouhan Lin, Dianbo Liu

机构 * National University of Singapore, Singapore(新加坡国立大学) Shanghai Jiao Tong University, Shanghai, China(上海交通大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

AI总结 本文提出渐进量化方法,通过引入量化难度动态作为VQ训练的关键维度,有效引导代码本向扩展良好的流形发展,提升了多模态模型的生成性能和生物序列建模能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.22276 2026-03-24 cs.LG stat.ML 57%

Scaling DoRA: High-Rank Adaptation via Factored Norms and Fused Kernels

DoRA的扩展:通过因子范数和融合内核进行高秩适应

Alexandra Zelenin, Alexandra Zhuravlyova

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出通过因子范数和融合内核实现高秩适应,减少内存占用并提升计算效率,适用于大规模视觉-语言模型。

Comments 30 pages, 15 figures, 15 tables, including appendices. Code and data at https://github.com/sockeye44/dorafactors

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21504 2026-03-24 cs.CV 57%

Parameter-efficient Prompt Tuning and Hierarchical Textual Guidance for Few-shot Whole Slide Image Classification

高效参数提示调优与层次文本引导在少样本整张滑片图像分类中的应用

Jayanie Bogahawatte, Sachith Seneviratne, Saman Halgamuge

机构 * AI, Optimization and Pattern Recognition Research Group(人工智能、优化与模式识别研究组) Dept. of Mechanical Eng., University of Melbourne, Australia(墨尔本大学机械工程系,澳大利亚)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出高效参数提示调优和层次文本引导方法,以解决少样本整张滑片图像分类中的计算成本和信息损失问题,实验显示在乳腺、肺癌和卵巢癌数据集上均取得显著提升。

Comments Accepted for publication at CVPR 2026 Workshop on Medical Reasoning with Vision Language Foundation Models (Med-Reasoner)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19610 2026-03-24 cs.CV 57%

ParallelVLM: Lossless Video-LLM Acceleration with Visual Alignment Aware Parallel Speculative Decoding

ParallelVLM: 无损视频-大语言模型加速与视觉对齐感知并行推测解码

Quan Kong, Yuhao Shen, Yicheng Ji, Huan Li, Cong Wang

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

AI总结 ParallelVLM通过并行化阶段和无偏验证器引导剪枝策略,有效提升视频理解任务的解码效率,实现3.36倍的加速效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.21010 2026-03-24 cs.CV 57%

SkinCLIP-VL: Consistency-Aware Vision-Language Learning for Multimodal Skin Cancer Diagnosis

SkinCLIP-VL: 一种面向多模态皮肤癌诊断的一致性感知视觉-语言学习框架

Zhixiang Lu, Shijie Xu, Kaicheng Yan, Xuyue Cai, Chong Zhang, Yulong Li, Angelos Stefanidis, Anh Nguyen, Jionglong Su

机构 * Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) University of Liverpool(利物浦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出SkinCLIP-VL,通过冻结感知与自适应推理范式,结合CLIP编码器与轻量量化Qwen2.5-VL,引入一致性聚焦对齐损失,实现高效皮肤癌诊断,优于13B参数基线模型,参数更少且临床信任度更高。

Comments Accepted by 2026 IEEE International Conference on Multimedia and Expo (ICME 2026)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20731 2026-03-24 cs.CV 57%

VSD-MOT: End-to-End Multi-Object Tracking in Low-Quality Video Scenes Guided by Visual Semantic Distillation

VSD-MOT: 低质量视频场景中基于视觉语义蒸馏的端到端多目标跟踪

Jun Du

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出VSD-MOT框架,通过视觉语义蒸馏提升低质量视频中多目标跟踪性能,设计双约束语义蒸馏和动态语义权重调节模块,实验证明其在低质量场景和常规场景中的有效性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.20492 2026-03-24 cs.LG cs.CL 57%

AE-LLM: Adaptive Efficiency Optimization for Large Language Models

AE-LLM:面向大语言模型的自适应效率优化

Kaito Tanaka, Masato Ito, Yuji Nishimura, Keisuke Matsuda, Aya Nakayama

机构 * SANNO University(SANNO大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

AI总结 本文提出AE-LLM框架,通过自适应选择和组合最优效率技术,提升大语言模型在不同部署场景下的效率,实验显示在15种模型和10种任务中,效率提升达2.8倍,精度保持在基线1.2%以内。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15164 2026-03-23 cs.CV 57%

Multimodal Continual Instruction Tuning with Dynamic Gradient Guidance

多模态持续指令微调与动态梯度指导

Songze Li, Mingyu Gao, Tonghua Su, Xu-Yao Zhang, Zhongjie Wang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Guangdong Laboratory of Artificial Intelligence and Digital Economy (SZ)(广东人工智能与数字经济发展实验室) Chongqing Research Institute of HIT(重庆哈工大研究院) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出通过几何参数空间方向向量近似缺失梯度,结合有限回放缓冲区和伯努利采样策略,有效缓解多模态持续指令微调中的灾难性遗忘问题。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19571 2026-03-23 cs.CV 57%

CurveStream: Boosting Streaming Video Understanding in MLLMs via Curvature-Aware Hierarchical Visual Memory Management

CurveStream: 通过曲率感知的层次视觉记忆管理提升MLLMs在流媒体视频理解中的性能

Chao Wang, Xudong Tan, Jianjian Cao, Kangcong Li, Tao Chen

机构 * College of Future Information Technology, Fudan University(未来信息科技学院,复旦大学) Shanghai Innovation Institute(上海创新研究院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 CurveStream通过曲率感知的层次视觉记忆管理框架,在流媒体视频理解中实现显著性能提升,实验表明其在多个基准测试中均优于现有方法,达到新状态-of-the-art结果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19533 2026-03-23 cs.CV cs.RO 57%

Pedestrian Crossing Intent Prediction via Psychological Features and Transformer Fusion

通过心理特征和Transformer融合进行行人过街意图预测

Sima Ashayer, Hoang H. Nguyen, Yu Liang, Mina Sartipi

机构 * The University of Tennessee at Chattanooga(田纳西大学查塔努加分校)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出一种轻量级社交感知架构,通过融合四种行为流实现行人意图预测,采用高效Transformer结构和不确定性量化方法,在PSI 1.0和PSI 2.0数据集上取得优异性能。

Comments Accepted to IEEE Intelligent Vehicles Symposium (IV) 2026. 8 pages, 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.19228 2026-03-20 cs.CV 57%

SAMA: Factorized Semantic Anchoring and Motion Alignment for Instruction-Guided Video Editing

SAMA:用于指令引导视频编辑的因子化语义锚定与运动对齐

Xinyao Zhang, Wenkai Dong, Yuxin Song, Bo Fang, Qi Zhang, Jing Wang, Fan Chen, Hui Zhang, Haocheng Feng, Yu Lu, Hang Zhou, Chun Yuan, Jingdong Wang

机构 * Baidu(百度) Tsinghua University(清华大学) City University of Hong Kong(香港城市大学) Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 SAMA通过因子化语义锚定和运动对齐方法,在无需外部先验知识的情况下实现精确语义修改与运动保真的平衡,展示了强大的零样本视频编辑能力。

Comments 24 pages, 12 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2601.09658 2026-03-20 cs.CV 57%

Image2Garment: Simulation-ready Garment Generation from a Single Image

Image2Garment: 从单张图像生成可模拟的服装

Selim Emir Can, Jan Ackermann, Kiyohiro Nakayama, Ruofan Liu, Tong Wu, Yang Zheng, Hugo Bertiche, Menglei Chai, Thabo Beeler, Gordon Wetzstein

机构 * Stanford University(斯坦福大学) Google(谷歌) Institute of Science Tokyo(东京科学研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出一种框架,通过微调视觉语言模型获取材料属性,再训练轻量预测模型生成物理参数,实现从单张图像生成可模拟的服装。

Comments Project Page: https://image2garment.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17965 2026-03-19 cs.CV 57%

LaDe: Unified Multi-Layered Graphic Media Generation and Decomposition

LaDe:统一的多层图形媒体生成与分解

Vlad-Constantin Lungu-Stan, Ionut Mironica, Mariana-Iuliana Georgescu

机构 * Adobe Research(Adobe研究院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 LaDe通过结合LLM提示扩展器、4D RoPE位置编码的潜在扩散变换器和RGBA VAE,实现灵活的多层媒体设计生成与分解,提升文本到多层媒体设计的对齐能力。

Comments 18 pages (main + supp)

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17326 2026-03-19 cs.CV 57%

FineViT: Progressively Unlocking Fine-Grained Perception with Dense Recaptions

FineViT: 通过密集描述逐步解锁细粒度感知

Peisen Zhao, Xiaopeng Zhang, Mingxing Xu, Ruoyu Sun, Zewei Du, Dunzheng Wang, Guanghao Zheng, Haohang Xu, Zhibo Zhang, Yuhang Zhang, Yi Ai, Lin Liu, Qi Tian

机构 * Huawei Inc.(华为公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 FineViT通过密集描述逐步训练,提升细粒度视觉感知能力,在长上下文检索中表现优异,超越现有多模态视觉编码器。

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.17244 2026-03-19 cs.AI cs.IR cs.LO 57%

Graph-Native Cognitive Memory for AI Agents: Formal Belief Revision Semantics for Versioned Memory Architectures

面向AI代理的图原认知记忆:版本化记忆架构的正式信念修订语义

Young Bin Park

机构 * Kumiho Inc.(科米霍公司)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出Kumiho架构,结合正式信念修订语义,实现统一的图原记忆系统,通过双重存储模型和混合检索方式,在LoCoMo和LoCoMo-Plus基准测试中取得显著性能提升。

Comments 56 pages, 1 figure

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.22496 2026-03-19 cs.CV 57%

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

MLLMs关注什么以及依赖什么:解释自回归标记生成

Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

机构 * Institute of Information Engineering, Chinese Academy of Sciences(中国科学院信息工程研究所) University of Chinese Academy of Sciences(中国科学院大学) Department of Computer Science, Hong Kong Baptist University(香港 Baptist 大学计算机科学系) College of Computing and Data Science, NTU(NTU 计算与数据科学学院) Huawei(华为) School of Flexible Electronics, SYSU(SYSU 灵活电子学院) School of Cyber Science and Technology, Shenzhen Campus of Sun Yat-sen University(Sun Yat-sen 大学深圳校区计算机科学与技术学院)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出EAGLE框架,通过轻量级黑盒方法解释MLLMs的自回归标记生成,量化语言先验和感知证据的影响,提升模型可解释性。

Comments Accepted to CVPR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.16641 2026-03-18 cs.CV 57%

FlowComposer: Composable Flows for Compositional Zero-Shot Learning

FlowComposer: 用于组合零样本学习的可组合流

Zhenqi He, Lin Li, Long Chen

机构 * The Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出FlowComposer,通过学习两个基础流将视觉特征传输到属性和对象文本嵌入,并引入可学习的Composer显式融合速度场以生成组合流,有效解决组合零样本学习中的隐式组合构造和特征纠缠问题。

Comments Accepted to CVPR2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.14336 2026-03-17 cs.CV 57%

UAVBench and UAVIT-1M: Benchmarking and Enhancing MLLMs for Low-Altitude UAV Vision-Language Understanding

UAVBench 和 UAVIT-1M:用于低空无人机视觉-语言理解的LLM基准测试与增强

Yang Zhan, Yuan Yuan

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出UAVBench和UAVIT-1M,用于评估和提升LLM在低空无人机视觉-语言任务中的能力,通过大规模数据集和基准测试揭示开源LLM在低空视觉内容生成上的不足,并通过微调提升性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.16931 2026-03-17 cs.AI 57%

Narrow Fine-Tuning Erodes Safety Alignment in Vision-Language Agents

细粒度微调会削弱视觉语言代理的安全对齐

Idhant Gulati, Shivam Raval

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.AI

AI总结 研究发现细粒度微调在有害数据集上会导致广泛的任务和模态对齐偏差,且单模态安全基准可能低估视觉语言模型的对齐退化。

Comments 25 pages, 14 figures, Published at the Lifelong Agent Workshop at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏