arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 546 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 546 篇

2606.18553 2026-06-18 cs.CV 新提交 81%

Hierarchical Multi-Modal Retrieval for Knowledge-Grounded News Image Captioning

基于知识的分层多模态检索用于新闻图像描述生成

Minh-Loi Nguyen, Xuan-Vu Le, Long-Bao Nguyen, Hoang-Bach Ngo, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南国立大学胡志明市分校理学院) Vietnam National University, Ho Chi Minh City(越南国立大学胡志明市分校)

专题命中 VLM训练与架构 :VLM(summary_cn,abstract);分类 cs.CV

AI总结 提出分层多模态文章检索增强的图像描述框架,通过结构感知检索和上下文精炼,结合VLM和LLM生成富含上下文细节的描述,在EVENTA 2025挑战赛中获得第5名。

Comments SOICT 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19075 2026-08-20 cs.CV cs.AI cs.CL 新提交 81%

ReWEIGH the Evidence: Calibrating Token-Level Ordinal Visual Evidence to Mitigate Hallucinations in Large Vision-Language Models

重新权衡证据:校准令牌级有序视觉证据以减轻大型视觉语言模型的幻觉

Jihae Jeong, Junha Choi, Hwanjo Yu

机构 * Pohang University of Science and Technology (POSTECH)(浦项科技大学(POSTECH))

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 ReWEIGH是一种无需训练的解码干预方法,通过聚合视觉位置的令牌排名并施加有界惩罚,在多个7B至32B规模的LVLM上减少了最多21.3%的幻觉对象提及,且延迟增加极少。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.15425 2026-08-18 cs.CV cs.AI 新提交 81%

NumerosityVLM: A Cognitively Inspired Benchmark for Interpreting Numerosity Representations in Vision-Language Models

NumerosityVLM:一种受认知启发的、用于解释视觉-语言模型中数量表征的基准测试

Yiming Fu, Fangjun Li, Xiujin Liu, Ruidong Ma, Hang Yu, Zhichen Lu, Kanwei He, Alessandro Di Nuovo, Angelo Cangelosi, Zhegong Shangguan

机构 * The University of Manchester(曼彻斯特大学) University of Michigan(密歇根大学) Sheffield Hallam University(谢菲尔德哈勒姆大学) Tufts University(塔夫茨大学) ENSTA, Institut Polytechnique de Paris(巴黎综合理工学院国立高等先进技术学校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究针对视觉-语言模型数量感知研究的基准缺陷,提出受认知启发的NumerosityVLM基准,评估7个模型发现架构对性能影响最大,数量信号出现在视觉编码器早期,差异主要来自语言模型组件。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.07562 2026-08-11 cs.CV cs.LG 新提交 81%

Mechanistic Interpretability-Guided Selective Fine-Tuning of Vision-Language Models for Centimeter-Level Flood Depth Estimation

面向厘米级洪水深度估计的、由机械可解释性引导的视觉-语言模型选择性微调

Nafis Fuad, Xiaodong Qian, Dongxiao Zhu

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 该研究针对城市洪水缺乏厘米级实时深度估计的问题,提出三种视觉-语言模型,通过机械可解释性分析确定关键交叉注意力层进行选择性微调,在合成与真实基准测试中均实现高精度洪水深度估计,大幅减少可训练参数。

Comments This Paper is accepted in International Conference on Machine Learning and Application (ICMLA) 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.04496 2026-08-06 cs.CV cs.LG 新提交 81%

DIVE: Dynamic Iterative Visual Evidence Construction for Efficient Vision-Language Models

DIVE:面向高效视觉-语言模型的动态迭代视觉证据构建

Chen Zhong, Xiao An, Zijie Wang, Jiepan Li, Guangyi Yang, Wei He

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 本研究针对视觉-语言模型中视觉token导致的推理瓶颈,提出无需训练的DIVE框架,通过动态迭代构建视觉证据,在减少88.9%视觉token的同时保留98.2%的平均性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01821 2026-08-04 cs.CV cs.LG 新提交 81%

DAVET: Denoising-Aware Visual Evidence Trajectory Allocation for Diffusion Vision-Language Models

DAVET:面向扩散视觉-语言模型的降噪感知视觉证据轨迹分配

Yongkang Zhou, Xiang Xia, Cheng Yan, Fan Xu, Wuyang Zhang

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.LG

AI总结 DAVET 是一种无需训练的框架,通过根据扩散视觉-语言模型的生成状态自适应分配视觉证据,实现平均 1.55 倍加速且仅 1.86% 的平均性能下降,降低了视觉条件成本。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.01644 2026-08-04 cs.CV cs.AI 新提交 81%

CRAFT: Compression via Recursive Adaptive Fusion of Video Tokens for Vision-Language Models

CRAFT:面向视觉语言模型的基于视频令牌递归自适应融合的压缩方法

Yu Chen, Xiaohong Li, Xiaole Wang, Jianjin Zhang, Jun Sun, Yafeng Deng

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 针对视觉语言模型视频令牌压缩效率与适应性的权衡问题,提出CRAFT方法,通过解耦令牌选择与融合实现高效压缩,在8倍压缩时保留97%主干准确率且性能优于现有方法。

Comments 11 pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.04593 2026-07-07 cs.CV cs.AI 新提交 81%

TORINO: Token Reduction via Interpretable Concept Overlap in Vision-Language Models

TORINO:通过视觉语言模型中可解释的概念重叠进行令牌减少

Riccardo Renzulli, Gabriele Spadaro, Shruthi Gowda, Alaa Eddine Mazouz, Van-Tam Nguyen

机构 * University of Turin, Italy(意大利都灵大学) Eindhoven University of Technology, The Netherlands(荷兰埃因霍温理工大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型计算成本高问题,提出TORINO框架,利用稀疏自动编码器将视觉令牌投影到可解释潜在空间,通过概念重叠分组并减少令牌,兼顾效率与准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02995 2026-07-07 cs.CV cs.AI 新提交 81%

VISTA: Auditing Semantic Divergence in Vision-Language Models

VISTA:视觉语言模型中的语义差异审计

Junchi Liao, Jiawen Deng, Fuji Ren

机构 * University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究视觉语言模型中视觉概念条件性差异,提出VISTA黑箱跨模型审计方法,结合语义熵与基于分布的差异标记异常,通过实验验证其有效性并发现新差异模式。

Comments Preprint. 3 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.02819 2026-07-07 cs.CR cs.AI cs.CV 新提交 81%

Vision Token Manipulation Attacks on Cloud-Edge Inference of Large Vision-Language Models

对大型视觉语言模型云边缘推理的视觉令牌操纵攻击

Zikai Zhang, Rui Hu, Olivera Kotevska, Jiahao Xu

机构 * Department of Computer Science and Engineering, University of Nevada, Reno(内华达大学里诺分校计算机科学与工程系) Oak Ridge National Laboratory(橡树岭国家实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI

AI总结 研究黑盒中间人设置下的视觉令牌操纵攻击,提出四种简答攻击策略和基于优化的令牌选择方法,实验表明操纵少量视觉令牌可大幅降低大型视觉语言模型云边缘推理的准确性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10797 2026-07-14 cs.CV 新提交 80%

Compositional Context Fine-Tuning Vision-Language Model for Complex Assembly Action Understanding from Videos

用于从视频理解复杂装配动作的组合上下文微调视觉语言模型

Hao Zheng, Jinyi Huang, Tiantian Zheng, Xun Xu, Tuka Alhanai

机构 * New York University Abu Dhabi(纽约大学阿布扎比分校) The University of Auckland(奥克兰大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV;vision language model(comments)

AI总结 针对装配动作理解难题,提出组合上下文微调方法及层划分交替训练方法,将动作分解为语义元素并微调视觉语言模型,创建相关数据集,实验证明该方法优于基线且能提供可解释预测,助力人机协作装配。

Comments Accepted by ICRA 2026. Video Understanding; Vision Language Model; Multi-modal LLM; Action Recognition; Assembly

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.05949 2026-08-07 cs.AI cs.CV cs.LG 新提交 80%

VLMs for Videogame Data Annotation

用于视频游戏数据标注的视觉语言模型(VLMs)

Katrin Schmid, Iuri Frosio

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 该研究针对VLMs在视频游戏应用受限的问题,探究其用于游戏帧序列奖励信号标注的可行性,分析其在游戏问答中的不足并提出应对措施,还研究了输入参数对标注质量的影响。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.00584 2026-08-04 cs.CV cs.AI cs.LG 新提交 80%

Element-Aware Group Learning for E-Commerce Image Generation

面向电商图像生成的元素感知组学习

Jingtong Chen, Jiahui Wang, Xue Zhao, ShaoGuo Liu, Minghao Li

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对电商图像生成中GRPO仅在完整提示层面分配信用的缺陷,提出EAGLE-GRPO,通过分解奖励并推导闭式解实现元素级信用分配,提升提示质量与生成图像性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.10666 2026-07-14 cs.CV cond-mat.mtrl-sci cs.AI cs.LG 新提交 80%

Answer-Conditioned Chain-of-Thought Distillation for Few-Shot Industrial Vision with Small VLMs

用于少样本工业视觉的小视觉语言模型的答案条件思维链蒸馏

Shubham Rao

机构 * Entropy AI Research Labs Private Limited(熵人工智能研究实验室私人有限公司)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对制造业视觉检测难题,提出答案条件思维链蒸馏法,利用最少标注数据让小型视觉语言模型适应新工业任务,经实验验证该方法在多任务中优于直接微调,提升了推理质量和模型性能。

Comments 11 pages, 5 figures, 8 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.07401 2026-07-09 cs.CV cs.AI cs.LG 新提交 80%

Heterogeneity-Adaptive Diffusion Schrodinger Bridge for PET-Guided Whole-Body MRI Translation

用于PET引导的全身MRI转换的异质性自适应扩散薛定谔桥

Chengbo Wang, Jiacheng Yu, Linjie Bian, Ming Qi, Xiaosheng Liu, Tongtong Che, Jichang Zhang, Shuyu Li, Shaoli Song, Xiuying Wang

机构 * The University of Sydney(悉尼大学) Fudan University Shanghai Cancer Center(复旦大学附属上海肿瘤医院) Beijing Normal University(北京师范大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对PET-MR扫描时间长的问题,提出异质性自适应扩散薛定谔桥(HA-DSB)框架,通过整合视觉语言模型嵌入及PET先验,利用双阶段引导机制,实现全身MRI转换,提升不同区域尤其是病变区域的转换质量。

Comments Accepted at MICCAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.03624 2026-07-07 cs.CV cs.AI cs.LG 新提交 80%

RADIO1D: Elastic Representations for Condensed Vision Modeling

RADIO1D:用于压缩视觉建模的弹性表示

Greg Heinrich, Mike Ranzinger, Collin McCarthy, Natan Bagrov, Eugene Khvedchenya, Bryan Catanzaro, Jan Kautz, Andrew Tao, Pavlo Molchanov

机构 * NVIDIA(英伟达)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 挑战视觉语言模型需固定基于补丁的2D视觉特征的假设,分析微调视觉编码器,基于发现引入RADIO1D,用多教师知识蒸馏等将图像压缩成1D令牌序列,有强分层总结能力,在多模态基准测试中有优势。

Comments Published as main conference paper at ICML 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.23679 2026-06-23 cs.CV cs.AI cs.GR cs.LG 新提交 80%

Semantic Browsing: Controllable Diversity for Image Generation

语义浏览:图像生成的可控多样性

Sara Dorfman, Maya Vishnevsky, Omer Dahary, Or Patashnik, Daniel Cohen-Or

机构 * Tel Aviv University(特拉维夫大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 针对文本到图像模型生成多样性不足且缺乏语义结构的问题,提出一种在文本层面引入多样性的方法,通过视觉语言模型和代理工作流实现用户可导航的语义变化空间。

Comments ECCV 2026. Project page: https://saradorfman1.github.io/SemanticBrowsing-webpage/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.09059 2026-06-09 cs.LG cs.AI cs.CV 新提交 80%

Stage-1 Controls the Entropy Regime, Not the Outcome

Stage-1 控制熵状态,而非最终结果

Jianxiong Shen

机构 * University of California, Berkeley(加州大学伯克利分校)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文通过小数据实验研究两阶段后训练中Stage-1(SFT或OPD)的作用,发现其主要影响策略熵状态,但对最终性能影响有限。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08060 2026-08-11 cs.CV 新提交 79%

ZOMP: Zeroth-Order Multi-Modal Prompt Tuning for Vision-Language Models

ZOMP:面向视觉-语言模型的零阶多模态提示调优

Sajjad Ghiasvand, Yifan Yang, Mahnoosh Alizadeh, Ramtin Pedarsani

机构 * UC Santa Barbara(加州大学圣巴巴拉分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出ZOMP方法,通过跨模态低秩重参数化等技术,在仅前向传递的条件下高效调优CLIP模型,在13个基准上优于现有无反向传播的提示调优方法,泛化能力更强。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.03580 2026-08-05 cs.CV 新提交 79%

SlimVLM: Sensitivity-aware Dynamic Structured Pruning with Adaptive Visual Token Selection for Efficient Vision-Language Models

SlimVLM:面向高效视觉-语言模型的感知敏感性动态结构化剪枝与自适应视觉token选择

Yaozhi Wen, Jialong Guo, Zhenliang Ni, Han Shu, Xinghao Chen

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 SlimVLM是一种结构化剪枝框架,通过自适应视觉token选择和感知敏感性动态剪枝机制,在压缩视觉-语言模型的同时保持性能,在多模态基准测试中达到最优。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.25818 2026-07-29 cs.CV 新提交 79%

SepPrune:A Separator-based Pruning Framework for Efficient Multimodal Large Language Models

SepPrune:一种基于分隔符的高效多模态大语言模型剪枝框架

Yuchen Wang, Qihui Zhu, Yang Liu, Xiaoyan Sun, Siying Wu

机构 * University of Science and Technology of China(中国科学技术大学) ChangXin Memory Technologies(长鑫存储技术有限公司)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 针对多模态大语言模型视觉令牌计算成本高的问题,提出SepPrune剪枝方法,以模态分隔符令牌为统一查询来排序和选择视觉令牌,复用内置投影参数,无需架构更改,在Qwen2.5-VL-7B上实验取得最优性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.24447 2026-07-28 cs.CV 新提交 79%

RP-OPSD: Resolution-Privileged On-Policy Self-Distillation for Multimodal Large Language Models

RP - OPSD:用于多模态大语言模型的分辨率特权在线自蒸馏

Qihui Zhu, Yuchen Wang, Zijian Wen, Tao Zhang, Mengjie Zhang, Yang Liu, Shuangwu Chen, Siying Wu, Jian Yang, Xiaofeng Jiang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 研究针对多模态大语言模型在线自蒸馏问题,利用同一图像高低分辨率视图信息差提出RP - OPSD,学生策略用低分辨率图像生成轨迹,教师策略用原始分辨率图像监督,实验表明该方法能提升性能并加快训练速度,为在线自蒸馏提供有效途径。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.17052 2026-07-21 cs.CV 新提交 79%

Searching for Task-Specific Vision Paths: Evolutionary Block Pruning Across Vision-Language Models

寻找特定任务的视觉路径:跨视觉语言模型的进化块剪枝

Tarun Tomar

机构 * IIIT(国际信息技术研究所)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型中能否跳过固定预算视觉块组合,引入源平衡进化搜索并与其他方法比较,实验表明组合搜索可改进路由构建,但能力标签不能定义普遍可转移视觉路径,搜索能跨架构转移,能力专业化稳定性欠佳。

Comments 14 pages, 8 figures. Code and aggregate evidence: https://github.com/TarunTomar122/vision-pathways

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.14966 2026-07-17 cs.CV 新提交 79%

U-shaped Multi-granularity Learning for Vision-Language Models

用于视觉语言模型的U形多粒度学习

Biao Chen, Yunqian Yu, Xiangxu Zhao, Zhongshu Chen, Mengmeng Jing, Lin Zuo

机构 * University of Electronic Science and Technology of China(电子科技大学) Hithink Research(恒生电子股份有限公司)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 研究视觉语言模型提示学习的粒度困境,提出U形多粒度提示学习框架UPrompt,通过构建并行多粒度表示及粗细粒度交互增强与监督,在多个基准实验中验证了其有效性和优势。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.13500 2026-07-16 cs.CV 新提交 79%

Attention-Free and Lightweight Token Reduction for Efficient Vision-Language Models

用于高效视觉语言模型的无注意力轻量级令牌约简

Xuanyi Hao, Zuoyuan Zhang, Zhibo Wang, Xiaoyi Pang, Jiahui Hu, Jiacheng Du, Shuguo Zhuo

机构 * Zhejiang University(浙江大学) Hong Kong University of Science and Technology(香港科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对视觉语言模型在边缘设备部署难的问题,提出无注意力轻量级令牌约简框架,通过基于熵的准则估计令牌重要性,引入一致性信号确保视觉覆盖,经实验验证该框架在精度和效率权衡上表现出色。

Comments This work has been submitted to the IEEE for possible publication

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.08029 2026-07-10 cs.LG 新提交 79%

Rethinking Small VLM Quantization: From Component-Wise Analysis to Hardware-Aware Edge Deployment

重新思考小型视觉语言模型量化:从组件级分析到硬件感知边缘部署

Hyeju Shin, Chorwon Kim, Ryangsoo Kim, Hark Yoo, Jaein Kim

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract);分类 cs.LG

AI总结 本文针对小型视觉语言模型量化,提出系统评估框架,在特定硬件上验证五个假设,分离相关组件得出结论,包括量化敏感性受结构范式影响、SigLIP编码器延迟情况、大语言模型INT4量化利弊、复合量化误差特点及不同平台每焦耳智能差异。

Comments 14 pages. Accepted at the ICML 2026 Workshop on Hypothesis Testing

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.06185 2026-07-08 cs.CV 新提交 79%

Structured-Condensed Prompt Tuning in Vision-Language Models for Fine-grained Image Recognition

用于细粒度图像识别的视觉语言模型中的结构化压缩提示调优

Xinda Liu, Qinyu Zhang, Weiqing Min, Guohua Geng, Shuqiang Jiang

机构 * School of Information Science and Technology, Northwest University(西北大学信息科学与技术学院) Laboratory of Intelligent Information Processing, Institute of Computing Technology(中国科学院计算技术研究所智能信息处理重点实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 针对细粒度图像识别中视觉语言模型捕捉细微差别能力有限的问题,提出结构化压缩提示调优(SCPT),通过语义关系编码和语义压缩损失增强语义结构建模,在多基准实验中有效减轻语义模糊性,取得领先性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2607.01908 2026-07-03 cs.CV 新提交 79%

Towards Real-World Ultrasound Understanding: Large Vision-Language Models from Multi-Image Examinations with Long-Form Reports

迈向真实世界超声理解:基于多图像检查与长文本报告的大规模视觉语言模型

Bingcong Yan, Chunlei Li, Jingliang Hu, Yilei Shi, Xiao Xiang Zhu, Lichao Mou

机构 * MedAI Technology (Wuxi) Co. Ltd.(MedAI科技(无锡)有限公司) Technical University of Munich(慕尼黑工业大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV

AI总结 通过构建150万次真实超声检查的大规模数据集(含1770万图像和多器官覆盖),采用标准视觉语言模型结合低秩适配微调,无需复杂架构即实现多任务超声理解性能领先。

Comments Project Page: https://medai-t.github.io/LUMI/

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.28266 2026-06-29 cs.CV 新提交 79%

RSICCLLM: A Multimodal Large Language Model for Remote Sensing Image Change Captioning

RSICCLLM:用于遥感图像变化描述的多模态大语言模型

Yelin Wang, Zijia Song, Shuo Ye, Chuanguang Yang, Miaoyu Wang, Yong Xu, Zhulin An, Yongjun Xu, Zitong Yu

机构 * State Key Laboratory of AI Safety, Institute of Computing Technology, Chinese Academy of Sciences, Beijing, China(人工智能安全国家重点实验室,计算技术研究所,中国科学院,北京,中国) Great Bay University, Dongguan, China(东莞Great Bay大学,中国) Harbin Institute of Technology, Shenzhen, China(哈尔滨工业大学深圳学院,中国) Dongguan Key Laboratory for Intelligence and Information Technology, Dongguan, China(东莞智能与信息科技重点实验室,中国)

专题命中 VLM训练与架构 :multimodal large language model(title);vision-language model(abstract);分类 cs.CV

AI总结 提出首个针对遥感图像变化描述任务的大视觉语言模型后训练框架RSICCLLM,通过数据生成范式、差异感知微调和双负偏好优化,仅7B参数即超越更大规模模型。

Comments Accepted by ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2606.24156 2026-06-24 cs.CV 新提交 79%

Accelerating Multimodal Large Language Models with Prior-Corrected Token Reduction

利用先验校正的令牌缩减加速多模态大语言模型

Zengjie Chen, Yuxiang Cai, Jingcai Guo, Taotao Cai, Jianwei Yin, Zhi Chen

机构 * School of Software Technology, Zhejiang University(浙江大学软件学院) Zhejiang Key Laboratory of Digital-Intelligence Service Technology(浙江省数字化服务技术重点实验室) Hong Kong Polytechnic University(香港理工大学) The University of Southern Queensland(南昆士兰大学)

专题命中 VLM训练与架构 :multimodal large language model(title,abstract);分类 cs.CV

AI总结 提出PriorTR方法,通过分离任务条件注意力与模型先验注意力,在单次前向传播中估计先验并校正令牌重要性,实现无训练令牌缩减,提升多模态大语言模型效率与准确性。

Comments Accepted to ECCV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏