arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-03 至 2025-12-03 共收录 39 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 8 篇

2503.21214 2025-12-03 cs.CV cs.CL 83%

VoxRep: Enhancing 3D Spatial Understanding in 2D Vision-Language Models via Voxel Representation

VoxRep:通过体素表示增强2D视觉-语言模型的3D空间理解

Alan Dao, Norapat Buppodom

机构 * Menlo Research(Menlo研究)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出VoxRep方法,通过将体素空间切分为2D切片并输入预训练的视觉-语言模型,实现对3D环境的高效语义理解。

Journal ref Proc. APSIPA ASC 2025, pp. 1464-1469

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09809 2025-12-03 cs.CV cs.AI cs.LG 82%

Test-Time Spectrum-Aware Latent Steering for Zero-Shot Generalization in Vision-Language Models

测试时谱感知的潜在引导用于视觉-语言模型中的零样本泛化

Konstantinos M. Dafnis, Dimitris N. Metaxas

机构 * Rutgers University(罗格斯大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出STP,一种轻量级的测试时适应框架,通过谱感知方法引导潜在表示,提升视觉-语言模型在零样本泛化中的性能,同时保持高效推理速度和低内存消耗。

Comments NeurIPS 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02584 2025-12-03 cs.MM 80%

Stepwise Schema-Guided Prompting Framework with Parameter Efficient Instruction Tuning for Multimedia Event Extraction

分步模式引导提示框架与参数高效指令微调用于多模态事件提取

Xiang Yuan, Xinrong Chen, Haochen Li, Hang Yang, Guanyu Wang, Weiping Li, Tong Mo

专题命中 VLM训练与架构 :LLaVA(abstract);grounding(abstract);multimodal large language model(abstract);MLLM(abstract)

AI总结 本文提出分步模式引导提示框架与参数高效指令微调方法,用于提升多模态事件提取任务的性能。

Comments Accepted by 2025 IEEE International Conference on Multimedia and Expo

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01629 2025-12-03 cs.CV cs.RO 79%

SPARK: Sim-ready Part-level Articulated Reconstruction with VLM Knowledge

SPARK: 面向模拟的关节化重建与VLK知识

Yumeng He, Ying Jiang, Jiayin Lu, Yin Yang, Chenfanfu Jiang

专题命中 VLM训练与架构 :VLM(title,abstract);分类 cs.CV

AI总结 SPARK通过结合VLK和生成扩散模型,实现从单张图像中生成物理一致的关节化3D物体,提升机器人操作和交互建模的应用效果。

Comments Project page: https://heyumeng.com/SPARK/index.html. 17 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.06183 2025-12-03 cs.RO 67%

Sampling-Based Model Predictive Control for Dexterous Manipulation on a Biomimetic Tendon-Driven Hand

基于采样的模型预测控制在仿生腱驱动手的灵巧操作中的应用

Adrian Hess, Alexander M. Kübler, Benedek Forrai, Mehmet Dogar, Robert K. Katzschmann

机构 * Soft Robotics Lab, Department of Mechanical and Process Engineering, ETH Zurich(苏黎世联邦理工学院机械与过程工程系软机器人实验室) School of Computer Science, University of Leeds(利兹大学计算机科学学院)

专题命中 VLM训练与架构 :VLM(abstract);visual language model(abstract)

AI总结 本研究提出利用基于采样的模型预测控制实现仿生腱驱动手的灵巧操作,通过结合视觉语言模型与实时优化器,有效生成接触丰富的行为。

Comments For a video, see https://youtu.be/u4d6v3ohsOI

Journal ref 2025 IEEE/RSJ International Conference on Intelligent Robots and Systems (IROS)

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02438 2025-12-03 cs.CV cs.AI 62%

Boosting Medical Vision-Language Pretraining via Momentum Self-Distillation under Limited Computing Resources

通过有限计算资源下的动量自蒸馏提升医学视觉-语言预训练

Phuc Pham, Nhu Pham, Ngoc Quoc Ly

机构 * Faculty of Information Technology, University of Science, Ho Chi Minh City, Vietnam(信息科技学院,科学大学,胡志明市,越南) Vietnam National University, Ho Chi Minh City, Vietnam(越南国家大学,胡志明市,越南)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过动量自蒸馏与梯度累积提升医学视觉-语言预训练效率,实现高效多模态学习并提升零样本分类和少量样本适应性能。

Comments WACV 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02273 2025-12-03 cs.CV cs.AI 62%

Progressive Image Restoration via Text-Conditioned Video Generation

通过文本条件视频生成实现渐进式图像修复

Peng Kang, Xijun Wang, Yu Yuan

机构 * Department of Computer Science, University of Illinois Springfield(伊利诺伊大学斯普林菲尔德分校计算机科学系) School of Electrical and Computer Engineering, Purdue University(普渡大学电气与计算机工程学院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI

AI总结 本研究通过微调CogVideo,利用文本条件视频生成实现图像渐进式修复,提升感知度量并展示强泛化能力。

Comments First two authors contributed equally to this work. IEEE ICNC Accepted

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 2 篇

2512.02713 2025-12-03 cs.AI 57%

Training Data Attribution for Image Generation using Ontology-Aligned Knowledge Graphs

利用本体对齐的知识图谱训练数据归因于图像生成

Theodoros Aivalis, Iraklis A. Klampanos, Antonis Troumpoukis, Joemon M. Jose

机构 * National Centre for Scientific Research ``Demokritos''(国家科学研究中心「德莫克里特」) University of Glasgow(格拉斯哥大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

AI总结 本文提出利用本体对齐的知识图谱方法,通过多模态大语言模型提取图像中的结构化三元组,以追踪生成模型中训练数据的影响,从而提升透明度和可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.02517 2025-12-03 cs.CV 57%

SkyMoE: A Vision-Language Foundation Model for Enhancing Geospatial Interpretation with Mixture of Experts

SkyMoE:一种用于增强遥感解释的视觉-语言基础模型

Jiaqi Liu, Ronghao Fu, Lang Sun, Haoran Liu, Xiao Yang, Weipeng Zhang, Xu Na, Zhuoran Duan, Bo Yang

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

AI总结 SkyMoE通过Mixture-of-Experts架构提升遥感多模态多任务处理能力,实现对不同粒度任务的高效适应与优化。

详情

展开后加载摘要…

URL PDF HTML 收藏