arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2026-02-10 至 2026-02-10 共收录 22 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 22 篇

2602.07051 2026-02-10 cs.CV cs.AI cs.LG cs.NE 89%

Neural Sentinel: Unified Vision Language Model (VLM) for License Plate Recognition with Human-in-the-Loop Continual Learning

神经哨兵:用于车牌识别的统一视觉语言模型(VLM)与人类在循环持续学习

Karthik Sivakoti

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 Neural Sentinel利用视觉语言模型实现车牌识别与多任务学习,提升准确率并减少系统复杂性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07013 2026-02-10 cs.CV cs.AI cs.LG 85%

Steering to Say No: Configurable Refusal via Activation Steering in Vision Language Models

转向说不:通过激活转向实现可配置拒绝在视觉语言模型中

Jiaxi Yang, Shicheng Liu, Yuchen Yang, Dongwon Lee

机构 * The Pennsylvania State University, USA(宾夕法尼亚州立大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 本文提出CR-VLM,通过激活转向实现视觉语言模型中的可配置拒绝,解决现有拒绝策略无法适应多样化需求的问题,提升模型的安全性和适应性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08099 2026-02-10 cs.CV cs.AI 84%

VidVec: Unlocking Video MLLM Embeddings for Video-Text Retrieval

VidVec:解锁视频MLLM嵌入用于视频-文本检索

Issar Tzachor, Dvir Samuel, Rami Ben-Ari

专题命中 VLM训练与架构 :MLLM(title,abstract);multimodal large language model(abstract);分类 cs.CV、cs.AI

AI总结 VidVec通过利用预训练MLLM的中间层嵌入和校准头部,实现无需训练的视频-文本检索,超越现有方法,达到最佳性能。

Comments Project page: https://iyttor.github.io/VidVec/

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.04864 2026-02-10 cs.CV 83%

When LLaVA Meets Objects: Token Composition for Vision-Language-Models

当LLaVA遇见物体:用于视觉-语言模型的标记组成

Soumya Jahagirdar, Walid Bousselham, Anna Kukleva, Hilde Kuehne

机构 * Tuebingen AI Center/University of Tuebingen(图宾根人工智能中心/图宾根大学) Max Planck Institute for Informatics, SIC(马克斯·普朗克信息学院,SIC) MIT-IBM Watson AI Lab(麻省理工-IBM沃森人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(title,abstract);vision language model(abstract);分类 cs.CV

AI总结 本文提出Mask-LLaVA框架,通过结合多级视觉特征,实现更高效的视觉语言模型,减少标记数量的同时保持性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07790 2026-02-10 cs.LG 83%

MaD-Mix: Multi-Modal Data Mixtures via Latent Space Coupling for Vision-Language Model Training

MaD-Mix: 通过潜在空间耦合实现多模态数据混合用于视觉-语言模型训练

Wanyun Xie, Francesco Tonin, Volkan Cevher

机构 * LIONS, EPFL(EPFL 雷奥尼实验室)

专题命中 VLM训练与架构 :vision-language model(title,abstract);VLM(abstract);分类 cs.LG

AI总结 MaD-Mix通过潜在空间耦合实现多模态数据混合,提升视觉-语言模型训练效率,减少训练步骤并增强复杂场景下的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2512.01952 2026-02-10 cs.CV cs.AI cs.LG cs.RO 82%

GrndCtrl: Grounding World Models via Self-Supervised Reward Alignment

GrndCtrl: 通过自监督奖励对齐实现世界模型的 grounding

Haoyang He, Jay Patrikar, Dong-Ki Kim, Max Smith, Daniel McGann, Ali-akbar Agha-mohammadi, Shayegan Omidshafiei, Sebastian Scherer

专题命中 VLM训练与架构 :grounding(title,abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 GrndCtrl通过自监督奖励对齐提升世界模型的几何 grounding,实现更稳定的空间一致性与导航性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08713 2026-02-10 cs.CV cs.LG 79%

Towards Understanding Multimodal Fine-Tuning: Spatial Features

迈向多模态微调的理解:空间特征

Lachin Naghashyar, Hunar Batra, Ashkan Khakzar, Philip Torr, Ronald Clark, Christian Schroeder de Witt, Constantin Venhoff

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文通过分阶段模型差分技术,揭示了多模态微调过程中视觉特征如何形成及空间关系编码,提升了多模态训练的可解释性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08219 2026-02-10 cs.HC 78%

HOICraft: In-Situ VLM-based Authoring Tool for Part-Level Hand-Object Interaction Design in VR

HOICraft:基于VLM的现场手-物体交互设计VR部分级作者工具

Dohui Lee, Qi Sun, Sang Ho Yoon

专题命中 VLM训练与架构 :VLM(title,abstract)

AI总结 HOICraft是一种基于VLM的VR手-物体交互设计工具,通过推荐可交互元素、自定义属性和映射手部运动,提升VR中HOI设计效率。

Comments 25 pages, 15 figures, Presented at ACM CHI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07041 2026-02-10 cs.CV cs.LG 73%

OMNI-Dent: Towards an Accessible and Explainable AI Framework for Automated Dental Diagnosis

OMNI-Dent:迈向一个可及且可解释的AI框架,用于自动化牙科诊断

Leeje Jang, Yao-Yi Chiang, Angela M. Hastings, Patimaporn Pungchanchaikul, Martha B. Lucas, Emily C. Schultz, Jeffrey P. Louie, Mohamed Estai, Wen-Chen Wang, Ryan H. L. Ip, Boyen Huang

机构 * University of Minnesota(明尼苏达大学) Khon Kaen University(科恩卡恩大学) Minnesota State University(明尼苏达州立大学) The University of Western Australia(西澳大学) Kaohsiung Medical University(高雄医学院) Auckland University of Technology(奥克兰理工大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV、cs.LG

AI总结 OMNI-Dent通过结合临床推理原则和视觉语言模型,提供一个数据高效且可解释的牙科诊断框架,帮助用户识别异常并判断是否需要专业评估。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08439 2026-02-10 cs.CV 70%

Demo-ICL: In-Context Learning for Procedural Video Knowledge Acquisition

Demo-ICL: 用于过程视频知识获取的上下文学习

Yuhao Dong, Shulin Tian, Shuai Liu, Shuangrui Ding, Yuhang Zang, Xiaoyi Dong, Yuhang Cao, Jiaqi Wang, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室) CUHK-MMLab(香港大学多媒体实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

AI总结 Demo-ICL通过两阶段训练策略提升模型从上下文示例中学习的能力,针对视频理解中的新挑战提出Demo-ICL-Bench基准测试。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.05809 2026-02-10 cs.CV 70%

Focus-Scan-Refine: From Human Visual Perception to Efficient Visual Token Pruning

聚焦-扫描-精炼:从人类视觉感知到高效的视觉令牌修剪

Enwei Tong, Yuanchao Bai, Yao Zhu, Junjun Jiang, Xianming Liu

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 FSR是一种受人类视觉感知启发的高效视觉令牌修剪框架,通过聚焦关键证据、全局扫描和上下文精炼,提升视觉-语言模型的准确率与效率平衡。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.08024 2026-02-10 cs.CV cs.AI cs.CL cs.LG 67%

FlashVID: Efficient Video Large Language Models via Training-free Tree-based Spatiotemporal Token Merging

FlashVID: 通过无训练树状时空标记合并实现高效的视频大语言模型

Ziyang Fan, Keyu Chen, Ruilong Xing, Yulin Li, Li Jiang, Zhuotao Tian

机构 * Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳)) The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Shenzhen Loop Area Institute(深圳河套学院)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 FlashVID通过无训练的树状时空标记合并技术,在保留99.1%性能的情况下将视频帧输入提升10倍,实现高效视频大语言模型加速。

Comments Accepted by ICLR 2026 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07469 2026-02-10 astro-ph.IM 67%

Toward Vision-Language Assistants for Radio Astronomical Source Analysis

迈向射电天文源分析的视觉-语言助手

S. Riggi

专题命中 VLM训练与架构 :vision-language model(abstract);LLaVA(abstract)

AI总结 本文提出radio-llava,一种针对射电天文的视觉-语言助手,通过指令微调提升多任务性能,但发现专用视觉模型仍更优,且微调导致通用任务性能下降。

Comments 5 pages, 3 figures, Proceedings IAU Symposium No. 397, 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2310.05239 2026-02-10 cs.RO 67%

Lan-grasp: Using Large Language Models for Semantic Object Grasping and Placement

Lan-grasp:利用大语言模型进行语义物体抓取与放置

Reihaneh Mirjalili, Michael Krawez, Yannik Blei, Simone Silenzi, Florian Walter, Wolfram Burgard

机构 * Department of Computer Science and Artificial Intelligence, University of Technology Nuremberg(计算机科学与人工智能系,图恩技术大学) Department of Engineering ``Enzo Ferrari'' (DIEF), University of Modena and Reggio Emilia(恩佐·费尔拉蒂工程系(DIEF),摩德纳和雷吉奥艾米利亚大学) Technical University of Munich(慕尼黑技术大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract)

AI总结 Lan-grasp利用大语言模型实现更精确的语义抓取与放置,通过结合多种模型提升抓取效果和安全性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07540 2026-02-10 cs.CV cs.LG 62%

LLM-Guided Diagnostic Evidence Alignment for Medical Vision-Language Pretraining under Limited Pairing

基于LLM的诊断证据对齐用于有限配对情况下的医学视觉-语言预训练

Huimin Yan, Liang Bai, Xian Yang, Long Chen

机构 * Institute of Intelligent Information Processing, Shanxi University(山西大学智能信息处理研究所) Alliance Manchester Business School, The University of Manchester(曼彻斯特大学阿利安斯商学院) Department of Computer Science and Engineering, The Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.LG

AI总结 本文提出LLM引导的诊断证据对齐方法,旨在解决有限配对数据下医学视觉-语言预训练的诊断表示学习问题,通过提取关键诊断证据提升跨模态对齐效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07311 2026-02-10 cs.CV cs.AI 62%

LUCID-SAE: Learning Unified Vision-Language Sparse Codes for Interpretable Concept Discovery

LUCID-SAE:学习统一的视觉-语言稀疏代码以发现可解释的概念

Difei Gu, Yunhe Gao, Gerasimos Chatzoudis, Zihan Dong, Guoning Zhang, Bangwei Guo, Yang Zhou, Mu Zhou, Dimitris Metaxas

机构 * Rutgers University(罗杰斯大学) Stanford University(斯坦福大学)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.CV、cs.AI

AI总结 LUCID-SAE通过统一视觉-语言稀疏编码方法,实现了跨模态的可解释概念发现与多模态表示的鲁棒性提升。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07014 2026-02-10 cs.CV cs.AI 62%

Vectra: A New Metric, Dataset, and Model for Visual Quality Assessment in E-Commerce In-Image Machine Translation

Vectra: 一种新的度量标准、数据集和模型用于电子商务图像中的图像翻译视觉质量评估

Qingyu Wu, Yuxuan Han, Haijun Li, Zhao Xu, Jianshan Zhao, Xu Jin, Longyue Wang, Weihua Luo

机构 * Alibaba International Digital Commerce Group(阿里巴巴国际数字商业集团)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV、cs.AI

AI总结 Vectra提出了一种无参考、基于大语言模型的视觉质量评估框架,通过多维度量系统、数据集和模型提升电子商务图像翻译的视觉质量评估效果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.07915 2026-02-10 cs.CV 57%

MARC: Memory-Augmented RL Token Compression for Efficient Video Understanding

MARC: 用于高效视频理解的记忆增强强化学习令牌压缩

Peiran Wu, Zhuorui Yu, Yunze Liu, Chi-Hao Wu, Enmin Zhou, Junxiao Shen

机构 * University of Bristol(布里斯托大学) Memories.ai Research(Memories.ai研究)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 MARC通过结合结构化检索和强化学习知识蒸馏,实现高效视频理解,显著减少视觉令牌、GPU内存和延迟。

Comments Accepted at ICLR 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23278 2026-02-10 cs.CV 57%

UniLiP: Adapting CLIP for Unified Multimodal Understanding, Generation and Editing

UniLiP: 适配CLIP以实现统一的多模态理解、生成与编辑

Hao Tang, Chenwei Xie, Xiaoyi Bao, Tingyu Weng, Pandeng Li, Yun Zheng, Liwei Wang

机构 * Center for Data Science, Peking University(北京大学数据科学中心) Alibaba Group(阿里巴巴集团) CASIA Center for Machine Learning Research, Peking University(北京大学机器学习研究中心) State Key Laboratory of General Artificial Intelligence, Peking University(北京大学通用人工智能国家重点实验室)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

AI总结 UniLIP通过两阶段训练和双条件架构,提升CLIP在多模态理解、生成和编辑任务中的性能,实现高效参数下的高表现。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.07414 2026-02-10 cs.AI cs.CL 57%

Can LLMs Truly Embody Human Personality? Analyzing AI and Human Behavior Alignment in Dispute Resolution

LLMs真的能体现人类个性吗?分析AI与人类行为在纠纷解决中的对齐

Deuksin Kwon, Kaleen Shrestha, Bin Han, Spencer Lin, James Hale, Jonathan Gratch, Maja Matarić, Gale M. Lucas

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文研究LLMs在模拟人类人格驱动的冲突行为方面的有效性,通过评估框架和数据集方法,揭示LLMs在纠纷解决中与人类行为的显著差异。

Comments AAAI 2026 (Special Track: AISI)

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.21266 2026-02-10 cs.AI 57%

Rethinking Explainable Disease Prediction: Synergizing Accuracy and Reliability via Reflective Cognitive Architecture

重新思考可解释疾病预测:通过反思认知架构协同提升准确性和可靠性

Zijian Shao, Haiyang Shen, Mugeng Liu, Gecheng Fu, Yaoqi Guo, Yanfeng Wang, Yun Ma

机构 * Institute for Artificial Intelligence, Peking University School of Software \& Microelectronics, Peking University School of Computer Science, Peking University School of Life Sciences, Peking University Department of Comprehensive Oncology, National Cancer Center/National Clinical Research Center for Cancer/Cancer Hospital, Chinese Academy of Medical Sciences Peking Union Medical College Beijing, China

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

AI总结 本文提出反思认知架构(RCA),通过经验与反思直接从表格数据学习,实现预测精度与解释可靠性的协同提升。

Comments under review

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.25682 2026-02-10 cs.CL 50%

PairUni: Pairwise Training for Unified Multimodal Language Models

PairUni: 用于统一多模态语言模型的成对训练

Jiani Zheng, Zhiyang Teng, Kunpeng Qiu, Xiangtai Li, Anran Wang, Yu Tian, Ye Tian, Haochen Wang, Zhuochen Wang

机构 * ByteDance(字节跳动)

专题命中 VLM训练与架构 :vision-language model(abstract)

AI总结 PairUni通过成对训练提升统一多模态语言模型的理解与生成能力,采用配对数据集和PairGRPO算法实现更有效的策略学习。

Comments 22 pages, 11 figures, and 10 tables

详情

展开后加载摘要…

URL PDF HTML 收藏