arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2501.11561 2025-12-01 cs.CV 57%

Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution

利用大规模语言模型回归准确的图像质量评分使用分数分布

Zhiyuan You, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学) CPII under InnoHK(创新香港下的CPII)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本研究提出基于分布的DeQA-Score模型,通过离散化评分分布为软标签,提升图像质量评分的准确性和一致性。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20614 2025-11-26 cs.CV 57%

The Consistency Critic: Correcting Inconsistencies in Generated Images via Reference-Guided Attentive Alignment

一致性批评者:通过参考引导的注意对齐纠正生成图像中的不一致

Ziheng Ouyang, Yiren Song, Yaoli Liu, Shihao Zhu, Qibin Hou, Ming-Ming Cheng, Mike Zheng Shou

机构 * VCIP, Nankai University Show Lab, National University of Singapore State Key Laboratory of CAD\&CG, Zhejiang University

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

AI总结 本文提出ImageCritic,通过参考引导的注意力对齐方法纠正生成图像中的不一致问题,提升细粒度细节的一致性。

Comments Project page: https://ouyangziheng.github.io/ImageCritic-Page/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.20478 2025-11-26 cs.LG 57%

NVIDIA Nemotron Parse 1.1

NVIDIA推出Nemotron Parse 1.1:轻量级OCR模型提升文档解析与OCR性能

Kateryna Chumachenko, Amala Sanjay Deshmukh, Jarno Seppanen, Ilia Karmanov, Chia-Chih Chen, Lukas Voegtle, Philipp Fischer, Marek Wawrzos, Saeid Motiian, Roman Ageev, Kedi Wu, Alexandre Milesi, Maryam Moosaei, Krzysztof Pawelec, Padmavathy Subramanian, Mehrzad Samadi, Xin Yu, Celina Dear, Sarah Stoddard, Jenna Diamond, Jesse Oliver, Leanna Chraghchian, Patrick Skelly, Tom Balough, Yao Xu, Jane Polak Scowcroft, Daniel Korzekwa, Darragh Hanley, Sandip Bhaskar, Timo Roman, Karan Sapra, Andrew Tao, Bryan Catanzaro

机构 * NVIDIA

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.LG

AI总结 NVIDIA推出Nemotron Parse 1.1,一种轻量级OCR模型,提升文档解析和OCR性能,支持更长输出序列,实现高准确率和高效处理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.19836 2025-11-26 cs.CV 57%

4DWorldBench: A Comprehensive Evaluation Framework for 3D/4D World Generation Models

4DWorldBench: 一种用于3D/4D世界生成模型的综合评估框架

Yiting Lu, Wei Luo, Peiyan Tu, Haoran Li, Hanxin Zhu, Zihao Yu, Xingrui Wang, Xinyi Chen, Xinge Peng, Xin Li, Zhibo Chen

机构 * University of Science and Technology of China(中国科学技术大学) Zhejiang University(浙江大学) Beijing Zhongguancun Academy(北京中关村学院)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 4DWorldBench提出了一种用于评估3D/4D世界生成模型的综合框架,通过四个维度评估模型的感知质量、条件对齐、物理真实性和一致性,支持多模态输入并整合多种评估方法。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.17964 2025-11-26 cs.CV 57%

X-ReID: Multi-granularity Information Interaction for Video-Based Visible-Infrared Person Re-Identification

X-ReID:基于视频的可见-红外人重识别中的多粒度信息交互

Chenyang Yu, Xuehu Liu, Pingping Zhang, Huchuan Lu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 X-ReID通过多粒度信息交互和跨模态特征学习,提升视频中可见-红外人重识别的性能。

Comments Accepted by AAAI2026. More modifications may be performed

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.16181 2025-11-26 cs.CV 57%

CLIP-IT: CLIP-based Pairing for Histology Images Classification

CLIP-IT: 基于CLIP的病理图像分类配对

Banafsheh Karimian, Giulia Avanzato, Soufian Belharbi, Alexis Guichemerre, Luke McCaffrey, Mohammadhadi Shateri, Eric Granger

机构 * LIVIA, ILLS, Dept. of Systems Engineering, ETS Montreal, Canada(LIVIA、ILLs、系统工程系、蒙特利尔大学ETSMontreal加拿大) Dept. of Computer Engineering, University of Cagliari, Italy(计算机工程系、卡利亚里大学意大利) Goodman Cancer Research, Centre, Dept. of Oncology, McGill University, Canada(Goodman癌症研究中心、肿瘤学系、麦吉尔大学加拿大)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 CLIP-IT通过利用未配对的病理报告提升病理图像分类性能,无需配对数据或复杂推理。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18396 2025-11-25 cs.CV 57%

Exploring Weak-to-Strong Generalization for CLIP-based Classification

探索基于CLIP的分类中的弱到强泛化

Jinhao Li, Sarah M. Erfani, Lei Feng, James Bailey, Feng Liu

机构 * School of Computing and Information Systems University of Melbourne, Australia(墨尔本大学计算机与信息系统学院) School of Computing and Information Systems University of Melbournem, Australia(墨尔本大学计算机与信息系统学院) School of Computer Science and Engineering Southeast University, China(东南大学计算机科学与工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本文提出类别原型学习方法,通过弱监督提升CLIP模型分类性能,实验显示在预训练受限情况下取得显著改进。

Comments TMLR

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.18272 2025-11-25 cs.CV cs.CR 57%

Vision Token Masking Alone Cannot Prevent PHI Leakage in Medical Document OCR: A Systematic Evaluation

仅依靠视觉标记无法防止医疗文档OCR中的PHI泄露:系统评估

Richard J. Young

机构 * University of Nevada, Las Vegas(内华达大学拉斯维加斯分校) Department of Neuroscience(神经科学系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 本研究发现,仅靠视觉标记无法有效防止医疗文档OCR中的PHI泄露,需结合NLP后处理以提高隐私保护效果。

Comments 24 pages, 11 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.09540 2025-11-21 cs.CV 57%

vMFCoOp: Towards Equilibrium on a Unified Hyperspherical Manifold for Prompting Biomedical VLMs

vMFCoOp:在统一超球面流形上实现平衡的提示生物医学VLMs

Minye Shao, Sihan Guo, Xinrun Li, Xingyu Miao, Haoran Duan, Yang Long

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 vMFCoOp通过统一超球面流形上的vMF分布估计,实现LLM与CLIP主干间的语义对齐,提升生物医学VLMs的提示效果和少样本分类性能。

Comments Accepted as an Oral Presentation at AAAI 2026 Main Technical Track (this version is not peer-reviewed; it is the extended version)

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.15316 2025-11-20 cs.CV 57%

What Your Features Reveal: Data-Efficient Black-Box Feature Inversion Attack for Split DNNs

Zhihan Ren, Lijun He, Jiaxi Liang, Xinzhu Fu, Haixia Bi, Fan Li

机构 * Xi’an Jiaotong University(西安交通大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12079 2025-11-20 cs.CV 57%

Point Cloud Quantization through Multimodal Prompting for 3D Understanding

Hongxuan Li, Wencheng Zhu, Huiying Xu, Xinzhong Zhu, Pengfei Zhu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2026. 11 pages, 7 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.18757 2025-11-20 cs.CV 57%

ToDRE: Effective Visual Token Pruning via Token Diversity and Task Relevance

Duo Li, Zuhao Yang, Xiaoqin Zhang, Ling Shao, Shijian Lu

机构 * CCDS, NTU, Singapore(南洋理工大学新加坡分校) CCST, ZJUT, China(浙江工业大学计算机科学与技术学院) Terminus AI Lab, UCAS, China(中国科学院大学人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 19 pages, 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.14072 2025-11-19 cs.CV 57%

CORE: Compact Object-centric REpresentations as a New Paradigm for Token Merging in LVLMs

Jingyu Lei, Gaoang Wang, Der-Horng Lee

机构 * Zhejiang University(浙江大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.14454 2025-11-19 cs.CV 57%

Video Compression Commander: Plug-and-Play Inference Acceleration for Video Large Language Models

Xuyang Liu, Yiyu Wang, Junpeng Ma, Linfeng Zhang

机构 * Shanghai Jiao Tong University(上海交通大学) Sichuan University(四川大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments EMNLP 2025 main

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13648 2025-11-18 cs.CV cs.RO 57%

PhysX-Anything: Simulation-Ready Physical 3D Assets from Single Image

Ziang Cao, Fangzhou Hong, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * S-Lab, Nanyang Technological University(南洋理工大学S实验室) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Project page: https://physx-anything.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13644 2025-11-18 cs.CV 57%

CacheFlow: Compressive Streaming Memory for Efficient Long-Form Video Understanding

Shrenik Patel, Daivik Patel

机构 * Rutgers University(罗切斯特大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.13626 2025-11-18 cs.AI 57%

CreBench: Human-Aligned Creativity Evaluation from Idea to Process to Product

Kaiwen Xue, Chenglong Li, Zhonghong Ou, Guoxin Zhang, Kaoyan Lu, Shuai Lyu, Yifan Zhu, Ping Zong Junpeng Ding, Xinyu Liu, Qunlin Chen, Weiwei Qin, Yiran Shen, Jiayi Cen

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

Comments 13 pages, 3 figures,The 40th Annual AAAI Conference on Artificial Intelligence(AAAI 2026),Paper has been accepted for a poster presentation

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12639 2025-11-18 cs.CV 57%

Medical Knowledge Intervention Prompt Tuning for Medical Image Classification

Ye Du, Nanxi Yu, Shujun Wang

机构 * The Hong Kong Polytechnic University(香港理工大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments IEEE Transactions on Medical Imaging (Early Access) July 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.12452 2025-11-18 cs.CV cs.CL 57%

DenseAnnotate: Enabling Scalable Dense Caption Collection for Images and 3D Scenes via Spoken Descriptions

Xiaoyu Lin, Aniket Ghorpade, Hansheng Zhu, Justin Qiu, Dea Rrozhani, Monica Lama, Mick Yang, Zixuan Bian, Ruohan Ren, Alan B. Hong, Jiatao Gu, Chris Callison-Burch

机构 * University of Pennsylvania(宾夕法尼亚大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10338 2025-11-18 cs.CL cs.AI 57%

BhashaKritika: Building Synthetic Pretraining Data at Scale for Indic Languages

Guduru Manoj, Neel Prabhanjan Rachamalla, Ashish Kulkarni, Gautam Rajeev, Jay Piplodiya, Arul Menezes, Shaharukh Khan, Souvik Rana, Manya Sah, Chandra Khatri, Shubham Agarwal

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.24021 2025-11-18 cs.CL cs.AI 57%

SelecTKD: Selective Token-Weighted Knowledge Distillation for LLMs

Haiduo Huang, Jiangcheng Song, Yadong Zhang, Pengju Ren

机构 * Institute of Artificial Intelligence and Robotics(人工智能与机器人研究院)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.09443 2025-11-18 cs.CL cs.LG 57%

Scaling Laws for Conditional Emergence of Multilingual Image Captioning via Generalization from Translation

Julian Spravil, Sebastian Houben, Sven Behnke

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.02650 2025-11-18 cs.CV 57%

Can Visual Input Be Compressed? A Visual Token Compression Benchmark for Large Multimodal Models

Tianfan Peng, Yuntao Du, Pengzhou Ji, Shijie Dong, Kailin Jiang, Mingchuan Ma, Yijun Tian, Jinhe Bi, Qian Li, Wei Du, Feng Xiao, Lizhen Cui

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.04953 2025-11-18 cs.CV 57%

APVR: Hour-Level Long Video Understanding with Adaptive Pivot Visual Information Retrieval

Hong Gao, Yiming Bao, Xuezhen Tu, Bin Zhong, Linan Yue, Minling Zhang

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.11262 2025-11-17 cs.CV cs.CL 57%

Discovering Meaningful Units with Visually Grounded Semantics from Image Captions

Melika Behjati, James Henderson

机构 * Idiap Research Institute(日内瓦研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.10774 2025-11-17 cs.CV 57%

Frequency-Aware Vision-Language Multimodality Generalization Network for Remote Sensing Image Classification

Junjie Zhang, Feng Zhao, Hanqiang Liu, Jun Yu

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06653 2025-11-11 cs.CV cs.CL 57%

HiMo-CLIP: Modeling Semantic Hierarchy and Monotonicity in Vision-Language Alignment

Ruijia Wu, Ping Chen, Fei Shen, Shaoan Zhao, Qiang Hui, Huanlin Gao, Ting Lu, Zhaoxiang Liu, Fang Zhao, Kai Wang, Shiguo Lian

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by AAAI 2026 as an Oral Presentation (13 pages, 7 figures, 7 tables)

Journal ref AAAI2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.21412 2025-11-11 cs.CV 57%

Bridging the gap to real-world language-grounded visual concept learning

Whie Jung, Semin Kim, Junee Kim, Seunghoon Hong

机构 * School of Computing, KAIST(计算机学院,韩国科学技术院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Journal ref Advances in Neural Information Processing Systems (NeurIPS), 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.06225 2025-11-11 cs.CV 57%

MoRA: Missing Modality Low-Rank Adaptation for Visual Recognition

Shu Zhao, Nilesh Ahuja, Tan Yu, Tianyi Shen, Vijaykrishnan Narayanan

机构 * The Pennsylvania State University(宾夕法尼亚州立大学) Intel(英特尔) NVIDIA(英伟达)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07607 2025-11-11 cs.CV 57%

X2Edit: Revisiting Arbitrary-Instruction Image Editing through Self-Constructed Data and Task-Aware Representation Learning

Jian Ma, Xujie Zhu, Zihao Pan, Qirong Peng, Xu Guo, Chen Chen, Haonan Lu

机构 * OPPO AI Center(OPPO人工智能中心)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted to AAAI 2026

详情

展开后加载摘要…

URL PDF HTML 收藏