arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5067 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5067 篇

2412.06293 2025-08-15 cs.CV 57%

Mastering Collaborative Multi-modal Data Selection: A Focus on Informativeness, Uniqueness, and Representativeness

Qifan Yu, Zhebei Shen, Zhongqi Yue, Yang Wu, Bosheng Qin, Wenqiao Zhang, Yunfei Li, Juncheng Li, Siliang Tang, Yueting Zhuang

机构 * Zhejiang University(浙江大学) Nanyang Technological University(南洋理工大学) Ant Group(蚂蚁集团)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments ICCV 2025 Highlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.14332 2025-08-14 cs.CV 57%

ViCToR: Improving Visual Comprehension via Token Reconstruction for Pretraining LMMs

Yin Xie, Kaicheng Yang, Peirou Liang, Xiang An, Yongle Zhao, Yumeng Wang, Ziyong Feng, Roy Miles, Ismail Elezi, Jiankang Deng

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments 10 pages, 6 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06555 2025-08-13 cs.CV cs.CY cs.MA 57%

StyleTailor: Towards Personalized Fashion Styling via Hierarchical Negative Feedback

Hongbo Ma, Fei Shen, Hongbin Xu, Xiaoce Wang, Gang Xu, Jinkai Zheng, Liangqiong Qu, Ming Li

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 24pages, 5 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03926 2025-08-13 cs.CV 57%

Multiple Stochastic Prompt Tuning for Few-shot Adaptation under Extreme Domain Shift

Debarshi Brahma, Soma Biswas

机构 * Indian Institute of Science(印度科学研究院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07804 2025-08-12 cs.CV 57%

Pose-RFT: Enhancing MLLMs for 3D Pose Generation via Hybrid Action Reinforcement Fine-Tuning

Bao Li, Xiaomei Zhang, Miao Xu, Zhaoxin Fan, Xiangyu Zhu, Zhen Lei

机构 * CASIA(中国科学院自动化研究所) UCAS(中国科学院大学) CAIR, HKISI, CAS(中国科学院自动化研究所) Beihang University(北京航空航天大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.07738 2025-08-12 cs.LG 57%

Separation and Collaboration: Two-Level Routing Grouped Mixture-of-Experts for Multi-Domain Continual Learning

Jialu Zhou, Dianxi Shi, Shaowu Yang, Xinyu Wei, Mingyue Yang, Leqian Li, Mengzhu Wang, Chunping Qiu

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06036 2025-08-11 cs.CV 57%

More Is Better: A MoE-Based Emotion Recognition Framework with Human Preference Alignment

Jun Xie, Yingjian Zhu, Feng Chen, Zhenghao Zhang, Xiaohui Fan, Hongzhu Yi, Xinming Wang, Chen Yu, Yue Bi, Zhaoran Zhao, Xiongjun Guan, Zhepeng Wang

机构 * Lenovo Research(联想研究) Institute of Automation, Chinese Academy of Sciences(中国科学院自动化研究所) University of Chinese Academy of Sciences(中国科学院大学) Tsinghua University(清华大学) Beijing Jiaotong University(北京交通大学) Shandong University(山东大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04642 2025-08-07 cs.RO cs.CV 57%

RoboTron-Sim: Improving Real-World Driving via Simulated Hard-Case

Baihui Xiao, Chengjian Feng, Zhijian Huang, Feng yan, Yujie Zhong, Lin Ma

机构 * Meituan(美团) Shenzhen Campus of Sun Yat-sen University(中山大学深圳校区)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04571 2025-08-07 cs.IR cs.CL cs.LG 57%

Do Recommender Systems Really Leverage Multimodal Content? A Comprehensive Analysis on Multimodal Representations for Recommendation

Claudio Pomo, Matteo Attimonelli, Danilo Danese, Fedelucio Narducci, Tommaso Di Noia

机构 * Sapienza University of Rome(罗马大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.LG

Comments Accepted as Full Research Papers at CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04469 2025-08-07 cs.CV cs.CL 57%

FrEVL: Leveraging Frozen Pretrained Embeddings for Efficient Vision-Language Understanding

Emmanuelle Bourigault, Pauline Bourigault

机构 * Department of Engineering Science, University of Oxford(牛津大学工程科学系) Department of Electrical Engineering, Imperial College London(伦敦帝国学院电子工程系)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.01602 2025-08-07 cs.CV 57%

Enhancing Zero-Shot Brain Tumor Subtype Classification via Fine-Grained Patch-Text Alignment

Lubin Gan, Jing Zhang, Linhao Qu, Yijun Wang, Siying Wu, Xiaoyan Sun

机构 * University of Science and Technology of China(科学技术大学) Fudan University(复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02532 2025-08-05 cs.CL cs.LG 57%

Contextual Graph Transformer: A Small Language Model for Enhanced Engineering Document Information Extraction

Karan Reddy, Mayukha Pal

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.02331 2025-08-05 cs.CV cs.SD 57%

VAEmo: Efficient Representation Learning for Visual-Audio Emotion with Knowledge Injection

Hao Cheng, Zhiwei Zhao, Yichao He, Zhenzhen Hu, Jia Li, Meng Wang, Richang Hong

机构 * Hefei University of Technology(合肥工业大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Source code and pre-trained models will be available at https://github.com/MSA-LMC/VAEmo

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.19903 2025-08-05 cs.CV 57%

Scaling Vision Pre-Training to 4K Resolution

Baifeng Shi, Boyi Li, Han Cai, Yao Lu, Sifei Liu, Marco Pavone, Jan Kautz, Song Han, Trevor Darrell, Pavlo Molchanov, Hongxu Yin

机构 * UC Berkeley(加州大学伯克利分校) NVIDIA(英伟达)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments CVPR 2025. Project Page: https://nvlabs.github.io/PS3

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.07025 2025-08-05 cs.CV cs.CL 57%

CheXalign: Preference fine-tuning in chest X-ray interpretation models without human feedback

Dennis Hein, Zhihong Chen, Sophie Ostmeier, Justin Xu, Maya Varma, Eduardo Pontes Reis, Arne Edward Michalson, Christian Bluethgen, Hyun Joo Shin, Curtis Langlotz, Akshay S Chaudhari

机构 * Stanford University(斯坦福大学) University of Oxford(牛津大学) University Hospital Zurich, University of Zurich(苏黎世大学医院、苏黎世大学) Yongin Severance Hospital, Yonsei University(永临松医院、延世大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ACL 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2307.15640 2025-08-05 cs.CV cs.MM 57%

CLIP Brings Better Features to Visual Aesthetics Learners

Liwu Xu, Jinjin Xu, Yuzhe Yang, Xilu Wang, Yijie Huang, Yaqian Li

机构 * OPPO AI Center(OPPO人工智能中心) University of Surrey(塞弗尔大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICME 2025 Oral

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22062 2025-08-04 cs.CV cs.CL 57%

Meta CLIP 2: A Worldwide Scaling Recipe

Yung-Sung Chuang, Yang Li, Dong Wang, Ching-Feng Yeh, Kehan Lyu, Ramya Raghavendra, James Glass, Lifei Huang, Jason Weston, Luke Zettlemoyer, Xinlei Chen, Zhuang Liu, Saining Xie, Wen-tau Yih, Shang-Wen Li, Hu Xu

机构 * FAIR, Meta(FAIR与Meta公司) MIT(麻省理工学院) Princeton University(普林斯顿大学) New York University(纽约大学)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments 10 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.23373 2025-08-01 cs.CV 57%

Multi-Prompt Progressive Alignment for Multi-Source Unsupervised Domain Adaptation

Haoran Chen, Zexiao Wang, Haidong Cao, Zuxuan Wu, Yu-Gang Jiang

机构 * Institute of Trustworthy Embodied AI, Fudan University(可信具身人工智能研究院,复旦大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22003 2025-07-31 cs.CV 57%

See Different, Think Better: Visual Variations Mitigating Hallucinations in LVLMs

Ziyun Dai, Xiaoqiang Li, Shaohua Zhang, Yuanchen Wu, Jide Li

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by ACM MM25

Journal ref 33rd ACM International Conference on Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.22100 2025-07-31 cs.CV 57%

Trade-offs in Image Generation: How Do Different Dimensions Interact?

Sicheng Zhang, Binzhu Xie, Zhonghao Yan, Yuli Zhang, Donghao Zhou, Xiaofei Chen, Shi Qiu, Jiaqi Liu, Guoyang Xie, Zhichao Lu

机构 * Khalifa University(卡利法大学) The Chinese University of Hong Kong(香港中文大学) Queen Mary University of London(伦敦大学玛丽女王学院) Xi’an Jiaotong-Liverpool University(西安交通大学利物浦大学) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

Comments Accepted in ICCV 2025, Codebase: https://github.com/fesvhtr/TRIG

详情

展开后加载摘要…

URL PDF HTML 收藏
2410.11824 2025-07-29 cs.CV 57%

KITTEN: A Knowledge-Intensive Evaluation of Image Generation on Visual Entities

Hsin-Ping Huang, Xinyi Wang, Yonatan Bitton, Hagai Taitelbaum, Gaurav Singh Tomar, Ming-Wei Chang, Xuhui Jia, Kelvin C. K. Chan, Hexiang Hu, Yu-Chuan Su, Ming-Hsuan Yang

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

Comments Project page: https://kitten-project.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18915 2025-07-28 cs.CL cs.CV 57%

Mining Contextualized Visual Associations from Images for Creativity Understanding

Ananya Sahu, Amith Ananthram, Kathleen McKeown

机构 * Columbia University(哥伦比亚大学)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.18531 2025-07-25 cs.CV 57%

IntentVCNet: Bridging Spatio-Temporal Gaps for Intention-Oriented Controllable Video Captioning

Tianheng Qiu, Jingchun Gao, Jingyu Li, Huiyi Leong, Xuan Huang, Xi Wang, Xiaocheng Zhang, Kele Xu, Lan Zhang

机构 * University of Science and Technology of China(中国科学技术大学) Hefei Institutes of Physical Science,Chinese Academy of Sciences(合肥物理研究所,中国科学院) Institute of Artificial Intelligence, Hefei Comprehensive National Science Center(人工智能研究所,合肥综合性国家科学中心) State Key Lab. for Novel Software Technology, Nanjing University(新型软件技术国家重点实验室,南京大学) University of Chicago(芝加哥大学) National University of Defense Technology(国防科技大学) Harbin Institute of Technology(哈尔滨工业大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.23825 2025-07-25 cs.CV 57%

Flash-VStream: Efficient Real-Time Understanding for Long Video Streams

Haoji Zhang, Yiqin Wang, Yansong Tang, Yong Liu, Jiashi Feng, Xiaojie Jin

机构 * Tsinghua University(清华大学) Tsinghua Shenzhen International Graduate School(清华大学深圳国际研究生院) Beijing Jiaotong University(北京交通大学) ByteDance Inc(字节跳动公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.02591 2025-07-24 cs.CV 57%

AuroraLong: Bringing RNNs Back to Efficient Open-Ended Video Understanding

Weili Xu, Enxin Song, Wenhao Chai, Xuexiang Wen, Tian Ye, Gaoang Wang

机构 * Zhejiang University(浙江大学) University of Washington(华盛顿大学) HKUST (GZ)(香港科技大学(广州)) Zhejiang University / Shanghai AI Lab(浙江大学/上海人工智能实验室)

专题命中 VLM训练与架构 :LLaVA(abstract);分类 cs.CV

Comments ICCV 2025 Camera Ready

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06312 2025-07-23 cs.CV 57%

DOFA-CLIP: Multimodal Vision-Language Foundation Models for Earth Observation

Zhitong Xiong, Yi Wang, Weikang Yu, Adam J Stewart, Jie Zhao, Nils Lehmann, Thomas Dujardin, Zhenghang Yuan, Pedram Ghamisi, Xiao Xiang Zhu

机构 * Technical University of Munich(慕尼黑技术大学) Helmholtz-Zentrum Dresden-Rossendorf(德累斯顿-罗斯托克亥姆霍尔茨中心)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments code & weights: https://github.com/xiong-zhitong/DOFA-CLIP

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15576 2025-07-22 cs.CL cs.CV 57%

Smart Eyes for Silent Threats: VLMs and In-Context Learning for THz Imaging

Nicolas Poggi, Shashank Agnihotri, Margret Keuper

机构 * Data and Web Science Group, University of Mannheim(曼海姆大学数据与网络科学组) Max-Planck-Institute for Informatics, Saarland Informatics Campus(马克斯·普朗克信息研究所,萨尔兰州信息校区)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15281 2025-07-22 cs.CL cs.AI 57%

A Novel Self-Evolution Framework for Large Language Models

Haoran Sun, Zekun Zhang, Shaoning Zeng

机构 * Haoran Sun, Zekun Zhang, Shaoning Zeng(作者)

专题命中 VLM训练与架构 :grounding(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.15130 2025-07-22 cs.CV 57%

Enhancing Visual Planning with Auxiliary Tasks and Multi-token Prediction

Ce Zhang, Yale Song, Ruta Desai, Michael Louis Iuzzolino, Joseph Tighe, Gedas Bertasius, Satwik Kottur

机构 * UNC Chapel Hill(北卡罗来纳大学教堂山分校) Meta

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.09442 2025-07-22 cs.CV 57%

Advancing Textual Prompt Learning with Anchored Attributes

Zheng Li, Yibing Song, Ming-Ming Cheng, Xiang Li, Jian Yang

机构 * PCA Lab, VCIP, College of Computer Science, Nankai University(PCA实验室、VCIP、计算机科学学院、南开大学) DAMO Academy, Alibaba Group(达摩院、阿里巴巴集团)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025. Code: https://github.com/zhengli97/ATPrompt. Project Page: https://zhengli97.github.io/ATPrompt/

详情

展开后加载摘要…

URL PDF HTML 收藏