arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2504.11829 2025-09-15 cs.CL cs.AI 57%

Déjà Vu: Multilingual LLM Evaluation through the Lens of Machine Translation Evaluation

Julia Kreutzer, Eleftheria Briakou, Sweta Agrawal, Marzieh Fadaee, Kocmi Tom

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.09541 2025-09-12 cs.AI 57%

Compositional Concept Generalization with Variational Quantum Circuits

Hala Hawashin, Mina Abbaszadeh, Nicholas Joseph, Beth Pearson, Martha Lewis, Mehrnoosh sadrzadeh

机构 * School of Computer Science Engineering University of New South Wales Sydney, Australia Stanford University California, USA Computer Science University College London London, UK School of Eng. Maths. \& Tech University of Bristol Bristol, UK Inst. Logic Language \& Computation University of Amsterdam Amsterdam, NL

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments Accepted to: 2025 IEEE International Conference on Quantum Artificial Intelligence (QAI), Naples, Italy, Nov 2-5, 2025. This is the authors' accepted manuscript (AAM). An IEEE copyright notice appears on page 1. The final published version will appear in IEEE Xplore; DOI to be added when available

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11538 2025-09-12 cs.CL cs.AI eess.AS 57%

MERaLiON-SpeechEncoder: Towards a Speech Foundation Model for Singapore and Beyond

Muhammad Huzaifah, Geyu Lin, Tianchi Liu, Hardik B. Sailor, Kye Min Tan, Tarun K. Vangani, Qiongqiong Wang, Jeremy H. M. Wong, Jinyang Wu, Nancy F. Chen, Ai Ti Aw

机构 * MERaLiON Team(MERaLiON团队) Institute for Infocomm Research (I 2 R), A*STAR, Singapore(信息通信研究所(I2R),A*STAR,新加坡)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2409.10090 2025-09-10 cs.CV 57%

InteractPro: A Unified Framework for Motion-Aware Image Composition

Weijing Tao, Xiaofeng Yang, Miaomiao Cui, Guosheng Lin

机构 * College of Computing and Data Science, Nanyang Technological University(计算与数据科学学院,南洋理工大学) DAMO Academy, Alibaba Group(阿里达摩院)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.18201 2025-09-05 cs.CL cs.CV cs.HC 57%

Deciphering Emotions in Children Storybooks: A Comparative Analysis of Multimodal LLMs in Educational Applications

Bushra Asseri, Estabraq Abdelaziz, Maha Al Mogren, Tayef Alhefdhi, Areej Al-Wabil

机构 * College of Engineering & Advanced Computing(工程与高级计算学院)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.01259 2025-09-03 cs.CV 57%

ReCap: Event-Aware Image Captioning with Article Retrieval and Semantic Gaussian Normalization

Thinh-Phuc Nguyen, Thanh-Hai Nguyen, Gia-Huy Dinh, Lam-Huy Nguyen, Minh-Triet Tran, Trung-Nghia Le

机构 * University of Science, VNU-HCM(越南胡志明市科学大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ACM Multimedia 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11452 2025-09-03 cs.AI cs.CL cs.HC 57%

Inclusion Arena: An Open Platform for Evaluating Large Foundation Models with Real-World Apps

Kangyu Wang, Hongliang He, Lin Liu, Ruiqi Liang, Zhenzhong Lan, Jianguo Li

机构 * Shanghai Jiao Tong University(上海交通大学) Zhejiang University(浙江大学) Westlake University(西湖大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.AI

Comments Our platform is publicly accessible at https://www.tbox.cn/about/model-ranking

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.13859 2025-09-03 cs.CV 57%

Learning Visual Proxy for Compositional Zero-Shot Learning

Shiyu Zhang, Cheng Yan, Yang Liu, Chenchen Jing, Lei Zhou, Wenjun Wang

机构 * Tianjin University(天津大学) Zhejiang University(浙江大学) Zhejiang University of Technology(浙江工业大学) Hainan University(海南大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13602 2025-09-03 cs.CV 57%

PersonaVlog: Personalized Multimodal Vlog Generation with Multi-Agent Collaboration and Iterative Self-Correction

Xiaolu Hou, Bing Ma, Jiaxiang Cheng, Xuhua Ren, Kai Yu, Wenyue Li, Tianxiang Zheng, Qinglin Lu

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Project Page: https://personavlog-paper.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.02518 2025-09-03 cs.LG 57%

AnalogCoder-Pro: Unifying Analog Circuit Generation and Optimization via Multi-modal LLMs

Yao Lai, Souradip Poddar, Sungyoung Lee, Guojin Chen, Mengkang Hu, Bei Yu, Ping Luo, David Z. Pan

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.21660 2025-09-03 cs.LG 57%

PreGenie: An Agentic Framework for High-quality Visual Presentation Generation

Xiaojie Xu, Xinli Xu, Sirui Chen, Haoyu Chen, Fan Zhang, Ying-Cong Chen

机构 * The Hong Kong University of Science and Technology(Guangzhou)(香港科技大学(广州)) The Hong Kong University of Science and Technology(香港科技大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.LG

Comments Accepted at EMNLP 2025, Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.05892 2025-09-03 cs.CR cs.AI 57%

PBI-Attack: Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

Ruoxi Cheng, Yizhong Ding, Shuirong Cao, Ranjie Duan, Xiaoshuang Jia, Shaowei Yuan, Simeng Qin, Zhiqiang Wang, Xiaojun Jia

机构 * Alibaba Group(阿里巴巴集团) Beijing Electronic Science and Technology Institute(北京电子科技研究所) Nanjing University(南京大学) Renmin University of China(中国人民大学) Northeastern University(东北大学) BraneMatrix AI Nanyang Technological University(南洋理工大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.AI

Comments Prior-Guided Bimodal Interactive Black-Box Jailbreak Attack for Toxicity Maximization

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.19024 2025-08-27 cs.CV 57%

ProPy: Building Interactive Prompt Pyramids upon CLIP for Partially Relevant Video Retrieval

Yi Pan, Yujia Zhang, Michael Kampffmeyer, Xiaoguang Zhao

机构 * State Key Laboratory of Multimodal Artificial Intelligence Systems, Institute of Automation, Chinese Academy of Sciences(多模态人工智能系统国家重点实验室,自动化研究所,中国科学院) School of Artificial Intelligence, University of Chinese Academy of Sciences(人工智能学院,中国科学院大学) Department of Physics and Technology, UiT The Arctic University of Norway(物理与技术系,UiT 北极大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted by EMNLP 2025 Findings

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17467 2025-08-26 cs.LG cs.PF 57%

MoE-Inference-Bench: Performance Evaluation of Mixture of Expert Large Language and Vision Models

Krishna Teja Chitty-Venkata, Sylvia Howland, Golara Azar, Daria Soboleva, Natalia Vassilieva, Siddhisanket Raskar, Murali Emani, Venkatram Vishwanath

机构 * Argonne National Laboratory(阿贡国家实验室) Cerebras(Cerebras公司) Pacific Northwest National Laboratory(太平洋西北国家实验室)

专题命中 其他VLM :vision language model(abstract);分类 cs.LG

Comments Preprint

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.16789 2025-08-26 cs.CV cs.CL 57%

Leveraging the Power of MLLMs for Gloss-Free Sign Language Translation

Jungeun Kim, Hyeongwoo Jeon, Jongseong Bae, Ha Young Kim

机构 * Department of Artificial Intelligence, Yonsei University(人工智能系,延世大学) Graduate School of Information, Yonsei University(信息研究生院,延世大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments Accepted by ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.16158 2025-08-25 cs.CV 57%

RAGSR: Regional Attention Guided Diffusion for Image Super-Resolution

Haodong He, Yancheng Bai, Rui Lan, Xu Duan, Lei Sun, Xiangxiang Chu, Gui-Song Xia

机构 * School of Computer Science, Wuhan University(武汉大学计算机学院) Amap, Alibaba Group(阿里巴巴集团阿里的)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.13713 2025-08-20 cs.CV 57%

Hierarchical Vision-Language Retrieval of Educational Metaverse Content in Agriculture

Ali Abdari, Alex Falcon, Giuseppe Serra

机构 * University of Udine(乌迪大学) University of Naples Federico II(那不勒斯费德里科二世大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted for publication at the 23rd International Conference on Image Analysis and Processing (ICIAP 2025)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.22884 2025-08-20 cs.CV 57%

AutoComPose: Automatic Generation of Pose Transition Descriptions for Composed Pose Retrieval Using Multimodal LLMs

Yi-Ting Shen, Sungmin Eum, Doheon Lee, Rohit Shete, Chiao-Yi Wang, Heesung Kwon, Shuvra S. Bhattacharyya

机构 * University of Maryland, College Park(马里兰大学学院市分校) DEVCOM Army Research Laboratory(陆军研究实验室)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

Comments ICCV 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12668 2025-08-19 cs.CV 57%

WP-CLIP: Leveraging CLIP to Predict Wölfflin's Principles in Visual Art

Abhijay Ghildyal, Li-Yun Wang, Feng Liu

机构 * Portland State University(波特兰州立大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments ICCV 2025 AI4VA workshop (oral), Code: https://github.com/abhijay9/wpclip

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12396 2025-08-19 cs.CV 57%

DeCoT: Decomposing Complex Instructions for Enhanced Text-to-Image Generation with Large Language Models

Xiaochuan Lin, Xiangyong Chen, Xuan Li, Yichen Su

机构 * Henan Polytechnic University(河南理工大学)

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.12291 2025-08-19 cs.AI 57%

RadarQA: Multi-modal Quality Analysis of Weather Radar Forecasts

Xuming He, Zhiyuan You, Junchao Gong, Couhua Liu, Xiaoyu Yue, Peiqin Zhuang, Wenlong Zhang, Lei Bai

机构 * Shanghai Artificial Intelligence Laboratory(上海人工智能实验室) ZheJiang University(浙江大学) The Chinese University of Hong Kong(香港中文大学) Center for Earth System Modeling and Prediction of China Meteorological Administration(中国气象局地球系统模拟与预测中心)

专题命中 其他VLM :MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.11801 2025-08-19 cs.CV cs.CL 57%

VideoAVE: A Multi-Attribute Video-to-Text Attribute Value Extraction Dataset and Benchmark Models

Ming Cheng, Tong Wu, Jiazhen Hu, Jiaying Gong, Hoda Eldardiry

机构 * Virginia Tech(弗吉尼亚理工大学)

专题命中 其他VLM :vision language model(abstract);分类 cs.CV

Comments 5 pages, 2 figures, 5 tables, accepted in CIKM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.08536 2025-08-18 cs.CV 57%

SenCLIP: Enhancing zero-shot land-use mapping for Sentinel-2 with ground-level prompting

Pallavi Jain, Dino Ienco, Roberto Interdonato, Tristan Berchoux, Diego Marcos

机构 * Mediterranean Agronomic Institute of Montpellier - CIHEAM-IAMM(地中海农业研究院-CIHEAM-IAMM) Inria(法国国家信息与自动化技术研究院) INRAE(法国国家农业研究咨询中心) Cirad(国际热带农业研究中心) UMR TETIS(TETIS联合研究单位) Univ. of Montpellier(蒙彼利埃大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments Accepted at WACV'25

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.09858 2025-08-14 cs.CV 57%

HumanGenesis: Agent-Based Geometric and Generative Modeling for Synthetic Human Dynamics

Weiqi Li, Zehao Zhang, Liang Lin, Guangrun Wang

专题命中 其他VLM :MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.08220 2025-08-12 cs.CV 57%

Learning User Preferences for Image Generation Model

Wenyi Mo, Ying Ba, Tianyu Zhang, Yalong Bai, Biye Li

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.06342 2025-08-11 cs.CV cs.SI 57%

Street View Sociability: Interpretable Analysis of Urban Social Behavior Across 15 Cities

Kieran Elrod, Katherine Flanigan, Mario Bergés

机构 * Carnegie Mellon University(卡内基梅隆大学)

专题命中 其他VLM :multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.05661 2025-08-11 cs.IR cs.AI 57%

Zero-Shot Retrieval for Scalable Visual Search in a Two-Sided Marketplace

Andre Rusli, Shoma Ishimoto, Sho Akiyama, Aman Kumar Singh

机构 * Mercari, Inc.(Mercari公司)

专题命中 其他VLM :vision-language model(abstract);分类 cs.AI

Comments 6 pages, KDD 2025 Workshop on Two-sided Marketplace Optimization: Search, Pricing, Matching & Growth (TSMO)

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04998 2025-08-08 cs.CV 57%

Attribute Guidance With Inherent Pseudo-label For Occluded Person Re-identification

Rui Zhi, Zhen Yang, Haiyang Zhang

机构 * Beijing University of Post and Telecommunication(北京邮电大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.CV

Comments 8 pages, 2 supplement pages, 3 figures, ECAI2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04732 2025-08-08 cs.LG cs.GR 57%

LumiGen: An LVLM-Enhanced Iterative Framework for Fine-Grained Text-to-Image Generation

Xiaoqi Dong, Xiangyu Zhou, Nicholas Evans, Yujia Lin

机构 * Dali University(大理大学) Bandırma Onyedi Eylül University(班迪尔马第十七个九月大学)

专题命中 其他VLM :vision-language model(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2408.15098 2025-08-07 cs.CV 57%

CLIP-AGIQA: Boosting the Performance of AI-Generated Image Quality Assessment with CLIP

Zhenchen Tang, Zichuan Wang, Bo Peng, Jing Dong

机构 * New Laboratory of Pattern Recognition, Institute of Automation, Chinese Academy of Sciences(模式识别新实验室,自动化研究所,中国科学院)

专题命中 其他VLM :visual language model(abstract);分类 cs.CV

Comments accepted by ICPR2024

详情

展开后加载摘要…

URL PDF HTML 收藏