arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 1578 信号源:cs.CV, cs.AI, cs.LG

1. 其他VLM 1578 篇

2510.17002 2025-10-21 cs.LG 70%

EEschematic: Multimodal-LLM Based AI Agent for Schematic Generation of Analog Circuit

Chang Liu, Danial Chitnis

机构 * School of Engineering The University of Edinburgh Edinburgh, UK(工程学院 苏格兰爱丁堡大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.15241 2025-09-22 cs.CV cs.CL 70%

M-PACE: Mother Child Framework for Multimodal Compliance

Shreyash Verma, Amit Kesari, Vinayak Trivedi, Anupam Purwar, Ratnesh Jamidar

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments The M-PACE framework uses a "mother-child" AI model system to automate and unify compliance checks for ads, reducing costs while maintaining high accuracy

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03893 2025-09-05 cs.CV 70%

Weakly-Supervised Learning of Dense Functional Correspondences

Stefan Stojanov, Linan Zhao, Yunzhi Zhang, Daniel L. K. Yamins, Jiajun Wu

机构 * Stanford University(斯坦福大学)

专题命中 其他VLM :vision-language model(abstract);vision language model(abstract);分类 cs.CV

Comments Accepted at ICCV 2025. Project website: https://dense-functional-correspondence.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.03385 2025-09-04 cs.CV 70%

Human Preference-Aligned Concept Customization Benchmark via Decomposed Evaluation

Reina Ishikawa, Ryo Fujii, Hideo Saito, Ryo Hachiuma

机构 * Keio University(庆应大学) NVIDIA(英伟达)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to ICCV Workshop 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.11060 2025-08-22 cs.CV 70%

BannerAgency: Advertising Banner Design with Multimodal LLM Agents

Heng Wang, Yotaro Shimose, Shingo Takamatsu

机构 * Sony Group Corporation(索尼集团)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted as a main conference paper at EMNLP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.17782 2025-06-24 cs.IR cs.AI 70%

Expanding Relevance Judgments for Medical Case-based Retrieval Task with Multimodal LLMs

Catarina Pires, Sérgio Nunes, Luís Filipe Teixeira

机构 * Faculty of Engineering, University of Porto(葡萄牙波尔图大学工程学院)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

Comments To appear at the Third Workshop on Large Language Models for Evaluation in Information Retrieval (LLM4Eval 2025), co-located with SIGIR 2025. 9 pages, 2 figures, 5 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.13326 2025-06-17 cs.CV cs.HC 70%

VIS-Shepherd: Constructing Critic for LLM-based Data Visualization Generation

Bo Pan, Yixiao Fu, Ke Wang, Junyu Lu, Lunke Pan, Ziyang Qian, Yuhan Chen, Guoliang Wang, Yitao Zhou, Li Zheng, Yinghao Tang, Zhen Wen, Yuchen Wu, Junhua Lu, Biao Zhu, Minfeng Zhu, Bo Zhang, Wei Chen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.08933 2025-06-11 cs.CV 70%

What Limits Virtual Agent Application? OmniBench: A Scalable Multi-Dimensional Benchmark for Essential Virtual Agent Capabilities

Wendong Bu, Yang Wu, Qifan Yu, Minghe Gao, Bingchen Miao, Zhenkui Zhang, Kaihang Pan, Yunfei Li, Mengze Li, Wei Ji, Juncheng Li, Siliang Tang, Yueting Zhuang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICML 2025 (Oral)

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03126 2025-06-04 cs.CV 70%

AnimeShooter: A Multi-Shot Animation Dataset for Reference-Guided Video Generation

Lu Qiu, Yizhuo Li, Yuying Ge, Yixiao Ge, Ying Shan, Xihui Liu

机构 * The University of Hong Kong(香港大学) ARC Lab, Tencent PCG(腾讯PCG ARC实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project released at: https://qiulu66.github.io/animeshooter/

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.24441 2025-06-02 cs.CV 70%

SORCE: Small Object Retrieval in Complex Environments

Chunxu Liu, Chi Xie, Xiaxu Chen, Wei Li, Feng Zhu, Rui Zhao, Limin Wang

机构 * State Key Laboratory for Novel Software Technology, Nanjing University(南京大学新型软件技术国家重点实验室) Sensetime Research(商汤科技研究院) Tongji University(同济大学) Beijing Institute of Technology(北京理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Project Page: https://github.com/MCG-NJU/SORCE

详情

展开后加载摘要…

URL PDF HTML 收藏
2312.02980 2025-06-02 cs.CV 70%

GPT4Point: A Unified Framework for Point-Language Understanding and Generation

Zhangyang Qi, Ye Fang, Zeyi Sun, Xiaoyang Wu, Tong Wu, Jiaqi Wang, Dahua Lin, Hengshuang Zhao

机构 * The University of Hong Kong(香港大学) Fudan University(复旦大学) Shanghai Jiao Tong University(上海交通大学) The Chinese University of Hong Kong(香港中文大学) Shanghai AI Laboratory(上海人工智能实验室)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.04620 2025-05-08 cs.CV 70%

On Path to Multimodal Generalist: General-Level and General-Bench

Hao Fei, Yuan Zhou, Juncheng Li, Xiangtai Li, Qingshan Xu, Bobo Li, Shengqiong Wu, Yaoting Wang, Junbao Zhou, Jiahao Meng, Qingyu Shi, Zhiyuan Zhou, Liangtao Shi, Minghe Gao, Daoan Zhang, Zhiqi Ge, Weiming Wu, Siliang Tang, Kaihang Pan, Yaobo Ye, Haobo Yuan, Tao Zhang, Tianjie Ju, Zixiang Meng, Shilin Xu, Liyu Jia, Wentao Hu, Meng Luo, Jiebo Luo, Tat-Seng Chua, Shuicheng Yan, Hanwang Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ICML'25, 305 pages, 115 tables, 177 figures, project page: https://generalist.top/

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.13995 2025-04-22 cs.CV 70%

Scaling LLaNA: Advancing NeRF-Language Understanding Through Large-Scale Training

Andrea Amaduzzi, Pierluigi Zama Ramirez, Giuseppe Lisanti, Samuele Salti, Luigi Di Stefano

机构 * CVLAB, University of Bologna(CV实验室,博洛尼亚大学)

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Under submission. Project page at https://andreamaduzzi.github.io/llana/

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.21257 2025-03-26 cs.RO cs.CV 70%

RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete

Yuheng Ji, Huajie Tan, Jiayu Shi, Xiaoshuai Hao, Yuan Zhang, Hengyuan Zhang, Pengwei Wang, Mengdi Zhao, Yao Mu, Pengju An, Xinda Xue, Qinghang Su, Huaihai Lyu, Xiaolong Zheng, Jiaming Liu, Zhongyuan Wang, Shanghang Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.09703 2025-03-25 cs.CV 70%

MagicQuill: An Intelligent Interactive Image Editing System

Zichen Liu, Yue Yu, Hao Ouyang, Qiuyu Wang, Ka Leong Cheng, Wen Wang, Zhiheng Liu, Qifeng Chen, Yujun Shen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted to CVPR 2025. Code and demo available at https://magic-quill.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.10120 2025-03-14 cs.CV eess.IV 70%

Hybrid Agents for Image Restoration

Bingchen Li, Xin Li, Yiting Lu, Zhibo Chen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.06063 2025-03-11 cs.CV 70%

Multi-Layer Visual Feature Fusion in Multimodal LLMs: Methods, Analysis, and Best Practices

Junyan Lin, Haoran Chen, Yue Fan, Yingqi Fan, Xin Jin, Hui Su, Jinlan Fu, Xiaoyu Shen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by CVPR2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.09367 2025-03-10 cs.CV 70%

Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs

Zijia Zhao, Haoyu Lu, Yuqi Huo, Yifan Du, Tongtian Yue, Longteng Guo, Bingning Wang, Weipeng Chen, Jing Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments ICLR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.08234 2025-02-13 cs.CV 70%

Learning Human Skill Generators at Key-Step Levels

Yilu Wu, Chenhui Zhu, Shuai Wang, Hanlin Wang, Jing Wang, Zhaoxiang Zhang, Limin Wang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.05901 2025-01-14 cs.CV 70%

Valley2: Exploring Multimodal Models with Scalable Vision-Language Design

Ziheng Wu, Zhenghao Chen, Ruipu Luo, Can Zhang, Yuan Gao, Zhentao He, Xian Wang, Haoran Lin, Minghui Qiu

专题命中 其他VLM :vision-language model(abstract);multimodal large language model(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.18060 2024-12-25 cs.CV 70%

An Ensemble Approach to Short-form Video Quality Assessment Using Multimodal LLM

Wen Wen, Yilin Wang, Neil Birkbeck, Balu Adsumilli

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Accepted by ICASSP 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.17077 2024-12-24 cs.AI 70%

SubstationAI: Multimodal Large Model-Based Approaches for Analyzing Substation Equipment Faults

Jinzhi Wang, Qinfeng Song, Lidong Qian, Haozhou Li, Qinke Peng, Jiangbo Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11767 2024-12-17 cs.CV 70%

IDEA-Bench: How Far are Generative Models from Professional Designing?

Chen Liang, Lianghua Huang, Jingwu Fang, Huanzhang Dou, Wei Wang, Zhi-Fan Wu, Yupeng Shi, Junge Zhang, Xin Zhao, Yu Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.17323 2024-11-27 cs.CV 70%

InsightEdit: Towards Better Instruction Following for Image Editing

Yingjing Xu, Jie Kong, Jiazhi Wang, Xiao Pan, Bo Lin, Qiang Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2406.11840 2024-11-25 cs.CV 70%

LLaNA: Large Language and NeRF Assistant

Andrea Amaduzzi, Pierluigi Zama Ramirez, Giuseppe Lisanti, Samuele Salti, Luigi Di Stefano

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Under review. Project page: https://andreamaduzzi.github.io/llana/

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.05600 2024-10-29 cs.CV 70%

GenArtist: Multimodal LLM as an Agent for Unified Image Generation and Editing

Zhenyu Wang, Aoxue Li, Zhenguo Li, Xihui Liu

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments NeurIPS 2024 Spotlight

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.08683 2024-10-14 cs.CV 70%

SEED-Story: Multimodal Long Story Generation with Large Language Model

Shuai Yang, Yuying Ge, Yang Li, Yukang Chen, Yixiao Ge, Ying Shan, Yingcong Chen

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Our models, codes and datasets are released in https://github.com/TencentARC/SEED-Story

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.09045 2024-10-10 cs.CV 70%

AMSNet: Netlist Dataset for AMS Circuits

Zhuofu Tao, Yichen Shi, Yiru Huo, Rui Ye, Zonghang Li, Li Huang, Chen Wu, Na Bai, Zhiping Yu, Ting-Jung Lin, Lei He

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.19103 2024-05-30 cs.CR cs.LG 70%

Voice Jailbreak Attacks Against GPT-4o

Xinyue Shen, Yixin Wu, Michael Backes, Yang Zhang

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2405.04007 2024-05-08 cs.CV 70%

SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing

Yuying Ge, Sijie Zhao, Chen Li, Yixiao Ge, Ying Shan

专题命中 其他VLM :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV

Comments Technical Report; Dataset released in https://huggingface.co/datasets/AILab-CVC/SEED-Data-Edit

详情

展开后加载摘要…

URL PDF HTML 收藏