arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

共收录 5095 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 5095 篇

2505.14481 2025-05-22 cs.CL 78%

PlanGPT-VL: Enhancing Urban Planning with Domain-Specific Vision-Language Models

He Zhu, Junyou Su, Minxin Chen, Wen Wang, Yijie Deng, Guanhua Chen, Wenjia Zhang

机构 * Behavioral and Spatial AI Lab, Peking University & Tongji University(行为与空间人工智能实验室,北京大学 & 同济大学) Southern University of Science and Technology(南方科技大学)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2505.10862 2025-05-19 cs.CL 78%

Have Multimodal Large Language Models (MLLMs) Really Learned to Tell the Time on Analog Clocks?

Tairan Fu, Miguel González, Javier Conde, Elena Merino-Gómez, Pedro Reviriego

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

Comments 6 pages, 5 figures, 2 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2504.14692 2025-04-22 cs.CL 78%

OmniV-Med: Scaling Medical Vision-Language Model for Universal Visual Understanding

Songtao Jiang, Yuan Wang, Sibo Song, Yan Zhang, Zijie Meng, Bohan Lei, Jian Wu, Jimeng Sun, Zuozhu Liu

机构 * Zhejiang University(浙江大学) Alibaba Group(阿里巴巴集团) UIUC(伊利诺伊大学香槟分校)

专题命中 VLM训练与架构 :vision-language model(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.23990 2025-04-01 cs.CL 78%

BeMERC: Behavior-Aware MLLM-based Framework for Multimodal Emotion Recognition in Conversation

Yumeng Fu, Junjie Wu, Zhongjie Wang, Meishan Zhang, Yulin Wu, Bingquan Liu

专题命中 VLM训练与架构 :MLLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.18680 2025-03-25 cs.IR cs.CL 78%

ArchSeek: Retrieving Architectural Case Studies Using Vision-Language Models

Danrui Li, Yichao Shi, Yaluo Wang, Ziying Shi, Mubbasir Kapadia

专题命中 VLM训练与架构 :vision-language model(title,abstract)

Comments 15 pages, 8 figures, 3 tables. Accepted by CAAD Futures 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.16418 2025-02-25 cs.IT math.IT 78%

M4SC: An MLLM-based Multi-modal, Multi-task and Multi-user Semantic Communication System

Feibo Jiang, Siwei Tu, Li Dong, Kezhi Wang, Kun Yang, Cunhua Pan

专题命中 VLM训练与架构 :MLLM(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2502.02938 2025-02-06 cs.CL 78%

LLaVAC: Fine-tuning LLaVA as a Multimodal Sentiment Classifier

T. Chay-intr, Y. Chen, K. Viriyayudhakorn, T. Theeramunkong

专题命中 VLM训练与架构 :LLaVA(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2407.11712 2025-02-04 cs.IR 78%

Fine-tuning Multimodal Large Language Models for Product Bundling

Xiaohao Liu, Jie Wu, Zhulin Tao, Yunshan Ma, Yinwei Wei, Tat-seng Chua

专题命中 VLM训练与架构 :multimodal large language model(title);MLLM(abstract)

Comments Accepted by KDD 2025 (CR)

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11175 2025-01-22 cs.CV cs.AI cs.LG 78%

ProKeR: A Kernel Perspective on Few-Shot Adaptation of Large Vision-Language Models

Yassir Bendou, Amine Ouasfi, Vincent Gripon, Adnane Boukhayma

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments Code available at https://ybendou.github.io/ProKeR

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.20826 2024-12-31 cs.RO cs.HC 78%

ReStory: VLM-augmentation of Social Human-Robot Interaction Datasets

Fanjun Bu, Wendy Ju

专题命中 VLM训练与架构 :VLM(title);vision language model(abstract)

Comments 16th International Conference on Social Robotics +AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2412.11087 2024-12-17 cs.IR 78%

Leveraging Large Vision-Language Model as User Intent-aware Encoder for Composed Image Retrieval

Zelong Sun, Dong Jing, Guoxing Yang, Nanyi Fei, Zhiwu Lu

专题命中 VLM训练与架构 :vision-language model(title,abstract)

Comments Accepted by AAAI 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2411.02589 2024-12-06 cs.CL 78%

Context-Informed Machine Translation of Manga using Multimodal Large Language Models

Philip Lippmann, Konrad Skublicki, Joshua Tanner, Shonosuke Ishiwatari, Jie Yang

专题命中 VLM训练与架构 :multimodal large language model(title,abstract)

Comments COLING 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2404.09275 2024-06-18 cs.CV cs.AI cs.CL cs.LG 78%

TrafficVLM: A Controllable Visual Language Model for Traffic Video Captioning

Quang Minh Dinh, Minh Khoi Ho, Anh Quan Dang, Hung Phong Tran

专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV、cs.AI、cs.LG

Journal ref Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR) Workshops, 2024, pp. 7134-7143

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.06354 2024-03-12 cs.CL 78%

Amharic LLaMA and LLaVA: Multimodal LLMs for Low Resource Languages

Michael Andersland

专题命中 VLM训练与架构 :LLaVA(title,abstract)

详情

展开后加载摘要…

URL PDF HTML 收藏
2305.15033 2024-02-27 cs.CL 78%

SmartTrim: Adaptive Tokens and Attention Pruning for Efficient Vision-Language Models

Zekun Wang, Jingchang Chen, Wangchunshu Zhou, Haichao Zhu, Jiafeng Liang, Liping Shan, Ming Liu, Dongliang Xu, Qing Yang, Bing Qin

专题命中 VLM训练与架构 :vision-language model(title,abstract)

Comments COLING-LREC 2024

详情

展开后加载摘要…

URL PDF HTML 收藏
2311.02236 2023-11-07 cs.CV cs.AI cs.CL cs.LG 78%

Robust Fine-Tuning of Vision-Language Models for Domain Generalization

Kevin Vogt-Lowell, Noah Lee, Theodoros Tsiligkaridis, Marc Vaillant

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments In proceedings of the 27th IEEE High Performance Extreme Computing Conference

详情

展开后加载摘要…

URL PDF HTML 收藏
2210.01936 2023-03-27 cs.CV cs.AI cs.CL cs.LG 78%

When and why vision-language models behave like bags-of-words, and what to do about it?

Mert Yuksekgonul, Federico Bianchi, Pratyusha Kalluri, Dan Jurafsky, James Zou

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI、cs.LG

Comments ICLR 2023 Oral (notable-top-5%)

详情

展开后加载摘要…

URL PDF HTML 收藏
2302.14115 2023-03-22 cs.CV cs.AI cs.CL cs.LG 78%

Vid2Seq: Large-Scale Pretraining of a Visual Language Model for Dense Video Captioning

Antoine Yang, Arsha Nagrani, Paul Hongsuck Seo, Antoine Miech, Jordi Pont-Tuset, Ivan Laptev, Josef Sivic, Cordelia Schmid

专题命中 VLM训练与架构 :visual language model(title);分类 cs.CV、cs.AI、cs.LG

Comments CVPR 2023 Camera-Ready; Project Webpage: https://antoyang.github.io/vid2seq.html ; 18 pages; 6 figures

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.21486 2026-08-25 cs.CV 新提交 77%

EXPL-FR: Explaining Face Recognition Models via Vision-Language Alignment

EXPL-FR:基于视觉-语言对齐的人脸识别模型解释方法

Guray Ozgur, Mustafa Efe Tamyapar, Naser Damer, Fadi Boutros

机构 * Fraunhofer IGD(弗劳恩霍夫应用研究促进协会图形数据处理研究所) TU Darmstadt(达姆施塔特工业大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 EXPL-FR是一种基于视觉-语言对齐的人脸识别模型解释方法,通过轻量适配器在FR嵌入空间内生成语义特征,支持多粒度解释,可实现无标签的属性级审计与模型性能排名。

Comments Accepted at the ECCV 2026 Workshops

详情

展开后加载摘要…

URL PDF HTML 收藏
2603.11421 2026-08-25 cs.CV 版本更新 77%

ShotVerse: Advancing Cinematic Camera Control for Text-Driven Multi-Shot Video Creation

ShotVerse: 提升文本驱动多镜头视频创作的电影级摄像机控制

Songlin Yang, Zhe Wang, Xuyi Yang, Songchun Zhang, Xianghao Kong, Taiyi Wu, Xiaotong Zhao, Ran Zhang, Alan Zhao, Anyi Rao

机构 * Tencent Video AI Center, PCG, Tencent(腾讯视频AI中心)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 ShotVerse通过'计划然后控制'框架,结合视觉语言模型和摄像机适配器,实现多镜头视频创作中精准的摄像机控制与高保真电影效果。

Comments SIGGRAPH Asia 2026

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.14537 2026-08-25 cs.CV 版本更新 77%

LanGuSTE: Language-Guided Coarse-to-Fine Patch Selection for Efficient Whole Slide Image Analysis

LanGuSTE:用于高效全切片图像分析的语言引导粗到细补丁选择

Yonghan Shin, Gangsu Kim, Won-Ki Jeong

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 该研究针对全切片图像分析的高计算成本问题,提出LanGuSTE框架,通过跨尺度视觉提示调优和粗到细补丁选择,在保持诊断性能的同时将处理时间降至约3倍。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20699 2026-08-24 cs.CV 新提交 77%

ArtiMo: Agent-Driven Articulated Mesh Animation

ArtiMo:智能体驱动的关节网格动画

Chunyu Zou, Peng Dai, Yi-Hua Huang, Ze Yuan, Jingwei Huang, Yeming Yao, Xiaojuan Qi

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 ArtiMo是一种智能体驱动的零样本框架,结合URDF运动学约束与LLMs/VLMs,生成文本引导的关节网格动画,通过视觉自改进机制修正错误,在新基准数据集上优于基线。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.20141 2026-08-21 cs.CV 新提交 77%

DPC-Net: Dual-Prior Collaborative Network for All-in-One Image Restoration

DPC-Net:用于一体化图像修复的双先验协同网络

Zhaokun He, Kangbiao Shi, Axi Niu, Jian Jin, Peng Wu, Wei Dong, Qingsen Yan

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对一体化图像修复现有方法的结构扭曲与语义不一致问题,提出双先验协同网络DPC-Net,联合利用退化-语义耦合与低层视觉先验,在多基准上实现优于现有最优方法的修复性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.19613 2026-08-21 cs.RO cs.CV 新提交 77%

What Matters for Latent Actions in Robot Learning

机器人学习中隐式动作的关键影响因素

Xizhou Bu, Qingda Hu, Lei Zhou, Lingfeng Zhang, Yingbo Tang, Zihao Liu, Xinyi Tao, Zhiqiang Ma, Qingqiu Huang, Chufeng Tang, Hongbo Wang, Jing Zhang, Jiayi Ma, Hangjun Ye, Wei Li, Xiaoshuai Hao

机构 * College of Intelligent Robotics and Advanced Manufacturing, Fudan University(复旦大学智能机器人与先进制造学院) Tsinghua Shenzhen International Graduate School, Tsinghua University(清华大学深圳国际研究生院) Guangdong Provincial Key Laboratory of Computility Microelectronics, Faculty of Computility Microelectronics, Shenzhen University of Advanced Technology(深圳先进技术研究院计算机微科学与技术学院、广东省计算微电子重点实验室) School of Aeronautics and Astronautics, Sichuan University(四川大学航空航天学院) Suzhou Evans Intelligent Technology Co., Ltd.(苏州伊文斯智能科技有限公司) Morphi Intelligence Technology Co., Ltd.(墨飞智能科技有限公司) School of Artificial Intelligence, Wuhan University(武汉大学人工智能学院) Xiaomi EV(小米汽车)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本研究通过统一框架整合代表性隐式动作模型,系统探究41种设计选择,发现用隐式动作微调视觉语言模型主干可为下游机器人操纵策略学习提供更强初始化。

Comments Project page: https://carldegio.github.io/latent_action.github.io

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.16284 2026-08-18 cs.CV 新提交 77%

TransAnyText: Translating Arbitrary Text in E-commerce Images via Structured Visual Generation

TransAnyText:通过结构化视觉生成实现电商图像中任意文本的翻译

Xiaoan Liu, Lichen Ma, Zipeng Guo, Yu He, Xiaoyan Su, Shaojie Guo, Hao Yang, Jingling Fu, Xiaolong Fu, Zhen Chen, Yu Guo, Fei Wang, Xinyi Liu, Yongjun Zhang, Ke Zhang, Junshi Huang

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 本文提出TransAnyText框架,将电商图像文本翻译转化为生成可渲染HTML补丁,经三阶段后训练优化,在多基准上表现优于对比方法,为跨境电商图像翻译提供有效可控的解决方案。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.13980 2026-08-17 cs.CV 新提交 77%

FIRM: Fine-Grained Intra-Token Representation of Masks for Remote Sensing Reasoning Segmentation

FIRM:面向遥感推理分割的掩码细粒度令牌内表示

Weidong Tang, Kaiyu Li, Yikai Wang, Yanan Wu, Haotian Gan, Shihong Wang, Xiangyong Cao

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.CV

AI总结 本文提出FIRM模型,通过预测视觉令牌内的r×r二值子单元掩码代码结合轻量连续渲染器优化边界,在5个遥感推理分割基准上取得领先结果,提升了细粒度分割性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2605.28642 2026-08-17 cs.AI 版本更新 77%

Parameter- and Bandwidth-Efficient Edge--cloud Many-to-Many Speech-to-Text Translation

带宽高效且隐私保护的边缘-云多对多语音翻译

Yexing Du, Kaiyuan Liu, Youcheng Pan, Bo Yang, Lei Chen, Ming Liu, Bing Qin, Yang Xiang

机构 * Harbin Institute of Technology(哈尔滨工业大学) Pengcheng Laboratory(鹏城实验室)

专题命中 VLM训练与架构 :MLLM(abstract,abstract_cn);multimodal large language model(abstract);分类 cs.AI

AI总结 提出边缘-云协同框架ESRT,通过分割推理架构压缩中间特征实现带宽降低10倍和语音隐私保护,并采用多任务加权课程学习策略实现45种语言的多对多语音翻译。

详情

展开后加载摘要…

URL PDF HTML 收藏
2602.12314 2026-08-17 cs.RO cs.CV 版本更新 77%

LatentAM: Real-Time, Large-Scale Latent Gaussian Attention Mapping via Online Dictionary Learning

LatentAM:通过在线字典学习实现实时、大规模的潜在高斯注意力映射

Junwoon Lee, Yulun Tian

机构 * Robotics Department, University of Michigan(密歇根大学机器人系)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 LatentAM通过在线字典学习实现实时、大规模的潜在高斯注意力映射,提升机器人感知的特征重建保真度与实时性

Comments 8 pages, 7 figures. Accepted for RA-L. Homepage: https://junwoonlee.github.io/projects/LatentAM/ Code: https://github.com/UMich-SSI-Lab/latentam

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.11692 2026-08-13 cs.AI 新提交 77%

HUGIN: Enhancing Vision-Language Planning for Autonomous Logistics Sorting

HUGIN:增强自主物流分拣的视觉-语言规划能力

Xikai Sun, Cangtian Zhou, Kebin Liu, Ke Ma, Xu Wang, Zaishu Chen, Haotian Wang, Li Liu, Yunhao Liu

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.AI

AI总结 针对自主物流分拣的联合多场景理解挑战,提出HUGIN训练框架,构建SortingBench基准,在多VLMs上性能提升,验证了方法有效性与实际可行性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2608.08805 2026-08-11 cs.CV 新提交 77%

LASA: Language-and-Source-Anchored Alignment for Domain Generalized Semantic Segmentation

LASA:面向域泛化语义分割的语言与源锚定对齐

Jinhong Zhu, Weiqi Yan, Shengchuan Zhang, Liujuan Cao

机构 * Xiamen University(厦门大学)

专题命中 VLM训练与架构 :VLM(abstract,abstract_cn);vision-language model(abstract);分类 cs.CV

AI总结 针对域泛化语义分割中传统方法损害特征完整性的问题,提出LASA框架,含三个协同组件,实验显示其性能优于现有最优方法。

Comments 10 pages, 4 figures

详情

展开后加载摘要…

URL PDF HTML 收藏