arXivDaily arXiv每日学术速递 周一至周五更新

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-12-01 至 2025-12-01 共收录 74 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 16 篇

2511.22594 2025-12-01 cs.CV cs.AI 76%

HarmoCLIP: Harmonizing Global and Regional Representations in Contrastive Vision-Language Models

HarmoCLIP:在对比视觉语言模型中协调全局和区域表示

Haoxi Zeng, Haoxuan Li, Yi Bin, Pengpeng Zeng, Xing Xu, Yang Yang, Heng Tao Shen

机构 * Tongji University(同济大学) University of Electronic Science and Technology of China(电子科技大学)

专题命中 VLM训练与架构 :vision-language model(title);分类 cs.CV、cs.AI

AI总结 HarmoCLIP通过引入细粒度语义监督和区域-语言对齐策略,协调CLIP中全局与区域表示,提升检索和边界框分类性能,实现平衡高效的全局-局部权衡解决方案。

Comments 13 pages, 7 figures, 6 tables

详情

展开后加载摘要…

URL PDF HTML 收藏
2506.03195 2025-12-01 cs.CV cs.AI cs.LG 75%

Unlabeled Data Improves Fine-Grained Image Zero-shot Classification with Multimodal LLMs

未标记数据提升多模态大语言模型在细粒度图像零样本分类中的性能

Yunqi Hong, Sohyun An, Andrew Bai, Neil Y. C. Lin, Cho-Jui Hsieh

机构 * Computer Science Department, University of California, Los Angeles(加州大学洛杉矶分校计算机科学系) Mechanical and Aerospace Engineering Department, University of California, Los Angeles(加州大学洛杉矶分校机械与航空航天工程系)

专题命中 VLM训练与架构 :multimodal large language model(abstract);MLLM(abstract);分类 cs.CV、cs.AI、cs.LG

AI总结 AutoSEP通过利用未标记数据提升多模态大语言模型在细粒度图像零样本分类中的性能。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.21631 2025-12-01 cs.CV cs.AI 73%

Qwen3-VL Technical Report

Qwen3-VL 技术报告

Shuai Bai, Yuxuan Cai, Ruizhe Chen, Keqin Chen, Xionghui Chen, Zesen Cheng, Lianghao Deng, Wei Ding, Chang Gao, Chunjiang Ge, Wenbin Ge, Zhifang Guo, Qidong Huang, Jie Huang, Fei Huang, Binyuan Hui, Shutong Jiang, Zhaohai Li, Mingsheng Li, Mei Li, Kaixin Li, Zicheng Lin, Junyang Lin, Xuejing Liu, Jiawei Liu, Chenglong Liu, Yang Liu, Dayiheng Liu, Shixuan Liu, Dunjie Lu, Ruilin Luo, Chenxu Lv, Rui Men, Lingchen Meng, Xuancheng Ren, Xingzhang Ren, Sibo Song, Yuchong Sun, Jun Tang, Jianhong Tu, Jianqiang Wan, Peng Wang, Pengfei Wang, Qiuyue Wang, Yuxuan Wang, Tianbao Xie, Yiheng Xu, Haiyang Xu, Jin Xu, Zhibo Yang, Mingkun Yang, Jianxin Yang, An Yang, Bowen Yu, Fei Zhang, Hang Zhang, Xi Zhang, Bo Zheng, Humen Zhong, Jingren Zhou, Fan Zhou, Jing Zhou, Yuanzhi Zhu, Ke Zhu

专题命中 VLM训练与架构 :vision-language model(abstract);grounding(abstract);分类 cs.CV、cs.AI

AI总结 Qwen3-VL 是一款强大的多模态模型,具备强大的纯文本理解、长上下文处理和多模态推理能力,适用于图像推理、代理决策和多模态代码智能。

Comments 42 pages

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22470 2025-12-01 cs.CV 70%

Hybrid, Unified and Iterative: A Novel Framework for Text-based Person Anomaly Retrieval

混合、统一和迭代:一种基于文本的人员异常检索新框架

Tien-Huy Nguyen, Huu-Loc Tran, Huu-Phong Phan-Nguyen, Quang-Vinh Dinh

机构 * University of Information Technology Vietnam National University(信息技术大学越南国家大学) AI VIETNAM Lab(AI越南实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

AI总结 本文提出了一种混合、统一和迭代的新型框架,通过结合局部-全局视角和统一图像-文本模型,提升基于文本的人员异常检索性能。

Comments Accepted on World Wide Web 2025 Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22739 2025-12-01 cs.CV cs.AI 62%

All Centers Are at most a Few Tokens Apart: Knowledge Distillation with Domain Invariant Prompt Tuning

所有中心距离最多几个token:基于领域不变提示微调的知识蒸馏

Amir Mohammad Ezzati, Alireza Malekhosseini, Armin Khosravi, Mohammad Hossein Rohban

机构 * Department of Computer Engineering, Sharif University of Technology, Tehran, Iran(计算机工程系,谢赫拉兹大学,德黑兰,伊朗)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.AI

AI总结 本文提出领域不变提示微调(DIPT)方法,通过学习领域不变提示提升知识蒸馏效果,从而增强病理学领域模型的泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.23469 2025-12-01 cs.CV 57%

Visual Generation Tuning

视觉生成微调

Jiahao Guo, Sinan Du, Jingfeng Yao, Wenyu Liu, Bo Li, Haoxiang Cao, Kun Gai, Chun Yuan, Kai Wu, Xinggang Wang

机构 * Huazhong University of Science and Technology(华中科技大学) Tsinghua University(清华大学) School of Artificial Intelligence, South China Normal University(华南师范大学人工智能学院) Kolors Team, Kuaishou Technology(快手科技Kolors团队)

专题命中 VLM训练与架构 :vision language model(abstract);分类 cs.CV

AI总结 本文提出VGT,通过视觉生成微调提升视觉语言模型的视觉生成能力,在图像重建和生成任务中均取得优异成果。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22897 2025-12-01 cs.CV 57%

From Points to Clouds: Learning Robust Semantic Distributions for Multi-modal Prompts

从点到云:学习多模态提示的稳健语义分布

Weiran Li, Yeqiang Liu, Yijie Wei, Mina Han, Xin Liu, Zhenbo Li

机构 * China Agricultural University(中国农业大学)

专题命中 VLM训练与架构 :visual language model(abstract);分类 cs.CV

AI总结 本文提出P2C框架,通过动态去噪机制学习语义云分布,提升多模态提示学习的鲁棒性和泛化能力。

详情

展开后加载摘要…

URL PDF HTML 收藏
2507.12465 2025-12-01 cs.CV 57%

PhysX-3D: Physical-Grounded 3D Asset Generation

PhysX-3D:基于物理的3D资产生成

Ziang Cao, Zhaoxi Chen, Liang Pan, Ziwei Liu

机构 * Nanyang Technological University(南洋理工大学) Shanghai AI Lab(上海人工智能实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

AI总结 PhysX-3D提出一种基于物理的3D资产生成方法,通过构建物理标注数据集和双分支框架,提升生成资产的物理合理性和几何质量。

Comments Accepted by NeurIPS 2025, Spotlight Project page: https://physx-3d.github.io/

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.04182 2025-12-01 cs.CL cs.AI 57%

COPO: Causal-Oriented Policy Optimization for Hallucinations of MLLMs

COPO:面向MLLM幻觉的因果导向策略优化

Peizheng Guo, Jingyao Wang, Wenwen Qiang, Jiahuan Zhou, Changwen Zheng, Gang Hua

机构 * University of Chinese Academy of Sciences(中国科学院大学) Institute of Software Chinese Academy of Sciences(中国科学院软件研究所) Wangxuan Institute of Computer Technology, Peking University(北京大学王轩计算机技术研究所) Amazon.com, Inc.(亚马逊公司)

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI

AI总结 COPO通过引入因果完整性奖励和GRPO框架,解决多模态大语言模型的幻觉问题,通过令牌级因果约束确保输出的正确性和证据基础。

详情

展开后加载摘要…

URL PDF HTML 收藏
2501.11561 2025-12-01 cs.CV 57%

Teaching Large Language Models to Regress Accurate Image Quality Scores using Score Distribution

利用大规模语言模型回归准确的图像质量评分使用分数分布

Zhiyuan You, Xin Cai, Jinjin Gu, Tianfan Xue, Chao Dong

机构 * Shenzhen Institutes of Advanced Technology, Chinese Academy of Sciences(深圳先进技术研究院,中国科学院) Multimedia Laboratory, The Chinese University of Hong Kong(香港中文大学多媒体实验室) Shanghai AI Laboratory(上海人工智能实验室) Shenzhen University of Advanced Technology(深圳先进技术大学) CPII under InnoHK(创新香港下的CPII)

专题命中 VLM训练与架构 :MLLM(abstract);分类 cs.CV

AI总结 本研究提出基于分布的DeQA-Score模型,通过离散化评分分布为软标签,提升图像质量评分的准确性和一致性。

Comments Accepted by CVPR 2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22576 2025-12-01 cs.MM 50%

A Progressive Evaluation Framework for Multicultural Analysis of Story Visualization

一种用于故事可视化多元文化分析的渐进评估框架

Janak Kapuriya, Ali Hatami, Paul Buitelaar

专题命中 VLM训练与架构 :MLLM(abstract)

AI总结 本文提出一种渐进多元文化评估框架,通过五个新指标评估故事可视化模型在不同文化下的表现,揭示模型在文化适当性和视觉美学上的差异。

详情

展开后加载摘要…

URL PDF HTML 收藏

2. 其他VLM 3 篇

2511.22943 2025-12-01 cs.CL cs.CV 79%

Visual Puns from Idioms: An Iterative LLM-T2IM-MLLM Framework

基于成语的视觉双关:一个迭代的LLM-T2IM-MLLM框架

Kelaiti Xiao, Liang Yang, Dongyu Zhang, Paerhati Tulajiang, Hongfei Lin

机构 * Dalian University of Technology(大连理工大学) Xinjiang Normal University(新疆师范大学)

专题命中 其他VLM :MLLM(title,abstract);分类 cs.CV

AI总结 本文提出一个迭代框架,结合LLM、T2IM和MLLM,实现基于成语的视觉双关的自动生成与评估,实验表明MLLM选择对性能影响最大。

Comments Submitted to ICASSP 2026 (under review)

详情

展开后加载摘要…

URL PDF HTML 收藏
2403.10624 2025-12-01 cs.CV 79%

Configurable Fairness: Direct Optimization of Parity Metrics via Vision-Language Models

可配置公平性:通过视觉-语言模型直接优化平衡度指标

Miao Zhang, Rumi Chunara

机构 * New York University(纽约大学)

专题命中 其他VLM :vision-language model(title,abstract);分类 cs.CV

AI总结 本文提出通过视觉-语言模型直接优化平衡度量指标的方法,无需群体标签,提升图像识别的公平性。

详情

展开后加载摘要…

URL PDF HTML 收藏
2511.22688 2025-12-01 cs.LG cs.AI 62%

Test-time scaling of diffusions with flow maps

扩散模型测试时间缩放与流映射

Amirmojtaba Sabour, Michael S. Albergo, Carles Domingo-Enrich, Nicholas M. Boffi, Sanja Fidler, Karsten Kreis, Eric Vanden-Eijnden

机构 * NVIDIA(NVIDIA公司) University of Toronto(多伦多大学) Vector Institute(向量研究所) Harvard University(哈佛大学) Kempner Institute(凯姆纳研究所) IAIFI(IAIFI机构) Microsoft Research(微软研究院) Carnegie Mellon University(卡内基梅隆大学) Courant Institute, New York University(纽约大学应用数学学院) ML Lab at Capital Fund Management (CFM)(Capital Fund Management (CFM)机器学习实验室)

专题命中 其他VLM :vision language model(abstract);分类 cs.AI、cs.LG

AI总结 本文提出通过流映射改进扩散模型测试时间性能,通过流映射与速度场关系构建FMTT算法,实现更优奖励上升并支持复杂图像编辑。

详情

展开后加载摘要…

URL PDF HTML 收藏