arXivDaily arXiv每日学术速递 周一至周五更新
arXiv周末暂无论文更新,休息一下吧,周末愉快~~

AI 大模型

视觉大模型 / VLM

视觉语言模型、视觉推理、视觉问答、图文理解和视觉 grounding。

2025-10-02 至 2025-10-02 共收录 10 信号源:cs.CV, cs.AI, cs.LG

1. VLM训练与架构 10 篇

2509.25413 2025-10-02 cs.CV 83%

DepthLM: Metric Depth From Vision Language Models

Zhipeng Cai, Ching-Feng Yeh, Hu Xu, Zhuang Liu, Gregory Meyer, Xinjie Lei, Changsheng Zhao, Shang-Wen Li, Vikas Chandra, Yangyang Shi

机构 * Meta Princeton University(普林斯顿大学)

专题命中 VLM训练与架构 :vision language model(title,abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2503.17349 2025-10-02 cs.CV 83%

Beyond Semantics: Rediscovering Spatial Awareness in Vision-Language Models

Jianing Qi, Jiawei Liu, Hao Tang, Zhigang Zhu

机构 * CUNY Graduate Center(纽约大学研究生中心) Borough of Manhattan Community College(曼哈顿社区学院) The City College of New York(纽约城市学院)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);LLaVA(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00088 2025-10-02 cs.AI cs.CY 79%

Judging by Appearances? Auditing and Intervening Vision-Language Models for Bail Prediction

Sagnik Basu, Shubham Prakash, Ashish Maruti Barge, Siddharth D Jaiswal, Abhisek Dash, Saptarshi Ghosh, Animesh Mukherjee

机构 * Indian Institute of Technology Kharagpur(印度理工学院Khargapur分校) Max Planck Institute for Software Systems(马克斯·普朗克软件系统研究所)

专题命中 VLM训练与架构 :vision-language model(title);vision language model(abstract);分类 cs.AI

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.26006 2025-10-02 cs.CV 70%

AgenticIQA: An Agentic Framework for Adaptive and Interpretable Image Quality Assessment

Hanwei Zhu, Yu Tian, Keyan Ding, Baoliang Chen, Bolin Chen, Shiqi Wang, Weisi Lin

机构 * Nanyang Technological University(南洋理工大学) Nanjing University of Information Science and Technology(南京信息工程大学) Zhejiang University(浙江大学) South China Normal University(华南师范大学) Alibaba DAMO Academy(阿里巴巴达摩院) City University of Hong Kong(香港城市大学)

专题命中 VLM训练与架构 :vision-language model(abstract);VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2508.17846 2025-10-02 cs.CV cs.LG 62%

Alternating Training-based Label Smoothing Enhances Prompt Generalization

Yang Chen, Yanbin Wei, Ke Jin, Yi Kong, James Kwok, Yu Zhang

机构 * Department of Computer Science and Engineering, Southern University of Science and Technology(南方科技大学计算机科学与工程系) Department of Computer Science and Engineering, Hong Kong University of Science and Technology(香港科技大学计算机科学与工程系) School of Information and Control Engineering, China University of Mining and Technology(中国矿业大学信息与控制工程学院)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00032 2025-10-02 eess.SP cs.AI cs.CL cs.LG q-bio.NC 62%

WaveMind: Towards a Conversational EEG Foundation Model Aligned to Textual and Visual Modalities

Ziyi Zeng, Zhenyang Cai, Yixi Cai, Xidong Wang, Junying Chen, Rongsheng Wang, Yipeng Liu, Siqi Cai, Benyou Wang, Zhiguo Zhang, Haizhou Li

机构 * The Chinese University of Hong Kong, Shenzhen(香港中文大学(深圳)) Harbin Institute of Technology, Shenzhen(哈尔滨工业大学(深圳))

专题命中 VLM训练与架构 :multimodal large language model(abstract);分类 cs.AI、cs.LG

详情

展开后加载摘要…

URL PDF HTML 收藏
2509.05978 2025-10-02 eess.IV cs.CL cs.CV cs.LG 62%

Imagining Alternatives: Towards High-Resolution 3D Counterfactual Medical Image Generation via Language Guidance

Mohamed Mohamed, Brennan Nichyporuk, Douglas L. Arnold, Tal Arbel

机构 * McGill University(麦吉尔大学) Mila – Quebec AI Institute(魁北克人工智能研究所)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV、cs.LG

Comments Accepted to the 2025 MICCAI ELAMI Workshop

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00993 2025-10-02 cs.CV 57%

Visual Self-Refinement for Autoregressive Models

Jiamian Wang, Ziqi Zhou, Chaithanya Kumar Mummadi, Sohail Dianat, Majid Rabbani, Raghuveer Rao, Chen Qiu, Zhiqiang Tao

机构 * Rochester Institute of Technology(罗切斯特理工大学) Bosch Research(博世研究) DEVCOM Army Research Laboratory(美国陆军研究实验室)

专题命中 VLM训练与架构 :vision-language model(abstract);分类 cs.CV

Comments Accepted by EMNLP2025

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00618 2025-10-02 cs.CV 57%

Robust Context-Aware Object Recognition

Klara Janouskova, Cristian Gavrus, Jiri Matas

机构 * Visual Recognition Group, Czech Technical University in Prague(捷克技术大学布拉格分校视觉识别组)

专题命中 VLM训练与架构 :VLM(abstract);分类 cs.CV

详情

展开后加载摘要…

URL PDF HTML 收藏
2510.00647 2025-10-02 cs.CL 50%

MCM-DPO: Multifaceted Cross-Modal Direct Preference Optimization for Alt-text Generation

Jinlan Fu, Shenzhen Huangfu, Hao Fei, Yichong Huang, Xiaoyu Shen, Xipeng Qiu, See-Kiong Ng

机构 * National University of Singapore(新加坡国立大学) Fudan University(复旦大学) Harbin Institute of Technology(哈尔滨工业大学) Eastern Institute of Technology(东方技术研究所)

专题命中 VLM训练与架构 :vision-language model(abstract)

Comments Accepted by ACM MM 2025

详情

展开后加载摘要…

URL PDF HTML 收藏